KeyFrame內部研究專用

Fable 5 COMING BACK! Deepseek v4.1, GPT-5.6 Leaks, Fusion API, & Kimi K2.7 Code High Speed! AI NEWS!

World of AI·6月16日週二·16 min英文

三句話摘要

AI 產業近期重大動態綜述,涵蓋 Fable 5 被禁風波、GPT 5.6 發布預告、開源模型快速迭代與創新突破。 未來AI應用的競爭優勢將從追求單一最強模型轉向通過多模型協作和智能融合實現成本-性能最優化。 Fable禁令的政治因素——美國政府將強大的AI模型視為國家安全風險,擔心安全措施被繞過會助外國行為體發現軟件漏洞和提升網絡能力,Amazon作為最大投資者反而是發現漏洞並舉報的公司,推動了禁令實施,顯示投資者利益與政府監管的複雜張力。

重點整理

重點
  • 1

    Fable禁令的政治因素——美國政府將強大的AI模型視為國家安全風險,擔心安全措施被繞過會助外國行為體發現軟件漏洞和提升網絡能力,Amazon作為最大投資者反而是發現漏洞並舉報的公司,推動了禁令實施,顯示投資者利益與政府監管的複雜張力。

  • 2

    開源模型生態加速迭代——Kimi Code 2.7相比2.6在基準測試多項指標大幅提升,推理標記減少30%代表運行效率提高;Qun在不到1個月內從3.6Plus迭代到3.7Plus,反映中國AI實驗室的快速試錯節奏,與美國單一大模型追求形成對比。

  • 3

    開源社區的欺騙與創新並存——Rio 3.5只是現有兩個模型的線性插值卻聲稱無所不能,作者被抓包後仍狡辯,體現開源生態的信任危機,同時Next N2 Pro在編碼能力上的突出表現說明真正的創新依然存在。

  • 4

    模型組合優於單一模型的新趨勢——Open Router的Fusion API通過並行調用多個模型再用評判模型融合答案,使低成本模型組合在性能上可媲美高端單一模型(如Opus 4.8),成本僅為後者50%左右,暗示未來AI應用不再只追求單一龐大模型,而是多模型協作的系統設計。

實用技巧與重點

乾貨
  • Fable 5/Mythos 5禁令:美國政府出口管制指令,原因涉及軟件漏洞發現和網絡能力;Amazon發現安全系統漏洞後向政府報告;Anthropic高管赴華盛頓談判;可能恢復措施包括安全過濾、監控、速率限制、企業優先訪問或僅限美國用戶
  • GPT 5.6:預計本週四或下週發布;150萬token上下文窗口;價格低於Fable;Poly Market預測本月發布概率86%
  • Kimi Code 2.7:Kim Code Bench版本2性能提升21.8%;Program Bench提升11%;MLS Bench Light提升31%;推理標記減少約30%;高速版本速度提升6倍,每秒處理180個令牌,短上下文最高260令牌/秒;訪問限制於Kimi Code測試計劃、Kimi API、企業用戶
  • Rio 3.5:被發現為Next N2 Pro和Qun 3.5的線性插值;作者宣稱上傳錯誤文件
  • Open Router Fusion API:並行發送提示到多個模型;評判模型融合答案;低價模型組合性能與Claude Fable 5相差不到1%,成本僅為後者一半左右;可媲美GPT 5.5和Opus 4.8性能
  • 其他動態:Anthropic估值可能達1.75萬億美元;Deepseek 4.1計劃6月發布;Qun快速迭代(3.6Plus→3.7Plus不到1個月);法國是歐洲擁有最大語言模型公司的國家(Mistral);中國推出「黑盒子」AI機器人,無按鈕無液晶屏,完全AI控制,為無人值守實驗室設計

結論

結論

未來AI應用的競爭優勢將從追求單一最強模型轉向通過多模型協作和智能融合實現成本-性能最優化。

完整解析

詳細

Fable 5和Mythos 5的禁令事件揭示了AI安全治理的複雜現實。美國政府以國家安全為由對Anthropic發布出口管制指令,官員擔憂這些高性能模型若安全措施被繞過,可能協助外國行為體發現軟件漏洞或增強網絡攻擊能力。值得關注的是,Anthropic最大的投資者Amazon的研究人員發現了Fable 5安全系統中的漏洞,並直接向政府報告,這成為禁令的關鍵觸發點。雖然Anthropic聲稱這些風險並非該模型獨有,GPT 5.5等其他公開模型也具備類似功能,但政府仍認為這是安全風險。禁令涵蓋所有外國公民,甚至包括Anthropic的國際員工,導致全球服務暫停。不過,Anthropic高管已飛往華盛頓協商,預計本月內可能恢復,但將實施更嚴格的控制措施,包括強化安全過濾、增加監控、設置速率限制,或限制為企業優先訪問和美國用戶專屬。

AI模型發展方面呈現美中並驅的格局。OpenAI的GPT 5.6即將發布,配備150萬token的上下文窗口,價格將顯著低於Fable,發布時機在Fable禁用期間堪稱完美,預計將吸引大量尋求替代方案的用戶。Poly Market數據顯示本月內發布概率達86%。與此同時,Moonshot的Kimi Code 2.7展現出中國模型的迭代速度,相比2.6版本多項基準測試大幅提升,其中最顯著的是Kim Code Bench 2提升21.8%、Program Bench提升11%、MLS Bench Light提升31%,推理標記減少30%代表更高的運行效率。該公司還推出了速度快6倍的高速版本,每秒處理180個令牌,短上下文場景達260令牌/秒,顯示速度與精度的兼顧。Qun則展現出月級別的快速迭代節奏,從3.6Plus不到一個月內升級到3.7Plus,反映了中國AI實驗室的試錯和改進效率。

開源生態中出現了創新與欺騙的有趣對比。Rio 3.5一度聲稱超越Qun、Deepseek等多個模型,在社交媒體引發熱議,但研究人員的技術分析揭露其實僅為Next N2 Pro和Qun 3.5的線性插值——一個簡單的數學組合。作者被抓包後仍辯稱上傳了錯誤文件,實際上等同於複製粘貼加改名。這反映了開源社區中信任危機的一面。但同時,Next N2 Pro作為真正的開源創新代表,在規劃、執行、調試複雜應用程序構建任務上表現卓越,證明開源生態仍有值得關注的創新。

最具前景的趨勢是Open Router的Fusion API所代表的多模型協作範式。該系統不再依賴單一龐大模型,而是並行調用多個不同模型處理同一提示,由評判模型分析所有答案,識別共識點、矛盾之處與盲點,最後融合為更強有力的答案。根據基準測試,低成本模型組合(如使用Gemini 1.5 Flash、Kimi Code 2.6、DeepSeek 4 Pro等)在性能上不僅能媲美GPT 5.5和Opus 4.8,與Claude Fable 5的差距不到1%,而成本僅為後者的一半。這預示著未來AI應用架構可能不再追求單一超級模型,而是通過智能的模型佈線、面板化設計與成本優化,讓多個廉價模型組成「AI研究團隊」共同協作。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。