KeyFrame內部研究專用

Meta Muse Code at Ultra-Low Price, DeepSeek Does the Opposite and Hikes Prices | Muse Spark 1.2 |...

最佳拍档·8月10日週一·11 min中文

三句話摘要

Meta 推出 Muse Code 編程智能體,對標 Claude Code 和 DeepSeek,引發全球大模型編程賽道的新一輪競爭。 AI 編程進入工程運行時時代,競爭核心從單純的性能榜單轉向可靠性、數據主權和生態鎖定,開發者的選擇將重新塑造市場格局。 1. 定價策略背後的數據飛輪

重點整理

重點
  • 1

    1. 定價策略背後的數據飛輪

  • 2

    Meta 採雙層定價模式:標準版保持競爭力,貢獻者版(允許用代碼訓練)便宜十倍以上。這是用接近白送的價格吸引海量開發者,收集真實軟件工程軌跡來訓練下一代模型。對開源貢獻者誘人,但企業客戶需要零數據留存保證,給 Meta 帶來信任挑戰。

  • 3

    2. 產品架構創新:可靠性和自主性

  • 4

    Muse Code 採用事件日誌機制記錄所有行為(模型調用、工具運行、代碼修改),作為唯一可信數據源,支持精確重放和故障後恢復。內置 /plan(任務拆解)、/grill(壓力測試)、/goal(目標推進)等技能,給智能體工作流加上結構化約束。

  • 5

    3. 性能定位:專精編程,整體第二梯隊

  • 6

    Muse Spark 1.2 在 DeepSWE 1.1、Meta 內部編碼基準(440 項真實 PR 任務)上次於 Claude Opus 5;在 MCP Atlas 工具調用基準登頂;能處理超過 1000 次工具調用的 24 小時長任務。重點優化了代碼生成、問題調試、代碼庫理解。

  • 7

    4. 市場格局轉向:運行時能力成新戰場

  • 8

    從 2023 年的補全時代、2024-2025 年的 demo 時代,進入 2026 年的工程運行時時代。競爭焦點轉向日誌回放、崩潰恢復、並行隔離、合規開關等基礎設施層能力,而非單純的榜單分數。

實用技巧與重點

乾貨
  • 定價對比
  • Muse Spark 1.2 標準版:輸入 $1.25/百萬 token、緩存 $0.15、輸出 $4.25
  • Muse Spark 1.2 貢獻者版:輸入 $0.10(便宜 92%)、緩存 $0.002(便宜 99%)、輸出 $0.20(便宜 95%+)
  • DeepSeek-V4-Flash(7 月 31 日):輸入 1 元/百萬 token、緩存 0.2 元、輸出 2 元
  • 基準測試成績
  • Terminal-Bench 2.1、DeepSWE 1.1:次於 Claude Opus 5,超越 GPT-5.6、Grok 4.5、Gemini 3.6
  • 複雜推理(GDPVal-AA V2):次於 Opus 5
  • MCP Atlas(工具調用):登頂榜首
  • Almanbench:超越 DeepSeek-V4-Pro-Preview,媲美 GPT-5.6 Sol xhigh
  • AI 分析指數:54 分(與 SpaceX AI 並列美國實驗室第三)
  • Muse Code 核心功能
  • 事件日誌:記錄模型調用、工具運行、審批操作、代碼修改;支持精確重放、安全恢復、故障續行
  • 內置技能三件套:/plan(任務拆解→審批執行)、/grill(反覆壓力測試)、/goal(圍繞目標持續推進)
  • 演示案例:NVIDIA Hopper 架構 GPU 內核優化,1000+ 工具調用,約 24 小時,禁止直接導入第三方包,需在 Triton 層實質優化
  • 技術進步三項
  • Muse Spark 1.2 與 Muse Code 協同訓練,引入基於拒絕採樣的智能體運行軌跡
  • 大規模長時程任務訓練(完整代碼倉庫生成、端到端項目、自動化研究)
  • 自我改進機制:用 1.1 版本生成高難度編程環境和指令遵循模板,由新版本評估和迭代

結論

結論

AI 編程進入工程運行時時代,競爭核心從單純的性能榜單轉向可靠性、數據主權和生態鎖定,開發者的選擇將重新塑造市場格局。

完整解析

詳細

2026 年 8 月 6 日,全球 AI 圈同時發生了兩件看似矛盾的事件:Meta 無預兆推出首款編程智能體 Muse Code 及新模型 Muse Spark 1.2,定價直接壓低至比 DeepSeek 還便宜;而 DeepSeek 在同一天宣布漲價。這個反差揭示的並非簡單的降價與漲價對抗,而是 AI 編程賽道進入新階段的信號。

Meta 的定價策略極具進攻性。標準版每百萬 token 輸入 1.25 美元、輸出 4.25 美元,已處於旗艦編程模型中的良心價位。但真正的殺招是貢獻者版本——允許 Meta 用開發者的提示詞和代碼訓練下一代模型,換來輸入價格便宜 92%、緩存便宜 99%、輸出便宜 95% 以上的超低定價。這套邏輯如出一轍:用接近白送的價格吸引海量開發者,收集真實軟件工程軌跡,反哺下一版本訓練,形成飛輪。對個人和開源貢獻者而言是不錯的交易,但對處理用戶數據、專有算法或受監管行業代碼的企業幾乎無法接受。Meta 預見到這點,開放了零數據留存通道,但這又帶來了新問題:靠廣告和用戶數據建立帝國的公司,如何說服企業相信他們不會偷用代碼?信任挑戰不小。

Muse Code 的技術亮點體現在兩個核心設計上。其一是運行時可靠性:採用本地事件日誌機制,逐條記錄模型調用、工具運行、審批操作、代碼修改等所有行為,作為唯一可信數據源。這套日誌支持精確重放和故障恢復,即使程序崩潰,智能體也能從中斷位置繼續執行,適合處理長時間運行的複雜任務。其二是工作流結構化:內置 /plan、/grill、/goal 三項技能,分別負責任務拆解→審批執行、反覆壓力測試、圍繞目標持續推進。這些約束條件讓智能體不再漫無目的嘗試,而是有規劃、有驗證、有目標地推進工作。

在性能層面,Muse Spark 1.2 展現出明確的專精方向。在代碼基準測試(Terminal-Bench 2.1、DeepSWE 1.1)上次於 Claude Opus 5,但超越 GPT-5.6、Grok 4.5 和 Gemini 3.6。Meta 內部的編碼基準包含 440 項基於真實 PR 構建的任務(涵蓋漏洞修復、功能開發、重構、代碼清理等),Muse Spark 1.2 同樣次於 Opus 5 max 版本。在工具調用基準(MCP Atlas)上直接登頂。官方演示選擇了 NVIDIA Hopper 架構的 GPU 內核優化——一個超過 1000 次工具調用、約 24 小時的真實工程任務,禁止直接導入第三方包,需在 Triton 層面做實質優化。這不僅展示了長程智能體的持久性,也暗示 Muse Code 未來可能進入 Meta 自己的基礎設施體系,幫助優化內部系統。

模型本身在三個技術方向上做了深化:與 Muse Code 協同訓練確保配合發揮;引入基於拒絕採樣的智能體運行軌跡優化訓練方法;大規模進行長時程任務訓練(完整代碼倉庫生成、端到端項目、自動化研究)。此外採用自我改進機制:用前代版本生成高難度編程環境和指令遵循模板,由新版本評估候選方案並迭代,構建可規模化擴展的訓練數據。

回到開篇的反差:Meta 降價搶客,DeepSeek 涨價備战。表面是兩條相反的路,實質是雙方都在為同一個戰場做準備。價格戰只是序章,真正的競爭已轉向算力、性能、價格、應用、生態的全維度。當編程工具從幫你打字進化到替你干活,當 AI 從助手變成可獨立完成工程任務的駐場工程師,關鍵問題不再是誰的榜單分數更高,而是開發者願不願意把代碼、工作流、數據交給這個新實習生。在數據主權和模型能力、開放生態和商業閉環、短期成本和長期鎖定之間,每個技術團隊都需要想清楚自己的選擇。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。