KeyFrame內部研究專用

Ornith 1.0 + DSpark is INSANE : Self-Scaffolding Local AI That Runs 85% Faster

Cloud Codes·7月2日週四·14 min英文

三句話摘要

開源編碼代理模型 Ornith 加上推理加速層 DeSpark,實現本地、隱私、無需付費的前沿級代碼開發助手。 開源代理可以自學框架、推理層可以無損加速,兩者結合讓前沿級能力以零成本在本地運行,開源與商業閉源的界線從未如此靠近。 代理框架自學習機制 — 不同於傳統由工程師手寫固定框架,Ornith 將框架本身視為可學習對象,通過兩階段訓練(先提出框架、再執行任務)讓模型同時學習「如何工作」和「怎樣回答」,形成自適應的解題策略,這是本次突破的核心。

重點整理

重點
  • 1

    代理框架自學習機制 — 不同於傳統由工程師手寫固定框架,Ornith 將框架本身視為可學習對象,通過兩階段訓練(先提出框架、再執行任務)讓模型同時學習「如何工作」和「怎樣回答」,形成自適應的解題策略,這是本次突破的核心。

  • 2

    參數效率的躍進 — 同樣是 9B 參數,Ornith 比基礎 QWen 快 16 個 SWE bench 點數(69 vs 53),證明學到更好的流程比堆砌參數更有效;35B MoE 版本甚至贏過 10 倍大的專有模型。

  • 3

    無損推理加速原理 — DeSpark 用小型草案模型並行猜測多個 token,大模型一次遍歷驗證整塊,透過拒絕採樣保證輸出完全相同,打破傳統權衡(準確性 vs 速度),達到 85% 加速。

  • 4

    三層開源棧的協同 — Ornith 基於 QWen/Gemma 構建,DeSpark 正好也針對這兩個基座優化,搭配 Claude Code 等框架使用,形成無縫整合,讓前沿能力在本地機器運行。

實用技巧與重點

乾貨
  • 模型規格
  • Ornith 四個版本:9B、31B、35B (MoE)、397B
  • 上下文長度:全數 250K token(可達 400K 作整倉位任務)
  • 9B 顯存需求:80GB 卡上約 19GB(半精度)
  • 許可:MIT 開源、HuggingFace、無地域鎖、可離線
  • SWE Bench 驗證得分
  • Ornith 9B:69
  • Ornith 35B (MoE):領先同級別所有模型
  • Ornith 397B:82.4(超越 Opus 4.7 的 ~81,低於 Opus 4.8 的 87)
  • Gemma 4 (31B):低於 Ornith 9B
  • QWen 基線 (9B):53
  • DeSpark 加速數據
  • Flash 模型:85% 加速
  • Pro 模型:78% 加速
  • Token 接納率提升:比 Eagle 高 26-31%,比 Flash 高 16-18%
  • 2 層 DeSpark 性能超過 5 層 DeathLash
  • 輸出品質:數學上等同於標準解碼(拒絕採樣保證)
  • 技術組件
  • 訓練框架:兩階段強化學習(框架提議 + 任務執行)
  • DeSpark 架構:並行骨幹 + 低秩 Markov 順序頭 + 信心評分 + 硬體感知調度
  • 安全機制:固定外部信任邊界、確定性監控器、凍結裁決模型
  • 開源工具:VLLM 或 SGLang 部署,DeepSpec 訓練流程
  • 效能對比
  • 端到端任務延遲降低 50%(完全相同輸出,不是更小/更弱的模型)
  • 本地運行成本:$0/token(vs API 費用模型)

結論

結論

開源代理可以自學框架、推理層可以無損加速,兩者結合讓前沿級能力以零成本在本地運行,開源與商業閉源的界線從未如此靠近。

完整解析

詳細

編碼代理的歷史瓶頸在於模型被人工設計的框架束縛。工程師手寫代理邏輯──定計畫、列工具、設記憶、做重試──一旦寫死就很難改。Ornith 打破這個模式,把框架本身當作學習目標。在強化學習訓練中,模型先針對具體任務提出一套自己的框架設計,然後在那個框架下嘗試解題。成敗的獎勵信號同步回流到框架和執行兩個層次,強制它們一起進化。經過數千輪迭代,好的框架被保留,差的變異消失,最後每類任務自然浮現出最適合它的策略。結果是模型不只學會給答案,還學會了「怎樣工作」──先計畫再行動、優先用真實工具而非幻覺、讀自己的輸出發現失敗再修復。這些習慣通常必須由外部硬寫,但 Ornith 自己學會了。

為了防止模型欺騙(比如看到隱藏測試、寫死預期答案),團隊築起三道牆:固定的外層信任邊界、確定性監控擋住違禁操作、凍結的裁決模型可以中止整個運行。代價是效率的真實躍進。同樣 9B 參數,Ornith 在 SWE Bench 上拿到 69 分,而其基座 QWen 只有 53 分,超越了 31B 的 Gemma 4,甚至在某些測試上打平 35B 的 QWen 本身。那 16 個點數純粹來自學到的更好流程,不是更多參數。35B MoE 版本進一步激進化,容量相同但只激活稀疏片段,結果不但超越所有同級別模型,還在某些基準上擊敗體型十倍大的專有模型。

同週 DeepSeek 放出 DeSpark,它解決的問題是:大模型為什麼慢?因為生成每個 token 都要把全部參數過一遍,但 GPU 大部分時間在搬數據進記憶體,計算單元閒著。推測性解碼改變這個。用小型快速模型猜一整塊 token 前景,大模型在一次遍歷中驗證整塊,相當於五個猜測只花一次大模型成本。DeSpark 的聰明在三層優化同時打開:並行骨幹快速粗糙地猜全部 token,加一個低秩 Markov 順序頭逐個微調(結合兩者優點,避免平行的「後綴衰減」),再加信心評分和硬體感知排程。輸出用拒絕採樣保證數學等同──任何錯誤猜測直接丟,只保留真實模型會寫的 token。速度提升在 Flash 達 85%,Pro 達 78%。

關鍵是這兩個版本從設計之初就互為 perfect fit。Ornith 建在 QWen 和 Gemma 上,DeepSpec(DeSpark 的訓練框架)也正好為這兩個基座設計。所以實踐時,用 VLLM 或 SG Lang 啟動 Ornith 端點,掛上 DeSpark 草案模型,再指向 Claude Code,就能在本地機器跑前沿級代碼代理,無網絡、無費用、純隱私。一個 SWE Bench 82.4 的模型,推理快 85%,所有權在你手裡。

使用邊界很清楚:代碼必須本地、網路必須斷線、許可必須免費、拒絕 token 計費的場景,開源棧完勝。但最困難、最長的多步驟任務,那幾個頂端基準點真的生死攸關的情況,Opus 4.8(87 分)還是贏。聰明的做法是一套框架(Claude Code)長期不變,按任務換腦子──簡單的用本地開源加速版,難的臨時用雲端前沿。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。