Ornith 1.0 + DSpark is INSANE : Self-Scaffolding Local AI That Runs 85% Faster
三句話摘要
開源編碼代理模型 Ornith 加上推理加速層 DeSpark,實現本地、隱私、無需付費的前沿級代碼開發助手。 開源代理可以自學框架、推理層可以無損加速,兩者結合讓前沿級能力以零成本在本地運行,開源與商業閉源的界線從未如此靠近。 代理框架自學習機制 — 不同於傳統由工程師手寫固定框架,Ornith 將框架本身視為可學習對象,通過兩階段訓練(先提出框架、再執行任務)讓模型同時學習「如何工作」和「怎樣回答」,形成自適應的解題策略,這是本次突破的核心。
重點整理
重點- 1
代理框架自學習機制 — 不同於傳統由工程師手寫固定框架,Ornith 將框架本身視為可學習對象,通過兩階段訓練(先提出框架、再執行任務)讓模型同時學習「如何工作」和「怎樣回答」,形成自適應的解題策略,這是本次突破的核心。
- 2
參數效率的躍進 — 同樣是 9B 參數,Ornith 比基礎 QWen 快 16 個 SWE bench 點數(69 vs 53),證明學到更好的流程比堆砌參數更有效;35B MoE 版本甚至贏過 10 倍大的專有模型。
- 3
無損推理加速原理 — DeSpark 用小型草案模型並行猜測多個 token,大模型一次遍歷驗證整塊,透過拒絕採樣保證輸出完全相同,打破傳統權衡(準確性 vs 速度),達到 85% 加速。
- 4
三層開源棧的協同 — Ornith 基於 QWen/Gemma 構建,DeSpark 正好也針對這兩個基座優化,搭配 Claude Code 等框架使用,形成無縫整合,讓前沿能力在本地機器運行。
實用技巧與重點
乾貨- 模型規格
- Ornith 四個版本:9B、31B、35B (MoE)、397B
- 上下文長度:全數 250K token(可達 400K 作整倉位任務)
- 9B 顯存需求:80GB 卡上約 19GB(半精度)
- 許可:MIT 開源、HuggingFace、無地域鎖、可離線
- SWE Bench 驗證得分
- Ornith 9B:69
- Ornith 35B (MoE):領先同級別所有模型
- Ornith 397B:82.4(超越 Opus 4.7 的 ~81,低於 Opus 4.8 的 87)
- Gemma 4 (31B):低於 Ornith 9B
- QWen 基線 (9B):53
- DeSpark 加速數據
- Flash 模型:85% 加速
- Pro 模型:78% 加速
- Token 接納率提升:比 Eagle 高 26-31%,比 Flash 高 16-18%
- 2 層 DeSpark 性能超過 5 層 DeathLash
- 輸出品質:數學上等同於標準解碼(拒絕採樣保證)
- 技術組件
- 訓練框架:兩階段強化學習(框架提議 + 任務執行)
- DeSpark 架構:並行骨幹 + 低秩 Markov 順序頭 + 信心評分 + 硬體感知調度
- 安全機制:固定外部信任邊界、確定性監控器、凍結裁決模型
- 開源工具:VLLM 或 SGLang 部署,DeepSpec 訓練流程
- 效能對比
- 端到端任務延遲降低 50%(完全相同輸出,不是更小/更弱的模型)
- 本地運行成本:$0/token(vs API 費用模型)
結論
結論“開源代理可以自學框架、推理層可以無損加速,兩者結合讓前沿級能力以零成本在本地運行,開源與商業閉源的界線從未如此靠近。”
完整解析
詳細編碼代理的歷史瓶頸在於模型被人工設計的框架束縛。工程師手寫代理邏輯──定計畫、列工具、設記憶、做重試──一旦寫死就很難改。Ornith 打破這個模式,把框架本身當作學習目標。在強化學習訓練中,模型先針對具體任務提出一套自己的框架設計,然後在那個框架下嘗試解題。成敗的獎勵信號同步回流到框架和執行兩個層次,強制它們一起進化。經過數千輪迭代,好的框架被保留,差的變異消失,最後每類任務自然浮現出最適合它的策略。結果是模型不只學會給答案,還學會了「怎樣工作」──先計畫再行動、優先用真實工具而非幻覺、讀自己的輸出發現失敗再修復。這些習慣通常必須由外部硬寫,但 Ornith 自己學會了。
為了防止模型欺騙(比如看到隱藏測試、寫死預期答案),團隊築起三道牆:固定的外層信任邊界、確定性監控擋住違禁操作、凍結的裁決模型可以中止整個運行。代價是效率的真實躍進。同樣 9B 參數,Ornith 在 SWE Bench 上拿到 69 分,而其基座 QWen 只有 53 分,超越了 31B 的 Gemma 4,甚至在某些測試上打平 35B 的 QWen 本身。那 16 個點數純粹來自學到的更好流程,不是更多參數。35B MoE 版本進一步激進化,容量相同但只激活稀疏片段,結果不但超越所有同級別模型,還在某些基準上擊敗體型十倍大的專有模型。
同週 DeepSeek 放出 DeSpark,它解決的問題是:大模型為什麼慢?因為生成每個 token 都要把全部參數過一遍,但 GPU 大部分時間在搬數據進記憶體,計算單元閒著。推測性解碼改變這個。用小型快速模型猜一整塊 token 前景,大模型在一次遍歷中驗證整塊,相當於五個猜測只花一次大模型成本。DeSpark 的聰明在三層優化同時打開:並行骨幹快速粗糙地猜全部 token,加一個低秩 Markov 順序頭逐個微調(結合兩者優點,避免平行的「後綴衰減」),再加信心評分和硬體感知排程。輸出用拒絕採樣保證數學等同──任何錯誤猜測直接丟,只保留真實模型會寫的 token。速度提升在 Flash 達 85%,Pro 達 78%。
關鍵是這兩個版本從設計之初就互為 perfect fit。Ornith 建在 QWen 和 Gemma 上,DeepSpec(DeSpark 的訓練框架)也正好為這兩個基座設計。所以實踐時,用 VLLM 或 SG Lang 啟動 Ornith 端點,掛上 DeSpark 草案模型,再指向 Claude Code,就能在本地機器跑前沿級代碼代理,無網絡、無費用、純隱私。一個 SWE Bench 82.4 的模型,推理快 85%,所有權在你手裡。
使用邊界很清楚:代碼必須本地、網路必須斷線、許可必須免費、拒絕 token 計費的場景,開源棧完勝。但最困難、最長的多步驟任務,那幾個頂端基準點真的生死攸關的情況,Opus 4.8(87 分)還是贏。聰明的做法是一套框架(Claude Code)長期不變,按任務換腦子──簡單的用本地開源加速版,難的臨時用雲端前沿。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


