KeyFrame內部研究專用

Recursive Coding Agents - Raymond Weitekamp, OpenProse

AI Engineer·6月25日週四·23 min英文

三句話摘要

如何通過遞迴結構與代理編程範式,將編碼代理轉變為可靠、自主的系統。 遞迴編碼代理透過統一工具調用與推理、讓代理自主決定問題分解策略,將AI系統從聰明但不可靠的工具轉變為可信賴的協作者。 可靠性是信任的基礎:演講者指出模型本身智能足夠,但代理無法可靠交付成果,導致無法被信任。解決方案不是追求更高智能,而是改進行為協調與工作管理機制。

重點整理

重點
  • 1

    可靠性是信任的基礎:演講者指出模型本身智能足夠,但代理無法可靠交付成果,導致無法被信任。解決方案不是追求更高智能,而是改進行為協調與工作管理機制。

  • 2

    RLM本質上是工具調用與推理的融合:不同於單純的鏈式思維,RLM讓代理在REPL環境中符號性地操作上下文,可以調用子代理遞迴處理問題,從而處理遠超上下文窗口的信息量(數千萬tokens)。

  • 3

    編碼代理需滿足特定條件才能成為RLM:可執行環境、外部化提示詞、代碼驅動模型、模型決定問題分解方式、符號狀態保持。不是所有有工具調用的系統都是RLM。

  • 4

    多個平台已實現遞迴編碼代理:Claude Code動態工作流、OpenPros語言、Pi(支援遞迴擴展)、Acts(TypeScript實現)等都提供了實踐路徑,開發者可根據需求選擇。

實用技巧與重點

乾貨
  • 關鍵基準成果:
  • Qwen 3.5 9B在長COT推理任務上超越Opus、GPT-5.4等頂級模型
  • Symbolica團隊的agentica RLM在ArcAGI 3發佈數小時內達到30%+準確率(對比基準2-3%)
  • RLM作為記憶系統可媲美或超越專門設計的記憶系統
  • 實現工具與框架:
  • DSPy.RLM(官方實現,適合基準測試)
  • Y Pi(基於Lambda演算Y組合子,完全遞迴)
  • Acts(TypeScript變體,支援代理間遞迴調用)
  • Unix RLM(純Bash + Linux文件系統)
  • OpenPros語言(支援任何編碼代理、Markdown規範、邏輯英語)
  • Claude Code動態工作流(最近發佈)
  • RLM vs其他系統的判別依據:
  • ✓ 需要:可執行環境、外部化提示詞、代碼驅動、代理決定分解策略、符號狀態
  • ✗ 不符合:純LLM、RAG(缺代碼/子代理/遞迴)、硬編碼MapReduce(代理不決定分解)
  • 應用場景與模式:
  • 規模遷移(Scale migrations)
  • 大規模重構(並行分解+合併)
  • 遞迴目錄深度分析
  • 審計與bug掃描
  • 對抗性驗證(懷疑代理、紅隊並行)
  • 黃金會話捕獲與重用(將成功工作流轉化為可重複的Pros程序)
  • Claude Code相關:
  • 官方部落格文章:《A Harness for Every Task》介紹6種工作流模式
  • 命令:`pros write` 讓Claude Code生成.pros.md文件
  • 類似:`code review ultra` 命令結構
  • 技術細節:
  • OpenPros可顯式聲明子代理工作、驗證工作品質
  • 支援在Pros中宣告技能、工具作為顯式依賴項

結論

結論

遞迴編碼代理透過統一工具調用與推理、讓代理自主決定問題分解策略,將AI系統從聰明但不可靠的工具轉變為可信賴的協作者。

完整解析

詳細

代理技術的核心困境在於可靠性而非智能。Raymond Whitecamp在OpenPros的工作中發現,現代AI代理就像「被誤管的天才」——它們具備充分的知識和能力,卻無法可靠地交付成果。他親身經歷過的矛盾最好地說明了這點:同一套系統某天能生成幾乎完整的SaaS應用,隔天卻會清空整個Solana錢包。這種不穩定性摧毀了信任,而信任恰恰是將AI代理用於生產環境的前提。

解決方案源於遞迴語言模型(RLM)的概念。RLM的核心洞察是,上下文本身就是計算對象。不同於傳統的鏈式思維直接在模型內部展開,RLM將代理放入一個可執行環境(如Python REPL),代理可以符號性地操作上下文——不是一次性讀入所有內容,而是選擇性地探索、調用工具、或派遣其他子代理去處理特定子問題。這種方式統一了工具調用和推理,使模型能在推理時「思考」如何分解問題。結果是驚人的:Qwen 3.5 9B這樣的小模型,在作為RLM運行時,竟能在長推理任務上超越Opus和GPT-5.4。Symbolica團隊更在ArcAGI 3發佈後數小時內,用RLM代理將準確率從2-3%推升到30%以上。

將RLM原則應用到編碼代理上就產生了遞迴編碼代理。這需要滿足五個條件:可執行環境、外部化提示詞、代碼驅動模型、模型決定問題分解方式、符號狀態保持。當前有多個實現路徑。Claude Code的動態工作流(Dynamic Workflows,剛發佈)使其成為RLM——代理現在可以編寫定義其他工作流的代碼,形成完整的遞迴結構。OpenPros則提供了更通用的方案:它是一種由編碼代理編譯而非傳統編譯器編譯的Markdown規範語言。使用者可以用`pros write`命令讓代理自動生成.pros.md文件,在其中顯式聲明子代理的職責、驗證標準,甚至依賴的技能或CLI工具。Y Pi、Acts等項目則展示了其他可行的架構。

實踐中的應用包括:大規模代碼遷移(並行分解任務,最後合併結果)、遞迴目錄分析、系統審計、bug掃描、甚至對抗性測試(多個懷疑代理並行驗證)。更創新的是「黃金會話捕獲」——當開發者獲得一次理想的代理表現時,可以用OpenPros將其自動分解為一個可重複的工作流,下次執行時就能穩定地達到相同品質。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。