Ralph-loop 2.0? The real autonomous coder is coming...
三句話摘要
Codex/Hermes 代理的「目標功能」如何實現長時間自主工作,克服模型懶惰問題。 目標功能通過 LLM 智慧判斷而非死板循環,結合結構化提示詞和長期任務的「Mission」概念,讓 AI 代理能勝任跨越數小時甚至數月的複雜自主工作。 代理的「懶惰問題」:模型容易提前宣告任務完成。傳統粗略循環(rough loop)用簡單 for 迴圈反覆觸發代理,但無法有效判斷真正完成。目標功能改用 LLM 調用,讓系統聰慧地判斷任務是否真正達成,只有通過審計驗證才標記為完成。
重點整理
重點- 1
代理的「懶惰問題」:模型容易提前宣告任務完成。傳統粗略循環(rough loop)用簡單 for 迴圈反覆觸發代理,但無法有效判斷真正完成。目標功能改用 LLM 調用,讓系統聰慧地判斷任務是否真正達成,只有通過審計驗證才標記為完成。
- 2
提示詞設計的關鍵:好的目標提示應定義目標內容、禁止改動部分、驗證進度方法,最重要的是明確「完成」定義。模糊條件(如「一直運行直到所有問題解決」)導致代理過早退出或陷入循環,必須給出可量化的數字作為停止條件。
- 3
前期溝通不可省略:代理開始前應瞭解專案背景、用戶關切、已嘗試的方法、應遵循的設計模式。Vincent(Open Claw 維護者)經 13 輪 3 天實驗證明,提前建立共識的結果遠優於直接丟提示詞。
- 4
長期任務的「Mission」概念:對於數週數月的目標(SEO、廣告優化、粉絲增長),單次長運行不奏效。改用 mission.md 記錄目標,代理執行一步→輸出成果→自動排定下次運行,每次新會話接收前次摘要持續迭代。
實用技巧與重點
乾貨- 啟用方式:`codex features list` 查看、`codex features enable goal` 啟用
- 使用命令:`/goal 目標` 啟動、`/goal` 查狀態、`/goal pause` 暫停、`/goal clear` 清除、`/help` 分支對話
- 工作原理:代理執行 → LLM 判斷是否完成 → 若否則更新提示 → 循環至完成
- 量化提示範例:「發現 20 個獨立新問題,每個都生成倉庫、提出修復、推送分支、記錄成果」
- 新專案提示範例:「構建 X 參考實現,列出反模式、日誌、應遵循設計模式、用戶期望」
- 輔助工具:Go Body(`npx go-body`)自動生成 goal.md 和 state.yaml
- Hermes 對應功能:持久幽靈功能,使用特殊 LLM 判斷結果
- 成功案例:9 小時連續遷移 JS→TS、6 小時自建 iOS 應用、Twitter 策略從平庸推文→創始人聲音→高互動
結論
結論“目標功能通過 LLM 智慧判斷而非死板循環,結合結構化提示詞和長期任務的「Mission」概念,讓 AI 代理能勝任跨越數小時甚至數月的複雜自主工作。”
完整解析
詳細AI 編碼代理在自主工作能力上已有顯著進步,但隨著任務複雜度增加,一個普遍問題浮現:模型傾向於「過早宣告勝利」。例如,請求代理修復倉庫中所有失敗測試時,代理往往在 10 到 15 分鐘後就聲稱完成,但實際上只是表面修復。開發者需要不斷提醒「還有 XYZ 任務未完成」才能繼續推進。這個問題促使工程師社群開發出「粗略循環」(rough loop)概念——在 for 迴圈中反覆觸發編碼代理,每次完成後將輸出寫入檔案系統再觸發下一輪。
Codex 和 Hermes 代理的「目標功能」升級了這套機制。它不採用簡單的程序迴圈,而是在每個迴合後調用大型語言模型,讓 LLM 判斷任務是否真正完成。若未完成,系統會自動生成更新的提示,列出目標文件並明確指示代理採取下一步具體行動;只有當 LLM 審計認定目標已實現,系統才標記為完成。這種改進使代理能處理不僅是明確的任務列表,還能應對模糊目標——例如「將 Docker 鏡像大小減少 60%」這類沒有預定義解決方案的挑戰,代理能自動探索多種途徑並逐步優化。
然而,要充分利用這個功能,提示詞的品質至關重要。優質的目標提示應該定義要實現的目標、禁止改動的部分、如何驗證進度,以及最關鍵的「完成」定義。Vincent(開源項目 Open Claw 的維護者)經過 13 輪連續 3 天的實驗得出一個重要洞察:代理開始工作前,應先花時間進行深度溝通——瞭解專案背景、用戶關切重點、已嘗試且排除的方法、應遵循的設計模式。若直接丟出提示詞,結果往往是無謂的循環。另一個常見錯誤是設定模糊的停止條件(如「一直運行直到所有問題解決」),這會讓模型要麼提前退出,要麼陷入無意義的重複。必須提供可量化的數字——比如「發現 20 個獨立新問題」就比「解決所有問題」更有效。Go Body 這類開源工具能自動將模糊目標轉換為結構化的 goal.md 文件和 state.yaml 任務清單,進而讓代理能更有序地推進工作。
對於需要持續數週或數月的長期目標(如 SEO 優化、廣告回報率優化或 Twitter 粉絲增長),單次長時間運行的局限性變得明顯。團隊引入了「Mission」概念:將長期目標記錄在 mission.md 文件中,明確定義要優化的指標,代理執行一步操作、輸出結果作為成果物,然後自動排定下次運行(可能是幾小時、幾天甚至幾週後)。每次新會話啟動時,都會接收 mission.md 與前次步驟摘要,形成持續迭代的循環。實踐中,結合人機交互也相當有用——代理若意識到某項行動過於激進或任務定義不清,可向人類發送訊息並調整狀態。在 Twitter 粉絲增長實驗中,代理觀察初期推文表現平庸,提出假設改用「創始人聲音」策略,結果互動率明顯提升;基於這個學習,代理繼續迭代,效果持續改善。這套方法同樣適用於廣告優化和產品增長。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


