我的 AI agent 連續跑了 27 個小時,/goal 功能怎麼用?
三句話摘要
如何設計AI評分標準(Rubric),讓AI不眠不休地長時間自動迭代,從而真正解放你的注意力。 --- 寫Evaluation Rubric表面上是給AI用,實際上是在逼你把腦袋裡的模糊品味具體寫成文字,一旦寫出來AI就能幫你守住並大規模執行它。 Evaluation才是關鍵,不是Prompt工程
重點整理
重點- 1
Evaluation才是關鍵,不是Prompt工程
- 2
最近所有工具推出的功能全指向同一件事:你能否定義清楚什麼叫「做得好」。Prompt工程和Context工程都是次要的,關鍵是評分標準能否被AI清晰執行。
- 3
清晰的完成定義決定了迭代品質
- 4
Rubric寫得好,AI會一直跑到你要的結果;寫得差,AI會在三分鐘內自己定義完成就停下來。完成標準包括Outcome(目標狀態)、Verification(驗證方式)、Constraints(限制條件)、Iteration Policy(每輪要做什麼)、Error Handling(何時暫停回報)。
- 5
質化工作需要拆解成多個維度加具體反例
- 6
Anthropic用「設計品質、原創性、技術執行、可用性」四維度評估網頁設計。不是寫「保持原創性」,而是列舉「絕對不要用Inter字體」、「絕對不要用紫漸層」等具體案例,讓評審一掃就抓得到問題。
- 7
多樣化案例防止AI過度擬合你的示例
- 8
初期用單一風格(如「博物館級質感」)會導致所有產出都是博物館風。改為列舉11種美學風格(Brutalist、Art Deco、Industrial等),讓AI根據狀況選擇,才能激發創意並保持多樣性。
- 9
--
實用技巧與重點
乾貨- 推出Goal功能的公司
- Claude Code
- OpenAI Codex
- Hermes Agent
- 核心概念
- Context Anxiety:LLM感受到上下文快滿了就會開始wrap up
- 執行者+評審者架構:執行者做事,評審者檢查是否達成目標
- Ralph Loop:去年的插件,精神是無論如何持續做到底的循環
- Anthropic網頁設計研究的4維度
- 設計品質:顏色、字體、排版有無整體語言
- 原創性:設計選擇有無刻意性,避免預設模板
- 技術執行:字體階層、間距、配色、對比是否一致
- 可用性:使用者能否直覺完成目的
- Anthropic列舉的禁用字體
- Inter
- Roboto
- Arial
- System fonts
- 禁用設計元素
- 紫漸層蓋在白色卡片上
- 6步SOP步驟
- 讓AI做一輪baseline(如投5-10個寫作主題)
- 親自看所有產出並記錄皺眉原因
- 將皺眉原因分類成維度(如邏輯鬆散、沒有人味、開頭無hook)
- 把每個維度轉化成具體案例(絕對不要用破折號、不要用「不是A,而是B」句型)
- 用多樣化案例取代單一描述(列舉多種美學風格而非單一要求)
- 把Rubric餵給評審Agent,人工檢查3-4輪確保一致性
- 寫作Rubric具體案例
- 絕對不要用破折號連接兩個短句當作節奏感
- 絕對不要用「不是A,而是B」的句型
- 絕對不要用「在這個快速變化的時代」或「在AI時代」當起手式
- 任務設計對比
- 模糊任務:「把這個專案改得好一點」
- → AI會做1-2個小改動就說完成
- 清晰任務:「把網站結帳頁面反應速度降到0.2秒以內,用速度測試工具驗證,過程中其他功能保持完好,只能改結帳區塊程式碼跟相關測試,別的地方不要動。每改一次記錄改了什麼、測出來的速度、下一個最值得試的方向。如果工具跑不起來或所有方法都試過了,停下來告訴我試過什麼、卡在哪、需要什麼資訊」
- → AI會持續迭代直到達成
- Anthropic網頁迭代案例
- 第9輪:深色主題landing page,版面乾淨、視覺精緻
- 第10輪:重新想像成空間體驗,用CSS透視渲染3D房間,地板黑白方格,藝術品不規則排列,觀眾穿過虛擬門進入展廳
- 創意躍遷不是線性的,有可能第10輪比第15輪更好
- --
結論
結論“寫Evaluation Rubric表面上是給AI用,實際上是在逼你把腦袋裡的模糊品味具體寫成文字,一旦寫出來AI就能幫你守住並大規模執行它。”
完整解析
詳細真正的自動化不只是把任務從你手上移到AI手上,而是把那件事從你的心上徹底移開。Cognitive Science已證實,只要你心裡還掛著一件沒處理完的事,無論有沒有親自做,都會佔用腦力——這正是注意力稀缺的時代最大的浪費。
去年底,Claude Code、OpenAI Codex與Hermes Agent幾乎同時推出了一個名叫goal的功能。表面上只是在對話框打斜線加目標就能讓AI自動跑,但這背後解決的是一個所有AI使用者都遇過的問題:LLM會中途停下來。你要它做完一件事,它做到一半就停下來問你「我可以繼續嗎?」或直接說「做完了」就把球丟回來,明明還沒完成。Anthropic的2025年研究發現根本原因叫context anxiety——LLM在執行任務時會看著自己用掉的context window,當快滿了就開始慌,莫名其妙就想wrap up交差。這是刻在LLM基因裡的惰性,或說下班心態。
Goal功能的運作原理是執行者與評審者的協作。執行者負責執行指令、產出東西,評審在每輪結束後檢查使用者給的目標完成了沒有。只要答案是沒有,評審就指出問題並叫執行者繼續,就像在豬鼻子前吊根胡蘿蔔——豬還沒吃到就不會停下來。這套邏輯去年曾以Ralph Loop插件掀起風潮,如今已被官方納入功能。
然而真正的挑戰不在使用goal,而在如何寫出能產出正確結果的提示詞而非AI slop。如果隨興丟出「把這個專案改得好一點」,AI會做1-2個小改動就說完成,因為「好一點」沒有邊界。但如果寫「把網站結帳頁面反應速度降到0.2秒以內,用速度測試工具驗證,其他功能保持完好只能改結帳程式碼,每改一次記錄改了什麼和結果以及下一個方向,工具跑不起來或所有方法都試過就停下來告訴我卡在哪」,就有五個關鍵元素:Outcome(目標狀態)、Verification(驗證方式)、Constraints(限制條件)、Iteration Policy(每輪要做什麼)、Error Handling(何時暫停回報)。
對於有單元測試的程式工作這很直接,但佔白領工作大多數的質化工作——圖片好不好看、文章寫得好不好、產品好不好用——沒有測試也難定義過關。Anthropic的研究用一個漂亮網頁設計案例展示解決方案:把模糊概念「漂亮」拆成四個明確維度。第一是設計品質,整個網頁有無統一的設計語言(顏色、字體、排版)。第二是原創性,有無刻意的設計選擇還是都用預設模板。第三是技術執行,字體階層、間距、配色、對比有無一致。第四是可用性,純看實用性——使用者看得懂介面、找得到按鈕、能否直覺完成目的。更聰明的是,他們故意加重Claude平常做不好的維度權重(設計品質和原創性),用評分標準當作benchmark校正模型的預設行為。評審不看程式碼而是用Playwright打開瀏覽器截圖打分。結果在第九輪時Claude做出深色landing page,版面乾淨精緻,但到第十輪它把網站重新想像成空間體驗——用CSS透視渲染3D房間,地板黑白方格,藝術品不規則掛在牆上,觀眾穿過虛擬門進入展廳。研究人員說這種創意躍遷根本不可能從單一prompt產出,而且這種創新不是線性增長的,有時第十輪反而比第十五輪更棒。
要把自己工作領域的品味拆解成AI可執行的準則,建議用六步SOP。第一步先讓AI做一輪工作測試baseline能力,比如投5-10個寫作主題進去。第二步親自看所有產出並記錄每個皺眉的具體原因——是開頭沒吸引力、沒具體例子、還是詞彙問題。第三步把這些理由分類成維度,比如邏輯鬆散、沒有人味、開頭無hook。第四步最關鍵:把每個維度整理成具體案例當reference。Anthropic的做法是寫「絕對不要用Inter、Roboto、Arial、system fonts」和「絕對不要用紫漸層蓋白卡片」,而非抽象的「保持原創性」。應用到寫作就是「絕對不要用破折號連接短句」「絕對不要用『不是A,而是B』句型」「絕對不要用『在這個快速變化的時代』起手式」——每一條評審一掃就抓得到。第五步用多樣化案例取代單一描述。Anthropic曾吃過虧,寫「請設計成博物館等級質感」結果全都變博物館風,改成列舉11種風格(Brutalist、Art Deco、Pastel、Industrial、Retro-futuristic等)讓Claude根據狀況選擇,確保多樣性激發創意。第六步把rubric餵給評審agent執行迭代,但初期要人工檢查3-4輪確保評審判斷與你的品味一致。跑個三四輪後你會發現自己心裡對「做得好」的定義正被逐條梳理出來。當你有這種感覺時,你就不再是AI的協作者,而是能定義品味的AI管理者。
---
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


