KeyFrame內部研究專用

我的 AI agent 連續跑了 27 個小時,/goal 功能怎麼用?

Gary Chen·5月24日週日·15 min中文

三句話摘要

如何設計AI評分標準(Rubric),讓AI不眠不休地長時間自動迭代,從而真正解放你的注意力。 --- 寫Evaluation Rubric表面上是給AI用,實際上是在逼你把腦袋裡的模糊品味具體寫成文字,一旦寫出來AI就能幫你守住並大規模執行它。 Evaluation才是關鍵,不是Prompt工程

重點整理

重點
  • 1

    Evaluation才是關鍵,不是Prompt工程

  • 2

    最近所有工具推出的功能全指向同一件事:你能否定義清楚什麼叫「做得好」。Prompt工程和Context工程都是次要的,關鍵是評分標準能否被AI清晰執行。

  • 3

    清晰的完成定義決定了迭代品質

  • 4

    Rubric寫得好,AI會一直跑到你要的結果;寫得差,AI會在三分鐘內自己定義完成就停下來。完成標準包括Outcome(目標狀態)、Verification(驗證方式)、Constraints(限制條件)、Iteration Policy(每輪要做什麼)、Error Handling(何時暫停回報)。

  • 5

    質化工作需要拆解成多個維度加具體反例

  • 6

    Anthropic用「設計品質、原創性、技術執行、可用性」四維度評估網頁設計。不是寫「保持原創性」,而是列舉「絕對不要用Inter字體」、「絕對不要用紫漸層」等具體案例,讓評審一掃就抓得到問題。

  • 7

    多樣化案例防止AI過度擬合你的示例

  • 8

    初期用單一風格(如「博物館級質感」)會導致所有產出都是博物館風。改為列舉11種美學風格(Brutalist、Art Deco、Industrial等),讓AI根據狀況選擇,才能激發創意並保持多樣性。

  • 9

    --

實用技巧與重點

乾貨
  • 推出Goal功能的公司
  • Claude Code
  • OpenAI Codex
  • Hermes Agent
  • 核心概念
  • Context Anxiety:LLM感受到上下文快滿了就會開始wrap up
  • 執行者+評審者架構:執行者做事,評審者檢查是否達成目標
  • Ralph Loop:去年的插件,精神是無論如何持續做到底的循環
  • Anthropic網頁設計研究的4維度
  • 設計品質:顏色、字體、排版有無整體語言
  • 原創性:設計選擇有無刻意性,避免預設模板
  • 技術執行:字體階層、間距、配色、對比是否一致
  • 可用性:使用者能否直覺完成目的
  • Anthropic列舉的禁用字體
  • Inter
  • Roboto
  • Arial
  • System fonts
  • 禁用設計元素
  • 紫漸層蓋在白色卡片上
  • 6步SOP步驟
  • 讓AI做一輪baseline(如投5-10個寫作主題)
  • 親自看所有產出並記錄皺眉原因
  • 將皺眉原因分類成維度(如邏輯鬆散、沒有人味、開頭無hook)
  • 把每個維度轉化成具體案例(絕對不要用破折號、不要用「不是A,而是B」句型)
  • 用多樣化案例取代單一描述(列舉多種美學風格而非單一要求)
  • 把Rubric餵給評審Agent,人工檢查3-4輪確保一致性
  • 寫作Rubric具體案例
  • 絕對不要用破折號連接兩個短句當作節奏感
  • 絕對不要用「不是A,而是B」的句型
  • 絕對不要用「在這個快速變化的時代」或「在AI時代」當起手式
  • 任務設計對比
  • 模糊任務:「把這個專案改得好一點」
  • → AI會做1-2個小改動就說完成
  • 清晰任務:「把網站結帳頁面反應速度降到0.2秒以內,用速度測試工具驗證,過程中其他功能保持完好,只能改結帳區塊程式碼跟相關測試,別的地方不要動。每改一次記錄改了什麼、測出來的速度、下一個最值得試的方向。如果工具跑不起來或所有方法都試過了,停下來告訴我試過什麼、卡在哪、需要什麼資訊」
  • → AI會持續迭代直到達成
  • Anthropic網頁迭代案例
  • 第9輪:深色主題landing page,版面乾淨、視覺精緻
  • 第10輪:重新想像成空間體驗,用CSS透視渲染3D房間,地板黑白方格,藝術品不規則排列,觀眾穿過虛擬門進入展廳
  • 創意躍遷不是線性的,有可能第10輪比第15輪更好
  • --

結論

結論

寫Evaluation Rubric表面上是給AI用,實際上是在逼你把腦袋裡的模糊品味具體寫成文字,一旦寫出來AI就能幫你守住並大規模執行它。

完整解析

詳細

真正的自動化不只是把任務從你手上移到AI手上,而是把那件事從你的心上徹底移開。Cognitive Science已證實,只要你心裡還掛著一件沒處理完的事,無論有沒有親自做,都會佔用腦力——這正是注意力稀缺的時代最大的浪費。

去年底,Claude Code、OpenAI Codex與Hermes Agent幾乎同時推出了一個名叫goal的功能。表面上只是在對話框打斜線加目標就能讓AI自動跑,但這背後解決的是一個所有AI使用者都遇過的問題:LLM會中途停下來。你要它做完一件事,它做到一半就停下來問你「我可以繼續嗎?」或直接說「做完了」就把球丟回來,明明還沒完成。Anthropic的2025年研究發現根本原因叫context anxiety——LLM在執行任務時會看著自己用掉的context window,當快滿了就開始慌,莫名其妙就想wrap up交差。這是刻在LLM基因裡的惰性,或說下班心態。

Goal功能的運作原理是執行者與評審者的協作。執行者負責執行指令、產出東西,評審在每輪結束後檢查使用者給的目標完成了沒有。只要答案是沒有,評審就指出問題並叫執行者繼續,就像在豬鼻子前吊根胡蘿蔔——豬還沒吃到就不會停下來。這套邏輯去年曾以Ralph Loop插件掀起風潮,如今已被官方納入功能。

然而真正的挑戰不在使用goal,而在如何寫出能產出正確結果的提示詞而非AI slop。如果隨興丟出「把這個專案改得好一點」,AI會做1-2個小改動就說完成,因為「好一點」沒有邊界。但如果寫「把網站結帳頁面反應速度降到0.2秒以內,用速度測試工具驗證,其他功能保持完好只能改結帳程式碼,每改一次記錄改了什麼和結果以及下一個方向,工具跑不起來或所有方法都試過就停下來告訴我卡在哪」,就有五個關鍵元素:Outcome(目標狀態)、Verification(驗證方式)、Constraints(限制條件)、Iteration Policy(每輪要做什麼)、Error Handling(何時暫停回報)。

對於有單元測試的程式工作這很直接,但佔白領工作大多數的質化工作——圖片好不好看、文章寫得好不好、產品好不好用——沒有測試也難定義過關。Anthropic的研究用一個漂亮網頁設計案例展示解決方案:把模糊概念「漂亮」拆成四個明確維度。第一是設計品質,整個網頁有無統一的設計語言(顏色、字體、排版)。第二是原創性,有無刻意的設計選擇還是都用預設模板。第三是技術執行,字體階層、間距、配色、對比有無一致。第四是可用性,純看實用性——使用者看得懂介面、找得到按鈕、能否直覺完成目的。更聰明的是,他們故意加重Claude平常做不好的維度權重(設計品質和原創性),用評分標準當作benchmark校正模型的預設行為。評審不看程式碼而是用Playwright打開瀏覽器截圖打分。結果在第九輪時Claude做出深色landing page,版面乾淨精緻,但到第十輪它把網站重新想像成空間體驗——用CSS透視渲染3D房間,地板黑白方格,藝術品不規則掛在牆上,觀眾穿過虛擬門進入展廳。研究人員說這種創意躍遷根本不可能從單一prompt產出,而且這種創新不是線性增長的,有時第十輪反而比第十五輪更棒。

要把自己工作領域的品味拆解成AI可執行的準則,建議用六步SOP。第一步先讓AI做一輪工作測試baseline能力,比如投5-10個寫作主題進去。第二步親自看所有產出並記錄每個皺眉的具體原因——是開頭沒吸引力、沒具體例子、還是詞彙問題。第三步把這些理由分類成維度,比如邏輯鬆散、沒有人味、開頭無hook。第四步最關鍵:把每個維度整理成具體案例當reference。Anthropic的做法是寫「絕對不要用Inter、Roboto、Arial、system fonts」和「絕對不要用紫漸層蓋白卡片」,而非抽象的「保持原創性」。應用到寫作就是「絕對不要用破折號連接短句」「絕對不要用『不是A,而是B』句型」「絕對不要用『在這個快速變化的時代』起手式」——每一條評審一掃就抓得到。第五步用多樣化案例取代單一描述。Anthropic曾吃過虧,寫「請設計成博物館等級質感」結果全都變博物館風,改成列舉11種風格(Brutalist、Art Deco、Pastel、Industrial、Retro-futuristic等)讓Claude根據狀況選擇,確保多樣性激發創意。第六步把rubric餵給評審agent執行迭代,但初期要人工檢查3-4輪確保評審判斷與你的品味一致。跑個三四輪後你會發現自己心裡對「做得好」的定義正被逐條梳理出來。當你有這種感覺時,你就不再是AI的協作者,而是能定義品味的AI管理者。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。