How AI Agents Work: Prompt, Context, Harness & Loop Explained
三句話摘要
AI工程的四層金字塔:從提示工程、上下文工程、管道工程到迴圈工程,如何把單次對話升級為全自動代理系統。 AI的真正能力不在模型本身,而在如何層層疊加提示→上下文→工具→自動化,把被動的對話升級為全自主的代理系統。 提示工程的三要素:加上角色定義、明確問題、指定輸出格式就能戲劇性提升模型品質。同一個模型、同樣的空白起點,改變措辭方式就得到完全不同的結構化回答。
重點整理
重點- 1
提示工程的三要素:加上角色定義、明確問題、指定輸出格式就能戲劇性提升模型品質。同一個模型、同樣的空白起點,改變措辭方式就得到完全不同的結構化回答。
- 2
上下文工程的陷阱:不是餵進去更多資訊就更好,Chroma Research測試18個前沿模型發現全部都隨輸入長度增加而性能下降,200k token窗口的模型在50k就開始失效,這叫「上下文腐爛」。正確的上下文比數量多的上下文更重要。
- 3
管道工程的轉變:把AI從被動的「問答機」變成主動的「工作代理人」,給它工具(讀檔案、執行程式)、護欄、反饋迴圈,讓它觀察結果、自我反應、驗證修正,不用等待用戶每步輸入。
- 4
迴圈工程的三大風險:時間觸發(/loop)或條件觸發(/goal)都強大但危險,必須設硬token預算、避免模糊目標(須能二元驗證)、只用於真正重複且完成條件清晰的任務,否則是無限迴圈。
實用技巧與重點
乾貨- 所有18個frontier模型性能衰減:200k token窗口在50k時開始失效
- Prompt Engineering三要素:角色、具體問題、輸出格式
- 兩類agent架構對比
- Cloud Agent/Claude:自動上下文管理、速度便利
- Pi:4個內建工具、<1000 token系統提示、完全透明
- Harness三大功能:Tools(工具調用)、Guardrails(護欄)、Feedback Loops(反饋迴圈)
- 迴圈工程語法
- 時間觸發:`/loop every 50 minutes if [condition] then [action]`
- 條件觸發:`/goal [goal statement]`
- 獨立Evaluator驗證機制:Worker和Checker分離,避免自欺欺人
- 迴圈設計的三個必須
- 設硬token預算和最大迭代數
- 目標可二元驗證(檔案存在、欄數匹配),不能是「改進代碼」
- 適用情景:重複任務+清晰完成條件
結論
結論“AI的真正能力不在模型本身,而在如何層層疊加提示→上下文→工具→自動化,把被動的對話升級為全自主的代理系統。”
完整解析
詳細講者從Netflix影片分析案例出發,展示AI工程如何層層遞進提升系統能力。
第一層:提示工程 —— 改進「怎麼問」。當籠統地問「Netflix上什麼讓節目成功」時,模型只吐出通用廢話:流行類型、收視趨勢。加上三個要素就逆轉局面——定義角色(「你是數據分析師」)、明確問題(「為什麼電視劇比電影更容易續約」)、指定格式(「給三個假設和驗證指標」)。模型瞬間產出結構化、可測試的回答。提示工程就是改變措辭,戲劇性改善結果。
第二層:上下文工程 —— 「讓模型知道什麼」而非「怎麼問」。講者打開代碼庫模式、餵入筆記本和CSV檔案後,模型用真實欄位名稱、處理實際邊界情況、遵循項目編碼風格。但這裡有個反直覺的陷阱叫「上下文腐爛」:Chroma Research測試了18個最先進模型,全部都隨著輸入長度增加而性能下降。一個200k token窗口的模型在50k時已經開始失效。因此關鍵不是「更多上下文」而是「正確的上下文」——Andre Carpathy定義為「用恰好足夠的信息填滿上下文窗口來完成下一步」。
第三層:管道工程 —— 真正的飛躍。前兩層都還是「用戶→模型→等待輸出」的被動互動。管道工程給模型工具(tool calls)、護欄(guardrails)、反饋迴圈,把它從「回答機器」變成「工作代理人」。講者丟一句話給Cloud Agent:「執行Netflix分析筆記本,修復任何失敗的儲存格」。模型自動讀筆記本→執行→看到錯誤→編輯儲存格→重新執行驗證——全程無需用戶碰滑鼠,這才是管道工程。不同的harness有不同的策略:Cloud Agent自動處理上下文壓縮、記憶體管理、工具編排,方便快速;Pi則提供四個核心工具、完全透明,讓你掌控每一步。
第四層:迴圈工程 —— 設計自動觸發系統。用`/loop every 50 minutes if dataset changed then rerun notebook`讓Netflix分析每小時自動檢查新資料、更新報告,不用手動按開始鍵。更強大的是`/goal`:指定「直到筆記本無錯誤且日誌有今日紀錄」,模型持續迭代直到達成。系統巧妙地用獨立Evaluator驗證目標(避免worker自欺欺人),形成observe→decide→act→verify→repeat的閉迴圈。但迴圈有三個風險:token成本複合增長(必須設硬預算和迭代上限)、模糊目標會無限迴圈(「改進代碼」太模糊,必須能二元驗證)、不是所有任務都適合(只用於真正重複且完成條件清晰的工作)。
這四層層層堆疊,不是替代關係。迴圈裡仍有管道、管道裡仍有上下文、上下文裡仍有精心措辭的提示。但槓桿點逐步升級,從「我如何措辭」進化到「系統自動運作」。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


