KeyFrame內部研究專用

矽谷AI圈又有新概念?Harness Engineering已經過時了?Loop Agent能幫你找職缺、改履歷|哈佛姐夢遊矽谷

哈佛姐夢遊矽谷 AliceInSiliconWonderland·6月30日週二·16 min英文

三句話摘要

Harness Engineering 與 Loop Engineering 的區別、演進及實務應用。 Harness Engineering 是 Loop Engineering 的基礎,不是被替代的舊概念,兩者結合才能打造真正有效且安全的 AI agent 自動化系統。 AI 工程的層級演進,而非替代關係 — Harness Engineering(2026年2月出現)和 Loop Engineering(2026年最新)不是一前一後的替代,而是逐層進階。就像要寫好 Loop,必須先建立好 Harness,Harness 是準備工作的硬規則,Loop 則是自動化執行的循環邏輯。

重點整理

重點
  • 1

    AI 工程的層級演進,而非替代關係 — Harness Engineering(2026年2月出現)和 Loop Engineering(2026年最新)不是一前一後的替代,而是逐層進階。就像要寫好 Loop,必須先建立好 Harness,Harness 是準備工作的硬規則,Loop 則是自動化執行的循環邏輯。

  • 2

    Harness 的核心要素 — 以裝潢師傅的比喻說明:給 AI agent 提供設計圖(系統 prompt)、正確工具、執行規則、驗證標準,以及問題回報機制。Harness 分為執行前(告訴模型能做什麼)和執行後(檢查結果並反饋)兩部分。

  • 3

    Loop 區別於 Cron Job — Cron Job 只是定時執行,執行後不理會結果。Loop 則會執行→檢查結果→判斷是否達成標準→決定是否繼續重複,這個判斷回圈是 Loop Engineering 的靈魂。

  • 4

    Loop 的三大陷阱 — 必須設置停止條件(最多執行次數或 token 限制,否則帳單會爆炸)、初始 prompt 品質決定整個循環品質、完成任務不代表結果質量好,需評估解決方式是否可接受。

實用技巧與重點

乾貨
  • AI 工程時間線:
  • 2023 年:Prompt Engineering
  • 2024-2025 年:Context Engineering
  • 2025-2026 年:Harness Engineering(2月出現)
  • 2026 年:Loop Engineering
  • Harness 的兩部分:
  • Cover(執行前):系統 prompt、工具、中間件設置
  • Sensor(執行後):結果驗證、反饋機制
  • LangChain 實驗案例: 只改變 Harness(系統 prompt、工具、中間件),benchmark 分數從 52% 跳升至 66%
  • Loop 設計必要條件:
  • 停止條件(如執行 N 次後停止、token 達上限停止)
  • 進度策略(判斷是否達成目標)
  • 初始 prompt 品質
  • 適合 Loop 的任務特徵:
  • 結果是二元的(通過/失敗、成功/失敗)
  • 不需要創意判斷的重複工作
  • 有明確評分標準(如 AI 分數必須 > 90 分)
  • 不適合 Loop 的任務:
  • 需要詳細產品判斷
  • 需要人工創意決策的部分
  • Claude AI 平台功能:
  • Skills:設定 AI 的行動規則
  • Connectors:連接 Slack、Discord、Google、LinkedIn 等
  • Memory:記錄每次執行結果
  • 支持多個 AI 模型選擇(如 Opus 4.8)
  • Workspace:組合多個 agent 完成複雜任務
  • 實作案例(求職 Agent):
  • 執行時間:每天早上 9 點
  • 目標:查找 20 個工作機會
  • 篩選條件:頂級 AI 新創或同等級公司、職位狀態為開放
  • 額外功能:根據 JD 建議修改簡歷、生成客製化 PDF 簡歷、追蹤已申請工作
  • 人工介入:最後申請決策保留給人類

結論

結論

Harness Engineering 是 Loop Engineering 的基礎,不是被替代的舊概念,兩者結合才能打造真正有效且安全的 AI agent 自動化系統。

完整解析

詳細

在 2026 年 6 月,AI 業界對「如何與 AI 協作」的概念又有新的演進。Open Cloud 創辦人 Peter Steinberg 和 Anthropic 負責人 Boris Charny 各自發表了影響力深遠的看法:前者認為不該放棄編碼,而是要設置循環;後者則說自己已不再推廣 Prompt Engineering,而是專注於「寫循環」。這些言論在業界引發激烈討論,有人認為這是 AI 的未來,也有人質疑 Loop 只是換個名字的舊概念(如排程腳本),這促使我們需要深入理解 Harness Engineering 和 Loop Engineering 究竟是什麼。

要理解兩者的關係,首先要看 AI 工程的演進脈絡。從 2023 年開始,業界關注 Prompt Engineering(如何正確提問);2024-2025 年轉向 Context Engineering(提供背景資訊給 AI);2025-2026 年出現 Harness Engineering(建立 AI 的執行環境);2026 年最新概念則是 Loop Engineering(設計自動循環,減少人工干預)。這不是技術替代,而是工程層次的遞進。最好的比喻是:假設你僱一位能力超強的裝潢師傅來修繕房子。你不能只告訴他「修好我的房子」就走人,而要提供設計圖紙(明確要求)、給他正確工具、列出執行規則、訂定驗收標準,甚至告訴他遇到問題要找誰。這一整套準備工作就是 Harness Engineering,在 AI 世界裡對應的是:系統 prompt 設定、可用工具、執行規則、驗證機制。LangChain 曾做過實驗,在不改變基礎模型的情況下,只調整 Harness(改變系統 prompt、工具、中間件),測試分數從 52% 跳升到 66%,證明執行環境的設計非常關鍵。

然後在好的 Harness 基礎上,Loop Engineering 才能真正發揮作用。Loop 的核心概念是:你設定一個程序、定義目標條件、讓 AI 自動重複執行,直到達成標標準為止,中間不需要你每次都去推動。有人會問「這不就是 Cron Job 嗎?」,但差別很大:Cron Job 只是定時執行,執行完後就結束,無論結果如何;而 Loop 會執行→檢查結果→判斷是否達到標準→決定是否繼續迴圈,這個自我判斷的能力才是真正的 Loop Engineering。然而,使用 Loop 時有三個關鍵陷阱要注意:首先,必須設置停止條件(執行最多 N 次或 token 達上限時停止),否則無限循環會導致帳單爆炸;其次,初始 prompt 的品質是種子,直接決定整個循環的結果品質;第三,任務完成不等於質量好,某個 AI 可能寫出了功能代碼,但維護性差且有安全漏洞,Loop 解決問題的方式不一定符合你的接受度。因此,Loop 最適合用在結果二元的任務(通過/失敗)或有明確評分標準的工作上。

實際應用上,講者使用 Claude AI 平台搭建了一個求職 Agent 作為示範。這個 Agent 每天早上 9 點自動執行,去尋找 20 個頂級 AI 新創的開放職位,根據講者的簡歷提出針對性的修改建議,生成客製化的求職簡歷,並追蹤已申請的工作進度。整個流程結合了 Harness 的各個要素:明確的 Skills 規則(搜尋條件、篩選標準、簡歷修改邏輯)、外部連接(LinkedIn、Google Drive 等)、結果記憶和追蹤,以及一個關鍵的人工決策環節(最後申請前由人類確認)。Claude AI 平台的優勢在於,使用者不需要寫程式碼,只需用自然語言描述需求,平台就能幫助設計和自動化整個流程,大大降低了門檻。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。