KeyFrame內部研究專用

I Stopped Coding and Started Architecting Agents (And You Should Too)

Modern Software Engineering·6月24日週三·12 min英文

三句話摘要

透過「套套工程」設計指南與感測器,引導 AI 持續產出高品質程式碼並形成改進飛輪。 建立並維護符合團隊需求的 AI 套套,能形成程式碼品質持續改進的飛輪效應,是利用 Agentic AI 實現技術卓越的關鍵。 傳統 AI 工具(行內自動完成)分散注意力且價值有限,應改用 Agentic AI——它能在迴圈中迭代使用多個工具,產出能編譯執行的優質程式碼,並且可透過套套設計持續提升品質。

重點整理

重點
  • 1

    傳統 AI 工具(行內自動完成)分散注意力且價值有限,應改用 Agentic AI——它能在迴圈中迭代使用多個工具,產出能編譯執行的優質程式碼,並且可透過套套設計持續提升品質。

  • 2

    套套工程的核心是約束 AI 輸出,特別適合擁有大量遺留程式碼的團隊。因為 AI 會傾向複製程式碼庫中的設計模式,若基礎設計不良便會產生更多不良程式碼;但透過套套可形成「飛輪效應」——更好的程式碼引導 AI 產出更好的程式碼。

  • 3

    Guides 是前饋機制(Markdown 文件如「單元測試設計指南」),在 AI 編寫前提供建議;Sensors 是回饋機制(檢查指令碼或 linter),在程式碼完成後驗證品質。許多 AI 平台透過 skills 機制自動注入相關指南。

  • 4

    套套需持續維護,應將其視為與建構指令碼同等重要的工程資產。隨著程式碼庫改進與模型升級,許多指南和感測器會變得冗餘,團隊應定期評估、積極移除無效內容,避免套套臃腫化。

實用技巧與重點

乾貨
  • 套套工程概念出自 Begitta Burkula 的文章與播客
  • 套套成分:markdown 指南文件、感測器指令碼、技巧(skills)、鉤點(hooks)
  • Guides 機制:現代 AI 代理透過「skills」自動將相關指南注入 LLM 上下文
  • Sensors 實作:決定性指令碼檢查檔案行數限制、偵測程式碼異味等
  • 套套評估方法:取已完成任務,用有/無套套重新執行,比較輸出與原始接受程式碼
  • 維護策略:每個任務都更新套套、鼓勵移除非必要內容、定期 spot checks
  • 關鍵檔案:agents.md(Anthropic 文章提及)作為套套配置的重要部分
  • 核心原則:不應下載他人套套,應根據團隊偏好、程式碼風格與業務需求自行建立

結論

結論

建立並維護符合團隊需求的 AI 套套,能形成程式碼品質持續改進的飛輪效應,是利用 Agentic AI 實現技術卓越的關鍵。

完整解析

詳細

軟體開發中 AI 輔助已成常態,但許多開發人員只將 AI 視為高級的行內自動完成工具,導致認為 AI 沒有實際價值。Emily Bache 表示應改變思維,採用 Agentic AI——一種在迴圈中迭代、能調用多個工具的 AI 系統。這類工具的輸出通常可編譯且品質不俗,但要持續產出優質結果,需要一個精心設計的「套套」(Harness)。

套套工程是一套系統框架,包含兩個核心機制:指南(Guides)和感測器(Sensors)。指南是前饋機制,以 Markdown 文件形式存在,例如「單元測試應遵循 Arrange-Act-Assert 結構」等設計原則,在 AI 開始編寫程式碼前向其提供建議,AI 在迭代改進過程中可持續參考。感測器是回饋機制,通常是決定性的檢查指令碼(在建構流程或 linter 中執行),在程式碼完成後驗證是否違反特定規則。許多現代 AI 平台透過「skills」概念自動將相關指南注入 LLM 上下文,但團隊也可直接在提示或建構步驟中包含,這反而提供更多控制權。

對於擁有大量遺留程式碼的團隊,套套工程特別有價值。若程式碼庫本身設計不良,AI 會傾向複製這些模式,導致越來越多不良程式碼。講師的教練方法從改進單元測試設計開始,與 AI 協作數個回合,待團隊達成共識後,將這份「好設計」編成指南和感測器。往後 AI 處理類似任務時,就會遵循既定標準,形成「飛輪效應」——更好的程式碼帶來更好的指南,進而引導 AI 產出更好的程式碼,讓設計品質自我改進。

套套需持續演進。常見問題是指南與感測器不斷堆積,變得冗長低效。Anthropic 發表的文章提出評估方法:找出已完成的任務,分別用有/無套套重新執行相同提示,比較結果是否改進。雖然大規模實施較難(需大量樣本且耗時),但團隊應將套套視為與共享建構指令碼同等重要的工程資產。實踐上,每個任務都應審視是否更新套套,鼓勵開發人員積極移除無效內容,定期進行 spot checks。最重要的是,團隊應根據自身需求、程式碼風格與業務目標建立並擁有自己的套套,而非直接採用他人的,因為那樣無法理解其內涵,也會害怕修改。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。