KeyFrame內部研究專用

5 AI Agent Terms You Need to Know

IBM Technology·6月23日週二·11 min英文

三句話摘要

Frontier AI agents運作原理:五個核心概念的技術架構解析。 掌握 agents.md、Agent Skills、MCP、A to A 和 Sub Agents 這五個關鍵概念,就能理解現代 Frontier AI 代理的完整技術棧——從內部行為指令、技能模組化、到外部工具連接、代理協調和並行計算的全面架構。 Agents.md 是項目特定的指令層:它作為 markdown 文件位於項目根目錄,定義了編碼規範、測試命令、PR 標題格式等內容,Agent 啟動時會讀取該文件。多層級 agents.md 可相互嵌套並根據距離覆蓋。

重點整理

重點
  • 1

    Agents.md 是項目特定的指令層:它作為 markdown 文件位於項目根目錄,定義了編碼規範、測試命令、PR 標題格式等內容,Agent 啟動時會讀取該文件。多層級 agents.md 可相互嵌套並根據距離覆蓋。

  • 2

    Agent Skills 解決上下文污染問題:技能模組只在相關任務出現時才被加載,避免 PowerPoint 製作技能在不需要時占用 context window,提升工作效率與靈活性。

  • 3

    MCP 提供統一的外部連接標準:透過 MCP 伺服器封裝各種工具和數據源(Notion、支付系統等),任何支持 MCP 的 Agent 無需自定義連接器就能調用,解決了多 Agent 多工具整合的碎片化問題。

  • 4

    A to A 實現 Agent 間的自主協調:採購 Agent 和財務 Agent 可透過發布各自的 agent card(包含功能描述與溝通方式),自動識別與委托任務,無需人工編寫自定義整合代碼。

  • 5

    Sub Agents 突破單一 context 的計算限制:主 Agent 可生成子代理並行處理(如同時檢查 20 個函數),每個子代理獨立執行、返回結果,使整體吞吐量提升 20 倍以上,同時保持主代理的上下文整潔。

實用技巧與重點

乾貨
  • Agents.md
  • 由 OpenAI 引入,後由 Agentec AI Foundation(Linux Foundation 旗下)維護
  • Claude 使用替代名稱 CLAUDE.md
  • 可嵌套配置,越近的配置優先級越高
  • 定義內容:測試命令、編碼規範、PR 標題格式、設置命令
  • Agent Skills
  • 文件結構:資料夾 > skill.md(metadata + 觸發描述)+ 腳本與資源
  • 支援多個 agent 平台
  • 按需加載機制
  • MCP(Model Context Protocol)
  • 起源:Anthropic 開發
  • 治理:AAIF(Linux Foundation 旗下)
  • 核心元件:MCP 伺服器(封裝工具/數據源的標準接口)
  • 行業支援:廣泛
  • A to A(Agent to Agent Protocol)
  • 起源:Google 開發
  • 治理:Linux Foundation
  • 核心機制:agent card(描述功能與通信方式)
  • 應用場景:採購 Agent ↔ 財務 Agent 協調
  • Sub Agents
  • 無正式標準文檔,但現代 agent 系統普遍採用
  • 基本結構:主 Agent → 生成子 Agent → 獨立 context → 返回結果
  • 使用場景:大規模文件讀取(500+ 檔案)、並行檢查(20+ 獨立任務)

結論

結論

掌握 agents.md、Agent Skills、MCP、A to A 和 Sub Agents 這五個關鍵概念,就能理解現代 Frontier AI 代理的完整技術棧——從內部行為指令、技能模組化、到外部工具連接、代理協調和並行計算的全面架構。

完整解析

詳細

前沿 AI 代理之所以能在代碼規劃和撰寫中表現出色,並非僅因為底層 LLM 的推理能力,而是取決於其架構中的五個關鍵層。首先,指令層定義代理的行為。Agents.md 檔案是一份位於專案根目錄的 markdown 文檔,代理每次啟動時都會讀取它。這個檔案告訴代理應該採用哪些編碼規範、執行哪些測試命令,甚至如何格式化 PR 標題。若要求是「提交前執行 npm test」,代理就會自動執行該命令。這相當於為代理量身定制的使用手冊。OpenAI 推出了這一標準,如今由 Linux Foundation 旗下的 Agentec AI Foundation 維護,而 Claude 則採用同樣邏輯但名為 CLAUDE.md 的檔案。

其次,模組化技能避免上下文污染。Agent Skills 是一種資料夾結構,包含 skill.md 檔案(含元數據和觸發條件描述)以及相關腳本和資源。其巧妙之處在於,當任務與某個技能無關時,該技能不會被加載進上下文窗口。舉例來說,如果代理需要製作 PowerPoint,但當前任務與此無關,這項技能會保持沈默,不佔用寶貴的 context window 空間。這套標準已獲多個代理平臺支援。

第三層是與外部系統的統一連接。MCP(Model Context Protocol)是一套開放協議,由 Anthropic 開發、現由 Linux Foundation 治理。它的核心概念是 MCP 伺服器,將各種工具、數據源(如 Notion、支付平臺等)和 API 封裝成標準接口。無論代理需要與 Notion、支付系統還是其他平臺交互,只要它們實現 MCP 伺服器,任何支持 MCP 的代理都能直接溝通,無需為每個工具都寫一套自定義連接器。

第四層是代理間的自主協調。A to A(Agent to Agent)協議由 Google 開發,現為 Linux Foundation 的開放標準。想像採購代理需要與財務代理協調:採購代理談妥合同後,需要財務代理批准支出。傳統做法需要人工編寫自定義集成代碼,但 A to A 則讓每個代理發布一張「agent card」——一份描述該代理功能和溝通方式的文檔。採購代理讀取財務代理的 agent card,自動理解如何委托任務,整個過程無需人工介入。

最後,子代理機制突破計算限制。Sub Agents 雖然沒有正式的標準文檔,但已成為現代代理系統的通用模式。當單一代理的工作量太大(如分析數千個檔案)或任務高度並行化(如對 20 個函數進行獨立檢查)時,主代理可生成多個子代理,每個子代理在獨立的上下文中執行任務並返回結果。這樣既保持了主代理的上下文整潔,又通過並行化將吞吐量提升數倍。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。