KeyFrame內部研究專用

一口气讲完12个Agent的底层原理,从message到多Agent,全程干货,建议收藏!

白白说大模型·7月7日週二·8 min中文

三句話摘要

AI Agent系統設計的12個底層原理,從對話機制到多Agent編排的完整解析。 Agent不是神秘的新技術,而是若干個看似簡單的技巧和通用原理的組合——每一個都是可理解和可掌握的。 對話與記憶機制:AI的每次對話請求都是全新開始,它沒有真正的記憶。所謂"記得"前面的內容,完全是因為系統把整個對話歷史以message數組格式重新塞給它。這就是上下文窗口的本質,也解釋了為什麼對話越長成本越高。

重點整理

重點
  • 1

    對話與記憶機制:AI的每次對話請求都是全新開始,它沒有真正的記憶。所謂"記得"前面的內容,完全是因為系統把整個對話歷史以message數組格式重新塞給它。這就是上下文窗口的本質,也解釋了為什麼對話越長成本越高。

  • 2

    角色塑造與思維鏈:System Prompt通過定義人設(如"你是一個挑剔的老板")立即改變AI的回複風格;Chain of Thought提示("請一步一步地算")讓AI按步驟推理而非直接蒙答,能使數字計算和複雜推理的准確率爆炸性提升。

  • 3

    格式控制三層防護:Few-shot提示(給3-5個完整例子)讓AI理解輸出模式;預填充(預先寫好開頭字符如{)阻止AI選擇其他開頭方式;停止序列(設定"觀察"等標志符)強制AI在指定位置停止,防止自行編造工具結果。

  • 4

    工具調用本質:AI本質上只輸出字符串,真實的工具調用發生在外部框架層面。流程是:AI按格式輸出JSON參數→框架解析並調用真實API→返回結果給AI→用戶獲取最終答案。這就是Function Calling的全部原理。

實用技巧與重點

乾貨
  • Message數組:對話歷史的JSON格式結構
  • System Prompt:`{角色定義}` 設定AI人設
  • Chain of Thought:"請一步一步地算" → 准確率提升
  • Few-shot提示:3-5個完整例子示範輸入輸出
  • 預填充(Prefilling):`{` 直接寫好第一個字符
  • 停止序列(Stop Sequences):`觀察` 等標志符號讓AI停止
  • Function Calling協議:AI輸出JSON → 外部框架調用API → 反饋結果
  • RAG(檢索增強生成):預先查詢文檔庫 → 塞入Prompt → 基於真實信息回答
  • ReAct模式:思考(Think) → 行動(Action) → 觀察(Observe) 的循環迭代
  • 多Agent編排:主Agent分配任務 → 子Agent並行執行 → 結果匯總

結論

結論

Agent不是神秘的新技術,而是若干個看似簡單的技巧和通用原理的組合——每一個都是可理解和可掌握的。

完整解析

詳細

AI Agent系統的運作機制遠比想象簡單。首先要理解對話基礎:用戶與AI的交互完全基於message數組這一數據結構,每條消息、每段對話都被格式化為JSON並傳輸給模型。這裡有個關鍵認知需要修正——AI並沒有真正的記憶。每當新請求到來時,模型都是全新開始計算,它之所以能"記住"前面的對話,完全是因為系統把整個對話歷史重新塞給它一遍。這就是上下文窗口的概念,也解釋了為什麼隨著對話輪數增加,成本會持續上升。

提升AI輸出質量的兩個關鍵杠杆是角色塑造和思維鏈。通過在請求前添加System Prompt(如"你是一個挑剔的老板"),可以立即改變AI的回複風格和語氣。同樣重要的是Chain of Thought技術——只需在提示中加入"請一步一步地算"這樣的指令,AI就會按部就班地推理而非直接蒙答案,這能讓數字計算和複雜推理的准確率大幅提升。這些看似微小的提示詞調整,背後是高效的工程實踐。

格式控制是構建穩定Agent的必要條件。單純要求"請按JSON格式輸出"往往不足以完全鎖定格式,需要三層防護。第一是Few-shot學習,給AI輸入3-5個完整的例子說明"輸入這樣,輸出就是這樣",AI看懂模式後就能穩定輸出;第二是預填充技術,直接在生成位置提前寫好第一個字符(如{),這樣AI就無法從其他方式開頭;第三是停止序列,告訴模型在看到特定標志(如"觀察")就立刻停止生成,防止AI自己繼續編造內容。

工具調用的真相經常被過度神秘化。實際上非常直白:AI永遠只做一件事——輸出字符串。真正的工具調用發生在外部框架層面。當需要查天氣時,流程是:告訴AI按照指定格式輸出JSON參數 → 框架檢測到這個JSON → 框架去調用天氣API → 把結果反饋給AI → 用戶最終收到處理後的答案。這就是Function Calling的全部含義。同樣的邏輯適用於訪問公司內部知識,即RAG(檢索增強生成)的實現——先用程序從文檔庫檢索相關段落,然後把這些信息塞進Prompt跟問題一起提交給AI,AI基於實際內容而非猜測去生成答案。

Agent的自主決策能力來自於優雅的循環結構——ReAct模式,其核心就是"思考-行動-觀察"的反復迭代。框架按照這個模板讓AI先思考需要做什麼、然後決定采取什麼行動、再把執行結果反饋給AI進行觀察,然後AI繼續思考下一步。就這樣循環,最終得出完整答案。理解了這個模式,AI的"自主決策"就不再神秘。

關於幻覺問題,這不是bug而是模型的基本機制。大語言模型本質上進行自回歸生成——根據前面的文字預測下一個最可能的字符。它沒有"知道"或"不知道"的概念,只會繼續輸出文字。當被問"李白在1985年發表了什麼著作"時,AI可能會編造聽起來合理的答案,因為它只是在接續字符。解決方案是讓AI基於事實——比如讓它先搜索相關信息,然後基於搜索結果回答,有效減少幻覺。

最後是多Agent編排,這是處理複雜任務的終極技巧。一個主Agent接到大任務後,可以根據需要分拆成多個子任務,分別分配給專業的子Agent去處理(一個查機票、一個查酒店、一個規劃行程),再把所有結果匯總給主Agent做最終決策。這種分工協作的模式讓複雜的業務流程能夠被自動化和並行化處理。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。