用12个核心原理看懂AI Agent!
三句話摘要
AI Agent 底層運作的 12 個核心原理,從消息結構到多智能體協同。 Agent 不是黑魔法,而是由消息結構、提示策略、工具協議和迴圈控制這些簡單邏輯組件通過代碼拼接而成的系統工程。 訊息結構是底層基礎:AI 不是接收單句,而是接收包含全部歷史對話的 Message 陣列。系統以 JSON 格式標記「user」和「assistant」,AI 就是根據這個陣列內的所有上下文來預測下一個最可能的詞。無論多複雜的 AI 互動,本質都是在解析和推理這個數據結構。
重點整理
重點- 1
訊息結構是底層基礎:AI 不是接收單句,而是接收包含全部歷史對話的 Message 陣列。系統以 JSON 格式標記「user」和「assistant」,AI 就是根據這個陣列內的所有上下文來預測下一個最可能的詞。無論多複雜的 AI 互動,本質都是在解析和推理這個數據結構。
- 2
無狀態性決定記憶方式:AI 沒有真實記憶。每次對話都是完全新開始,它之所以能「記住」之前說過的話,是因為開發者在後台把歷史記錄重新打包進新的 Message 陣列裡。上下文窗口大小的平衡至關重要——太小會丟失信息,太大會增加成本並干擾 AI 的判斷。
- 3
控制 AI 行為需要多層策略:系統提示詞(System Prompt)像最高行為準則,在陣列最頂部設定 AI 的角色;Few-Shot 提示用具體例子而非抽象要求來約束輸出;預填充(Prefill)搶先寫好 AI 的開頭,讓它只能順著既定格式輸出;停止序列(Stop Sequence)則用停止符強行中斷 AI,把控制權交回代碼。
- 4
工具調用與 RAG 是企業應用的關鍵:AI 本身不能上網也不能調用工具,它只會輸出 JSON 格式的指令,實際執行由代碼完成。同樣,RAG(檢索增強生成)不是把公司資料灌進 AI 腦子,而是在每次提問時從文檔庫搜出相關片段,拼成新的 Prompt 發給 AI——相當於給 AI 做「開卷考試」。
實用技巧與重點
乾貨- 核心概念與技術名詞:
- Message 陣列(JSON 格式,標記 role: "user" 和 role: "assistant")
- 無狀態設計(Stateless)
- 上下文窗口(Context Window)
- System Prompt(系統提示詞)
- 思維鏈(Chain of Thought, CoT)
- Zero-Shot 提示 vs Few-Shot 提示(少樣本提示)
- 預填充(Prefill)
- 停止序列(Stop Sequence)
- 工具調用協議(Tool Use Protocol)
- 檢索增強生成(Retrieval-Augmented Generation, RAG)
- 幻覺(Hallucination)
- React 迴圈(Thought → Action → Observation)
- 多 Agent 編排(Multi-Agent Orchestration)
- 具體做法與效益:
- 「請一步一步計算」:準確率提升至 90% 以上
- Few-Shot 例子:比抽象要求更有效控制輸出格式
- 預填充左大括號:徹底消除 AI 的套話廢話,輸出純淨 JSON
- 停止序列設置為「observation」:防止 AI 幻想工具結果,確保真實執行
- RAG 流程:用戶提問 → 搜索文檔 → 拼接 Prompt → 發給 AI → 基於真實資料回答
- React 迴圈:每輪包含思考、行動、觀察,直到任務完成
- 多 Agent 模式:高層 Agent 分解任務,分發給垂直領域的子 Agent,最後匯總
結論
結論“Agent 不是黑魔法,而是由消息結構、提示策略、工具協議和迴圈控制這些簡單邏輯組件通過代碼拼接而成的系統工程。”
完整解析
詳細AI Agent 看起來很神秘,但底層運行邏輯其實是由多個簡單技術細節組合而成的系統工程。一切的起點是消息結構。當我們和 AI 對話時,並不是只發送當前這一句話,而是把整個對話歷史打包成一個 Message 陣列,用 JSON 格式明確標記哪句是用戶說的、哪句是 AI 回覆的。AI 就是通過逐句解析這個陣列,根據前面的所有信息計算並猜測下一個最可能出現的詞。這也解釋了為什麼 AI 看起來能和我們有來有回的對話。
但這裡有個顛覆性的真相:AI 根本沒有記憶。它沒有私密的儲存空間記住我們之前說過什麼。每次接收請求都是完全清空重新開始。如果我們先讓它寫一封郵件,再說「太長了,縮短一點」,它之所以知道要縮短什麼,是因為系統在後台把上一輪的所有內容(包括它自己的回覆)連同新指令一起重新打包成新的 Message 陣列發過去。這個陣列的容量上限就是著名的上下文窗口。開發者要在窗口大小、成本和 AI 理解能力之間找到平衡。
為了讓 AI 扮演特定角色,我們需要在 Message 陣列的最頂部加入一段系統提示詞(System Prompt)。它像是最高行為準則,會指導 AI 在後續所有對話中按特定方式思考。同一個問題「解釋什麼是 API」,加上不同的 System Prompt 會得到完全不同的回答。如果告訴 AI 它是面對 5 歲小孩的幼師,它就會用比喻而非教科書定義。
然而,AI 在複雜數學或嚴格格式上容易出錯。解決方案有三個層次。第一層是思維鏈(CoT):讓 AI 一步步寫出推理過程,而不是直接跳到答案。當 AI 寫出正確的中間步驟時,這些步驟就變成了它後續推理的上下文,大大提高準確率。第二層是Few-Shot 提示:與其抽象地要求「只輸出正面、負面或中性三個詞」,不如給出 2-3 個具體例子,AI 會直接模仿格式。第三層是預填充(Prefill):如果要 AI 返回 JSON,就在它要開始回答的位置提前寫好左大括號。AI 看到這個符號已經在這裡,就無法再說套話,只能老老實實地續寫 JSON 內容。
在讓 AI 自主決策時,停止序列(Stop Sequence) 是不可或缺的。想像 AI 決定要查天氣,它會輸出查詢命令。如果沒有停止信號,它會自己幻想出結果。設置停止序列(如「observation」)能強行打斷 AI,讓代碼去真實執行命令,再把真實結果拼回 AI 的 Prompt 裡。
在企業應用中,AI 經常需要訪問內部資料。重新訓練模型太貴,所以用檢索增強生成(RAG) 代替。當員工問「報銷額度是多少」,系統先從文檔庫搜出相關政策條款,再把條款和問題拼成新 Prompt 發給 AI。AI 相當於在做開卷考試,直接根據提供的資料回答,而非憑記憶編造。
真正的自主決策靠React 迴圈實現。AI 反覆執行三個動作:思考(根據當前信息推理下一步)、行動(輸出工具調用指令)、觀察(接收執行結果)。這個迴圈不斷轉圈,直到 AI 判定任務完成。工具調用的本質其實很簡單:AI 不能直接使用任何工具或上網,它只會輸出 JSON 指令。代碼負責解析這個指令、真實執行、把結果回傳。這就是工具調用協議。
最後一個挑戰是幻覺。因為 AI 是自回歸生成機制,它被逼著對所有問題都給出文字接續,即使在編造。幻覺是無法百分百消除的,但可以通過 RAG 提供真實材料、在 System Prompt 中強制約束、在關鍵決策點加入人工核查來壓制。
當這些技巧都掌握後,最後一步是多 Agent 編排。複雜任務用一個高層 Agent 接收用戶需求,它不親自幹活,而是分解任務分發給垂直領域的子 Agent(如機票 Agent、訂房 Agent、行程 Agent),最後再匯總結果。這樣每個 Agent 都能專注於自己的領域,大幅提升穩定性和效率。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


