KeyFrame內部研究專用

15分鐘學會AI Agent|完整講解

李厂长来了·6月6日週六·14 min中文

三句話摘要

用三級台階概念拆解吳恩達 AI Agent 完整課程,說明何為 Agent、如何搭建,以及最常被忽略的評估環節。 AI Agent 的核心不在技術複雜度,而在於讓 AI 從「執行者」升格為「決策者」,並透過持續評估來驗證與改進——搭完不測試,等於只做了一半。 LLM → 工作流 → Agent 是三個層次,不是同一件事。 大語言模型只能被動回答問題;工作流加入固定步驟但決策仍由人控制;Agent 則讓 AI 自己拆解目標、選擇工具、反覆迭代,做決定的主體完全轉移給 AI。

重點整理

重點
  • 1

    LLM → 工作流 → Agent 是三個層次,不是同一件事。 大語言模型只能被動回答問題;工作流加入固定步驟但決策仍由人控制;Agent 則讓 AI 自己拆解目標、選擇工具、反覆迭代,做決定的主體完全轉移給 AI。

  • 2

    搭建 Agent 的核心是三塊積木的組合。 模型負責推理,工具負責連接外部系統(如查訂單、發訊息),評估則用來衡量輸出品質好壞,少了任何一塊,Agent 都是不完整的。

  • 3

    四種設計模式對應不同場景的複雜度。 反思與工具使用模式穩定可預測,適合日常任務;規劃與多智能體模式靈活自主,適合拆解複雜、多環節的大型任務。

  • 4

    評估是搭建 Agent 的另外一半,不是可選項。 不做評估就不知道 Agent 在哪種情境下會出錯,也無從針對性改進提示詞或流程;吳恩達明確指出,這是絕大多數人完成搭建後就直接跳過的致命盲點。

實用技巧與重點

乾貨
  • 課程來源:吳恩達 Deep Learning AI,共 5 模組、8 小時,完全免費
  • 三級台階:LLM → AI Workflow → AI Agent
  • 三塊積木:Model(模型)、Tool(工具)、Evaluation(評估)
  • 四種設計模式:
  • Reflection(反思模式):AI 自我審查、反覆修改輸出
  • Tool Use(工具使用模式):接入外部工具擴充執行能力
  • Planning(規劃模式):AI 自行制定執行路徑,靈活但難以預判
  • Multi-agent(多智能體模式):拆成多個子 Agent 分工協作
  • RAG(檢索增強生成)本質上是一種 AI 工作流,非 Agent
  • MCP(Model Context Protocol,模型上下文協議):統一標準,讓 Agent 更方便連接各種外部工具,不需每個工具單獨寫程式碼
  • ReAct = Reasoning + Action,所有 Agent 必備的兩種能力
  • 評估建議:用 10–20 個不同類型的測試案例,重點找 Agent 表現比人差的地方
  • 無程式碼工具推薦:make.com、n8n、Claude Skills
  • 行動清單共 5 步:釐清現在的階段 → 選重複任務搭工作流 → 讓 AI 開始做決定升級為 Agent → 做評估測試 → 不斷迭代

結論

結論

AI Agent 的核心不在技術複雜度,而在於讓 AI 從「執行者」升格為「決策者」,並透過持續評估來驗證與改進——搭完不測試,等於只做了一半。

完整解析

詳細

這支影片的出發點很實際:吳恩達在 Deep Learning AI 發布了一套完整的 AI Agent 課程,共五個模組、總時長八小時,但大多數人沒有時間從頭看完。作者花了兩整天研讀課程,再把核心概念壓縮成一支可以讓非技術背景的人也能看懂的影片。影片聚焦三件事:AI Agent 到底是什麼、怎麼搭建、以及那個幾乎所有人都跳過的評估環節。

作者用「三級台階」的方式建立認知框架。第一級是大家熟悉的大語言模型(LLM),ChatGPT、Claude、Gemini 都屬於這一層,特點是被動、只回答你問的問題,無法主動查看外部資訊。第二級是 AI 工作流,解決了 LLM 無法查詢外部資料的問題,例如讓 AI 在回答前先去查日曆或待辦清單,但流程是你事先設定好的,做決定的人仍是你。第三級才是真正的 AI Agent,關鍵的躍升在於:做決定的主體從人轉移給 AI。Agent 能自己拆解目標、自己決定用什麼工具、自己評估結果夠不夠好、再自己決定是否繼續修改,整個過程不需要人介入。作者順帶澄清了兩個常見術語:RAG(檢索增強生成)本質上就是工作流;ReAct(Reasoning + Action)則是所有 Agent 必備的核心能力——先推理再行動。

搭建 Agent 的骨架由三塊積木構成。第一塊是模型,負責思考與推理。第二塊是工具,負責連接外部系統;以自動回覆客服訊息的 Agent 為例,它需要一個連接訂單後台的查詢工具,以及一個能真正發送訊息的工具,光靠模型本身是無法完成這些動作的。MCP(模型上下文協議)在此扮演統一標準的角色,讓 Agent 更方便串接各種工具而不需要逐一寫程式。第三塊是評估,是最容易被忽略的積木,但吳恩達直接說「評估是搭建 AI Agent 的另外一半」。若你做了一個自動整理會議記錄的 Agent,在沒有評估的情況下你根本不會發現它偶爾會把「已完成事項」和「待辦事項」搞混,錯誤的記錄就這樣默默發出去了。

四種設計模式則決定你怎麼把積木組合起來。反思模式最簡單,讓 AI 做完後再自我審查一遍,效果往往顯著提升;工具使用模式是接入外部能力的標準做法;規劃模式讓 Agent 自行制定執行路徑,適合沒有固定流程的任務,但可預測性較低;多智能體模式是最高階的一種,把大任務拆給多個專業子 Agent 分工,例如選題 Agent、寫稿 Agent、SEO Agent 各司其職,最後整合結果。前兩種模式穩定可控,後兩種則靈活但複雜,選擇時對應自己的需求即可。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。