KeyFrame內部研究專用

立党AI学习研究完整教程(第一期)

立党 lidang·6月23日週二·36 min中文

三句話摘要

2026年AI Agent學習與應用的實戰指南——從模型選擇到場景判斷的完整路線。 2026年學習AI Agent的核心是:選擇價效比最優的模型、掌握Agent的核心實現原理、建立通用定製化方案、在封閉可驗證的場景中應用,而不是盲目追求頂級模型或過度設計Multi-agent架構。 模型選擇的價效比邏輯。不必盲目訂閱頂級模型,80-90分的DeepSeek、阿里、百度等國產模型在普通程式設計和日常任務中價效比遠優於95分模型。就像普通程式設計不需要世界級數學家,日常工作的能力邊際收益遞減,額外的5分能力帶不來相應投資回報。

重點整理

重點
  • 1

    模型選擇的價效比邏輯。不必盲目訂閱頂級模型,80-90分的DeepSeek、阿里、百度等國產模型在普通程式設計和日常任務中價效比遠優於95分模型。就像普通程式設計不需要世界級數學家,日常工作的能力邊際收益遞減,額外的5分能力帶不來相應投資回報。

  • 2

    Agent開發是當代計算機教育的基礎課。學生必須手寫一個最小化的SV Agent,從Terminal執行、檔案讀寫、Prompt拼接、Function Calling等核心功能開始,理解而非複製現有實現。之後再學習Codex、CloudCode的Long-term Memory、Multi-agent管理、Context壓縮等進階特性。

  • 3

    非程式設計師的通用Agent方案。透過ClaudeCode繫結API Key、將任務文件放在臨時資料夾、用Node.js/Python指令碼以Headless模式全許可權呼叫、最後儲存JSON結果,即可實現完全定製化的Agent,效能往往超過手工設計。

  • 4

    Agent應用的嚴格邊界。最適合場景是封閉環境(本地可驗證、可模擬、可精確測試):程式設計、數學證明、晶片模擬、MATLAB、CAD設計等。股票預測、金融交易等跨越資訊邊界的任務不應交給Agent,因為人類尚無法解決的問題Agent同樣無法解決。

實用技巧與重點

乾貨
  • 推薦模型體系
  • 國產一線大模型:DeepSeek、Aliyun、百度、小米、快手、MiniMax等(價效比優先)
  • 國際模型:Claude、GPT family(成本考慮)
  • Agent核心功能清單
  • Terminal執行與輸出讀取
  • 檔案系統讀寫(I/O)
  • Prompt拼接與Function Calling
  • MCP整合與Tools呼叫
  • Long-term Memory實現
  • Multi-agent管理與排程
  • Background tasks管理
  • Skills/Plugins的選擇與呼叫
  • Context自動壓縮
  • Loop與Workflow流程控制
  • Sandbox環境隔離
  • 可觀測性與UI設計(TUI)
  • 學習參考實現
  • Codex(Rust實現)
  • CloudCode
  • OpenCode
  • Kimi Code
  • ZCode
  • 非程式設計師通用Agent方案步驟
  • ClaudeCode繫結API Key
  • 設定temp資料夾存放所有任務文件、資料庫、配置、Skills
  • 編寫Node.js/Python指令碼呼叫ClaudeCode Headless模式
  • 全許可權開啟(dangerously_skip_permission)
  • 成功/失敗狀態儲存為JSON檔案
  • 等待process結束後讀取JSON進行下一步
  • 最佳應用場景(封閉環境)
  • 程式設計:本地編譯、測試、報錯、迭代
  • 數學:LaTeX證明、本地檢查、Archive文獻參考
  • 晶片設計:EDA工具(Verilog、VHDL)、本地模擬驗證
  • 模擬系統:MATLAB、Simulink工具箱(100-200個)、訊號處理、流體力學、熱力學等
  • CAD與機械設計:AutoCAD、AutoLisp、G-Code、數控機床、PLC
  • 嵌入式與感測器模擬
  • Multi-agent反面案例
  • 程式設計:多Agent會產生程式碼merge混亂、工程管理問題
  • 流程鏈式執行:Sequential流程(產品→架構→程式設計→Review→測試)不如單Agent,效率反而下降
  • 公司架構模擬:多Agent相互溝通無管理,最終一團糟(Crew AI、MetaGPT等均踩坑)

結論

結論

2026年學習AI Agent的核心是:選擇價效比最優的模型、掌握Agent的核心實現原理、建立通用定製化方案、在封閉可驗證的場景中應用,而不是盲目追求頂級模型或過度設計Multi-agent架構。

完整解析

詳細

2026年的AI Agent學習需要從三個維度系統思考:模型選擇、實現路徑、應用邊界。

模型選擇的理性思維是首要問題。講者指出,對於全球大多數普通工作者而言,盲目追求最頂級的95分模型是浪費。80-90分的國產模型(DeepSeek、阿里、百度等)或開源模型已足夠解決普通程式設計、日常任務和工作需求。這個觀點的核心邏輯來自能力與成本的邊際關係——就如同普通數學問題不需要陳景潤或丘成桐來解決一樣,普通的前端開發、全棧應用、資料處理等工作,85分和95分的模型在實際應用中差異極微,使用者幾乎感知不到。額外的5分能力無法產生相應的投資回報,因此價效比最高的選擇是購買價效比最優的模型訂閱或充值。

Agent開發是當代計算機教育的新基礎課。講者明確指出,從2025-2026年起,每個計算機系學生的第一課就應該是手寫一個最小化的SV Agent。這就像過去的學生手寫Lisp直譯器、編譯器、作業系統一樣,是對該領域本質的理解。這個最小化Agent只需要實現Terminal執行、檔案讀寫、Prompt拼接、Function Calling等核心功能。學生不是為了重新造輪子,而是要理解為什麼要這樣設計。完成最小化實現後,應該閱讀Codex(Rust)、CloudCode、OpenCode等現代Agent框架的程式碼,學習它們如何實現Long-term Memory、Multi-agent排程、Background task管理、Context自動壓縮、Workflow流程控制、Sandbox隔離、可觀測性設計等進階特性。這個過程是從看懂 → 設計 → 實現 → 對標學習 → 迭代改進的完整閉環。

對於非程式設計師的通用Agent方案堪稱講者最實用的建議。他指出,如果直接開發Agent太複雜,可以用一個極簡方案:透過ClaudeCode的Headless模式,將所有與任務相關的文件、資料庫、配置檔案、Skills文件放在一個臨時資料夾,編寫Node.js或Python指令碼呼叫ClaudeCode API,全許可權開啟,讓系統自動執行整個流程,最後將成功或失敗狀態儲存為JSON檔案。這個方案的優勢在於無需深度程式設計能力,高中生都能實現,且效能和可維護性往往超過99%的手工設計方案。這就是講者所謂"價效比最優的通用Agent"——用好現成工具,定製化滿足自己的需求,往往勝過自己從零設計。

最後是Agent應用的嚴格邊界判斷,這也是講者最強調的部分。Agent最適合的場景是封閉環境——即本地完整可執行、可模擬、可精確驗證的領域。具體包括:程式設計(本地編譯、測試、實時反饋)、數學(LaTeX證明、計算機本地檢查)、晶片設計(EDA工具如Verilog/VHDL的本地模擬)、MATLAB/Simulink模擬(訊號處理、流體力學、熱力學、感測器等100-200個工具箱)、CAD與機械設計(AutoCAD、AutoLisp、數控機床程式設計)等。相反,金融預測、股票交易、開放市場預測等不應交給Agent,因為這些場景違反了資訊理論與英國論——人類尚無法可靠預測的問題,Agent同樣無法解決。講者強調,Agent不是神,不能超越資訊和邏輯的邊界,用Agent做金融預測最多是綜合網頁資訊後給出"可能漲也可能跌"的虛假結論,這是不負責任的。

此外,講者也批評了多年來Multi-agent領域的普遍誤區:程式設計場景不適合多Agent(會產生程式碼合併混亂)、串聯流程(如MetaGPT的產品→架構→程式設計→審查→測試)反而降低效率、公司架構模擬(團隊內各自對話)最終產生混亂無產出。Multi-agent真正適合的只有兩種場景:大規模並行任務(如Map-Reduce搜尋、爬蟲、資料稽核)和精細的流程控制Agent系統。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。