KeyFrame內部研究專用

EP345 - 不要再盲目追逐頂級模型了!為何建立「代理循環」系統比升級 AI 工具更重要?

AI懶人報·6月20日週六·17 min中文

三句話摘要

選對模型只是開始,真正的AI力量來自於怎麼設計系統、規劃流程,以及持續驗證優化的能力。 AI 的真正威力不在模型本身,而在於你如何規劃、驗證、設計系統,以及持續改進的意願。 模型選擇的甜蜜點:不是模型越貴越好,而是根據任務需求配置資源。GLM 52 在許多實際任務上表現不遜於 Opus,但成本遠低,對資源有限的個人創業者尤其關鍵。

重點整理

重點
  • 1

    模型選擇的甜蜜點:不是模型越貴越好,而是根據任務需求配置資源。GLM 52 在許多實際任務上表現不遜於 Opus,但成本遠低,對資源有限的個人創業者尤其關鍵。

  • 2

    駕馭勝過模型本身:如果模型是 F1 引擎,駕馭就是車架、空力套件和車手。真正的掌控力來自如何設計流程、提供資料、設置檢查點,而這些全由你主導,模型的能力反而其次。

  • 3

    系統設計四步法:規劃(定義目標和驗收標準)、建構(交給 AI 執行)、驗證(測試並反覆修正)、演進(把每次失敗當升級機會),形成完整的 AI 生產流程。

  • 4

    代理循環的實用性:透過「推理→行動→觀察→迭代」的自我修正,AI 能獨立解決問題,不必人工逐次調整。關鍵是清晰的停止條件和可檢查的目標。

實用技巧與重點

乾貨
  • 模型與成本
  • GLM 52:100 萬字上下文,輸入 $1+/百萬字,輸出 $4+/百萬字,開源模型(參數 7000+ 億)
  • Opus:輸入 $5/百萬字,輸出 $25/百萬字(百萬字級別)
  • 模型變笨區:Opus 在 25 萬字左右開始性能下降
  • 第二大腦分級
  • claudemd 檔案 + 清楚的資料夾結構
  • 內部小維基(概念互相連接)
  • 語義搜尋(找意思相近的內容)
  • 成熟知識庫
  • 全天候自動更新(易產生噪音,不建議)
  • 驗證方法
  • 寫程式跑測試、看圖表對齊、自己開網站點擊、模擬遊戲玩法
  • 讓 AI 截圖比對、自我打分(如清晰度、吸引力),反覆改進
  • 代理循環要素
  • 可檢查的目標、明確的停止條件、足夠好的工具、記憶與日誌
  • 實用規模:一個代理跑 30 分鐘到幾小時,不需要過度複雜的多代理艦隊
  • 具體案例
  • 代理設計縮圖:生 10 個概念、評分、挑前 3 名、改進、再評分(27 分鐘完成)
  • 代理編輯影片:自動語音轉文字、剪口誤、抓節奏、驗證
  • 代理生成網頁:查 45 個來源、改多版、驗證完成度
  • 安全措施
  • 設置權限、使用 hooks(在動作前後自動執行檢查)防止危險操作
  • 假設 AI 終有一天會碰到它能碰得到的所有東西

結論

結論

AI 的真正威力不在模型本身,而在於你如何規劃、驗證、設計系統,以及持續改進的意願。

完整解析

詳細

影片討論的核心洞察是:許多人把焦點放在選最強的 AI 模型,但實際上這忽略了更重要的一層——如何有效駕馭它。講者提到最近推出的 GLM 52 模型,能處理 100 萬字上下文,成本卻只有 Opus 的五分之一。開發者 Nate 的實測顯示,GLM 52 在日常任務上的表現往往不遜於更昂貴的選項,有時甚至更快。這背後有一個重要觀念:80% 的日常工作(寫文案、整理報告、做設計)根本不需要頂級推理能力,用更便宜的模型搭配好的系統設計,能用五分之一的成本達成同樣效果。

真正決定 AI 效果的是「駕馭」——也就是你如何設計流程、提供資料、設置檢查點。軟體工程師 Matt Pocock 強調,模型像是 F1 賽車的引擎,但控制權在於車架、空力套件和駕駛座上的車手。他區分了「戰術性」工作(日常編碼、除蟲)和「策略性」工作(系統架構、模組設計)。AI 已經在戰術層面打敗人類,所以專業人士的價值會往策略層移動。開發者 Cole Medin 進一步指出,駕馭就是包裹在模型外層的「殼」,包含工具、上下文、claudemd 規則、hooks 和 MCP 伺服器,這層殼決定了 AI 能做什麼。

Cole 整理出了一套四步驟的系統:規劃、建構、驗證、演進。規劃是最多人偷懶的地方,卻最容易決定成敗。你應該花在規劃的時間比實作還多,寫清楚目標、完成條件,甚至讓 AI 當面試官質疑你的想法,逼你把模糊的地方想清楚。關於「第二大腦」(把筆記、會議記錄整理成 AI 能取用的系統),Nate Herk 把它分成五級,但建議大多數人停在第二級——用 claudemd 檔案加清晰的資料夾結構就能解決 90% 的問題。建構階段就輕鬆了,因為規劃已經做足。驗證則需要讓 AI 用真實方式測試(跑測試、截圖比對、自己點開網站),而不是只聽它說「我做完了」。最後的演進是把每次失敗當作系統升級的機會,不是只修這一個 bug,而是在系統層面防止它再發生。

這套流程最值得注意的是「代理循環」——代理透過推理、行動、觀察、迭代自我改善。你給它一個目標和完成標準,它自己跑這個圈,每一次都檢查、修正、再試,直到達標。Nate 的實例包括讓代理設計 27 分鐘來生成並評分縮圖、編輯影片時自動去口誤、甚至用 45 個來源完整驗證成品。最關鍵的是明確的停止條件——越接近客觀標準,循環跑得越漂亮。許多號稱「一鍵完成」的 AI 工具背後其實都是這種自我修正循環。但講者也提醒,對大多數人來說,一個單一循環跑 30 分鐘到幾小時就足夠,無需過度複雜的多代理艦隊。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。