EP345 - 不要再盲目追逐頂級模型了!為何建立「代理循環」系統比升級 AI 工具更重要?
三句話摘要
選對模型只是開始,真正的AI力量來自於怎麼設計系統、規劃流程,以及持續驗證優化的能力。 AI 的真正威力不在模型本身,而在於你如何規劃、驗證、設計系統,以及持續改進的意願。 模型選擇的甜蜜點:不是模型越貴越好,而是根據任務需求配置資源。GLM 52 在許多實際任務上表現不遜於 Opus,但成本遠低,對資源有限的個人創業者尤其關鍵。
重點整理
重點- 1
模型選擇的甜蜜點:不是模型越貴越好,而是根據任務需求配置資源。GLM 52 在許多實際任務上表現不遜於 Opus,但成本遠低,對資源有限的個人創業者尤其關鍵。
- 2
駕馭勝過模型本身:如果模型是 F1 引擎,駕馭就是車架、空力套件和車手。真正的掌控力來自如何設計流程、提供資料、設置檢查點,而這些全由你主導,模型的能力反而其次。
- 3
系統設計四步法:規劃(定義目標和驗收標準)、建構(交給 AI 執行)、驗證(測試並反覆修正)、演進(把每次失敗當升級機會),形成完整的 AI 生產流程。
- 4
代理循環的實用性:透過「推理→行動→觀察→迭代」的自我修正,AI 能獨立解決問題,不必人工逐次調整。關鍵是清晰的停止條件和可檢查的目標。
實用技巧與重點
乾貨- 模型與成本
- GLM 52:100 萬字上下文,輸入 $1+/百萬字,輸出 $4+/百萬字,開源模型(參數 7000+ 億)
- Opus:輸入 $5/百萬字,輸出 $25/百萬字(百萬字級別)
- 模型變笨區:Opus 在 25 萬字左右開始性能下降
- 第二大腦分級
- claudemd 檔案 + 清楚的資料夾結構
- 內部小維基(概念互相連接)
- 語義搜尋(找意思相近的內容)
- 成熟知識庫
- 全天候自動更新(易產生噪音,不建議)
- 驗證方法
- 寫程式跑測試、看圖表對齊、自己開網站點擊、模擬遊戲玩法
- 讓 AI 截圖比對、自我打分(如清晰度、吸引力),反覆改進
- 代理循環要素
- 可檢查的目標、明確的停止條件、足夠好的工具、記憶與日誌
- 實用規模:一個代理跑 30 分鐘到幾小時,不需要過度複雜的多代理艦隊
- 具體案例
- 代理設計縮圖:生 10 個概念、評分、挑前 3 名、改進、再評分(27 分鐘完成)
- 代理編輯影片:自動語音轉文字、剪口誤、抓節奏、驗證
- 代理生成網頁:查 45 個來源、改多版、驗證完成度
- 安全措施
- 設置權限、使用 hooks(在動作前後自動執行檢查)防止危險操作
- 假設 AI 終有一天會碰到它能碰得到的所有東西
結論
結論“AI 的真正威力不在模型本身,而在於你如何規劃、驗證、設計系統,以及持續改進的意願。”
完整解析
詳細影片討論的核心洞察是:許多人把焦點放在選最強的 AI 模型,但實際上這忽略了更重要的一層——如何有效駕馭它。講者提到最近推出的 GLM 52 模型,能處理 100 萬字上下文,成本卻只有 Opus 的五分之一。開發者 Nate 的實測顯示,GLM 52 在日常任務上的表現往往不遜於更昂貴的選項,有時甚至更快。這背後有一個重要觀念:80% 的日常工作(寫文案、整理報告、做設計)根本不需要頂級推理能力,用更便宜的模型搭配好的系統設計,能用五分之一的成本達成同樣效果。
真正決定 AI 效果的是「駕馭」——也就是你如何設計流程、提供資料、設置檢查點。軟體工程師 Matt Pocock 強調,模型像是 F1 賽車的引擎,但控制權在於車架、空力套件和駕駛座上的車手。他區分了「戰術性」工作(日常編碼、除蟲)和「策略性」工作(系統架構、模組設計)。AI 已經在戰術層面打敗人類,所以專業人士的價值會往策略層移動。開發者 Cole Medin 進一步指出,駕馭就是包裹在模型外層的「殼」,包含工具、上下文、claudemd 規則、hooks 和 MCP 伺服器,這層殼決定了 AI 能做什麼。
Cole 整理出了一套四步驟的系統:規劃、建構、驗證、演進。規劃是最多人偷懶的地方,卻最容易決定成敗。你應該花在規劃的時間比實作還多,寫清楚目標、完成條件,甚至讓 AI 當面試官質疑你的想法,逼你把模糊的地方想清楚。關於「第二大腦」(把筆記、會議記錄整理成 AI 能取用的系統),Nate Herk 把它分成五級,但建議大多數人停在第二級——用 claudemd 檔案加清晰的資料夾結構就能解決 90% 的問題。建構階段就輕鬆了,因為規劃已經做足。驗證則需要讓 AI 用真實方式測試(跑測試、截圖比對、自己點開網站),而不是只聽它說「我做完了」。最後的演進是把每次失敗當作系統升級的機會,不是只修這一個 bug,而是在系統層面防止它再發生。
這套流程最值得注意的是「代理循環」——代理透過推理、行動、觀察、迭代自我改善。你給它一個目標和完成標準,它自己跑這個圈,每一次都檢查、修正、再試,直到達標。Nate 的實例包括讓代理設計 27 分鐘來生成並評分縮圖、編輯影片時自動去口誤、甚至用 45 個來源完整驗證成品。最關鍵的是明確的停止條件——越接近客觀標準,循環跑得越漂亮。許多號稱「一鍵完成」的 AI 工具背後其實都是這種自我修正循環。但講者也提醒,對大多數人來說,一個單一循環跑 30 分鐘到幾小時就足夠,無需過度複雜的多代理艦隊。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


