Boris Cherny: Stop Hobbling Your AI
三句話摘要
Claude Opus 5如何突破AI代理產品的設計瓶頸,以及構建最前沿AI產品的核心方法論。 最前沿的AI產品不是透過新增更多約束和提示實現的,而是透過刪除冗餘、信任模型的真實能力、併為其提供自我驗證的機制來實現的。 消融方法論是新模型時代的核心實踐。每次新模型釋出,Claude Code團隊不是保留舊提示並微調,而是刪除所有系統提示和工具提示,然後一行一行恢復,確保每行都是必需的。這違反傳統工程的"前期設計"思路,卻能解鎖模型真實能力,因為每代模型能力差異巨大——三個月前有效的提示對下一代可能完全冗餘。
重點整理
重點- 1
消融方法論是新模型時代的核心實踐。每次新模型釋出,Claude Code團隊不是保留舊提示並微調,而是刪除所有系統提示和工具提示,然後一行一行恢復,確保每行都是必需的。這違反傳統工程的"前期設計"思路,卻能解鎖模型真實能力,因為每代模型能力差異巨大——三個月前有效的提示對下一代可能完全冗餘。
- 2
"解除約束"是產品與能力的核心差距。模型能做的事遠超產品允許做的事——這叫"產品滯後";反之產品要求模型做不了的叫"產品過載"。早期Claude Code正是透過移除腳手架和約束、給予完整終端訪問許可權,才從自動完成工具升級為程式碼生成引擎,這種思路對所有基於Claude的產品都適用。
- 3
驗證機制比提示本身更核心。模型能否持續完成長期任務,關鍵不是更復雜的指令,而是給予自我驗證能力——像Boris用Swift重寫Electron應用的任務,執行14天、生成數千個Agent,並沒有使用特殊的"斜槓目標"或複雜提示,只是讓模型能看到執行結果、對比輸出、發現問題。系統提示的價值在於教會模型如何使用產品和驗證工作,而非約束行為。
- 4
經驗方法論取代理論設計。最佳Claude使用者的共同特徵不是掌握"巧妙技巧"(不存在這樣的技巧),而是透過實驗、觀察模型的困難點、然後迭代解決。這需要放下傳統電腦科學的前期規劃思維,轉向像科學實驗一樣的實證迴圈。
實用技巧與重點
乾貨- 模型效能指標
- Arc AGI 3分數:Opus 5達30%(前代個位數或十幾分)
- Opus 5續航能力:可處理數天、數週甚至數月的任務,無需腳手架
- 系統提示改變
- Claude Code中系統提示刪除比例:80%+
- Opus 5相比Opus 4.7、4.8的改進:快速注入防護達到新層級
- 快速注入防護機制
- 三層防護組合:
- 三年對齊研究(研究alignment方法)
- 所有流量執行的快速注入分類器(基於Crystal的機制可解釋性工作)
- 神經元級監測(觀察模型大腦中被啟用的神經元)
- Claude Code實戰案例
- Bun專案:Zig程式碼庫完整重寫為Rust,用時11天,一次透過(此前人工需1年+)
- 專案規模:超過100,000行JavaScript執行時
- 驗證方法:完整測試套件(Bun有大型測試套件,Node.js也有),逐畫素比對
- 使用工具:動態工作流程(Workflow)
- Swift版Electron應用重寫
- 任務執行時長:14天+(仍在執行)
- 生成Agent數量:數千個
- 驗證流程:在Mac虛擬機器執行原Electron應用 → 截圖 → 逐畫素對比 → Swift版本修改
- 進度報告:Claude自動建立內部Slack頻道,每幾分鐘釋出一次進度截圖
- 自動維護例程(每日執行)
- 清理無用程式碼(死程式碼檢測與刪除)
- 刪除已完成的實驗程式碼
- 為需要測試覆蓋的區域編寫測試
- 刪除過時/無用的舊測試
- 抽象概念警察:識別並統一程式碼庫中重複的相似抽象
- 每天執行數量:20-30個例程
- 參與Agent規模:每天數百個,有時數千個
- 模型能力新發現
- 程式碼庫跨語言重寫(之前做不到,Sonnet 3.5開始可以)
- 影象繪製(基於OpenCV):人像、動物、風景等
- 持續多周任務的自主完成
- 工作流程技術
- 動態工作流程(Dynamic Workflows):
- 沙箱:基於Bun執行時
- 協調:管理數十、數百、數千個Agent
- 分階段執行:第一輪篩選 → 驗證/總結 → 第二輪擴散
- 本質:面向Agent的代數(序列執行、並行執行)
- Loop:本地cron任務
- Schedule:雲端執行,支援合蓋繼續執行
- 測試時計算(Test-Time Compute)
- 定義:模型生成的token數量的函式式表達
- 應用:動態工作流本質是協調測試時計算的新方法
- 歷史擴充套件規律基於:神經網路大小、訓練資料量、訓練浮點運算
- 新突破:透過工作流有效協調和分配計算資源
- 系統提示實驗功能
- 命令列設定:`--system-prompt` 可指定自定義系統提示
- 簡易模式(未公開):設定環境變數 `CLAUDE_CODE_SIMPLE=1` → 刪除所有系統提示(包括工具提示)
- 作用:用於消融測試確定提示有效性
結論
結論“最前沿的AI產品不是透過新增更多約束和提示實現的,而是透過刪除冗餘、信任模型的真實能力、併為其提供自我驗證的機制來實現的。”
完整解析
詳細Claude Opus 5的釋出標誌著AI代理產品設計思路的根本轉變。在這次對話中,Anthropic創始人Boris揭示了一個看似矛盾卻深刻的洞察:為了構建最強大的AI產品,需要做的第一步是刪除而非新增。
傳統工程思維認為,當新一代硬體或系統釋出時,應該在舊的最佳實踐基礎上改進。但Claude Code團隊採取了相反的策略。每當新模型推出時,他們不僅不繼承舊提示,反而完全刪除系統提示、工具提示和大量框架程式碼,然後透過嚴格的"消融方法"逐行恢復。這個過程的邏輯很簡單:因為每代模型能力差異巨大,三個月前對Sonnet的關鍵約束在Opus 5上可能完全冗餘,甚至會限制模型的實際能力。Opus 5就是這種方法的成果——刪除了80%的系統提示後,模型表現反而更強,Arc AGI 3基準達到30%(而前代僅為個位數或十幾分)。
這背後的產品理念是"解除約束"。Boris觀察到,產品設計中常見兩類錯誤:一是"產品滯後"——模型能做的事,但產品沒讓它做;二是"產品過載"——產品要求超出模型能力。Claude Code的演進正是逐步解除約束的故事。Sonnet 3.5時代,市面上的編碼產品只能做單行或多行自動完成,充其量是聊天對話。但模型實際能寫整個函式、整個檔案。Claude Code的突破就在於移除腳手架、開放終端訪問許可權,讓模型的真實能力得以釋放。這個模式同樣適用於任何Claude應用——最好的使用者體驗往往來自對模型能力的充分信任,而非對其行為的過度約束。
驗證機制的重要性被大大低估。Boris分享的兩個核心案例——Bun從Zig到Rust的完整程式碼庫重寫(11天完成,之前需1年+)和Swift版Electron應用的逐畫素重寫(執行14天、生成數千個Agent)——都不是靠複雜提示或特殊技巧實現的。關鍵是給予模型自我驗證的能力和清晰的成功標準。在Bun案例中,完整的測試套件讓模型知道是否做對了;在Swift重寫中,模型能在虛擬機器執行原應用、截圖、對比畫素級差異。這種反饋迴圈讓模型能自主發現問題、糾正錯誤、持續多周完成極複雜任務,而無需高度詳細的每一步指令。
最後,Boris強調了學習和使用Claude的正確心態:放下理論,擁抱實驗。傳統CS教育強調前期設計、全面規劃,但在AI代理時代,這套方法反而成了累贅。最高效的使用者會做的是:刪除所有約束 → 觀察模型在哪失敗 → 根據失敗調整。這不是提示工程技巧的問題("沒有秘密技巧"),而是思維方式的轉變——從"我需要告訴模型做什麼"轉向"我需要觀察模型能做什麼,然後支援它做得更好"。這種經驗科學的方法,是掌握Claude的關鍵。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


