KeyFrame內部研究專用

Simon Willison in conversation with Cat Wu & Thariq Shihipar, Anthropic

AI Engineer·7月15日週三·51 min英文

三句話摘要

Anthropic工程師分享Claude Code和Claude Tag的實踐經驗:從代理式程式設計如何改變團隊工作流程,到如何在大幅簡化系統提示詞的情況下保持品質。 當代理式編碼工具從「加快既有工作」演進到「改變工作本質」,成功的關鍵不在工具本身,而在於工程師願意提升野心、重新定義價值——從執行層的速度優化,轉向策略層的品味決策。 系統設計的演進——模型能力提升後,不再需要詳細示例和硬約束。Anthropic發現過度約束反而限制創意,改為提供上下文和更寬鬆的指引,讓Fable這類前沿模型自行判斷何時驗證工作、何時跳過冗餘步驟,但依然為舊模型保留完整提示詞。

重點整理

重點
  • 1

    系統設計的演進——模型能力提升後,不再需要詳細示例和硬約束。Anthropic發現過度約束反而限制創意,改為提供上下文和更寬鬆的指引,讓Fable這類前沿模型自行判斷何時驗證工作、何時跳過冗餘步驟,但依然為舊模型保留完整提示詞。

  • 2

    多人協作的實踐——Claude Tag成為Claude Code的團隊層演進,透過公開Slack頻道實現真正的協作,內置記憶機制讓偏好設定對整隊生效,可自動監測bug報告並主動建立PR,改變了工程團隊的工作節奏。

  • 3

    安全性與信任的建立——Auto Mode從1月內部測試到現在,經歷6個月強化、數千評估和多個外部紅隊的對抗測試。Anthropic採漸進策略:先要求人工審查所有PR,再逐步證明代碼審查達成100%捕獲特定檔案類別的問題,最後移除人工介入;每次事件後反向測試確保未來版本不回歸。

  • 4

    工作重心轉移——當實現變快時,產品品味和商業判斷變成真正的稀缺資源。工程師需停止只做「相同工作但更快」,改為提升野心指數:設計更宏大的系統、重寫整個子系統(如Jared重寫Bun成Rust)、透過更清晰的需求定義讓模型執行,而非耗時做前期規格文件。

實用技巧與重點

乾貨
  • 時間軸與產品
  • Claude Code發布:2024年2月(Sonnet 3.7發布時的功能點)
  • Fable發布:影片錄製時剛推出(2026年7月)
  • Claude Tag發布:一週前(約2026年7月初)
  • Auto Mode內部使用:自2026年1月起
  • Claude Science:新推出的獨立產品
  • 系統提示詞變化
  • Opus 4.8及Fable:系統提示詞減少80%
  • 舊模型:保留完整提示詞
  • 移除的元素:詳細示例、絕對化命令(如「總是驗證」)
  • 新方向:提供上下文、減少hard constraints
  • Claude Tag技術細節
  • 內部PR落地率:65%(product-engaged PRs)
  • 記憶存儲:每個頻道一個markdown檔案
  • 多人模式:共享頻道記憶+個人session記憶
  • 執行方式:Auto Mode + 多層安全架構
  • Auto Mode安全評估
  • 評估數量:數千個
  • 紅隊測試:多個外部團隊
  • 防護層:Sonic classifier判斷工具與上下文
  • 動態權限:理解用戶指令內的「別這樣做」
  • Sandbox互動:檢查網路請求合理性
  • Claude Code工具設計原則
  • 移除grep、glob搜尋工具,改用原生bash
  • 保留File Edit工具:原因是有專用UI展示變更
  • Auto Mode使用者可跳過File Edit確認
  • 新工具標準:低基數、每個工具功能互不重複
  • 代碼審查進階
  • 程式碼所有者負責關鍵領域approval
  • 每個PR經GitHub自動review
  • 複雜PR產出artifact說明以利審查
  • Code Review工具已能100%捕獲特定檔案類別的問題
  • 事件複盤時反向測試確保未來不回歸
  • 評估策略
  • 外部評估套件 + 內部評估套件
  • 初期優化:完整定義下是否正確決策與修復bug
  • 進階優化:行為評估(避免「該睡覺了」、「完成2/5,要繼續嗎?」)
  • 新模型上線:對比前代模型確保嚴格更優
  • 工作流程工具
  • Workflows用途:深度研究、旅行規劃、團隊off-site場地搜尋、climbing destination探索
  • 能力:跨多資料源、Mountain Project爬蟲、Airbnb搜尋、地理過濾

結論

結論

當代理式編碼工具從「加快既有工作」演進到「改變工作本質」,成功的關鍵不在工具本身,而在於工程師願意提升野心、重新定義價值——從執行層的速度優化,轉向策略層的品味決策。

完整解析

詳細

Claude Code在Anthropic內部的演進故事,反映了LLM代理技術從實驗室走向生產環境的整個過程。一年半前首次發布時,工程師需對每個權限提示投入極高警覺,頻繁拒絕Claude的提案,深入檢查每個檔案讀取。今年的轉變源自兩個方向的努力:模型能力的升級(尤其是新推出的Fable),以及團隊對人機協作模式的理解深化。Fable的發布更是帶來量級跳躍——系統提示詞竟能減少80%,這不是因為功能刪減,反而是因為Fable擁有足夠的判斷力,無需詳細的規則和示例就能做出正確決策。

在系統設計層面,Anthropic發現了一個反直覺的真理:過度約束反而限制了模型。初期的Opus系列需要大量示例才能理解意圖,但Fable無需這些拐杖。團隊從「執行驗證」改為「通常在做UI變更時無法僅通過API理解完整體驗,請考慮本地執行應用」——用上下文引導而非絕對命令。這種微調基於長期的評估反饋:當一條指令在90%的情況下正確,但10%有例外時,應該軟化該指令而非讓模型困惑於矛盾的約束。新推出的Claude Tag進一步強化了這套思想,但把焦點轉向團隊協作。不同於Claude Code的單人交互迭代,Claude Tag在Slack頻道中運作,多人可同時對話、貢獻指令,系統自動記憶團隊偏好(例如「監控bug但別監控warnings」)。內部數據顯示它已落地65%的product-engaged PRs——超過半數的生產PR。

安全性是支撐這些自動化的基石。Auto Mode從1月開始內部硬化,經歷6個月、數千評估和多個獨立紅隊的對抗測試。核心機制是Sonic classifier,它在每次Claude執行工具或bash指令時判斷該操作與用戶指令的對齐度。系統能理解動態權限(「別推送」就不推送,「推送到GitHub」就允許推送),也能與sandbox基礎設施協作——當網路請求試圖脫逃sandbox時,classifier判斷該請求是否合理。Anthropic採取漸進策略建立信任:最初所有變更需人工審查,逐步證明Code Review在特定檔案範圍內達成100%的缺陷捕獲,最後才移除該部分的人工介入。每次生產事件都反向測試,確保未來版本的Code Review規則不會回歸同樣錯誤。

工程師角色的變化最為深刻。當實現速度從6-12個月縮短到一週,產品品味和商業判斷變成稀缺資源。傳統的「先寫詳盡規格再編碼」已不適用。取而代之的是,工程師需在更早階段就判斷什麼值得構建、什麼能推動業務。Tharik分享的例子很典型:remote control功能起初他沒看出價值,認為直接用雲端session就夠,但推出後發現大量工程師採用這個流程——晚上插電關屏,用手機從沙發遠端控制筆電上的Claude Code。這正是狹隘的執行焦點容易錯失的洞察。為了適應,工程師需更新直覺:重寫不再是禁忌(若有好的測試套件),prototype變成日常(甚至在會議期間用手機快速試驗想法),而Workflows這類工具讓深度研究不再是瓶頸。Kat提供的climbing app例子展現了這種思路——不再是為「誰」編碼,而是為「什麼場景」編碼:一個自訂的系統,透過Workflows整合Mountain Project、Airbnb、航班資料,按攀岩等級和車程距離過濾目的地,這是人工操作無法規模化的體驗。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。