KeyFrame內部研究專用

Field Guide to Fable — Thariq Shihipar, Anthropic

AI Engineer·7月6日週一·19 min英文

三句話摘要

Anthropic 工程師分享如何理解並有效利用 Fable 模型的四個關鍵思維:解開限制、發現未知、面對變化、重新定義野心。 與其在舊時代的權衡框架中保持理性,不如用 AI 改變成本結構,重新定義野心與可能性的邊界。 能力的尖峰式進步:模型不是線性變聰明,而是在引入新工具或改變提示方式時,突然展現未曾預期的能力。例如給 Claude 代碼執行工具後,它能回答「哪些寶可夢名字包含 'aw'」,而純靠推理無法做到。這意味著我們對模型的理解還很初級,需要不斷發現新的「能力超調」(capability overhang)。

重點整理

重點
  • 1

    能力的尖峰式進步:模型不是線性變聰明,而是在引入新工具或改變提示方式時,突然展現未曾預期的能力。例如給 Claude 代碼執行工具後,它能回答「哪些寶可夢名字包含 'aw'」,而純靠推理無法做到。這意味著我們對模型的理解還很初級,需要不斷發現新的「能力超調」(capability overhang)。

  • 2

    系統提示的演變:舊模型需要大量系統提示、範例與細緻約束;新模型(Fable)反而更需要簡短的上下文與更少的限制,因為它比給定的範例更富創意。這需要改變我們提示工程的習慣。

  • 3

    三種方法找出自己的未知:用盲點掃描(blind spot pass)讓模型教我們已有程式碼的潛在問題;用草圖與訪談(brainstorm & interview)讓模型協助澄清模糊的需求;用參考代碼(reference code)而非文字規格讓模型更好理解目標。必須區分已知(known)與未知(unknown),以及已知的未知(known unknowns)與完全預料外的未知(unknown unknowns)。

  • 4

    重新評估權衡的本質:以往開發受限於成本與時間,必須在「快、好、便宜」中選二;現在 AI 改變了單位成本,應該停止在腦中默默接受權衡,而是用模型一次做多件事,重新定義什麼是「合理」。

實用技巧與重點

乾貨
  • 新工具與提示:Ask Question Tool(讓 Claude 主動向你提問,能生成 HTML 報告)、Markdown 與 HTML 輸出(從簡單的 Markdown 進化到可互動的 HTML 報告)
  • 系統提示大幅精簡:移除 Claude Code 系統提示的 80%
  • 能力進步案例
  • Sonnet 3.5 → Opus 4.5:Ask Question Tool 從幾乎無法呼叫到能回答 40 個問題
  • Opus 4.8 → Fable:能生成帶嵌入式問卷的完整 HTML 報告
  • Claude Code 進化:從必須貼入完整程式碼庫,到自己用 Bash 工具建立與搜尋上下文
  • 找未知的五種方法
  • Blind spot pass(掃描現有程式碼找陷阱)
  • Brainstorms & prototypes(四個完全不同的設計方案)
  • Interviews(讓模型問你問題,特別是會改變架構的問題)
  • References(用現有程式碼當範本而非文字規格)
  • Implementation notes(要求模型記錄每個決策與偏差)
  • 講者親身經歷:用 Fable 製作此演講簡報用時 4 小時,整個工作流程從數週縮短至數小時

結論

結論

與其在舊時代的權衡框架中保持理性,不如用 AI 改變成本結構,重新定義野心與可能性的邊界。

完整解析

詳細

Anthropic 技術人員 Therik Shihapar 在本次演講中,將 Fable 模型的推出比作玩角色扮演遊戲時,從教學關卡進入開放世界——既充滿可能性,卻也令人困惑。他認為解鎖 Fable 的能力需要四個心態轉變。

首先是「解開 Claude 的限制」。模型的進步並非線性,而是在特定工具或提示方式出現時,突然展現意料外的能力。他以寶可夢名字的例子說明:同樣的知識,給模型代碼執行工具後,它就能精確回答「名字包含 'aw' 的寶可夢有哪些」,而純推理則無法。這反映出我們對模型的理解還很膚淺,系統提示的最佳實踐也在演變——從前需要龐大的提示與範例,現在反而要精簡,讓模型有更多創意空間。

其次是「發現自己的未知」。講者用地圖與領土的比喻說明:你的計畫與規格是地圖,實際程式碼與約束是領土。模型往往會在地圖上沒有標註的地方碰到決策點。他介紹了五種方法來補齊這些缺口:盲點掃描讓 AI 教你現有程式碼的隱藏風險;草圖與原型幫助澄清模糊的設計偏好;讓模型主動訪談你以發現遺漏的需求;用現有程式碼作為參考而非冗長的文字規格;要求模型記錄每個決策,方便事後反思。

第三是「面對變化與失落」。講者坦誠,AI 讓工作變快、變容易,卻也讓手工編碼的滿足感消退。他回想起創業時期為了時間與成本的艱難取捨,以及編程的挫折與學習。如今他無法回到那個時代,但也因此學會了一個核心悟道:「唯一的出路就是走過去」——繼續學習、保持在迴圈中,才能通向更大的可能。

最後是「變得更有野心」。Anthropic 的文化信念是「權衡取捨並非真實」。以往的團隊會列出優先順序,在「好、快、便宜」中選二;現在 AI 改變了單位成本,應該停止在心中默默接受權衡,而是挑戰自己去同時做所有事。講者舉例,用 Fable 製作演講簡報只花了四小時,同時保持品質與享受過程。他相信,AI 工程師現在被世界寄予厚望,要證明 AI 不只是炒作,而是真的能提高生產力與生活品質。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。