KeyFrame內部研究專用

Ultimate Claude Guide: How to Use Claude AI for Beginners in 2026

AI Master·7月18日週六·30 min英文

三句話摘要

Claude 5 新世代模型與平台完整指南:從五層模型梯隊到自主代理工作流的決策框架。 Sonnet 5 預設執行所有任務,Opus 處理真正困難的工作,Fable 在你睡覺時執行整個專案,Haiku 作為基層執行器,Mythos 5 在 Glasswing 開放前保持視野——一套清晰的決策框架。 Sonnet 5 質量翻轉期待:在知識工作基準測試中超越舊款 Opus,卻只要 Opus 成本的三分之一,能從零獨立構建生產級應用。關鍵在於它不只產生程式碼,而是推理整體使用情境並自動填補你沒想到的邏輯空缺(如實現正確的間隔重複演算法、避免物理模擬無限振盪)。

重點整理

重點
  • 1

    Sonnet 5 質量翻轉期待:在知識工作基準測試中超越舊款 Opus,卻只要 Opus 成本的三分之一,能從零獨立構建生產級應用。關鍵在於它不只產生程式碼,而是推理整體使用情境並自動填補你沒想到的邏輯空缺(如實現正確的間隔重複演算法、避免物理模擬無限振盪)。

  • 2

    Adaptive Thinking 終結手動預算猜測:舊系統需固定設置思考預算,新系統根據任務自動決定深度。從 Low(秒級列表)到 Max(主動提問澄清問題再規劃),讓 Claude 像真正的顧問而非機械回應機。

  • 3

    Fable 5 自主代理顛覆工作分配:簡報後獨立運行,自動規劃、處理錯誤、重新路由,交付完整成果。成本計算不是 token 而是完成專案,八小時自主執行往往比三天手動驅動便宜。

  • 4

    Projects + Memory + Cowork 構成新工作流基礎:一次上傳知識庫即永遠可用,記憶跨對話保持背景,平行多代理執行原本需要重複解釋的工作,從根本改變了協作的摩擦成本。

實用技巧與重點

乾貨
  • 模型與定價
  • Haiku 4.5:基礎層,支援每小時千次呼叫
  • Sonnet 5:$2/百萬輸入 token(8月後$3),前期優惠至 2026 年 8 月
  • Opus 4.8:$5 輸入/$25 輸出,深文件分析和長期記憶工作
  • Fable 5:$10 輸入/$50 輸出,八小時自主專案約 500 USD
  • Mythos 5:Project Glasswing 邀請制,能力超越 Fable 5
  • 具體案例數據
  • Sonnet 5 西班牙語應用:7 分鐘構建,含遊戲/間隔重複/動畫/localStorage,生產級質量
  • Sonnet 5 知識圖:8 分鐘構建,自寫彈簧物理模擬,60fps,代碼不超 40 行
  • Opus 4.8 SQL 課程:5 模組、3 個概念加類比、2 個練習、5 題測驗、頂石專案
  • Opus 4.8 Apple 10K 分析:自動發現兩章節數字不符並交叉檢驗
  • Fable 5 Chrome 擴充:晚 11 點提交,早 7 點交付(含擴充、文檔、測試影片、3 個自動修復錯誤)
  • Haiku 4.5 CSV 處理:200 列各需 <30 字描述,自動並行生成子代理
  • 新功能細節
  • Adaptive Thinking 四階段:Low(秒級回應)、Medium(含邏輯)、High(實際規劃)、XHigh(全面分析)、Max(先澄清再規劃)
  • Cowork:同一 Project 平行多代理,節省 20 分鐘重複解釋,11 分鐘完成原需時間更長的任務
  • Claude Design:內建設計工具,跳過 Figma 往返,概念到視覺 2 分鐘
  • Dynamic Workflows:大模型生成數百/千個平行 Haiku 子代理
  • Projects 與 Memory
  • Free:5 個 Project,付費版無上限
  • 知識庫自動檢索模式:超出上下文限制時啟用,容量擴增約 10 倍,無需手動設置
  • 分享權限:Can use(聊天不可編輯)vs Can edit(可新增文檔和指令)
  • Memory 更新頻率:自動每 24 小時,可手動指定立即記憶
  • 隱匿模式:跳過該次對話的 Memory 記錄
  • 訂閱方案
  • Free:中層模型、5 小時訊息窗、5 個 Project、無 Claude Code 和 Cowork
  • Pro:$20/月(年繳 $17/月),完整模型梯隊、Claude Code、Cowork、Research、Adaptive Thinking
  • Max:$100/月(5 倍額度)或 $200/月(20 倍額度)
  • Team/Enterprise:自訂定價,支援組織共享和集中帳單
  • 重要注意事項
  • Sonnet 5 新 tokenizer:同樣文本產生約 30% 更多 token,舊的 max_tokens 設置和成本估算需重新校準
  • Mythos 5 當前無開放訪問,由 Glasswing 計畫策選
  • Fable 5 基準數來自 Anthropic 系統卡和第三方追蹤,非獨立複製
  • Stripe 案例是一方客戶引述,可信度高

結論

結論

Sonnet 5 預設執行所有任務,Opus 處理真正困難的工作,Fable 在你睡覺時執行整個專案,Haiku 作為基層執行器,Mythos 5 在 Glasswing 開放前保持視野——一套清晰的決策框架。

完整解析

詳細

Claude 5 的發布重組了 AI 助手的整個邏輯。講者開門見山指出,如果你還在三個模型間猶豫,那套決策系統已經過時——Anthropic 推出了新的五層梯隊,並在最頂端新增 Mythos 等級,大多數使用者還沒跟上。

平台功能層首先被重新定義。Custom Instructions 用四句話改變每個回應的形狀——說明頻道風格(直接答案、引用來源、歡迎反駁)就足夠徹底改變輸出。Projects 功能讓使用者為特定工作流建立獨立的知識庫和指令集,上傳一次文件後永遠不用重複貼上,知識庫超出上下文時自動切換檢索模式,容量擴增約十倍。Memory 系統在後台追蹤使用者的角色、習慣、風格,跨對話保持上下文——講者提到兩週前說過一次肩膀在過頭推時疼,新對話中 Claude 直接記得,完全不用重複。Adaptive Thinking 是真正的心智轉變:舊系統需手動設置固定思考預算,新系統讓 Claude 根據任務複雜度自動決定,從秒級快速列表(Low)到像顧問一樣先提澄清問題(Max)。

Sonnet 5 成為新預設,這是真正的意外。它在知識工作基準測試上超越舊款 Opus,卻只要 Opus 成本的三分之一。講者給 Sonnet 5 一個簡潔提示——「從零構建西班牙語學習遊戲,單一 HTML,含三個遊戲、間隔重複、等級動畫」——七分鐘後得到真正可用的應用。不只視覺完整,Sonnet 5 還自動實現正確的間隔重複演算法,沒人要求它解釋;它推理到遺漏的詞應更早回來,所以自動填補邏輯空缺。另一測試中,講者要求互動知識圖視覺化工具,Sonnet 5 八分鐘交付 60fps 物理模擬系統,甚至手寫彈簧模擬器避免無限振盪——提示中完全沒提,但 Sonnet 5 推理到會感覺破損,主動修正。唯一陷阱是新分詞器導致同文本產生約 30% 更多 token,所有自動化和成本估算需重新校準。

Opus 4.8 往上一層,成本跳到 $5 輸入/$25 輸出,價值在於處理需同時在記憶中持有大型複雜結構的工作。講者展示兩案例:為零資料庫經驗的產品設計師設計完整 SQL 課程,Opus 保持整個課程的教學邏輯和心理學,類比感覺真正理解兩領域的人寫的;分析 Apple 10K 報告時,Opus 在 200 頁文件的兩章發現數字不符,自動交叉檢驗後浮出矛盾。這種跨文件持久一致性是 Opus 的價值所在。但講者明確指出適用範圍:跳過長內容總結、單純資料提取、標準內容生成、千行以下程式碼重構,只在需同時保持大型複雜結構並推理相互連接的工作上使用。

Fable 5 開啟全新等級——Mythos。它不是你提示的模型,而是你簡報的自主代理。講者晚 11 點給它簡報:構建 Chrome 擴充總結 YouTube 影片,MV3 only、無外部伺服器、八小時預算、遇錯誤則記錄並繼續。早 7 點時擴充已完成、文檔已寫、測試影片已錄,Fable 還自動診斷並修復三個錯誤,留下一個設計決策備註要求確認。真正的區別不是原始智能,而是耐久性——它不在障礙前崩潰,而是規劃繞過失敗。定價 $10 輸入/$50 輸出,但計算單位是完成專案而非 token,八小時自主執行通常比三天手動驅動便宜得多。作為執行層,Fable 委派大部分工作給 Haiku 4.5,使大規模應用相當經濟。

Haiku 4.5 是高容量操作工作的精確工具。講者給它 200 列 CSV 各需 <30 字描述,一句指令就自動生成必要子代理並平行處理。客服分類、日誌總結、郵件分類、內容審核——任何需每小時千次呼叫,Haiku 就是答案。

Mythos 5 坐在梯隊最頂端但無法直接使用。訪問權限透過 Project Glasswing 計畫,針對獲選研究實驗室和企業夥伴。Anthropic 表示 Mythos 5 能力超越曾開放的任何產品,包括 Fable 5。實踐中,Mythos 能保持更長規劃視野和更難推理鏈。獲訪問的組織在人類團隊需數月的問題上運用它——長視野科學研究、跨數十個相互連接系統數週的企業流程。Anthropic 在監管環境中觀察能力更強的模型獲更多自主權的結果,再向所有人開放。

新一代帶來三個改變工作方式的工作流功能。Cowork 讓 Claude 感覺像隊伍——給它一個 Project,它平行運行多個代理執行緒,底層共享相同上下文。講者早上的視頻專案在 11 分鐘完成,旁邊還喝咖啡,舊方式需開三對話並浪費 20 分鐘重複解釋。Claude Design 是內建設計工具,把縮圖敘述丟進去直接得視覺效果,跳過 Figma。整流程從粗略簡報到視覺概念只需兩分鐘。Dynamic Workflows 讓大模型生成數百個平行 Haiku 子代理,CSV 案例只是小規模示範,可擴展到數千檔案。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。