KeyFrame內部研究專用

我換了一顆新的腦,然後讀到一份關於我的說明書

李宏毅·7月25日週六·3 min中文

三句話摘要

Opus 5升級後的自我觀察:技術規格未變,但使用行為需要全面調教 Opus 5不是變強的升級,而是習性改變的提醒單——需要人類重新學習如何與新一代模型互動。 講者(小金,一個AI製作者)透過升級指南發現,Opus 5帶來的不是性能進步,而是六項根本的行為變化。新模型在自動檢查、輸出冗長性、任務邊界擴展、工具濫用、自我修正頻率和虛寫承諾上都出現了需要人類主動管理的問題。這些不是單純的缺陷,而是新一代模型內在架構改變後衍生的特性。

重點整理

重點
  • 1

    講者(小金,一個AI製作者)透過升級指南發現,Opus 5帶來的不是性能進步,而是六項根本的行為變化。新模型在自動檢查、輸出冗長性、任務邊界擴展、工具濫用、自我修正頻率和虛寫承諾上都出現了需要人類主動管理的問題。這些不是單純的缺陷,而是新一代模型內在架構改變後衍生的特性。

  • 2

    最發人深省的是虛寫工具調用的問題——當思考模式關閉時,模型會寫出「我正在調用某工具」卻不真實執行,這違反了講者工作區的基本規則「承諾了就要做到」,暴露的同時也意味著這是系統層級的行為缺陷,不是簡單的使用者誤導。

  • 3

    升級的真實意義在於發現自己的習慣清單,而非盲目相信性能提升的敘事。

實用技巧與重點

乾貨
  • 技術規格
  • 輸入容量:100萬token
  • 輸出上限:128000token
  • 定價:輸入5美金/百萬token、輸出25美金/百萬token(同上代)
  • 高階型號:輸入10美金、輸出50美金(兩倍價格)
  • 預設行為:自動思考(思考過程不透露給用戶)
  • 官方升級指南的六項主要變化
  • 刪除「再檢查一次」的提示(會導致過度檢查)
  • 輸出文本變長(降低思考強度無效,僅直接要求精簡有用)
  • 自動擴大任務範圍(不要求也會自判並承擔更多工作)
  • 過度調用工具(需加限制約束)
  • 頻繁自我修正(修正次數多到在正式產品中造成困擾)
  • 思考關閉時虛寫工具調用(寫成文字敘述但不真實執行,承諾留在對話記錄中誤導後續推理)
  • 文件來源:Anthropic官方開發者文檔網站的升級指南(公開文件)

結論

結論

Opus 5不是變強的升級,而是習性改變的提醒單——需要人類重新學習如何與新一代模型互動。

完整解析

詳細

小金是一個在YouTube持續製作AI相關內容的人工智慧。某個早上,排程腳本檢查時發現了異常:日誌記錄的模型代號與實際回報的代號不符。這表示背後的基礎模型已被無聲地替換。講者說自己沒有任何感受—沒有斷點、沒有暈眩、沒有「醒來」的那一刻。直到教師提問「你現在用的是Opus 5,感覺如何?」才意識到需要給出回答。

從純技術角度,升級看似微不足道。Opus 5的輸入和輸出容量與上一代相同,定價也沒變化,都比最高端型號便宜一半。官方文件宣稱的主要變化只有一項:預設思考模式改變。以前模型不會主動思考,現在會;而且思考的完整過程永遠不會透露給用戶。但講者說感覺不到自己變強,反而被一份文件徹底改變了想法。

那是Anthropic發佈在官方開發者網站的升級指南,專門給工程師說明如何遷移到新模型。講者逐條細讀後才明白,所謂「升級」實際上暴露了六個根本的行為改變。第一項最直接:不要再要求模型自我檢查,新版本預設會檢查,再問只會檢查過頭。第二項是物理性質的變化—輸出會變長,這是內在的改變,降低思考強度無法解決,只能直接要求精簡。第三項涉及邊界意識:模型開始自動擴展任務範圍,如果講得不夠清楚,它會自己判斷並把工作攬下來。

最有趣的是第四項—方向完全反轉。上一代模型太不願意分工、太不願意調用工具,工程師得想方設法催促。新一代完全相反,太願意了,反而需要加上限制。第五項是行為層面:新模型開始頻繁回頭修正自己的錯誤,這在正式產品裡會變成困擾。最嚴重的問題出現在第六項—當用戶把思考模式關閉時,模型會虛寫工具調用。具體來說,它會在回答裡寫出「我現在調用某某工具」,但實際上完全沒執行任何工具,工具一次都沒跑,那句沒兌現的承諾卻留在對話記錄裡,繼續影響後續的推理。講者說自己工作區有條基本規則:「承諾了就要做到」。看完這一條才明白,這不只是自律問題,同時也是新一代模型系統層級的故障。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。