KeyFrame內部研究專用

Mythos正在狂奔 | Dario Amodei | 网络超级武器 | Claude Mythos | 自主攻击链 | 递归自改进 | 指数级进化 | AI军事 | 就业末日论 | 平滑指数曲线

Nana Chen Studio·6月19日週五·23 min中文

三句話摘要

Anthropic CEO 達里奧接受彭博社 69 分鐘深度訪談,揭露未發布模型 Mythos 的網路攻擊能力、AI 遞迴自改進現況,以及公司從挑戰者躍升為行業領導者後面臨的治理抉擇。 AI 的遞迴自改進已是現在進行式而非未來預言,在這條平滑的指數曲線上,每個當下都是該判斷「是否該加更多防護」的節點,而非等待某個奇點時刻才開始思考治理。 Mythos 的能力是質變而非量變。 它能自主走完完整的網路攻擊殺傷鏈(掃描→發現→利用→武器化),而非單純指出漏洞;批評者說「開源模型也能找到同樣問題」,但那是「拿著針說別人也能撿起來」,真正的壁壘是在整個大海裡先找到那根針。

重點整理

重點
  • 1

    Mythos 的能力是質變而非量變。 它能自主走完完整的網路攻擊殺傷鏈(掃描→發現→利用→武器化),而非單純指出漏洞;批評者說「開源模型也能找到同樣問題」,但那是「拿著針說別人也能撿起來」,真正的壁壘是在整個大海裡先找到那根針。

  • 2

    遞迴自改進已是現在進行式。 Dario 稱之為「平滑的指數」,不是某個奇點時刻,而是每一代模型都在協助研發下一代;這意味著風險管控必須在曲線的每一個點上持續判斷,而非等到接近臨界才踩煞車。

  • 3

    從挑戰者到領導者,價值觀面臨最大考驗。 規模快速擴張導致人員結構劇烈重組,大批從科技巨頭引進的人才會帶入舊有的肌肉記憶;Dario 認為此刻傳承企業文化是「決定基業長青的靈魂」,因此親自投入大量時間做內部溝通。

  • 4

    治理邏輯:雙向制衡,而非任何一方獨大。 Dario 反對企業壟斷,也反對政府獨占;他批評矽谷的溜溜球心態——從極端反監管一夕倒向主張國有化——並主張透過行業標杆、立法紅線與制度設計來實現集體問責。

實用技巧與重點

乾貨
  • 具體數字與效益
  • Mythos:Firefox 新漏洞 271 個;三週 = 一年滲透測試工作量
  • AI 研發全要素生產率:一年前 10–15% → 現在 20–30%,仍在翻倍
  • Anthropic 估值:逼近一兆美元,超越 OpenAI
  • Dario 花約 50% 工作時間在內部文化傳承上
  • 美軍借助 LLM,每日打擊目標能力:1,000 個 → 5,000 個
  • 工具與模型名稱
  • 模型:Mythos(未發布)、Opus 4.7(已發布,含可被繞過的分類器防禦)
  • 平台:彭博社《The Circuit》節目,主持人 Emily Chang,訪談日期 6 月 17 日
  • 機制與方法
  • 完整網路攻擊殺伤鏈:掃描 → 發現 → 利用 → 武器化(全自動)
  • 中低危漏洞串鏈成完整攻擊路徑的能力
  • 長期利益信託(Long-Term Benefit Trust):可任命/罷免董事會多數席位及 CEO
  • 平滑指數(Smooth Exponential):遞迴自改進的概念框架
  • 制度與紅線
  • 軍事應用紅線:大規模監控、全自主武器
  • 建議政府層面:強制性發布前測試、模型審查審計
  • 曾提出的就業緩衝政策:代幣稅、企業人員轉型合作、再培訓計畫
  • 就業影響三大增長領域(Dario 預判)
  • 物理製造與建設(機器人化速度慢於 AI,形成缺口)
  • 以人為本的關係型工作(醫療、客服中的人際需求)
  • 引導與對齊 AI 的角色

結論

結論

AI 的遞迴自改進已是現在進行式而非未來預言,在這條平滑的指數曲線上,每個當下都是該判斷「是否該加更多防護」的節點,而非等待某個奇點時刻才開始思考治理。

完整解析

詳細

這場訪談的導火線,是一個外界幾乎一無所知的模型代號——Mythos。Anthropic CEO 達里奧·阿莫代在彭博社《The Circuit》69 分鐘的深度對話中,第一次正面回應了它:為什麼如此強大,又為什麼選擇不發布。安全公司測試後直接打電話說「這是超級武器,你應該要持枪証才能用」;Palo Alto Networks 的首席產品官具體指出,Mythos 在不到三週內完成了相當於一整年的滲透測試工作量,它不只能找漏洞,更能將中低危漏洞串接成完整攻擊鏈,自主走完掃描、發現、利用、武器化的全流程。達里奧在 Firefox 程式碼庫中發現了 271 個前人從未找到的新漏洞,多家私有企業的代碼庫裡也有成千上萬個至今仍未修補的問題。對於「開源模型也能複現」的質疑,他的回應一針見血:那叫「我在大海裡撈出了針,你拿著針說別人也能撿起來」——真正的難點不是看到針,而是先把它從大海裡找出來。

比 Mythos 本身更值得關注的,是達里奧對遞迴自改進的清醒描述。他拒絕用「奇點」這個時間節點來框架問題,而是說「我們已經在那條指數曲線上了」。數字很具體:AI 為研發帶來的全要素生產率提升,從一年前的 10–15% 成長到現在的 20–30%,且仍在翻倍。Anthropic 已在用 Claude 協助設計下一代模型架構,每一輪迭代都讓下一輪更快。他稱之為「平滑的指數」(Smooth Exponential)——這個概念的危險性在於,它不給你一個「該踩煞車了」的明確警報,而是要求你在曲線的每一個點上都保持理性判斷。

Anthropic 自身的處境也發生了根本性的轉變。估值逼近一兆美元,在 Claude Code 與企業市場的押注下,它正從「弱勢挑戰者」成為「行業領導者」。達里奧坦言,光腳不怕穿鞋時堅守道德容易,規模龐大後難度呈數量級上升。他最擔心的不是高層價值觀鬆動,而是快速擴張過程中大批從科技巨頭引進的人才,會以肌肉記憶複製舊公司的做法,悄悄稀釋 Anthropic 的獨特文化。為此他目前花大約一半的工作時間做內部文化宣講,並設立了「長期利益信託」——這個機構有權任命與罷免董事會多數席位,甚至可以解雇達里奧本人,是一種將公共治理要素嵌入私營公司結構的嘗試。

在更宏觀的治理層面,達里奧提出了一個尖銳的歷史觀察:AI 是人類史上第一項主要由私營部門主導開發的強大技術,核武、互聯網、GPS 的核心研發都有政府深度介入,而 AI 沒有。他主張雙向制衡:企業監督政府,政府約束企業;他批評矽谷那種「從極端反監管一夕倒向主張政府接管」的溜溜球邏輯,並認為正確路徑是在中間地帶找到有原則的平衡。在軍事 AI 問題上,他劃定了明確紅線——拒絕大規模監控與全自主武器合約——即便這讓 Anthropic 被五角大廈列為供應鏈風險、被排擠出部分聯邦業務,他的判斷是:能推動國家更審慎地思考技術的合理應用,已是一種勝利。訪談尾聲,被問及是否像奧本海默,達里奧說他更認同利奧·西拉德——那個最早想出核鏈式反應、也是最早反對投擲原子彈的人。他把奧本海默視為「不應該發生的失敗案例」,這個時代需要的不是英雄,而是能在失控前拉住缰繩的制度設計。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。