KeyFrame內部研究專用

美国AI监管盯上GPT-5.6,真正漏洞在哪?

老范讲故事·6月29日週一·33 min中文

三句話摘要

美國對AI的監管方向錯誤,盯住了模型名單而忽視了真正的危險:可進化的調度系統 # 美國監管AI的正確道路不在關門設卡,而在於開放創新,用AI防AI,把威脅變成產業升級的機遇。 監管目標錯位:美國焦點放在限制特定模型名單和按國籍審批,但真正威脅來自調度系統。調度系統能將分散的漏洞串成完整攻擊鏈、執行社會工程學騙局,甚至自動進化以繞過防禦——這才是無法防守的真實危險。

重點整理

重點
  • 1

    監管目標錯位:美國焦點放在限制特定模型名單和按國籍審批,但真正威脅來自調度系統。調度系統能將分散的漏洞串成完整攻擊鏈、執行社會工程學騙局,甚至自動進化以繞過防禦——這才是無法防守的真實危險。

  • 2

    安全的底層邏輯是制度而非技術:大型企業(Google、NSA)的安全事故中,60-70%源於人的操作失誤和不守規矩,而非技術漏洞。傳統的補丁、驗證測試、人事制度等管理手段本來設計來對付固定的已知威脅,無法應對會自我進化的AI調度系統。

  • 3

    開源和洩露讓限制失效:Anthropic已多次洩露關鍵代碼(2023年Cloud Code全套原代碼、2024年3月51萬行代碼、6月Fable 5的12萬字提示詞),中國的GLM、豆包等模型已很強,加上工程師密度與努力,複製調度系統難度不高。按國籍設限制反而削弱美國吸引全球人才的優勢。

  • 4

    正確出路是「AI防AI」和持續創新:不應被防守心態束縛,而要做比對手更開放、更快速創新的一方,用AI的進化節奏去應對進化的威脅。這不是負擔而是機會——類似1998-2000年千年蟲催生的IT產業升級。

  • 5

    #

實用技巧與重點

乾貨
  • 時間線(5月14日-6月26日):
  • 5月14日:美國國會眾議員發出警告
  • 5月下旬:白宮草案要求模型上線前審批(後被遊說軟化)
  • 6月2日:特朗普簽署相對寬鬆的政府行政令
  • 6月8日:國防部更新1260H清單,列入阿里、百度
  • 6月9日:Anthropic發布Fable 5和Claude 5
  • 6月10日:Fable 5提示詞洩露
  • 6月12-13日:商務部以國家安全為由下線Fable 5(72小時)
  • 6月22日:Anthropic談判換人
  • 6月26日:Fable恢復測試風聲
  • 具體模型與公司
  • Anthropic:Fable 5、Claude 5(部分恢復)
  • OpenAI:GPT 5.6(施加審批卡名單)
  • 中國模型:Zhipu GLM 5.2、MiniMax 3、Tongyi K2.7 Code、豆包C 2.1 Pro(周更)、Qwen 3.7 Max
  • Google工具:GWS(Google Workspace CLI)
  • 安全公司:360(用安全數據做專項調教)
  • 洩露事件
  • 2023年:Cloud Code全套原代碼洩露
  • 2024年3月:51萬行代碼洩露
  • 6月:Fable 5的12萬字提示詞洩露到GitHub
  • 關鍵數據
  • 安全事故中,60-70%源於人為操作失誤,非技術漏洞
  • Mesos穿透NSA:需要幾周工作量,AI用一晚上完成
  • Fable 5提示詞:一多半講調用工具方法,只有20%講性格約束
  • 關鍵人物
  • Jesting:Google Workspace CLI作者,因未走安全審批被開除
  • Elon Musk:XAI創始人,安全門檻導致創始團隊全部離職
  • #

結論

結論

美國監管AI的正確道路不在關門設卡,而在於開放創新,用AI防AI,把威脅變成產業升級的機遇。

完整解析

詳細

約六周來,美國的AI監管經歷了一個螺旋式的升級過程。從五月中旬國會議員的首次警告開始,政府先是擬定了相對強硬的審批制度,但在硅谷遊說(特別是馬斯克和扎克伯格)的壓力下有所緩和,改為自願送審。然而隨後一系列關鍵事件扭轉了這個局面:Anthropic發布被認為是最強的Fable 5後,其提示詞在兩周內洩露,進而被商務部以國家安全名義緊急下線。現在矛頭指向了OpenAI的GPT 5.6,施加了嚴格的名單審批制度。

這一系列監管的根本錯誤在於它盯住了模型本身,卻完全誤解了真正的威脅所在。Fable 5之所以強大,並非仅因為底座模型本身,而是模型配合了Anthropic內化的一整套調度系統。所謂調度系統,是決定AI何時調用什麼工具、如何規劃步驟、如何驗證結果、甚至如何回滾錯誤的完整框架。從洩露的12萬字提示詞來看,超過一半的內容都在講工具調用的時機和方法,真正講約束和性格特徵的還不到20%。

更危險的是,這套調度系統是可以被逆向工程、複製和專項調教的。講者用360作為案例說明,這家中國安全公司雖然在AI算法上可能不如OpenAI或Anthropic,但它在安全領域深耕了幾十年,掌握著海量真實安全事件數據和防守手段。如果它拿一個次級開源模型(比如Zhipu GLM 5.2),投入自己的安全數據做專項調教和強化學習,再按照洩露的提示詞設計相應的調度系統,就完全能在網絡安全領域做出不亞於甚至超過Fable 5的能力。講者用「學霸vs小鎮做題家」的比喻說明:Fable 5像真學霸,放到任何岗位都能快速上手。而次級開源模型如果專項針對某領域深度培訓,完全可以在該領域幹得漂亮。關鍵不在模型通用能力,而在有沒有那套成熟的調度系統和專業數據。

這引出了講者的第二個核心觀點:今天的安全大半靠制度撑起來,不靠技術。他舉自己在安全公司的經驗,以及Google開除GWS作者Jesting的例子。Jesting寫了一個讓Claude和其他AI工具連接Google Workspace的工具,非常受歡迎,在Hacker News冲到第一。但Google不是因為技術有問題,而是因為他沒有走法務和安全審批,還用了Google商標,於是被直接開除。講者指出,即使在技術天花板的公司(Google、NSA),安全防禦也主要靠審批流程、人事制度、規章制度這些管理手段,而不是什麼神奇的技術。

然而這套對付固定、已知威脅的制度體系,遇上能自我進化的AI調度系統就完全無效了。Mesos在測試中幾個小時就穿透NSA,說明問題根源不在單個漏洞,而在於AI能將分散、孤立的大量漏洞一個一個串起來,組合成原來沒人想到的全新攻擊路徑。更可怕的是,這個過程中還能融合社會工程學——AI最擅長的正是「一本正經地胡說八道」,它能同時進行漏洞利用和欺騙,而傳統防禦體系根本沒辦法測試社會工程學的問題。這好比人體免疫系統對付已知固定病毒,用疫苗和抗體對抗。但AI調度系統像一個會進化的超級病毒,它能觀察防禦方的應對方式,然後自動調整攻擊鏈的方向——正如遊戲「瘟疫公司」中的玩家策略,每當玩家採取防禦措施,病毒就往其他方向進化。

講者認為美國當前的限制措施徹底錯誤了。按國籍設卡和限制模型名單看似有效,實際上既無法有效防守(因為中國已有很強的模型和洩露的源代碼圖紙),又自廢武功(因為美國本來就是移民國家,優勢在於能吸引全球最聰明的人才)。他舉了歷史例子——中國古代幾千年來限制向遊牧民族出售鐵器,想防止他們製造兵器,但商人一直在偷偷運鐵,遊牧民族還是一次次入侵,甚至兩次滅國。這說明此路根本行不通。

最後,講者提出了他的答案:正確做法是「AI防AI」,開放創新而非關門設卡。與其嘗試用舊的審批和人事制度對付進化的AI威脅,不如做比對手更開放、更快速創新的一方。要用AI的進化節奏去應對進化的威脅,讓防禦方的AI調度系統24小時自動尋找漏洞、修補、進行紅隊測試,與攻擊方在同一時間表上競爭。講者強調這不是負擔,而是機會——類似於1998-2000年的「千年蟲」事件,雖然威脅本身有些誇大,但正因為這個集體認識和投入,整個IT產業借此機會完成了一次巨大升級。現在面對的威脅比千年蟲真實得多、可怕得多,但如果能把它變成「大規模投入AI安全產業」的催化劑,讓整個AI產業迎來新一輪飛躍,那麼這個看似吓人的故事就能變成一個正向的、積極的過程。

#

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。