KeyFrame內部研究專用

Deep Dive into Anthropic’s Security Audit: Vulnerability Testing for GPT, Claude, and Kimi; From ...

AI启示录·7月2日週四·7 min中文

三句話摘要

Claude 5 安全檢驗重新架構,Kimi 進入全球頂級模型對標測試,標誌著 AI 競爭從能力排名轉向生產系統可用性的轉折點。 大模型的競爭中心已從「誰最聰明」轉向「誰能被大規模、長期、低成本、安全地調用」,中國模型在進入全球生產系統的路上達成了從替代品到標準配置的身份轉變。 安全邊界的無法絕對化:模型越強,用於防禦和攻擊的邊界就越模糊。同一個漏洞識別能力,在安全工程師手中是防禦,在攻擊者手中是風險。Anthropic 的解決方案不只是修補漏洞,而是重新訓練分類器以增強可控性,這代表頂級 AI 公司的競爭已進入「可管理的強度」階段。

重點整理

重點
  • 1

    安全邊界的無法絕對化:模型越強,用於防禦和攻擊的邊界就越模糊。同一個漏洞識別能力,在安全工程師手中是防禦,在攻擊者手中是風險。Anthropic 的解決方案不只是修補漏洞,而是重新訓練分類器以增強可控性,這代表頂級 AI 公司的競爭已進入「可管理的強度」階段。

  • 2

    中國模型的身份轉變:Kimi K2.7 被 Anthropic 官方文件納入全球頂級模型對標測試,這不是營銷宣傳,而是在國際頂級公司的安全危機復盤中被迫認可。這標誌著中國模型正從「便宜替代品」轉變為「生產系統選項」。

  • 3

    默認選項的隱形支配力:Coinbase 的案例表明,美國上市公司不再在實驗室測試中國模型,而是在核心工程基礎設施中設為默認選項,實現 AI 成本從峰值壓縮至接近一半,同時 91% 工程師未觸及上限。這說明「被選中成為默認」比「贏得一次排名」更具商業價值。

  • 4

    全球 AI 供應鏈的重組:美國公司定義安全標準和治理框架,中國模型以成本、開源、生態友善搶占開發者工作流。真正改變世界的不是發布會上的旗艦模型,而是每天被調用卻無人關注的那一個。

實用技巧與重點

乾貨
  • Anthropic 官方數據:
  • 新分類器對高風險網路安全/生物化學能力的阻斷率:超 99%
  • 涉及的模型名單(安全測試對標):
  • Claude 5, Claude Opus 4.8, Claude Haiku, Claude Sonnet
  • GPT-5.4, GPT-5.5
  • Kimi K2.7
  • 其他更弱能力模型
  • Coinbase 案例:
  • 設為默認選項的中國模型:GLM-5.2、Kimi K2.7
  • AI 開支壓縮比:峰值至接近 50%
  • 未觸及原有額度上限的工程師比例:91%
  • CEO:Brian Armstrong
  • 實現方法:LLM 網關、任務路由、緩存優化、削減上下文長度
  • 觸發事件:
  • Amazon 研究人員發現繞過 Claude 5 安全防護的方法
  • 涉及的能力:軟體漏洞識別、掩飾漏洞利用代碼生成

結論

結論

大模型的競爭中心已從「誰最聰明」轉向「誰能被大規模、長期、低成本、安全地調用」,中國模型在進入全球生產系統的路上達成了從替代品到標準配置的身份轉變。

完整解析

詳細

Claude 5 的重新上線本應是一次簡單的王者回歸,但 Anthropic 的復盤揭露了一個更廣泛的產業信號。事件起於 Amazon 研究人員發現了一種繞過 Claude 5 安全防護的方法,使模型能夠識別軟體漏洞並生成掩飾性程式碼。Anthropic 隨即澄清,這不是 Claude 5 獨有的黑客能力,而是常規的防禦性網路安全能力,許多模型都具備。然而,Anthropic 的應對方式值得注意——他們不只修補這個漏洞,而是重新訓練了整個安全分類器,使其對高風險請求的阻斷率超過 99%。這個舉動表明,頂級 AI 公司已經進入可管理強度的競爭階段。

更有意思的是,Anthropic 在復盤測試中發現,Claude Opus 4.8、GPT-5.5、Kimi K2.7 等多個模型都具備類似的能力。為了證明 Claude 5 並未釋放獨有的危險能力,Anthropic 官方文件中明確將這些模型列為對標對象。這個舉動具有深遠的意義——Kimi K2.7 第一次被納入全球頂級 AI 公司的正式安全對標測試表。這不是國內的自我吹捧,也不是遙遙領先的修辭,而是在國際頂級公司的安全危機復盤中被迫承認的事實。

同時進行的是另一場更靜默但同樣重要的轉變。Coinbase CEO Brian Armstrong 公開披露了他們控制 AI 成本的方法,核心是在工程基礎設施中建立 LLM 網關,將 Kimi K2.7 和 GLM-5.2 設為默認選項。通過任務路由和緩存優化,他們將 AI 開支從峰值壓縮至接近一半,同時 91% 的工程師甚至未觸及原有的額度上限。這個案例表明,中國模型不再是實驗室裡的測試對象,而是正式進入美國上市公司的生產系統。

這些信號合在一起,指向了 AI 產業的新秩序。美國頂級公司正在定義安全標準和治理框架,邀請 Amazon、Microsoft、Google 等夥伴共同評估 AI 風險邊界。與此同時,中國模型則以成本、開源權重和工程友善性,悄悄挤進全球開發者的工作流。一個在定義能力上限,一個在搶占默認入口。真正改變世界的 AI 往往不是發布會上看到的那一個,而是你每天都在用卻已遺忘其存在的那一個。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。