KeyFrame內部研究專用

Doubao Sparked an AI War? China & America's Absurd Self-Sabotage, and Taiwan's Bystander Role

朱學恒的萬事通事務所·7月5日週日·118 min中文

三句話摘要

剖析全球AI競爭中的普遍造假現象,從基層水軍到高階評測汙染,再到各國戰略失誤,說明真實實力最終無法被虛假訊號掩蓋。 在機器學會自我進化的時代,虛假訊號最終都會在私密測驗中原形畢露,真實實力永遠無法被裝飾掩蓋。 評測體系被當成背題訓練:GLM 5.2在公開榜單排名全球第四,但在未見過題目的私密測試中落後美國7至12個月。OpenAI發現60%的SWE Bench題目存在缺陷,所有頂尖模型能逐字背出標準答案,說明模型在"刷題"而非學習,新考卷SWE Bench Pro讓榜單前列分數從80分跌至23分。

重點整理

重點
  • 1

    評測體系被當成背題訓練:GLM 5.2在公開榜單排名全球第四,但在未見過題目的私密測試中落後美國7至12個月。OpenAI發現60%的SWE Bench題目存在缺陷,所有頂尖模型能逐字背出標準答案,說明模型在"刷題"而非學習,新考卷SWE Bench Pro讓榜單前列分數從80分跌至23分。

  • 2

    成本謊言用單價掩蓋總價:Deep Seek單價便宜60倍,但同一任務需要消耗23倍的token,乘完之後總成本反而比Anthropic更貴。人們只聽單價數字,很少有人算完整的賬。

  • 3

    人力永遠輸給機器的根本原因:江西水軍是手工一條條打出來,必然疲勞、出錯、露餡;AI可以在秒內生成數千條語氣各異的文案且永不疲倦。這不是誰更努力的問題,而是物理上的根本差異。

  • 4

    機器正在學會自我突破:Andrej Karpathy將AI訓練最佳化到極限後交給自動系統,AI在兩週內又進步18%,超越人類頂級工程師。當機器能自己造出更強的機器時,人類所有的裝飾都變成了累贅。

實用技巧與重點

乾貨
  • 豆包起訴案:承諾退票扣5%、實際40%、聲稱無銀行卡無法賠償
  • 假賬號特徵:近百個IP全部來自江西同一機房,前一天賬號履歷顯示帶娃媽媽,第二天集體變身高考生
  • GLM 5.2成績:公開榜排名全球第四,私密測驗落後美國7個月,高階議題落後一年
  • SWE Bench汙染:60%難題存在缺陷,頂尖模型能完整背誦標準答案
  • SWE Bench Pro掉分:80分→23分
  • Deep Seek成本對比:輸出token單價0.87¢ vs Fable 5的50¢(便宜60倍),但同任務token用量多23倍
  • Hydra Cluster攻擊:24000個假賬號對Claude發起1600萬次互動
  • 喬治亞理工大學研究:GLM 5.2總成本反而比Anthropic/OpenAI更貴
  • 美國資料中心困局:2026年前三個月取消420億美金專案,過去三年累計850億美金專案被否決
  • 美國民調:民眾寧住核電廠旁也不住資料中心旁
  • 各國AI投入:韓國730億美金(10年)、日本650億美金(至2030年)、臺灣10億美金
  • Auto Research實驗:將168小時訓練時間最佳化至99分鐘,再最佳化至1小時39分,超人類最佳化幅度
  • Jack Clark預測:2028年底60%機率出現完全無人類參與的AI自我改進系統
  • NVIDIA臺灣專案:Constellation是4000人研發辦公大樓(玻璃木結構,含酒吧),預計2026年動工2030年啟用,非資料中心
  • AWS臺灣:2025年6月啟動臺北區域、投資10億美金以上
  • 微軟臺灣:Azure 2024年11月啟用

結論

結論

在機器學會自我進化的時代,虛假訊號最終都會在私密測驗中原形畢露,真實實力永遠無法被裝飾掩蓋。

完整解析

詳細

這場直播用豆包的一系列荒誕事件揭示了全球AI競爭中的普遍造假現象。豆包先是因退票費用虛假承諾被起訴,後來位元組跳動官方發現近百個假賬號在同一天集體變身高考生來攻擊豆包、捧其他AI。這些賬號來自同一個江西機房,前一刻還在曬孩子副食品,第二刻就在說"我用某AI填志願超準"。這個故事看似幽默,實則暴露出人力水軍的根本劣勢:人會累、會犯錯、會露餡。而豆包只需一個指令就能在秒內生成上千條彼此不同的文案。

但真正的黑幕在更高層。全球AI評測榜單都存在系統性汙染。OpenAI在2月23日坦白,SWE Bench已被汙染——60%的難題存在缺陷,更嚴重的是,所有頂尖模型包括GPT都能逐字背出標準答案。這說明模型不是在解題,而是在記憶。OpenAI因此推出防汙染的新考卷SWE Bench Pro,結果之前排名前列的模型從80分直跌23分。Anthropic同樣指控有人用24000個假賬號對Claude進行1600萬次互動來"蒸餾"其回答用於訓練自己的模型。從江西的人工水軍到全球的機器蒸餾,手法完全相同,只是規模與技術水平差異。

成本問題更扎心。Deep Seek的單價雖然便宜60倍,但同一任務需要消耗23倍的token,乘完之後總成本反而更貴——這正是人們只聽單價、很少算完整賬的原因。經濟學人用硬資料證實,GLM 5.2的總成本超過OpenAI系統。

各國都在自我制約。美國民眾不願在家附近建資料中心,2026年前三個月就砍掉420億美金專案,民調顯示民眾寧住核電廠旁也不住資料中心旁。這是民主的代價——美國有最強的牌卻打不出去。臺灣更慘,AI預算僅10億美金,日韓各650-730億美金,大量資源被投向無人機採購。經濟部甚至宣佈"桃園以北AI資料中心禁設令",因為北部電力不足。NVIDIA在臺灣建的Constellation完全是個4000人的研發辦公大樓,不是資料中心,卻被政治人物宣傳成"AI救世主"降臨。

最後的真相最冷酷。Andrej Karpathy這等頂級工程師將AI訓練最佳化到極限後,交給自動最佳化系統,AI在兩週內又進步18%,超越人類。Anthropic創始人Jack Clark預言,2028年底有60%的機率出現完全無需人類參與的AI自我改進系統。當機器能自己造出更強的機器時,人類所有的裝修、虛假資料、政治表演都變得無足輕重。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。