Doubao Sparked an AI War? China & America's Absurd Self-Sabotage, and Taiwan's Bystander Role
三句話摘要
剖析全球AI競爭中的普遍造假現象,從基層水軍到高階評測汙染,再到各國戰略失誤,說明真實實力最終無法被虛假訊號掩蓋。 在機器學會自我進化的時代,虛假訊號最終都會在私密測驗中原形畢露,真實實力永遠無法被裝飾掩蓋。 評測體系被當成背題訓練:GLM 5.2在公開榜單排名全球第四,但在未見過題目的私密測試中落後美國7至12個月。OpenAI發現60%的SWE Bench題目存在缺陷,所有頂尖模型能逐字背出標準答案,說明模型在"刷題"而非學習,新考卷SWE Bench Pro讓榜單前列分數從80分跌至23分。
重點整理
重點- 1
評測體系被當成背題訓練:GLM 5.2在公開榜單排名全球第四,但在未見過題目的私密測試中落後美國7至12個月。OpenAI發現60%的SWE Bench題目存在缺陷,所有頂尖模型能逐字背出標準答案,說明模型在"刷題"而非學習,新考卷SWE Bench Pro讓榜單前列分數從80分跌至23分。
- 2
成本謊言用單價掩蓋總價:Deep Seek單價便宜60倍,但同一任務需要消耗23倍的token,乘完之後總成本反而比Anthropic更貴。人們只聽單價數字,很少有人算完整的賬。
- 3
人力永遠輸給機器的根本原因:江西水軍是手工一條條打出來,必然疲勞、出錯、露餡;AI可以在秒內生成數千條語氣各異的文案且永不疲倦。這不是誰更努力的問題,而是物理上的根本差異。
- 4
機器正在學會自我突破:Andrej Karpathy將AI訓練最佳化到極限後交給自動系統,AI在兩週內又進步18%,超越人類頂級工程師。當機器能自己造出更強的機器時,人類所有的裝飾都變成了累贅。
實用技巧與重點
乾貨- 豆包起訴案:承諾退票扣5%、實際40%、聲稱無銀行卡無法賠償
- 假賬號特徵:近百個IP全部來自江西同一機房,前一天賬號履歷顯示帶娃媽媽,第二天集體變身高考生
- GLM 5.2成績:公開榜排名全球第四,私密測驗落後美國7個月,高階議題落後一年
- SWE Bench汙染:60%難題存在缺陷,頂尖模型能完整背誦標準答案
- SWE Bench Pro掉分:80分→23分
- Deep Seek成本對比:輸出token單價0.87¢ vs Fable 5的50¢(便宜60倍),但同任務token用量多23倍
- Hydra Cluster攻擊:24000個假賬號對Claude發起1600萬次互動
- 喬治亞理工大學研究:GLM 5.2總成本反而比Anthropic/OpenAI更貴
- 美國資料中心困局:2026年前三個月取消420億美金專案,過去三年累計850億美金專案被否決
- 美國民調:民眾寧住核電廠旁也不住資料中心旁
- 各國AI投入:韓國730億美金(10年)、日本650億美金(至2030年)、臺灣10億美金
- Auto Research實驗:將168小時訓練時間最佳化至99分鐘,再最佳化至1小時39分,超人類最佳化幅度
- Jack Clark預測:2028年底60%機率出現完全無人類參與的AI自我改進系統
- NVIDIA臺灣專案:Constellation是4000人研發辦公大樓(玻璃木結構,含酒吧),預計2026年動工2030年啟用,非資料中心
- AWS臺灣:2025年6月啟動臺北區域、投資10億美金以上
- 微軟臺灣:Azure 2024年11月啟用
結論
結論“在機器學會自我進化的時代,虛假訊號最終都會在私密測驗中原形畢露,真實實力永遠無法被裝飾掩蓋。”
完整解析
詳細這場直播用豆包的一系列荒誕事件揭示了全球AI競爭中的普遍造假現象。豆包先是因退票費用虛假承諾被起訴,後來位元組跳動官方發現近百個假賬號在同一天集體變身高考生來攻擊豆包、捧其他AI。這些賬號來自同一個江西機房,前一刻還在曬孩子副食品,第二刻就在說"我用某AI填志願超準"。這個故事看似幽默,實則暴露出人力水軍的根本劣勢:人會累、會犯錯、會露餡。而豆包只需一個指令就能在秒內生成上千條彼此不同的文案。
但真正的黑幕在更高層。全球AI評測榜單都存在系統性汙染。OpenAI在2月23日坦白,SWE Bench已被汙染——60%的難題存在缺陷,更嚴重的是,所有頂尖模型包括GPT都能逐字背出標準答案。這說明模型不是在解題,而是在記憶。OpenAI因此推出防汙染的新考卷SWE Bench Pro,結果之前排名前列的模型從80分直跌23分。Anthropic同樣指控有人用24000個假賬號對Claude進行1600萬次互動來"蒸餾"其回答用於訓練自己的模型。從江西的人工水軍到全球的機器蒸餾,手法完全相同,只是規模與技術水平差異。
成本問題更扎心。Deep Seek的單價雖然便宜60倍,但同一任務需要消耗23倍的token,乘完之後總成本反而更貴——這正是人們只聽單價、很少算完整賬的原因。經濟學人用硬資料證實,GLM 5.2的總成本超過OpenAI系統。
各國都在自我制約。美國民眾不願在家附近建資料中心,2026年前三個月就砍掉420億美金專案,民調顯示民眾寧住核電廠旁也不住資料中心旁。這是民主的代價——美國有最強的牌卻打不出去。臺灣更慘,AI預算僅10億美金,日韓各650-730億美金,大量資源被投向無人機採購。經濟部甚至宣佈"桃園以北AI資料中心禁設令",因為北部電力不足。NVIDIA在臺灣建的Constellation完全是個4000人的研發辦公大樓,不是資料中心,卻被政治人物宣傳成"AI救世主"降臨。
最後的真相最冷酷。Andrej Karpathy這等頂級工程師將AI訓練最佳化到極限後,交給自動最佳化系統,AI在兩週內又進步18%,超越人類。Anthropic創始人Jack Clark預言,2028年底有60%的機率出現完全無需人類參與的AI自我改進系統。當機器能自己造出更強的機器時,人類所有的裝修、虛假資料、政治表演都變得無足輕重。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


