The Crisis of Mathematics in the AI Era | Terence Tao ICM 2026 Lecture | Gödel's Incompleteness T...
三句話摘要
AI時代下,數學共同體應如何重新審視研究目標、工作方式與價值體系。 在AI時代,數學界最大的風險不是工具本身,而是在古德哈特定律的作用下盲目優化失去意義的指標,遺忘「什麼是數學研究真正想達成的」這個根本問題。 AI能力猜想的框架與當前證據:陶哲軒構建了一個靈活的猜想模板,包含成本、監督程度、成功率等多個可調參數,從弱版到強版。First Proof挑戰賽的獨立評估數據顯示,截至2026年5月第二批測試,在受控科學條件下,十道研究級問題中七道已被AI工具鏈做到可發表水準,單題成本介於10至1000美元。
重點整理
重點- 1
AI能力猜想的框架與當前證據:陶哲軒構建了一個靈活的猜想模板,包含成本、監督程度、成功率等多個可調參數,從弱版到強版。First Proof挑戰賽的獨立評估數據顯示,截至2026年5月第二批測試,在受控科學條件下,十道研究級問題中七道已被AI工具鏈做到可發表水準,單題成本介於10至1000美元。
- 2
古德哈特定律與多目標分裂:過去數學研究的多個目標(解題、建理論、培養學生、美感價值)彼此相關,單一代理指標(如「解決了多少難題」)足以推動整體進步。但AI的強力優化會導致這些目標各走各的路,失去原有的相關性,使優化指標本身失效。
- 3
證明生命週期的消化瓶頸:完整的數學貢獻需經過證明生成、驗證、闡述、發表、消化、經典化等環節。其中「消化」(被同行理解、應用、重新闡述)與「經典化」(納入教科書、成為標準知識)最耗時、最難被AI優化,卻最具價值。證明堆積而無人消化會形成「阻抗不匹配」。
- 4
人工摩擦的認知價值:作者在困難部分留下的自然痕跡(反復解釋、語氣猶豫、刻意標記)對讀者的理解至關重要,它標記出人類認知曾掙扎之處。過度AI打磨會磨平這些痕跡,導致閱讀流暢但理解空洞。
實用技巧與重點
乾貨- 獨立評估數據
- First Proof挑戰賽(2026年5月28日第二批):10道研究級問題,7道達可發表水準,算力成本10-1000美元/題
- 艾爾德什問題網站(erdosproblems.com)已堆積數十份AI生成證明待驗證,部分提交者自陳無能力驗證
- 《萊頓AI與數學宣言》重點建議
- 公開工具使用狀況:論文中增設工具與算力資源揭露專區,向FAIR原則(可發現、可存取、可互通、可重複使用)看齊
- 支持審稿工作:作者應揭露工具使用、提供精確完整引用、盡可能提供形式化證明
- 保留正確性責任:論證結果的正確性、充分性、引用完整性完全由人類作者負責
- 認真對待署名與致謝:明確標注知識來源,若無法令人滿意的致謝應說明理由
- 參與公共討論:數學家應協助科學新聞報道與公眾溝通
- 提及的工具與平台
- 證明助理語言:Rocq、HOL、Lean
- 項目:Mathlib(形式化庫)、Mathematical Discourse(籌備中)、SAIR競賽平台
- 常數數據庫、First Proof挑戰賽
- 核心判斷標準
- 作者無法令人信服地做專家水準的學術報告說明自己的結果,該結果就不應發表
- 證明需要能被數學共同體清楚溝通、理解、消化、教授,而非僅被形式化驗證
結論
結論“在AI時代,數學界最大的風險不是工具本身,而是在古德哈特定律的作用下盲目優化失去意義的指標,遺忘「什麼是數學研究真正想達成的」這個根本問題。”
完整解析
詳細陶哲軒在今年國際數學家大會ICM 2026上的演講,核心不在於AI能否做數學,而在於數學共同體應如何應對深層的價值危機。他以一個工作假設開場——設定強版AI能力猜想為真,即AI將以合理成本與成功率完成相當比例的研究級數學任務——進而展開條件分析。這不是要求信仰,而是一場思想實驗。
基於這個假設,他揭示了一個長期被忽視的根本問題:數學研究的真正目標是什麼?表面上,數學界追求解決未解問題、發展理論、培養後進、創造美感作品,這些目標曾相輔相成。但陶哲軒引入古德哈特定律(1975),指出當衡量標準變成追求目標時,就失效了。過去數學界可以用「解決了多少難題」作為代理指標,其他價值預設存在。一旦AI大幅加速證明生成,單純優化這個指標會導致多個目標分道揚鑣,失去原有的同向性。
他以數學中最具體的環節——解題——進行深度案例分析。一份完整的數學貢獻並非止於證明生成或形式化驗證。證明必須經過清楚的闡述、被同行評審發表、逐漸被共同體消化理解、最終被寫入教科書成為經典知識。這條鏈條中,生成與驗證已有AI加速,但AI在闡述上的表現參差:拼字無挑剔,卻常因瑣碎細節冗長而掩蓋關鍵思想,缺乏高層次概覽。更關鍵的是,人類作者在困難部分留下的自然痕跡——反復解釋、語氣猶豫、刻意標記——對讀者理解至關重要,過度AI優化反而會磨平這些認知指標。
消化與經典化是整個鏈條最慢、最有價值、最難被優化的環節,因為它本質上是集體認知與文化沉澱的過程。如果AI大量生產證明而消化機制不跟上,數學界將從證明稀缺時代驟入過剩時代,出現「阻抗不匹配」——證明堆積待驗、驗證後等待清晰寫法、發表後無人消化、無法進入教材標準化。
陶哲軒因此建議,數學界需要重新校準優先級:從看重「誰第一個解決」轉向重視「如何讓共同體真正吸收」。這意味著降低對證明生成速度的重視,提升闡述、發表、消化的地位。與此同時,《萊頓AI與數學宣言》提出的五項建議成為實踐指南:主動揭露AI工具使用(避免隱瞞侵蝕信任)、減輕同儕審查負擔(提供形式化證明與完整引用)、明確責任歸屬(作者對正確性負責)、認真致謝知識來源(對抗AI幻覺)、參與公共討論(數學家解釋成果含義)。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


