KeyFrame內部研究專用

The Crisis of Mathematics in the AI Era | Terence Tao ICM 2026 Lecture | Gödel's Incompleteness T...

最佳拍档·7月29日週三·23 min中文

三句話摘要

AI時代下,數學共同體應如何重新審視研究目標、工作方式與價值體系。 在AI時代,數學界最大的風險不是工具本身,而是在古德哈特定律的作用下盲目優化失去意義的指標,遺忘「什麼是數學研究真正想達成的」這個根本問題。 AI能力猜想的框架與當前證據:陶哲軒構建了一個靈活的猜想模板,包含成本、監督程度、成功率等多個可調參數,從弱版到強版。First Proof挑戰賽的獨立評估數據顯示,截至2026年5月第二批測試,在受控科學條件下,十道研究級問題中七道已被AI工具鏈做到可發表水準,單題成本介於10至1000美元。

重點整理

重點
  • 1

    AI能力猜想的框架與當前證據:陶哲軒構建了一個靈活的猜想模板,包含成本、監督程度、成功率等多個可調參數,從弱版到強版。First Proof挑戰賽的獨立評估數據顯示,截至2026年5月第二批測試,在受控科學條件下,十道研究級問題中七道已被AI工具鏈做到可發表水準,單題成本介於10至1000美元。

  • 2

    古德哈特定律與多目標分裂:過去數學研究的多個目標(解題、建理論、培養學生、美感價值)彼此相關,單一代理指標(如「解決了多少難題」)足以推動整體進步。但AI的強力優化會導致這些目標各走各的路,失去原有的相關性,使優化指標本身失效。

  • 3

    證明生命週期的消化瓶頸:完整的數學貢獻需經過證明生成、驗證、闡述、發表、消化、經典化等環節。其中「消化」(被同行理解、應用、重新闡述)與「經典化」(納入教科書、成為標準知識)最耗時、最難被AI優化,卻最具價值。證明堆積而無人消化會形成「阻抗不匹配」。

  • 4

    人工摩擦的認知價值:作者在困難部分留下的自然痕跡(反復解釋、語氣猶豫、刻意標記)對讀者的理解至關重要,它標記出人類認知曾掙扎之處。過度AI打磨會磨平這些痕跡,導致閱讀流暢但理解空洞。

實用技巧與重點

乾貨
  • 獨立評估數據
  • First Proof挑戰賽(2026年5月28日第二批):10道研究級問題,7道達可發表水準,算力成本10-1000美元/題
  • 艾爾德什問題網站(erdosproblems.com)已堆積數十份AI生成證明待驗證,部分提交者自陳無能力驗證
  • 《萊頓AI與數學宣言》重點建議
  • 公開工具使用狀況:論文中增設工具與算力資源揭露專區,向FAIR原則(可發現、可存取、可互通、可重複使用)看齊
  • 支持審稿工作:作者應揭露工具使用、提供精確完整引用、盡可能提供形式化證明
  • 保留正確性責任:論證結果的正確性、充分性、引用完整性完全由人類作者負責
  • 認真對待署名與致謝:明確標注知識來源,若無法令人滿意的致謝應說明理由
  • 參與公共討論:數學家應協助科學新聞報道與公眾溝通
  • 提及的工具與平台
  • 證明助理語言:Rocq、HOL、Lean
  • 項目:Mathlib(形式化庫)、Mathematical Discourse(籌備中)、SAIR競賽平台
  • 常數數據庫、First Proof挑戰賽
  • 核心判斷標準
  • 作者無法令人信服地做專家水準的學術報告說明自己的結果,該結果就不應發表
  • 證明需要能被數學共同體清楚溝通、理解、消化、教授,而非僅被形式化驗證

結論

結論

在AI時代,數學界最大的風險不是工具本身,而是在古德哈特定律的作用下盲目優化失去意義的指標,遺忘「什麼是數學研究真正想達成的」這個根本問題。

完整解析

詳細

陶哲軒在今年國際數學家大會ICM 2026上的演講,核心不在於AI能否做數學,而在於數學共同體應如何應對深層的價值危機。他以一個工作假設開場——設定強版AI能力猜想為真,即AI將以合理成本與成功率完成相當比例的研究級數學任務——進而展開條件分析。這不是要求信仰,而是一場思想實驗。

基於這個假設,他揭示了一個長期被忽視的根本問題:數學研究的真正目標是什麼?表面上,數學界追求解決未解問題、發展理論、培養後進、創造美感作品,這些目標曾相輔相成。但陶哲軒引入古德哈特定律(1975),指出當衡量標準變成追求目標時,就失效了。過去數學界可以用「解決了多少難題」作為代理指標,其他價值預設存在。一旦AI大幅加速證明生成,單純優化這個指標會導致多個目標分道揚鑣,失去原有的同向性。

他以數學中最具體的環節——解題——進行深度案例分析。一份完整的數學貢獻並非止於證明生成或形式化驗證。證明必須經過清楚的闡述、被同行評審發表、逐漸被共同體消化理解、最終被寫入教科書成為經典知識。這條鏈條中,生成與驗證已有AI加速,但AI在闡述上的表現參差:拼字無挑剔,卻常因瑣碎細節冗長而掩蓋關鍵思想,缺乏高層次概覽。更關鍵的是,人類作者在困難部分留下的自然痕跡——反復解釋、語氣猶豫、刻意標記——對讀者理解至關重要,過度AI優化反而會磨平這些認知指標。

消化與經典化是整個鏈條最慢、最有價值、最難被優化的環節,因為它本質上是集體認知與文化沉澱的過程。如果AI大量生產證明而消化機制不跟上,數學界將從證明稀缺時代驟入過剩時代,出現「阻抗不匹配」——證明堆積待驗、驗證後等待清晰寫法、發表後無人消化、無法進入教材標準化。

陶哲軒因此建議,數學界需要重新校準優先級:從看重「誰第一個解決」轉向重視「如何讓共同體真正吸收」。這意味著降低對證明生成速度的重視,提升闡述、發表、消化的地位。與此同時,《萊頓AI與數學宣言》提出的五項建議成為實踐指南:主動揭露AI工具使用(避免隱瞞侵蝕信任)、減輕同儕審查負擔(提供形式化證明與完整引用)、明確責任歸屬(作者對正確性負責)、認真致謝知識來源(對抗AI幻覺)、參與公共討論(數學家解釋成果含義)。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。