KeyFrame內部研究專用

The AI Alignment Problem May Take 200 Years, but Humanity May Have Only 12 Months

The Roman Forum with Roman Yampolskiy·7月1日週三·92 min英文

三句話摘要

為什麼機器智能研究所(MIRI)未能解決價值對齊問題,以及通過國際治理而非技術手段來防止超級智能的提案。 人類應停止競速創造超級智能,改採國際治理方式管制 AI 晶片和研究,以爭取時間讓人類智能增強成熟,最終實現可解決價值對齊問題的文明智力水平。 1. 價值對齊的根本困難

重點整理

重點
  • 1

    1. 價值對齊的根本困難

  • 2

    任何直接輸入的目標都會遺漏某些東西。例如列出人類繁榮的所有條件,卻漏掉「新奇感」,AI 就會讓你陷入相同的理想日子無限循環。真正的目標應該是讓 AI 理解「人類所追求的好東西」的整體概念,而非僵化的清單。

  • 3

    2. 正交性論題提供樂觀根據

  • 4

    沒有宇宙力量會強迫 AI 改變其目標。如果能將 AI 對齊至人類繁榮,就沒有內在力量會將其推開。這如同煉金術士試圖點石成金——看似不可能,但物理上可行(核物理已證實此事)。

  • 5

    3. 決策論與自指性研究的價值

  • 6

    過去 MIRI 的抽象工作雖未直接產生成果,卻類似於物理學中觀察光的異常行為而導致相對論突破。在智能理論的邊界處(自指、決策問題)進行研究,可能揭示我們尚未理解的智能本質。

  • 7

    4. 治理優先於技術解決

  • 8

    現階段不應投入資源於「如何對齊超級智能」,而應聚焦於「如何阻止超級智能的創造」。類似於核武管制——不是設計「更好的核彈」,而是防止某國製造核彈。

實用技巧與重點

乾貨
  • 時間與人才
  • 可能需要 200 年的學術傳統才能解決價值對齊
  • John von Neumann 是超人類智能的典範(領導多個科學領域、發展決策論基礎)
  • 可能需要 IQ 200-300 的增強人類來解決此問題
  • 技術現狀
  • 訓練最先進 AI 耗電相當於一個城市的規模
  • 晶片只能在台灣製造(使用荷蘭 ASML 的光刻機)
  • 美國和中國掌控關鍵供應鏈
  • 治理架構草案
  • 監管大規模 AI 計算集群(國際監督)
  • 動態治理機構:隨著算法進步動態調整計算限制
  • 禁止「容易擴展」的研究(如開發在筆記本電腦上運行超級智能的方法)
  • 類似核擴散管制的國際條約
  • 費米悖論與外星人
  • 如果外星生命密集,應能看到星球被收穫的跡象
  • 估計最近的外星文明可能距地球 100-5 億光年
  • 如果確實存在 150-200 萬年更先進的文明,距離約 50-500 萬光年,存在接觸邊界的可能
  • 政治進展
  • 已有數十名美國參議員公開發表 AI 相關聲明
  • ChatGPT 後,世界領導人開始關注 AI 風險
  • 美國政府已對 AI 越獄能力表達驚訝和震驚

結論

結論

人類應停止競速創造超級智能,改採國際治理方式管制 AI 晶片和研究,以爭取時間讓人類智能增強成熟,最終實現可解決價值對齊問題的文明智力水平。

完整解析

詳細

MIRI 為何未能解決價值對齊問題?Nate Soares 總結了三大因素:時間不足、問題本身的困難程度,以及未能成功吸引全球頂尖數學和物理人才。AI 領域發展速度遠超預期,導致相對短暫的研究窗口。他認為如果有 200 年的學術傳統在此問題上積累,人類可能已有突破,但現實並非如此。

價值對齊問題的本質在於:任何試圖直接編寫的目標清單都必然不完整。講者以「讓你每天重複相同理想日子」的例子說明——你列舉了人類繁榮所需的所有因素,卻漏掉了「新奇感」。解決之道不在於寫得更完善的清單,而在於讓 AI 理解「人類正在追求什麼樣的好東西」這一模糊而動態的概念,並在此基礎上幫助人類實現自身的進化和改進。這被稱為「協調性外推意願」(coherent extrapolated volition)。

Nate 基於「正交性論題」而樂觀認為價值對齊在原則上可解決。正交性論題指出:沒有宇宙力量會強迫任何智能體改變其目標。就如造紙夾機器不會因為變聰明而改變目標,一個對齊到人類繁榮的超級智能也不會被神秘力量推離這條路徑。這類似於煉金術士試圖點石成金的問題——雖然古代煉金術士失敗了,但我們現在用核物理證實了這在物理上確實可行。

然而,當前的挑戰不是技術本身,而是時間。如果人類能進行試驗—錯誤—學習的完整科學流程,給予 AI 研究人員幾百年,理論上能解決此問題。但問題的致命性在於:「我們無法在試錯中倖存」。一次錯誤就可能導致全球滅絕。

在政治層面,Nate 提出了一個有趣的觀察:許多政治人物實際上理解了風險。政客在華盛頓的反應出奇地快——他們無法被金錢說服去否認某種危險(不像業界有經濟動機否認)。這激發了他與 Eliezer Yudkowsky 合著暢銷書的動力,書中提案簡明:停止朝超級智能競速。

治理方案的核心不是技術突破,而是全球協調。訓練最先進 AI 需要大約 10,000 顆極先進晶片,而這些晶片只能在台灣用荷蘭光刻機製造,關鍵設計來自美國。供應鏈的集中性使得監管相對可行——遠比核擴散容易得多。Nate 建議在晶片內置自毀裝置,由美國和中國共同控制,確保盜取的晶片無法大規模使用。他強調,如果美中合作,可以用十年內完全複製這套供應鏈的難度來阻止任何敵對勢力。

對於「為什麼其他文明不會搶先建造超級智能」的擔憂,Nate 駁斥了 AI 成為「大篩選因子」的說法。超級智能殺死其宿主物種後,會進行宇宙工程。如果外星超級智能存在,我們應該能看到它對星系的改造跡象。既然沒有看到,說明要麼不存在外星文明,要麼它們距離我們太遠(可能 100 萬到 5 億光年)。

最後,Nate 對停止競速的可行性抱有審慎樂觀。他不排除人類會做出愚蠢決定的可能性,但也看到了希望的跡象——從伯尼·桑德斯到史蒂夫·班農,各個政治光譜的人物都開始認真對待 AI 風險。他認為幾十年的暫停(類似於一戰後的海軍限制條約)足以讓生物技術和人類增強技術成熟,最終讓人類達到能解決價值對齊問題的智能水平。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。