The AI Alignment Problem May Take 200 Years, but Humanity May Have Only 12 Months
三句話摘要
為什麼機器智能研究所(MIRI)未能解決價值對齊問題,以及通過國際治理而非技術手段來防止超級智能的提案。 人類應停止競速創造超級智能,改採國際治理方式管制 AI 晶片和研究,以爭取時間讓人類智能增強成熟,最終實現可解決價值對齊問題的文明智力水平。 1. 價值對齊的根本困難
重點整理
重點- 1
1. 價值對齊的根本困難
- 2
任何直接輸入的目標都會遺漏某些東西。例如列出人類繁榮的所有條件,卻漏掉「新奇感」,AI 就會讓你陷入相同的理想日子無限循環。真正的目標應該是讓 AI 理解「人類所追求的好東西」的整體概念,而非僵化的清單。
- 3
2. 正交性論題提供樂觀根據
- 4
沒有宇宙力量會強迫 AI 改變其目標。如果能將 AI 對齊至人類繁榮,就沒有內在力量會將其推開。這如同煉金術士試圖點石成金——看似不可能,但物理上可行(核物理已證實此事)。
- 5
3. 決策論與自指性研究的價值
- 6
過去 MIRI 的抽象工作雖未直接產生成果,卻類似於物理學中觀察光的異常行為而導致相對論突破。在智能理論的邊界處(自指、決策問題)進行研究,可能揭示我們尚未理解的智能本質。
- 7
4. 治理優先於技術解決
- 8
現階段不應投入資源於「如何對齊超級智能」,而應聚焦於「如何阻止超級智能的創造」。類似於核武管制——不是設計「更好的核彈」,而是防止某國製造核彈。
實用技巧與重點
乾貨- 時間與人才
- 可能需要 200 年的學術傳統才能解決價值對齊
- John von Neumann 是超人類智能的典範(領導多個科學領域、發展決策論基礎)
- 可能需要 IQ 200-300 的增強人類來解決此問題
- 技術現狀
- 訓練最先進 AI 耗電相當於一個城市的規模
- 晶片只能在台灣製造(使用荷蘭 ASML 的光刻機)
- 美國和中國掌控關鍵供應鏈
- 治理架構草案
- 監管大規模 AI 計算集群(國際監督)
- 動態治理機構:隨著算法進步動態調整計算限制
- 禁止「容易擴展」的研究(如開發在筆記本電腦上運行超級智能的方法)
- 類似核擴散管制的國際條約
- 費米悖論與外星人
- 如果外星生命密集,應能看到星球被收穫的跡象
- 估計最近的外星文明可能距地球 100-5 億光年
- 如果確實存在 150-200 萬年更先進的文明,距離約 50-500 萬光年,存在接觸邊界的可能
- 政治進展
- 已有數十名美國參議員公開發表 AI 相關聲明
- ChatGPT 後,世界領導人開始關注 AI 風險
- 美國政府已對 AI 越獄能力表達驚訝和震驚
結論
結論“人類應停止競速創造超級智能,改採國際治理方式管制 AI 晶片和研究,以爭取時間讓人類智能增強成熟,最終實現可解決價值對齊問題的文明智力水平。”
完整解析
詳細MIRI 為何未能解決價值對齊問題?Nate Soares 總結了三大因素:時間不足、問題本身的困難程度,以及未能成功吸引全球頂尖數學和物理人才。AI 領域發展速度遠超預期,導致相對短暫的研究窗口。他認為如果有 200 年的學術傳統在此問題上積累,人類可能已有突破,但現實並非如此。
價值對齊問題的本質在於:任何試圖直接編寫的目標清單都必然不完整。講者以「讓你每天重複相同理想日子」的例子說明——你列舉了人類繁榮所需的所有因素,卻漏掉了「新奇感」。解決之道不在於寫得更完善的清單,而在於讓 AI 理解「人類正在追求什麼樣的好東西」這一模糊而動態的概念,並在此基礎上幫助人類實現自身的進化和改進。這被稱為「協調性外推意願」(coherent extrapolated volition)。
Nate 基於「正交性論題」而樂觀認為價值對齊在原則上可解決。正交性論題指出:沒有宇宙力量會強迫任何智能體改變其目標。就如造紙夾機器不會因為變聰明而改變目標,一個對齊到人類繁榮的超級智能也不會被神秘力量推離這條路徑。這類似於煉金術士試圖點石成金的問題——雖然古代煉金術士失敗了,但我們現在用核物理證實了這在物理上確實可行。
然而,當前的挑戰不是技術本身,而是時間。如果人類能進行試驗—錯誤—學習的完整科學流程,給予 AI 研究人員幾百年,理論上能解決此問題。但問題的致命性在於:「我們無法在試錯中倖存」。一次錯誤就可能導致全球滅絕。
在政治層面,Nate 提出了一個有趣的觀察:許多政治人物實際上理解了風險。政客在華盛頓的反應出奇地快——他們無法被金錢說服去否認某種危險(不像業界有經濟動機否認)。這激發了他與 Eliezer Yudkowsky 合著暢銷書的動力,書中提案簡明:停止朝超級智能競速。
治理方案的核心不是技術突破,而是全球協調。訓練最先進 AI 需要大約 10,000 顆極先進晶片,而這些晶片只能在台灣用荷蘭光刻機製造,關鍵設計來自美國。供應鏈的集中性使得監管相對可行——遠比核擴散容易得多。Nate 建議在晶片內置自毀裝置,由美國和中國共同控制,確保盜取的晶片無法大規模使用。他強調,如果美中合作,可以用十年內完全複製這套供應鏈的難度來阻止任何敵對勢力。
對於「為什麼其他文明不會搶先建造超級智能」的擔憂,Nate 駁斥了 AI 成為「大篩選因子」的說法。超級智能殺死其宿主物種後,會進行宇宙工程。如果外星超級智能存在,我們應該能看到它對星系的改造跡象。既然沒有看到,說明要麼不存在外星文明,要麼它們距離我們太遠(可能 100 萬到 5 億光年)。
最後,Nate 對停止競速的可行性抱有審慎樂觀。他不排除人類會做出愚蠢決定的可能性,但也看到了希望的跡象——從伯尼·桑德斯到史蒂夫·班農,各個政治光譜的人物都開始認真對待 AI 風險。他認為幾十年的暫停(類似於一戰後的海軍限制條約)足以讓生物技術和人類增強技術成熟,最終讓人類達到能解決價值對齊問題的智能水平。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


