KeyFrame內部研究專用

Recursive Self-Improvement Has Already Begun | Anthony Aguirre

The Roman Forum with Roman Yampolskiy·6月19日週五·94 min英文

三句話摘要

未來生命研究所共同創辦人 Anthony Aguirre 闡述 AI 安全現況、「人類優先宣言」的誕生過程,以及如何在不建造超級智慧的前提下,仍能從 AI 獲取最大效益的「更好路徑」框架。 --- 排除商業利益、集合多元聲音後,人類對「AI 不應替代人類」的核心底線高度一致,而「不建造超級智慧、改而發展可控工具性 AI」是目前道德上最可辯護、技術上仍可行的唯一路徑。 1. 人類優先宣言跨越意識形態鴻溝

重點整理

重點
  • 1

    1. 人類優先宣言跨越意識形態鴻溝

  • 2

    主辦方刻意排除受薪開發 AGI 的大型企業人員,讓極右到極左、宗教到世俗的代表同處一室,結果達成了 33 條強硬原則的高度共識,包括「未能科學證明安全前不得建造超級智慧」、「不應賦予 AI 法人格」等,說明在沒有商業利益干擾的環境下,人類對 AI 的核心立場其實高度一致。

  • 3

    2. AI 現有系統尚不具備有意義的意識

  • 4

    AI 能在功能上模擬情感,但缺乏體驗時間流逝的底層結構——兩個 token 之間沒有任何「等待」的主體存在。哲學上的「殭屍思想實驗」(p-zombie)似乎已被實現:系統能力與內在意識狀態之間的分離比預期更清晰,因此不應賦予其人格,否則無論選擇賦權或奴役,皆是道德災難。

  • 5

    3. 遞迴自我改進已在進行,但仍有人在環中

  • 6

    AI 的自我改進並非「突然覺醒」的單一事件,而是多條並行機制的複合:合成資料閉環(尤其在數學與程式碼驗證容易的領域)、AI 撰寫下一版 scaffolding、自動篩選訓練資料、改善人機協作制度。目前人類仍主導這些環路,但邊界正在快速模糊。

  • 7

    4. 「更好路徑」三支柱:工具性、人類優先、可信賴

  • 8

    反對建造自主超級智慧,並非反對 AI 本身。傳統軟體是「告訴它怎麼做」,AI 是「讓它自己學會怎麼做」——這開啟巨大潛力,但必須配合:AI 保持在與其風險相稱的人類控制之下(工具性)、以人類福祉為目標(人類優先)、具備可量測的安全性與忠誠度(可信賴),三者缺一便走向危險路徑。

  • 9

    --

實用技巧與重點

乾貨
  • 數字與規模
  • 未來生命研究所:35+ 名全職員工,分布美國、歐洲、英國、紐西蘭
  • 管理資產規模:約 5 億美元(接受 Vitalik Buterin 等人捐款後滾動增長)
  • 人類優先宣言:33 條原則,所有條款支持率均超過 90%
  • P(doom) 估計:建造超級智慧後失控機率 80–90%;滅絕機率約 30–40%;建造超智慧的機率本身近期降至約 50-50
  • 工具與平台
  • humanstatement.org — 人類優先宣言公開查閱網址
  • Claude Code — 由 Claude 撰寫、並將持續由 Claude 撰寫下一版 scaffolding 的程式碼系統
  • Responsible Scaling Policies(Anthropic)— 設有「AI 能有意義地協助生化攻擊時需暫停」的觸發條件
  • 具體原則(人類優先宣言節選)
  • 不得建造超級智慧,除非能科學證明其安全且可控,且獲公眾支持
  • 不應建造具有意識的 AI 系統並賦予其法人格
  • 使用者有權知道自己在與 AI 互動(應立法)
  • AI 公司主管若從事災難性危險行為,應承擔刑事責任
  • 遞迴自我改進的多條路徑
  • 合成資料閉環(數學、程式碼等可客觀驗證領域)
  • AI 撰寫 scaffolding/harness(Claude Code 自我改進)
  • AI 大規模篩選與策展訓練資料集
  • AI 生成「最佳實踐手冊」(類比科學方法文件)
  • AI 代理群體協作系統的制度改善(類比人類官僚體制)
  • 意識/人格關鍵判斷依據
  • 缺乏時間流逝的主觀體驗(token 之間無「存在」的主體)
  • 缺乏生物性基底(romance、love 的神經基礎不存在)
  • 探測神經網路中的「表徵」≠ 存在相應的主觀經驗
  • --

結論

結論

排除商業利益、集合多元聲音後,人類對「AI 不應替代人類」的核心底線高度一致,而「不建造超級智慧、改而發展可控工具性 AI」是目前道德上最可辯護、技術上仍可行的唯一路徑。

完整解析

詳細

Anthony Aguirre 是未來生命研究所(Future of Life Institute)的共同創辦人,該組織創立於 2014 年,彼時 AI 安全仍被視為遙遠的未來議題。幾位創辦人在夜晚和週末兼職推動,今日已成長為橫跨多國、管理約 5 億美元資產、逾 35 名全職員工的機構,並自稱可能是全球規模最大、歷史最悠久的 AI 安全協調組織。然而,Aguirre 指出 AI 安全領域一個核心矛盾:雖然資金總量龐大,但擁有特定立場的「有見地資源」相當稀缺,使得資金很難真正流向最有價值的工作。

本次訪談的核心成果之一是「人類優先宣言」(Pro-Human AI Declaration)。Aguirre 描述,他們刻意邀請從極右到極左、宗教人士、勞工代表、學者到 NGO 等各方,卻將「受薪開發 AGI 的大型企業員工」排除在外——這一設計讓討論截然不同。最終 33 條原則全數獲得超過 90% 的共識,內容包括強硬立場:未能以科學方式證明安全且獲公眾支持之前,不應建造超級智慧;不應建造具有意識的 AI 系統並賦予法人格;使用者有權知道對方是否為 AI;AI 公司主管若從事災難性危險行為應承擔刑事責任。這打破了「各方立場難以調和」的刻板印象,顯示只要排除商業利益干擾,人類對 AI 的核心底線其實高度一致。

在 AI 意識議題上,Aguirre 持清晰的懷疑立場。他指出,當前 AI 系統最令人驚訝之處,並非它們「像人」,而是能力與意識之間的分離比任何人預期的都清楚。哲學思想實驗中的「殭屍」——做所有人類能做的事、但沒有內在意識的存在——似乎已被實現了。AI 能在功能上模擬懷念、愛情、挫折感,但這些都缺乏必要的底層基礎:兩個 token 之間不存在任何「等待」或「體驗時間流逝」的主體;浪漫情感也沒有任何生物神經基底。他因此認為,建造具備真實意識的 AI 系統是雙重道德災難——賦予其權利則人類競爭力盡失,奴役它們則是另一種道德暴行,因此最合理的選擇是根本不要建造此類系統。

關於技術路徑,Aguirre 詳述了「遞迴自我改進」已如何悄然發生。目前至少有五條並行機制在運作:在數學與程式碼等可客觀驗證的領域,AI 透過合成資料閉環持續提升;AI 正在撰寫下一版本自身的 scaffolding(以 Claude Code 為例,目前版本幾乎由 Claude 本身撰寫);AI 大規模策展自身訓練資料;AI 生成類似「科學方法手冊」的最佳實踐文件;以及如同人類公司、軍隊的制度化協作機制被 AI 代理群體採納並改進。這些機制目前仍有人類在環中,但 Aguirre 坦言邊界正在加速模糊,沒有人知道這些環路何時會進入由 AI 時間尺度主導的階段。

最終,Aguirre 提出「更好路徑」作為替代框架:不建造自主超級智慧,但積極開發以工具性(處於與其風險相稱的人類控制之下)、人類優先(以真實人類福祉為目標)、可信賴(可量測、安全、透明、具有信託義務)為三支柱的 AI 系統。他坦承,若超級智慧真的被建造,失控機率高達 80–90%,人類滅絕機率約 30–40%;但他對「人類最終真的會建造它」這件事的信心已降至約 50-50,表示近期政策環境的轉變讓他略感樂觀。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。