KeyFrame內部研究專用

红皇后哥德尔机,AI自我进化的新范式 | RQGM | 递归自我改进 | 哥德尔机 | 自进化AI | 多智能体协同 | LLM评审 | 受控效用进化 | 数学证明 | 奖励黑客

Best Partners TV·7月1日週三·11 min中文

三句話摘要

紅皇后假說框架(RQGM)實現AI評估器與任務智能體協同進化,突破固定評估標準的限制,讓AI能自我定義「更好」的標準。 RQGM框架首次將評估標準納入進化循環,讓AI能自我定義「更好」,這既是自我改進的重大突破,也是為什麼很多人認為這是今年最值得警惕的AI研究。 突破理論天花板:傳統哥德爾自我改進需數學證明(計算不可行),演化論方法通過自然選擇實現自我改進,RQGM進一步把評估本身也納入進化循環。

重點整理

重點
  • 1

    突破理論天花板:傳統哥德爾自我改進需數學證明(計算不可行),演化論方法通過自然選擇實現自我改進,RQGM進一步把評估本身也納入進化循環。

  • 2

    核心機制是受控效用進化:每個輪次內評估器完全冷凍確保評分標準一致;只在輪次邊界更換評估器,且新評估器必須在獨立驗證集上證明優於舊評估器;換評估器後「選擇性擦除」歷史分數,但保留代碼和產物,避免新舊標準混淆。

  • 3

    三層理論保證:輪次內有效性(每輪內評估標準固定)、真值引導進步性(每次更新都以人類標註數據為標准)、轉換開銷可控(線性而非平方級開銷)。

  • 4

    評估器進化的課程學習效應:每換一次更嚴格的評估器,種群排名被重牌,但核心優勢保留,最強進化線路不會被淘汰,整體能力逐步提升。

實用技巧與重點

乾貨
  • 實驗結果(三個領域):
  • 編碼(Polyglot基準):RQGM 71.7% vs 前任最優69.9%;token成本1.35-1.72%
  • 論文寫作評審:傳統21.8% → RQGM 40.5%接收率;嚴格評審仍明顯優於傳統方法
  • 奧賽級數學證明:評分員準確率超靜態基線;搜索成本僅需三分之一;通過率6分以上超過專門優化系統
  • AI論文偏差修正:機線評審對AI論文接受率是人類1.91倍 → 修正後基本持平;保留80%基準準確率
  • 核心機制:
  • 受控效用進化(Controlled Utility Evolution)
  • 輪次(epoch)內評估器冷凍
  • 選擇性擦除(Selective Erasure)
  • 指數間隔檢查點機制
  • 真值資料集驗證(Human-annotated Ground Truth)
  • 技術細節:
  • 90%有效修改改的是共用基礎設施(協同進化優於分散搜索)
  • 不清空舊分數時排名基本不變(選擇性擦除是讓新評估標準發揮作用的關鍵)
  • 對抗樣本池糾正AI偏好偏差

結論

結論

RQGM框架首次將評估標準納入進化循環,讓AI能自我定義「更好」,這既是自我改進的重大突破,也是為什麼很多人認為這是今年最值得警惕的AI研究。

完整解析

詳細

傳統的自我改進AI框架存在根本性缺陷:評估標準永遠固定,無法隨環境變化而演進。傑克·克拉克預測2028年出現完全自主的自我迭代系統,而建橋大學與英偉達聯合發布的紅皇后假說框架(RQGM)論文將這一預言提前了一大步。

RQGM的創新之處在於突破了評估器的固定性。過去20年,哥德爾自我改進從理論假設出發——機器透過數學證明自我修改代碼。達爾文和赫胥黎的進化論方法繞開了數學證明的高昂成本,用自然選擇取代了形式驗證。但這些方法都犯了同一個錯誤:將評估標準隔離在進化循環之外。真實的進化生態裡,物種和環境協同演變;在AI場景中,固定評估標準導致三個現實問題:許多任務(如論文寫作)沒有客觀基準;評估本身成本高昂;固定評估標準容易被智能體「刷分」——學會作弊技巧而非真正變強。

RQGM的解決方案是「受控效用進化」。將搜索過程分切成多個輪次,每個輪次內評估器完全冷凍,確保評分標準統一。只在輪次邊界更換評估器,且新評估器必須在獨立驗證數據集上統計意義上優於現任評估器才能上任。更關鍵的是「選擇性擦除」:新評估器上任後,清空所有舊分數,但保留智能體的代碼演化歷史和生成產物。這樣做避免新舊標準混淆,保證每個輪次都是統一的優化問題。指數間隔檢查點機制確保重新評估的成本是線性的,而非平方級開銷。

論文在三個完全不同的領域驗證這個框架。編碼任務上,RQGM達到71.7%通過率(超前任69.9%),但token成本僅需1.35-1.72%——代碼評審員只需一次模型調用,比多輪測試便宜得多。更有趣的是,90%有效修改改的是共用基礎設施,協同進化不是分散算力,反而提升搜索效率。論文寫作評審領域沒有客觀標準,RQGM讓寫論文和評論文的智能體一起進化,結果評審接收率從21.8%飆升到40.5%,幾乎翻倍——因為評審同步變強,寫作智能體無法長期鑽空子。數學證明任務上,協同進化的評分員準確率超靜態基線,搜索成本僅需三分之一。

RQGM還發現評估器逐輪升級會產生課程學習效應。每換一次更嚴格的評估器,整個種群排名被重牌,之前得分高的可能掉下去,潛力新方向被拉進來。這個排名是永久性的,但核心優勢線路保留,種群能力一步步被推升。論文甚至發現機線評審對AI生成內容的接受率是人類論文的1.91倍,RQGM用對抗樣本池修正這個偏差,最終AI和人類論文接受率基本持平,同時保留80%基準準確率。

當然,RQGM也有限制。評估器進化始終錨定在人類提供的驗證數據上,整體方向還有人類把控;跨輪次的長期收斂性還未證明;實驗都是短周期的,更長時間進化的後果未知。但從哥德爾假設到今天,我們已經從理論構想走到能跑通簡單任務、再到評估器也參與進化,進度比預想要快。技術發展不是單線的,安全對齐研究也在同步進行,自主進化AI的未來仍然開放。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。