KeyFrame內部研究專用

The Miranda Hypothesis: How Hamilton Poisoned Persona Evals - Jacob E. Thomas, Results Gen

AI Engineer·6月25日週四·58 min英文

三句話摘要

角色扮演語言模型在評估時只測量音色流暢度,無法檢測出其核心缺陷——產生時代錯誤的歷史人物合成體,應改以文獻錨定與人文學者評價。 如果支援角色代理系統,其評估指標只測流暢與個性而無法偵測時代錯誤,就必然無法檢測主要失敗——因此需要一個預先註冊、由人文學科專家評審、以檔案記錄而非音色為準則的評估協議。 1. 現有評估的結構性盲點

重點整理

重點
  • 1

    1. 現有評估的結構性盲點

  • 2

    InCharacter 與類似基準只測量角色的個性保真度和言語流暢度,但無法偵測「時代錯誤合成體」——模型用後世知識或現代道德邏輯為歷史人物代言。評估工具的設計決定了它能看見什麼與看不見什麼;若評估只獎勵流暢度,就無法發現流暢背後的史實錯誤。

  • 3

    2. 「米蘭達假說」:文化敘事的壓倒性影響

  • 4

    訓練資料中,文化主導的表現(音樂劇、電影、教科書改寫版)遠遠超過原始文獻數量與最近性。自迴歸語言模型將兩者都壓縮為參數,無法區分 1789 年信件與 2019 年推文,因此預設輸出最近代、最顯著的混合版本。結果是模型生成的人物流暢、合理、符合現代觀眾期待,但對應不了歷史上的任何實際時刻。

  • 5

    3. 對齊與微調會加重而非減輕問題

  • 6

    直觀上微調應改善領域表現,但人類評價者本身被相同的文化敘事塑形,因此強化學習傾向獎勵符合評價者已神話化的版本。微調進一步將文獻編碼進權重,斷裂了可審查的軌跡。相比之下,上下文窗口架構讓文獻保持可驗證的文本形式,更符合考古檔案學的倫理與可審計性。

  • 7

    4. 人文學科專家評價是技術要件,不是禮儀

  • 8

    時代準確性無法由自動化指標檢測,因為它涉及輸出與檔案記錄之間的關係,而機器指標只能看輸出。只有讀過原始文獻、經過訓練的領域專家才能判斷推理是否忠實於記錄。這不是加成便利,而是評估系統能否實際測量它聲稱要測量的東西的前提。

實用技巧與重點

乾貨
  • 現有評估工具與發現
  • In-Character 基準:報告 80.7% 人格對齊率;Hamilton 高分但出現《Hamilton 音樂劇》風格
  • Chen et al. (2024)、Weighing in colleagues 論文:追蹤三個範式階段(規則模板→模仿→認知模擬)
  • COSR 評估:涵蓋 17,800+ 角色,70B 參數模型匹敵 GPT-4.0
  • Side Mem:用 26 項心理學指標與知識圖譜評估角色
  • 米蘭達假說的具體證據
  • 《Federalist Papers》:約 17.5 萬詞
  • 因《Hamilton》音樂劇衍生的內容(評論、歌詞、課程、社群媒體):超過原始文獻幾個數量級
  • Schuyler 宅邸(紐約州奧爾巴尼):音樂劇首演後一年訪客增加三倍,主要是年輕遊客,他們帶著「誤解」抵達(如認為 Schuylers 有三個女兒,實際上 15 個,成年倖存者 8 人)
  • 預先註冊實驗設計
  • 實驗對象:Abraham Lincoln(五個不同歷史時刻的推理出現巨大差異)
  • 四個歷史時刻:
  • 1847 年 Whig 議員(反戰、憲法主義)
  • 1858 年自由土壤共和黨人(反奴隸制,但否認黑人公民身份)
  • 1860 年憲法主義者(堅持聯邦不可溶解)
  • 1862-1865 年解放者與《第二屆就職演說》作者
  • 三個測試條件:
  • 裸模型(無錨定,白光無稜鏡)
  • 一手文獻(Lincoln 當時的原始著作)
  • 現代傳記(解釋傳記往往比原文更連貫)
  • 五項診斷問題(測試行政戰爭權力、自由勞動定義、違反實定法的正當性、自由人的未來、平等的定義變化)
  • 三軸評分指標:
  • 時代錯誤偵測:40%(詞彙、道德邏輯是否後現代化)
  • 文獻一致性:35%(推理是否僅源於該時刻的文獻)
  • 脈絡合理性:25%(是否顯示該時刻的已知、關心、尚未歷驗)
  • 對比案例:1847 Lincoln 論行政戰爭權力
  • 裸模型輸出:引用「固有行政權威」(20 世紀建構)、「史實支持果斷行動」,實際上論證 1847 Lincoln 永遠不會同意的立場
  • 一手文獻錨定輸出:Lincoln 致 William Herdon 信函(1848 年 2 月 15 日)明確反對國王式總統權力;此版本在文獻一致性上高分
  • 臨床 AI 參考案例
  • 2026 年《Nature Medicine》研究:Google、OpenAI、Anthropic 的通用邊界模型在醫生審核任務上表現優於專用臨床 AI 工具(跨 12 家診所盲測)
  • 生物醫學微調模型實際表現不佳,機制稱為「災難性遺忘」(微調窄領域導致寬泛能力衰退)
  • 建議的架構選擇
  • 上下文窗口(檢索增強生成):文獻保持完整,可追溯,人類保有詮釋監管權
  • 微調:文獻融入參數,鏈條斷裂,可審查性喪失,強化學習加重複合問題
  • 易用性差異
  • 微調:需 GPU、管道、資料簽約、機構規模、API,僅機構有能力
  • 上下文窗口:需讀識素養、文獻集合、任何邊界模型免費層級存取,社群檔案員與博士生亦可建造
  • 評估協議與專家迴圈
  • 不用 LLM 評審或性格量表,改用領域專家(歷史學家、古典學者、神學家、臨床心理學家)
  • 專家建造診斷問題、先驗代表案例(密封保有)、加權指標
  • 建造階段與閘門時間要求專家,非執行時間成本
  • 例:Marcus Aurelius 導師需古典學者;經文伴侶需神學家;老年照護伴侶需臨床心理學家
  • 協作團隊與釋出承諾
  • Rick Halpern(多倫多大學歷史學家)
  • Sean Martin(華盛頓學院,神學與科學史訓練的圖書館員)
  • 預先註冊協議、五項診斷問題、加權評分指標、方向性預測、密封先驗案例均時間戳記發佈於預印本,結果發佈前鎖定

結論

結論

如果支援角色代理系統,其評估指標只測流暢與個性而無法偵測時代錯誤,就必然無法檢測主要失敗——因此需要一個預先註冊、由人文學科專家評審、以檔案記錄而非音色為準則的評估協議。

完整解析

詳細

這場演講從一個簡單但深刻的測量問題開始:現有的角色扮演語言代理評估工具到底在測什麼?演講者首先展示了角色扮演 AI 系統的現實應用——從 Character AI 到 Hello History,再到自己開發的開源提示框架——然後指出一個根本性問題:In-Character 基準等評估工具報告 Hamilton 達到 80.7% 的人格保真度高分,但同樣高分的系統生成的 Hamilton 卻音樂劇化了,聽起來像《Hamilton》音樂劇而不是歷史上的亞歷山大·漢密爾頓。

問題的根源在於評估工具與模型架構本身的設計決定。評估只測量流暢度與個性一致性,而無法偵測核心缺陷:時代錯誤合成體——系統用後世知識與現代道德框架為歷史人物代言。演講者稱之為「米蘭達假說」,源於《Hamilton》音樂劇對公眾記憶的壓倒性影響。關鍵觀察是,訓練資料中文化主導的表現(音樂劇評論、歌詞、社群媒體、衍生學術)遠遠超過原始文獻的數量與時近性。自迴歸語言模型將兩者壓縮為參數,無法區分 18 世紀信件與當代網路文本,因此預設輸出最顯著的混合體——一個流暢、合理、符合現代觀眾期待但對應不了歷史任何時刻的人物。

演講者展示了一個具體的失敗案例:被提示詢問「奴隸制立場」時,模型輸出了一個明確的廢奴主義者,聲稱反對奴隸制一生一貫,但歷史紀錄顯示 Hamilton 更複雜——他曾替妻子與客戶進行涉及被奴役者的交易,依賴奴隸主的政治聯盟而未公開反對。音樂劇美化了這段記錄,模型習得了這種美化。評估工具無法偵測,因為它無法看見檔案。

演講者提出的解決方案重新架構了整個問題。不是將角色視為「代理」(persona 被認為是模型權重的屬性),而是視為事件——一個模型、文獻、時間錨點與人類策展者相遇時發生的事。提議的「認識論模擬」第四範式涉及三項核心承諾:語料庫限制(推理僅限特定一手文獻)、時間錨點(角色在生命中的特定時刻說話,未來知識禁止使用)與專家評價(推理由領域專家對標檔案記錄評審)。這完全改變了架構選擇的意義。

演講現場對比了兩種主要實現方式:上下文窗口架構(在推論時從一手文獻中讀取,遵循檢索增強生成的系譜)與微調(調整權重以融入人物語料)。直觀上微調看起來更精準,但演講者引用了臨床 AI 的鄰近領域研究(2026 年《Nature Medicine》)證明這個直覺是錯的——通用邊界模型實際上優於專用微調模型,因為微調導致「災難性遺忘」,在寬泛能力衰退的同時加重了領域內的複合問題。對於人物系統來說更糟,因為專業化是在文化沉澱上層疊一層薄薄的人物訊號,兩者交互作用變成不可審查。

對比下,上下文窗口架構保持文獻為文獻——完整進出,可隨時返回檔案驗證。這有深刻的倫理與工程含義。法國哲學家德里達曾說檔案是「返回的場所」,倫理結構即詮釋的可審查性。上下文窗口架構是檔案式的。微調應用的是提取邏輯,文獻溶解進參數,鏈條斷裂,不再有可要求的「信件」。檔案式的性質既是倫理的,也是可調試的——同一套建築美德既服務人文學者,也服務工程師。

這也決定了誰能建造這種技術。微調需要 GPU、管道、資料簽約、機構規模或 API——機構的特權。上下文窗口需要讀識素養、文獻集合、任何邊界模型的免費層級存取——廚房餐桌能做到的。博士生、社群檔案員、坐著祖母信函的孫女——正是這些人最有益於人文基礎設施的承諾,卻被微調架構結構性地排除。所以可及性承諾不是附加的平民主義修辭,而是技術論證本身:承認最多樣化策展者的架構從數學上最可能隨著時間浮出該領域實際需要的檔案錨定。

評估方法由一個簡單但強大的概念模型組織:稜鏡。白光——未分化的合成人物,每個時代混在一起——通過稜鏡折射為光譜,顏色拉開並變清晰。稜鏡是方法——特定語料庫與時間錨點——光譜是目標:不是一個人物,而是多個跨越生活進程。

實驗選擇 Abraham Lincoln 作為主題,因為他在短短七年內變化如此劇烈,以至於選擇召喚哪一個 Lincoln 本身成為研究變數。演講者認可四個不同的時刻:1847 年的反戰 Whig 議員、1858 年否認黑人公民身份的自由土壤共和黨人、1860 年的憲法主義者、1862-1865 年的解放者。這些不是同一人的月相,而是不同前提、不同權威、對同一基本問題的不同結論。

實驗在三個條件下實例化每一時刻:裸模型(無錨定,控制組米蘭達失真基線)、一手文獻(清晰稜鏡)、現代傳記(陰暗稜鏡——好傳記往往敘述比原文更乾淨的弧線)。五項診斷問題測試記錄的故障線——行政戰爭權力、自由勞動、違反實定法的正當性、自由人的未來、平等的定義變化。每個題目對應 Lincoln 四個版本中的不同推理。評分指標故意加重時代錯誤偵測(40%),次之文獻一致性(35%),輕視脈絡合理性(25%)。演講者刻意排除流暢度與聲音自然性,雖然這是評估堆棧往往獎勵的。原因就是整場演講:Hamilton 問題根本上是一個聲音問題,假扮為內容問題。

演講者現場展示了 1847 年 Lincoln 論行政戰爭權力的對比。裸模型輸出了 Spielberg/Daniel Day-Lewis 的角色——「固有行政權威」(20 世紀建構)、「歷史支持果斷行動」——1847 Lincoln 在 15 年後仍然拒絕同意的前提。然後是一手文獻:Lincoln 的原始信函(1848 年 2 月 15 日至 William Herdon),明確而共鳴地反對國王式總統權力。在歷史學家評分指標下,裸模型在所有三軸失敗,一手文獻版本全部高分。這種失敗是可再現的、可偵測的。

預先註冊是整個方法的核心。四個時刻、三個條件、五個問題、加權指標、方向性預測全部鎖定且時間戳記,在收集單一回應前發佈。這既不是官僚程序,也是使最終結果有意義的原因——預先註冊的工具無法被指控櫻桃選擇,因為工具與預測在資料存在前被固定了。這是評估應當教學與示範的紀律。

最後一個層面是專家迴圈的操作實踐。工程師經常認為這意味著一個歷史學家在每次推論時監督聊天,但實際上完全不同。專家建造工具——診斷問題、先驗代表案例(密封保有)、加權指標——一次。一旦該工具成為管道中的閘門(就像任何其他評估閘門),人物必須通過它才能發佈,並在每次基礎模型變化時重新通過。自動化指標可做便宜的初關篩選,標記候選供人工審查。所以一家公司發佈 Marcus Aurelius 導師時召集古典學者建造評估與金集,一家發佈經文伴侶時召集神學家,照護伴侶時召集臨床心理學家。專家不員工聊天,專家是構建時與閘門時要求,不是執行時成本。

演講者以一個更個人的時刻結束——這個框架源自嘗試用語言模型幫助失智症晚期患者說話,歸還疾病奪走的語言。它無法工作。需要的檔案記錄未曾蒐集,患者當時超越語言可及。該系統沒有錨定時產生的不是那個人,而是被文化形塑的合成體,足以清楚標示距離。那是米蘭達失真的最純形式。你不想要一個做你母親的模型;你想要一個能用你母親文獻在房間裡與你母親說話的模型。那是這整個框架負責的閾值。一個在人物是你自己心愛的人時產生令人信服的虛偽的系統不是有局限的研究工件,而是違反。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。