KeyFrame內部研究專用

Beyond Static Intelligence: Evaluating Continual Learning — Parth Asawa, UC Berkeley

AI Engineer·8月12日週三·20 min中文

三句話摘要

現有語言模型評估方式忽視持續學習能力,Continual Learning Bench 1.0 提出新的評估基準來測量模型在長期交互中的真實學習效果。 持續學習並非單一能力點,必須用新的評估基準測量模型在長期交互中如何平衡「保留穩定知識」與「學習新信息」,這對構建真正能適應現實環境的 AI 系統至關重要。 評估方法根本問題 — 傳統基準假設模型每次評估都重置記憶,這與人類和系統的真實運作方式不符。持續學習必須在模型能「保留並利用過去經驗」的環境中測量,才能真正反映學習能力。

重點整理

重點
  • 1

    評估方法根本問題 — 傳統基準假設模型每次評估都重置記憶,這與人類和系統的真實運作方式不符。持續學習必須在模型能「保留並利用過去經驗」的環境中測量,才能真正反映學習能力。

  • 2

    設計三大準則 — Headroom 要求任務有進步空間(不能讓前沿模型通過預訓練直接飽和);Shared structure 要求任務間存在可被利用的共同潛在結構;Learning mechanism 要求環境提供明確反饋信號(獎勵、錯誤、文本反饋)。

  • 3

    gain 指標的創新 — 通過比較「有狀態運行」與「無狀態基線」的性能差異,隔離出純粹由持續學習帶來的收益,避免被基礎模型能力混淆。同時結合獎勵和成本在 Pareto 前沿評估,全面衡量系統表現。

  • 4

    參數化方法的未來 — 講者認為應從第一性原理重新設計模型架構與訓練棧以支持持續學習,而非在凍結的預訓練模型上事後補救。當前訓練棧(預訓練→監督微調→RLHF→多階段)可能本質上不適合持續學習。

實用技巧與重點

乾貨
  • 基準名稱
  • Continual Learning Bench 1.0
  • 六個任務域
  • Blind spectrum monitoring(信號處理)
  • Code base adaptation(軟體工程效率)
  • Cohort studies(流行病學)
  • Exploitable poker(策略遊戲)
  • Database exploration(數據探索)
  • Sales prediction(銷售預測)
  • 三個評估指標
  • Reward:每個任務實例的獎勵(效率、利潤、預測準確度等)
  • Gain:stateful reward - stateless reward(衡量純粹學習收獲)
  • Cost:系統開銷
  • 三個基準設計準則
  • Headroom:任務必須有進步空間,無法通過離線預訓練完全解決
  • Shared structure:任務間存在可被利用的潛在結構
  • Learning mechanism:環境提供明確的學習信號
  • 測試的持續學習方法
  • Vanilla in-context learning(將經驗放入上下文)
  • 外部記憶系統(記事本、鍵值存儲)
  • 參數化方法(線上更新模型權重)
  • 核心發現
  • Vanilla in-context learning 在所有指標上(reward vs cost、gain vs cost)表現最好
  • 複雜的記憶管理系統表現反而更差
  • 失敗模式主要分為:Stability 失敗(無法保留過去信息)和 Plasticity 失敗(無法從新信息學習)
  • 合作機構
  • UC Berkeley、Snorkel AI、UW Madison
  • 贊助:Snorkel AI Open Benchmarks Grant Program、LOD Institute Slingshots Program

結論

結論

持續學習並非單一能力點,必須用新的評估基準測量模型在長期交互中如何平衡「保留穩定知識」與「學習新信息」,這對構建真正能適應現實環境的 AI 系統至關重要。

完整解析

詳細

語言模型評估的核心問題在於其根本假設的不現實性。當前所有 AI 會議上討論的是模型「有多聰明」,卻沒有人真正在談論模型的「學習能力」。講者指出,今天的評估方式會將每項任務視為完全獨立的事件,模型被假設在每次評估前都完全遺忘所有記憶——就像一個人的人生每次做任何事都從零開始。這種評估方法產生的排行榜雖然看起來科學,卻無法反映真實的持續學習能力。

持續學習的定義是「樣本高效的在線學習,長期穩定運行」。這是一個雙重挑戰:模型必須既能穩定保留過去的知識而不遺忘,又能靈活地從新經驗中學習並更新認知。目前語言模型訓練是一次性的——數據丟進去,離線訓練數週,然後凍結權重部署到世界。但持續學習要求系統能隨著時間推移而進化。人們已經探索過多種方向:in-context learning(將信息塞入上下文)、外部記憶存儲、甚至直接線上更新模型權重。但真正的問題是:我們根本沒有在評估這些能力。

為此,講者與 Berkeley、Snorkel AI 和 UW Madison 的團隊開發了 Continual Learning Bench 1.0。基準的設計遵循三個根本準則。第一個是「Headroom」(進步空間):如果前沿模型通過離線預訓練就能完美解決任務,那麼這個任務無法測量持續學習。第二個是「Shared structure」(共享結構):任務間必須存在可被利用的潛在結構,使得先前的經驗確實能改進未來表現——這是評估持續學習的前提。第三個是「Learning mechanism」(學習機制):環境必須提供明確的反饋信號(獎勵、錯誤信息、文本反饋),讓代理有機會學習。

基準涵蓋六個實際任務域,從信號處理、軟體工程、流行病學、策略遊戲、數據庫探索到銷售預測。其中數據庫探索任務很好地說明了持續學習的本質:人類數據工程師在陌生的數據庫上工作時,會逐漸學習表結構、表之間的聯繫、數據特性。但如果一個 AI 代理的記憶每次重置,它永遠無法積累這些知識。隨著任務進行,一個持續學習系統應該需要更少的查詢來回答問題。更複雜的是,當數據庫發生遷移(欄位刪除、新欄位添加、格式改變)時,系統必須既能忘記過時的知識,又能從新信息中學習——這正是 stability-plasticity 的權衡。

評估指標的創新之處在於「Gain」(收益)的引入。簡單的累積獎勵容易被基礎模型的能力混淆——一個原本就更強的系統可能表現更好,但並非因為它學習能力強。所以基準對每個系統運行兩次:一次允許跨實例保持狀態(可能學習),一次重置狀態(純基線)。兩者的差異就是純粹的學習收益。這樣可以準確回答:「我在第五個任務上的改進中,有多少來自前四個任務的經驗?」

令人驚訝的是,初步結果顯示簡單的 vanilla in-context learning(直接把經驗放入上下文,不做花哨的記憶管理)在所有指標上都超過了複雜的外部記憶系統和參數化方法。這可能暗示當前任務還不夠難以壓倒 in-context learning 的優勢,但也反映了實現高效記憶管理的困難。講者觀察到的失敗模式大多落在 stability-plasticity 的某一側:Stability 失敗表現為模型忘記過去(如銷售預測任務中模型忘記之前的過度預測),Plasticity 失敗表現為模型無法從新信息更新認知(如流行病學任務中模型無法識別新的相關資訊)。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。