KeyFrame內部研究專用

Why Models Are AI’s Next Training Dataset with Damian Borth - #772

TWIML AI·7月27日週一·47 min英文

三句話摘要

權重空間學習:把訓練好的神經網路權重作為資料,用機器學習方法理解、分析和生成權重。 權重空間學習透過把已訓練模型權重轉化為可學習的資料流,在資料稀缺時代為模型開發提供了新的計算正規化:不再只依賴原始資料,而是複用全人類已投入的計算和知識,按需生成專用模型。 權重本身是被浪費的資產 — 訓練好的模型權重已嵌入大量資訊(準確度、泛化能力、超參配置),這些通常被丟棄,但透過自編碼器可以提取和學習這些隱含特徵。

重點整理

重點
  • 1

    權重本身是被浪費的資產 — 訓練好的模型權重已嵌入大量資訊(準確度、泛化能力、超參配置),這些通常被丟棄,但透過自編碼器可以提取和學習這些隱含特徵。

  • 2

    重建精度vs功能保留的矛盾 — 自編碼器雖然能低均方誤差重建權重,但失去高頻細節導致生成權重初期"模糊且損壞",需要微調才能恢復功能,這推動了損失函式(從重建損失改為感知/行為損失)和標準化策略的進化。

  • 3

    從受控模型動物園擴充套件到開放生態 — 突破早期僅限小規模同構資料的限制,透過處理序列化、位置編碼、後設資料補全等技術,支援Hugging Face的2000+異構模型,開啟了跨架構、跨任務的權重轉移可能性。

  • 4

    資料稀缺時代的新正規化 — 傳統做法在資料耗盡時陷入困境,權重空間學習用已存在的權重計算替代原始資料,並透過資料集嵌入實現隱私保護的模型生成,對受監管行業(金融、醫療)特別有價值。

實用技巧與重點

乾貨
  • 時間線與里程碑
  • 2021:首篇論文發表(Fashion MNIST上準確度預測R²達90%+)
  • 2022:發表權重生成論文
  • 2024:與UC Berkeley合作,Hugging Face模型規模突破
  • 技術引數與資料
  • 自編碼器:編碼器+對比損失+解碼器架構
  • 模型篩選:Hugging Face 20,000個模型 → 2,000個透過質量檢查 → 包含數十億引數
  • 計算效率:遙感基礎模型生成 350 GPU小時 vs Tel-FM的 12,000 GPU小時(節省25-30倍)
  • 模型預測能力:從權重預測準確度、泛化差距、啟用函式型別、初始化方式
  • 核心技術方案
  • 權重序列化:讀取模型,按順序展平引數為長整數序列(摧毀層級結構)
  • 標準化位置:批次標準化(而非例項標準化)、位置編碼標識層位置和絕對位置
  • 資料集提示(待發表論文):單一資料集向量替代模型錨點,實現隱私保護
  • 應用案例
  • 遠端遙感:ImageNet ViT → 遙感模型生成,效能與現有基礎模型相當但用時減少25倍
  • 跨域知識轉移:從計算機視覺模型取樣GPT-2型語言模型(雖然仍小規模,但驗證了模態轉移)
  • 未來願景:資料集編碼 + 架構訊號 + 條件生成 = 按需取樣專用模型
  • 相關研究方向
  • 模式連線、損失景觀分析(Bo和Rose,UC San Diego)
  • 權重觀察(Charles Martin的權重守望者)
  • 梯度和啟用空間學習(Hagai Maron)
  • 任務向量和任務算術

結論

結論

權重空間學習透過把已訓練模型權重轉化為可學習的資料流,在資料稀缺時代為模型開發提供了新的計算正規化:不再只依賴原始資料,而是複用全人類已投入的計算和知識,按需生成專用模型。

完整解析

詳細

權重空間學習源自一個簡潔而深刻的觀察:傳統監督學習用資料訓練神經網路得到權重,但這些權重在用於推理後便被視為終點。Damian Borth提出,權重其實蘊含了巨大的資訊資產——包括模型的準確度、泛化能力、所學特徵等。那為什麼不把權重本身當作資料,用機器學習來理解它們呢?

這個想法類比自然清晰:語言模型在網際網路所有句子上訓練以理解語言,視覺模型在所有畫素上訓練以理解影象,那麼我們也可以在所有已訓練神經網路的權重上訓練一個模型,從而學會分析和生成權重。這開啟了一個全新的研究維度。

初期實現採用自編碼器架構。團隊收集受控條件下訓練的模型動物園(如600個已知後設資料的Fashion MNIST模型),用編碼器將權重壓縮到低維潛空間,透過對比損失學習,再用解碼器重建。驚人的是,這個潛空間自動組織了資訊——不同初始化、不同準確度的模型在潛空間中形成視覺化的軌跡。僅用編碼器的嵌入加線性迴歸頭,就能預測未見過的模型準確度。

第二步嘗試從潛空間取樣生成新權重。雖然重建損失很低,但生成的權重卻"損壞"了模型——這個看似矛盾的現象推動了方法論進化。問題在於均方誤差是平均值,自編碼器擅長捕捉低頻資訊但喪失了決定模型功能的高頻細節。解決方案借鑑影象生成領域:改用感知損失、行為損失,加入標準化,最終生成的權重雖然仍需微調但可用。

擴充套件到真實規模的轉折點來自2024年。團隊突破了"模型動物園"的侷限,開始消化Hugging Face的異構模型生態。這需要解決技術難題:不同架構有不同序列長度、不同層型別,且約30%模型的後設資料缺失。他們採用與架構無關的處理方式——直接向量化權重序列,用位置編碼標識層級而非依賴層邊界。經過質量篩選,從20000個模型中選出2000個多樣的模型用於訓練,涵蓋計算機視覺和語言領域。

最引人注目的驗證來自遙感領域。以預訓練的ImageNet ViT為"錨點",他們生成了專用於遙感任務的基礎模型。這不只是證明可行,而是展現了實際價值:生成的模型效能與透過傳統微調達到的水平相當,但消耗的GPU時間從12000小時降至350小時——節省了25到30倍。這是真正的知識轉移:計算機視覺模型中學到的權重結構被重新利用到陌生領域。

更前沿的方向是用資料集嵌入代替模型作為條件訊號。在這個框架中,機構無需共享敏感原始資料,只需提供一個聚合的資料集向量。這個向量無法反推出單個樣本(隱私保護),卻足以指導權重空間學習模型生成適合該資料的權重。這對受監管行業(金融、醫療)意義重大——他們既想利用先進模型又無法暴露資料。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。