KeyFrame內部研究專用

Stop Making Models Bigger, Make Them Behave — Kobie Crawford, Snorkel

AI Engineer·6月10日週三·20 min英文

三句話摘要

4 億參數小模型通過強化學習和高質量數據超越 235 億參數大模型的金融工具使用能力。 找到真正的行為問題比盲目升級模型大小更重要——小模型通過正確的訓練數據和強化學習完全可以達到大模型水平。 大模型推理強但工具使用失敗:235B 參數的量化大模型有能力探索環境,卻沒有學會應該先檢查可用表格。它直接查詢不存在的表格,無法得到結果後開始編造答案,完全失效。

重點整理

重點
  • 1

    大模型推理強但工具使用失敗:235B 參數的量化大模型有能力探索環境,卻沒有學會應該先檢查可用表格。它直接查詢不存在的表格,無法得到結果後開始編造答案,完全失效。

  • 2

    小模型可通過行為訓練達到大模型水平:經過RL訓練的4B模型學會正確的工具調用順序——先用get_table_names探索、再用get_table_info獲取表結構、編寫SQL、遇到錯誤則自我糾正。這些行為的改進才是關鍵。

  • 3

    單表格訓練產生最佳泛化效果:用單表格數據集訓練的模型,在複雜多表格問題上的性能提升反而最大,說明掌握基礎工具使用比多樣化的複雜例子更重要。

  • 4

    用Rubrics評估精確定位問題:不只評估最終對錯,而是用多個維度的評估標尺分解模型回應的正確性,從而找到真正需要改進的具體行為,然後針對性地生成訓練數據。

實用技巧與重點

乾貨
  • 模型規格:4 billion vs 235 billion parameters
  • 任務域:金融分析工具使用(FinQA)
  • 性能指標:Pass@1 提升 100%;複雜任務(多表格)13.9% → 26.6%
  • 訓練參數
  • RL演算法:GRPO
  • 訓練時間:21 小時
  • 訓練成本:< $500 per run
  • 環境:FinQA(290 單表格樣本 + 79 多表格 FinQA Reasoning 樣本)
  • 關鍵工具函數
  • `get_table_names`(列出可用表格)
  • `get_table_info`(查詢表結構)
  • SQL query + 錯誤自糾正
  • 訓練策略
  • 單表格訓練 > 單+多表格混合 > 課程學習(先單後多)
  • 只訓練單步工具使用效果最好
  • 部署平台
  • PrimeIntellect infrastructure
  • OpenEnv + GitHub
  • Hugging Face Spaces
  • 合作機構:Snorkel AI + UC Berkeley RLLM team (Agentyca)

結論

結論

找到真正的行為問題比盲目升級模型大小更重要——小模型通過正確的訓練數據和強化學習完全可以達到大模型水平。

完整解析

詳細

企業在部署 AI 系統時常面臨困境:使用大模型成本高、推理慢、難以本地部署;但用小模型又怕性能不夠。特別在金融和醫療等受監管行業,組織需要更嚴格的安全控制和數據隱私保護。傳統解法是不斷升級到更大的模型,但 Snorkel 的這項研究挑戰了這個假設。

演講者先展示一個真實案例。當被問"YouTube 廣告收入 2023-24 的年增長率"時,235 億參數的大模型直接查詢了一個根本不存在的表格。雖然環境中提供了 `get_table_names` 工具,但模型沒有選擇使用它,反而在查詢失敗後開始編造數字。這暴露了一個本質問題:大模型有推理能力,卻缺乏工具使用的紀律。

Snorkel 與 UC Berkeley 合作,決定用強化學習來教 40 億參數的小模型執行正確的工具使用流程。他們先通過自有平台招募金融領域專家,生成高質量訓練數據,並在虛擬環境中驗證每個問題都有確定的正確答案。FinQA 環境包含 290 個單表格問題和 79 個需要多表格聯接的複雜問題。使用 GRPO 演算法進行 21 小時的訓練,成本低於 $500。

最出乎意料的發現是:只用單表格問題訓練模型效果最好。即使訓練集不含多表格例子,模型在複雜多表格測試集上的性能提升幅度反而最大(13.9% 提升到 26.6%)。經過訓練的小模型學會了行為序列:用 `get_table_names` 探索環境、用 `get_table_info` 了解表結構、編寫 SQL 查詢、觀察到錯誤時自我糾正。這些行為層面的改進才是決定性因素,而非推理深度。

Snorkel 的評估方法論也很關鍵。他們不只關注最終的對錯,而是用多維度的 Rubrics 評估表,將模型回應的正確性分解為多個可獨立評判的維度。這樣可以精確定位模型的具體失敗模式,然後針對性地生成訓練數據。強化學習只需要單一的獎勵信號,但前期的詳細分析能確保訓練數據和目標對齊。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。