Stop Making Models Bigger, Make Them Behave — Kobie Crawford, Snorkel
三句話摘要
4 億參數小模型通過強化學習和高質量數據超越 235 億參數大模型的金融工具使用能力。 找到真正的行為問題比盲目升級模型大小更重要——小模型通過正確的訓練數據和強化學習完全可以達到大模型水平。 大模型推理強但工具使用失敗:235B 參數的量化大模型有能力探索環境,卻沒有學會應該先檢查可用表格。它直接查詢不存在的表格,無法得到結果後開始編造答案,完全失效。
重點整理
重點- 1
大模型推理強但工具使用失敗:235B 參數的量化大模型有能力探索環境,卻沒有學會應該先檢查可用表格。它直接查詢不存在的表格,無法得到結果後開始編造答案,完全失效。
- 2
小模型可通過行為訓練達到大模型水平:經過RL訓練的4B模型學會正確的工具調用順序——先用get_table_names探索、再用get_table_info獲取表結構、編寫SQL、遇到錯誤則自我糾正。這些行為的改進才是關鍵。
- 3
單表格訓練產生最佳泛化效果:用單表格數據集訓練的模型,在複雜多表格問題上的性能提升反而最大,說明掌握基礎工具使用比多樣化的複雜例子更重要。
- 4
用Rubrics評估精確定位問題:不只評估最終對錯,而是用多個維度的評估標尺分解模型回應的正確性,從而找到真正需要改進的具體行為,然後針對性地生成訓練數據。
實用技巧與重點
乾貨- 模型規格:4 billion vs 235 billion parameters
- 任務域:金融分析工具使用(FinQA)
- 性能指標:Pass@1 提升 100%;複雜任務(多表格)13.9% → 26.6%
- 訓練參數
- RL演算法:GRPO
- 訓練時間:21 小時
- 訓練成本:< $500 per run
- 環境:FinQA(290 單表格樣本 + 79 多表格 FinQA Reasoning 樣本)
- 關鍵工具函數
- `get_table_names`(列出可用表格)
- `get_table_info`(查詢表結構)
- SQL query + 錯誤自糾正
- 訓練策略
- 單表格訓練 > 單+多表格混合 > 課程學習(先單後多)
- 只訓練單步工具使用效果最好
- 部署平台
- PrimeIntellect infrastructure
- OpenEnv + GitHub
- Hugging Face Spaces
- 合作機構:Snorkel AI + UC Berkeley RLLM team (Agentyca)
結論
結論“找到真正的行為問題比盲目升級模型大小更重要——小模型通過正確的訓練數據和強化學習完全可以達到大模型水平。”
完整解析
詳細企業在部署 AI 系統時常面臨困境:使用大模型成本高、推理慢、難以本地部署;但用小模型又怕性能不夠。特別在金融和醫療等受監管行業,組織需要更嚴格的安全控制和數據隱私保護。傳統解法是不斷升級到更大的模型,但 Snorkel 的這項研究挑戰了這個假設。
演講者先展示一個真實案例。當被問"YouTube 廣告收入 2023-24 的年增長率"時,235 億參數的大模型直接查詢了一個根本不存在的表格。雖然環境中提供了 `get_table_names` 工具,但模型沒有選擇使用它,反而在查詢失敗後開始編造數字。這暴露了一個本質問題:大模型有推理能力,卻缺乏工具使用的紀律。
Snorkel 與 UC Berkeley 合作,決定用強化學習來教 40 億參數的小模型執行正確的工具使用流程。他們先通過自有平台招募金融領域專家,生成高質量訓練數據,並在虛擬環境中驗證每個問題都有確定的正確答案。FinQA 環境包含 290 個單表格問題和 79 個需要多表格聯接的複雜問題。使用 GRPO 演算法進行 21 小時的訓練,成本低於 $500。
最出乎意料的發現是:只用單表格問題訓練模型效果最好。即使訓練集不含多表格例子,模型在複雜多表格測試集上的性能提升幅度反而最大(13.9% 提升到 26.6%)。經過訓練的小模型學會了行為序列:用 `get_table_names` 探索環境、用 `get_table_info` 了解表結構、編寫 SQL 查詢、觀察到錯誤時自我糾正。這些行為層面的改進才是決定性因素,而非推理深度。
Snorkel 的評估方法論也很關鍵。他們不只關注最終的對錯,而是用多維度的 Rubrics 評估表,將模型回應的正確性分解為多個可獨立評判的維度。這樣可以精確定位模型的具體失敗模式,然後針對性地生成訓練數據。強化學習只需要單一的獎勵信號,但前期的詳細分析能確保訓練數據和目標對齊。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


