How we taught agents to use good retrieval - Hanna Lichtenberg, Mixedbread AI
三句話摘要
通過多工具代理架構和強化學習,縮小大型語言模型的推理能力與檢索能力之間的差距。 通過多工具代理架構、精心設計的提示工程和強化學習訓練,可以將 LLM 搜尋性能從 9% 提升至 93%,徹底關閉知識推理與檢索檢索能力之間的差距。 知識差距的現實存在與量化驗證 — LLM 在 Browscom Plus 和 OfficeQA Pro 兩大基準測試中展現了巨大的性能落差。當提供正確文檔時(Oracle),模型分別達到 93% 和 64% 的準確率,但實際使用預設工具時只有 9% 和 8%。這證明瓶頸不在推理能力,而在於無法精準取得所需知識。
重點整理
重點- 1
知識差距的現實存在與量化驗證 — LLM 在 Browscom Plus 和 OfficeQA Pro 兩大基準測試中展現了巨大的性能落差。當提供正確文檔時(Oracle),模型分別達到 93% 和 64% 的準確率,但實際使用預設工具時只有 9% 和 8%。這證明瓶頸不在推理能力,而在於無法精準取得所需知識。
- 2
現有模型生成不規範查詢的根本原因 — 代理系統現在生成的搜尋查詢充滿無關鍵詞組合(例如「Senator woman questions billionaires not a company」),這源於三個訓練偏誤:模型主要針對代碼任務訓練而傾向使用正則表達式、模型學習模仿人類網路搜尋習慣的關鍵詞堆砌、現有基準測試如 BEIR 過度偏向 BM25 友善的實體型查詢。
- 3
多工具並行搜尋架構的設計邏輯 — 系統提供四種專用工具(概覽搜尋用於快速概括、語義搜尋用於精準語義檢索、元數據過濾用於精確篩選、關鍵詞工具用於精確匹配),代理在最多四輪搜尋中制定計畫,每輪可並行執行多個搜尋。通過目標框架、提示工程技巧(要求「寫出一句話描述欲搜尋內容」而非「寫搜尋查詢」)和少量示例,引導模型生成自然句子而非關鍵詞。
- 4
監督微調加強化學習的雙層訓練策略 — 系統先用較大教師模型進行監督微調,再使用自訂搜尋獎勵進行強化學習。獎勵函數結合檢索指標(NDCG、LLM 相關性判斷)與軌跡評估(查詢自然性、探索充分性、效率),全面優化模型的工具選擇和搜尋策略。
實用技巧與重點
乾貨- 基準測試性能對比
- Browscom Plus:Oracle 93% vs Codex 默認工具 9%;使用 Mixtbred 後 Oracle 與結果差距僅 3%
- OfficeQA Pro:Oracle 64% vs Codex 默認工具 8%;使用 Mixtbred 幾乎完全閉合差距
- ObliqueQA Congress(訓練中代理):NDCG@10 達 0.4,相較論文最佳結果 0.18 大幅提升
- MetQA(生產版 Mixtbred 代理搜尋):使用 Gemini 3.5 Flash 時達 93.4% 準確率,排名第一
- 檢索工具配置
- Overview Search:返回最多 50 個文本的摘要版本,用於快速掌握語料庫全景
- Semantic Search:返回前 10 個文本的完整內容,用於精準語義檢索
- Filter Chunks:基於元數據面向進行排序與篩選
- Web/Keyword Tool:進行精確關鍵詞匹配
- 代理搜尋流程
- 最多 4 輪搜尋循環,每輪可並行執行多個搜尋
- 初始階段:接收使用者查詢、初始語義搜尋結果、可用元數據提示
- 搜尋計畫:將查詢意圖分解為最多 4 個獨立查詢,各選最適工具
- 結果處理:去重文本塊以節省上下文,逐輪迭代直至掌握足夠證據
- 最終輸出:按合理排序列出所有相關文本塊
- 訓練方法論
- 使用小型 LLM(提高速度與成本效益)
- 監督微調階段:使用較大教師模型
- 強化學習階段:自訂搜尋獎勵函數
- 檢索獎勵:NDCG 指標 + LLM 判斷(相關性、排序合理性)
- 軌跡獎勵:查詢自然性評估、探索充分性評估、效率評估
結論
結論“通過多工具代理架構、精心設計的提示工程和強化學習訓練,可以將 LLM 搜尋性能從 9% 提升至 93%,徹底關閉知識推理與檢索檢索能力之間的差距。”
完整解析
詳細Mixtbred 發現了一個在產業界被廣泛忽視的瓶頸問題:儘管大型語言模型的推理能力在過去數年呈指數級增長,從 GPT 3.5 到 GPT 5.5 的性能躍升足以說明這一點,但檢索系統的進步卻極其緩慢。這造成了一個不對稱現象——模型的「知識差距」。通過分析 Browscom Plus 和 OfficeQA Pro 兩個真實基準測試,這個問題得到了量化驗證。當研究人員在查詢中直接提供正確的相關文檔時(即 Oracle 場景),模型在 Browscom Plus 上達到 93% 的準確率。但一旦切換到現實場景,使用 Codex 及其默認搜尋工具,準確率驟降至 9%——一個近 84 個百分點的落差。OfficeQA Pro 上的情況類似,從 64% 跌到 8%。
更有趣的是,觀察代理實際生成的搜尋查詢時,問題變得清晰可見。模型輸出的不是規範的搜尋陳述句,而是充滿無關鍵詞組合的混亂文本,如「Senator woman questions billionaires not a company then okay thank you staff will check hearing」。這個現象有三個根本原因:首先,模型的訓練數據主要來自代碼任務,這使它傾向於使用正則表達式和精確匹配的思維方式;其次,模型學會了模仿人類在網路搜尋中的習慣,即堆砌關鍵詞;第三,業界標準基準測試如 BEIR 過度偏向 BM25 演算法友善的實體型查詢,強化了這個不良模式。
為了突破這個瓶頸,Mixtbred 構建了一套完整的多工具代理搜尋系統。系統包含四種專用搜尋工具:概覽搜尋以快速掌握語料庫全景(返回 50 個文本摘要),主要語義搜尋以進行精準檢索(返回前 10 個完整文本),元數據過濾工具用於精確篩選,以及關鍵詞工具用於精確字串匹配。代理在最多四輪迭代中工作,每輪可並行執行多個搜尋查詢。流程的關鍵在於初始規劃階段——代理接收使用者查詢、初始語義搜尋預覽以及可用元數據提示,據此制定搜尋策略,將查詢意圖分解為最多四個獨立的查詢方向,為每個方向選擇最合適的工具。系統還會自動去重結果,防止相同文本塊重複出現浪費上下文。
為了引導模型寫出規範的自然語言查詢而非關鍵詞堆砌,Mixtbred 採用了巧妙的提示工程技巧。與其直接指示「寫搜尋查詢」,系統要求模型「寫一句話描述你想找什麼」。同時提供良好查詢的示例,展示如何將複雜查詢分解為多個探索維度。這些設計巧妙地繞過了模型的既有模式,使其生成自然流暢的語句。
訓練過程採用先後兩個階段。首先進行監督微調,使用較大的教師模型生成標準答案。隨後進行強化學習,引入自訂搜尋獎勵函數。這個獎勵函數結合了兩個維度:檢索維度衡量最終排序的質量(使用 NDCG 等標準指標配合 LLM 相關性判斷),軌跡維度評估搜尋過程本身(檢查查詢是否自然、探索是否充分、資源消耗是否高效)。為了保持成本效益,系統選擇訓練一個小型 LLM 代理,犧牲一定的絕對性能以換取速度和低成本。
結果相當令人矚目。在 ObliqueQA Congress 基準上,訓練中的代理達到 NDCG@10 為 0.4,相較該基準論文報告的最佳結果 0.18 提升了超過 100%。更重要的是,生產版本的 Mixtbred 代理搜尋目前在 MetQA 基準排名第一,當配合 Gemini 3.5 Flash 模型時,準確率達 93.4%,並以遠低於競品的成本與計算量實現了這一成績。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


