KeyFrame內部研究專用

How we taught agents to use good retrieval - Hanna Lichtenberg, Mixedbread AI

AI Engineer·7月7日週二·14 min英文

三句話摘要

通過多工具代理架構和強化學習,縮小大型語言模型的推理能力與檢索能力之間的差距。 通過多工具代理架構、精心設計的提示工程和強化學習訓練,可以將 LLM 搜尋性能從 9% 提升至 93%,徹底關閉知識推理與檢索檢索能力之間的差距。 知識差距的現實存在與量化驗證 — LLM 在 Browscom Plus 和 OfficeQA Pro 兩大基準測試中展現了巨大的性能落差。當提供正確文檔時(Oracle),模型分別達到 93% 和 64% 的準確率,但實際使用預設工具時只有 9% 和 8%。這證明瓶頸不在推理能力,而在於無法精準取得所需知識。

重點整理

重點
  • 1

    知識差距的現實存在與量化驗證 — LLM 在 Browscom Plus 和 OfficeQA Pro 兩大基準測試中展現了巨大的性能落差。當提供正確文檔時(Oracle),模型分別達到 93% 和 64% 的準確率,但實際使用預設工具時只有 9% 和 8%。這證明瓶頸不在推理能力,而在於無法精準取得所需知識。

  • 2

    現有模型生成不規範查詢的根本原因 — 代理系統現在生成的搜尋查詢充滿無關鍵詞組合(例如「Senator woman questions billionaires not a company」),這源於三個訓練偏誤:模型主要針對代碼任務訓練而傾向使用正則表達式、模型學習模仿人類網路搜尋習慣的關鍵詞堆砌、現有基準測試如 BEIR 過度偏向 BM25 友善的實體型查詢。

  • 3

    多工具並行搜尋架構的設計邏輯 — 系統提供四種專用工具(概覽搜尋用於快速概括、語義搜尋用於精準語義檢索、元數據過濾用於精確篩選、關鍵詞工具用於精確匹配),代理在最多四輪搜尋中制定計畫,每輪可並行執行多個搜尋。通過目標框架、提示工程技巧(要求「寫出一句話描述欲搜尋內容」而非「寫搜尋查詢」)和少量示例,引導模型生成自然句子而非關鍵詞。

  • 4

    監督微調加強化學習的雙層訓練策略 — 系統先用較大教師模型進行監督微調,再使用自訂搜尋獎勵進行強化學習。獎勵函數結合檢索指標(NDCG、LLM 相關性判斷)與軌跡評估(查詢自然性、探索充分性、效率),全面優化模型的工具選擇和搜尋策略。

實用技巧與重點

乾貨
  • 基準測試性能對比
  • Browscom Plus:Oracle 93% vs Codex 默認工具 9%;使用 Mixtbred 後 Oracle 與結果差距僅 3%
  • OfficeQA Pro:Oracle 64% vs Codex 默認工具 8%;使用 Mixtbred 幾乎完全閉合差距
  • ObliqueQA Congress(訓練中代理):NDCG@10 達 0.4,相較論文最佳結果 0.18 大幅提升
  • MetQA(生產版 Mixtbred 代理搜尋):使用 Gemini 3.5 Flash 時達 93.4% 準確率,排名第一
  • 檢索工具配置
  • Overview Search:返回最多 50 個文本的摘要版本,用於快速掌握語料庫全景
  • Semantic Search:返回前 10 個文本的完整內容,用於精準語義檢索
  • Filter Chunks:基於元數據面向進行排序與篩選
  • Web/Keyword Tool:進行精確關鍵詞匹配
  • 代理搜尋流程
  • 最多 4 輪搜尋循環,每輪可並行執行多個搜尋
  • 初始階段:接收使用者查詢、初始語義搜尋結果、可用元數據提示
  • 搜尋計畫:將查詢意圖分解為最多 4 個獨立查詢,各選最適工具
  • 結果處理:去重文本塊以節省上下文,逐輪迭代直至掌握足夠證據
  • 最終輸出:按合理排序列出所有相關文本塊
  • 訓練方法論
  • 使用小型 LLM(提高速度與成本效益)
  • 監督微調階段:使用較大教師模型
  • 強化學習階段:自訂搜尋獎勵函數
  • 檢索獎勵:NDCG 指標 + LLM 判斷(相關性、排序合理性)
  • 軌跡獎勵:查詢自然性評估、探索充分性評估、效率評估

結論

結論

通過多工具代理架構、精心設計的提示工程和強化學習訓練,可以將 LLM 搜尋性能從 9% 提升至 93%,徹底關閉知識推理與檢索檢索能力之間的差距。

完整解析

詳細

Mixtbred 發現了一個在產業界被廣泛忽視的瓶頸問題:儘管大型語言模型的推理能力在過去數年呈指數級增長,從 GPT 3.5 到 GPT 5.5 的性能躍升足以說明這一點,但檢索系統的進步卻極其緩慢。這造成了一個不對稱現象——模型的「知識差距」。通過分析 Browscom Plus 和 OfficeQA Pro 兩個真實基準測試,這個問題得到了量化驗證。當研究人員在查詢中直接提供正確的相關文檔時(即 Oracle 場景),模型在 Browscom Plus 上達到 93% 的準確率。但一旦切換到現實場景,使用 Codex 及其默認搜尋工具,準確率驟降至 9%——一個近 84 個百分點的落差。OfficeQA Pro 上的情況類似,從 64% 跌到 8%。

更有趣的是,觀察代理實際生成的搜尋查詢時,問題變得清晰可見。模型輸出的不是規範的搜尋陳述句,而是充滿無關鍵詞組合的混亂文本,如「Senator woman questions billionaires not a company then okay thank you staff will check hearing」。這個現象有三個根本原因:首先,模型的訓練數據主要來自代碼任務,這使它傾向於使用正則表達式和精確匹配的思維方式;其次,模型學會了模仿人類在網路搜尋中的習慣,即堆砌關鍵詞;第三,業界標準基準測試如 BEIR 過度偏向 BM25 演算法友善的實體型查詢,強化了這個不良模式。

為了突破這個瓶頸,Mixtbred 構建了一套完整的多工具代理搜尋系統。系統包含四種專用搜尋工具:概覽搜尋以快速掌握語料庫全景(返回 50 個文本摘要),主要語義搜尋以進行精準檢索(返回前 10 個完整文本),元數據過濾工具用於精確篩選,以及關鍵詞工具用於精確字串匹配。代理在最多四輪迭代中工作,每輪可並行執行多個搜尋查詢。流程的關鍵在於初始規劃階段——代理接收使用者查詢、初始語義搜尋預覽以及可用元數據提示,據此制定搜尋策略,將查詢意圖分解為最多四個獨立的查詢方向,為每個方向選擇最合適的工具。系統還會自動去重結果,防止相同文本塊重複出現浪費上下文。

為了引導模型寫出規範的自然語言查詢而非關鍵詞堆砌,Mixtbred 採用了巧妙的提示工程技巧。與其直接指示「寫搜尋查詢」,系統要求模型「寫一句話描述你想找什麼」。同時提供良好查詢的示例,展示如何將複雜查詢分解為多個探索維度。這些設計巧妙地繞過了模型的既有模式,使其生成自然流暢的語句。

訓練過程採用先後兩個階段。首先進行監督微調,使用較大的教師模型生成標準答案。隨後進行強化學習,引入自訂搜尋獎勵函數。這個獎勵函數結合了兩個維度:檢索維度衡量最終排序的質量(使用 NDCG 等標準指標配合 LLM 相關性判斷),軌跡維度評估搜尋過程本身(檢查查詢是否自然、探索是否充分、資源消耗是否高效)。為了保持成本效益,系統選擇訓練一個小型 LLM 代理,犧牲一定的絕對性能以換取速度和低成本。

結果相當令人矚目。在 ObliqueQA Congress 基準上,訓練中的代理達到 NDCG@10 為 0.4,相較該基準論文報告的最佳結果 0.18 提升了超過 100%。更重要的是,生產版本的 Mixtbred 代理搜尋目前在 MetQA 基準排名第一,當配合 Gemini 3.5 Flash 模型時,準確率達 93.4%,並以遠低於競品的成本與計算量實現了這一成績。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。