KeyFrame內部研究專用

Bypassing the Multimodal Tax: Hybrid RAG, SQL RRF & UI Telemetry - Abed Matini, Ogilvy

AI Engineer·6月28日週日·45 min英文

三句話摘要

如何構建本地化的 RAG 問答系統:從文檔預處理、智慧分塊到混合檢索的完整方案。 數據質量和預處理策略往往比選擇最大的模型更能決定 RAG 系統的成敗。 文檔預處理比模型選擇更關鍵 — 直接拖放原始 PDF 會產生無意義的分塊(如簽名、日期等),導致 token 浪費、幻覺增加、準確度下降。經過結構化處理的數據能用較小的模型達到更好效果。

重點整理

重點
  • 1

    文檔預處理比模型選擇更關鍵 — 直接拖放原始 PDF 會產生無意義的分塊(如簽名、日期等),導致 token 浪費、幻覺增加、準確度下降。經過結構化處理的數據能用較小的模型達到更好效果。

  • 2

    分塊策略必須匹配業務場景 — 不同文檔類型需要不同分塊方式:FAQ 適合標題分塊、非結構化文本用段落或固定字符(512 字符含 64% 重疊)、緊急訊息用句子分塊。正確的分塊方式直接影響後續檢索精度。

  • 3

    混合檢索勝於單一方法 — 向量檢索(余弦相似度)適合尋找語義相關內容,關鍵詞檢索(BM25)適合精確匹配。結合兩者並透過排序器(Re-ranker)篩選最相關的結果。

  • 4

    本地執行提供完整控制與成本優化 — 使用 Ollama 運行 5 億參數的 Quen 2.5 模型(400MB),無需付費 API,避免數據外流,可在 Python 層級加入防護(注入檢測、醫療告警)而非依賴 LLM 本身。

實用技巧與重點

乾貨
  • 模型與基礎設施
  • Quen 2.5(5 億參數,400MB,比 7B 模型快且幻覺少)
  • BGE-M3 嵌入模型
  • PostgreSQL 向量數據庫
  • Ollama 本地 LLM 運行時
  • Docker 容器化
  • FastAPI 後端 + React 前端
  • Langfuse 可觀測性平台(免費)
  • 分塊策略
  • 標題分塊:依文檔 heading 分割
  • 段落分塊:每段作為一個 chunk
  • 固定 512 字符分塊 + 64% 重疊
  • 句子分塊:適合郵件或短訊息
  • 檢索與排序
  • 混合檢索:向量檢索(最近鄰尋找)+ BM25 關鍵詞檢索
  • 余弦距離計算相似度
  • 限制檢索結果數量(預設 2 個,可按場景調整)
  • Re-ranker 重新排序最終結果
  • 安全與可觀測性
  • Langfuse 追蹤每筆對話(model、回應數、延遲、成本估算)
  • 意圖檢測(Intent Reject)攔截不相關查詢
  • 醫療告警詞庫(escalation keywords)
  • LLM 分類器檢測注入攻擊
  • 所有檢查在 Python 層級,不送交 LLM

結論

結論

數據質量和預處理策略往往比選擇最大的模型更能決定 RAG 系統的成敗。

完整解析

詳細

構建高效 RAG 系統的核心問題有二:一是用戶上傳文檔時即刻消耗 token,卻未回答任何問題;二是生產環境結合向量資料庫、關鍵詞搜尋、多個工具時管理複雜。講者提出「結構優先」的解法,而非直接依賴雲端 LLM。

具體做法從文檔預處理開始。使用 Dockling 將 PDF、Word、圖像轉為 Markdown 文件,再選擇適合的分塊策略。以 HR 員工手冊為例,若直接上傳 28 頁 PDF,分塊結果會包含「簽名」、「日期」等無意義內容,導致檢索時混入雜訊。相比之下,先將手冊改寫為「常見問題與回答」格式,再按標題分塊,每個 chunk 都具有明確的問題-答案對應,檢索時即能追蹤來源並驗證準確性。

檢索層面採用混合策略。向量檢索透過嵌入模型(BGE-M3)將查詢和文檔轉為向量,用余弦相似度找出語義相近的前 N 個結果;同時 BM25 關鍵詞檢索負責精確匹配(如產品名稱、編號)。兩路結果經排序器重新打分後,取得最相關的候選。限制返回結果數量也很關鍵——太多選項令用戶混淆,太少則遺漏重要資訊,需按使用場景調整。

系統採用本地優先架構,所有元件都能在筆電或 Code Space 運行。5 億參數的 Quen 2.5 模型(400MB)搭配 PostgreSQL 向量資料庫,使用 Langfuse 記錄每次查詢的模型、回應數、延遲等指標。關鍵創新在於安全防護不仰賴 LLM 本身的「理解」,而在 Python 層級預先攔截風險查詢——醫療相關詞彙觸發告警、注入攻擊字樣直接拒絕,確保只有合法請求才送交模型。這樣既減少 token 消耗,也避免了 LLM 有時遵守指令、有時「自作聰明」的不確定性。

整個系統無需任何付費 API 或外部依賴,成本為零,同時完全掌握數據流向和系統行為。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。