KeyFrame內部研究專用

普通 AI 答對率 0%,它能答對 85%!打造屬於你的企業級 RAG 數據管道

李哈利 | AI·7月30日週四·17 min中文

三句話摘要

拆解企业级RAG知識庫系統架構,展示如何用AI快速構建高精度的知識檢索系統。 企業級RAG從複雜架構設計簡化為提示詞驅動的自動化流程,這是AI時代提升團隊效率的真正利器。 市面知識庫大多是粗糙RAG實現,只能存儲卻無法精確檢索;Cerebras方案的關鍵是在向量化前增加預處理層,用LLM自動為原始數據分類標籤(技術摘要、解決方案等),使得相同內容從多維度被組織,大幅提升檢索準確度。

重點整理

重點
  • 1

    市面知識庫大多是粗糙RAG實現,只能存儲卻無法精確檢索;Cerebras方案的關鍵是在向量化前增加預處理層,用LLM自動為原始數據分類標籤(技術摘要、解決方案等),使得相同內容從多維度被組織,大幅提升檢索準確度。

  • 2

    傳統RAG的流程是「接收數據 → 直接嵌入 → 存儲」,新架構改為「接收數據 → 結構化整理 → 多維標籤化 → 嵌入 → 存儲」,這個順序差異直接決定了從「有個答案」到「有對的答案」的品質跳躍。

  • 3

    通過組合Claude、Gemini 2.5 Flash、Openrouter API的權限,使用者完全不需要學習複雜架構,只需給大模型一個詳細提示詞,就能自動完成數據接入、批量測試、評分計算、bug發現與修復的全流程。

  • 4

    Cerebras知識庫三個月內每天處理超過1.5萬次員工提問,無需人工訓練即可服務新員工,這才是真正提升企業ROI的工具,遠勝Obsidian等圖形化界面產品。

實用技巧與重點

乾貨
  • 數據規模統計:
  • 總文檔數:4,118份
  • YouTube視頻:695個
  • YouTube片段:1,482個
  • GitHub代碼區塊:1,271個
  • GitHub文檔:158個
  • GitHub評論:42個
  • 郵件對話:228個
  • 郵件片段:242個
  • 評測結果(20道題):
  • 總分:83/100
  • 完全正確:13題
  • 部分正確:5題
  • 未答出:1題
  • 幻覺:1題
  • 性能指標:
  • 向量檢索MRR(平均倒數排名):0.864
  • 答案得分:72%
  • 耗時:1.6秒
  • 檢索準確率:95%
  • 技術工具組合:
  • 主模型:Claude(架構設計與執行)
  • 評審與出題模型:Gemini 2.5 Flash
  • Embedding模型:Google 2.5 Flash
  • API平台:Openrouter
  • 數據接入:Slack API、GitHub API、YouTube API、Email、MCP
  • Cerebras知識庫運營數據:
  • 上線時長:3個月
  • 日均查詢量:15,000+次

結論

結論

企業級RAG從複雜架構設計簡化為提示詞驅動的自動化流程,這是AI時代提升團隊效率的真正利器。

完整解析

詳細

市面上流行各式知識庫工具,從Obsidian到各類「第二腦」應用,它們都提供漂亮的關係圖和可視化介面。但核心問題一致:儘管能存儲資料,卻無法精確從知識庫中提取所需答案。Cerebras這間由AI硬體業務支撐的百億美元級公司最近公開了其內部知識庫系統的架構設計。這不是理論框架,而是實際運行三個月、每天處理超過1.5萬次查詢的生產級系統。

系統分三層架構。第一層是數據存儲,通過統一管道吸收散落各處的資料:Gmail、GitHub代碼、內部數據庫、Slack訊息等。關鍵創新在於預處理步驟。傳統RAG做法是直接向量化存儲,Cerebras則在嵌入前使用大模型自動分析並標籤化原始資料。例如對聊天記錄,系統會自動抽取出問題、解決方案、技術討論等多個維度的信息塊,按內容類型分類儲存。同一條原始資訊會從多角度被組織,確保後續檢索時能更精確匹配使用者意圖。

作者按這套架構用Claude實際演示了從零構建的完整過程。只需一個詳細提示詞,Claude自動讀懂官方文檔,集成Gmail、GitHub、YouTube頻道數據,生成含4118份文檔的知識庫。系統處理了695個YouTube視頻、1482個片段、1271個GitHub代碼區塊、228封郵件對話。為驗證系統品質,作者設計了嚴格評測方式:用LLM根據真實文檔反向生成20道測試題,再讓RAG系統從知識庫檢索答案,與標準答案對比。最終得分83分(滿分100),完全正確13題、部分正確5題、未答1題、幻覺1題。MRR準確率達0.864,平均檢索耗時1.6秒。驚喜的是系統在評測中自動發現了兩個bug並修復,使得分數從78升至83。

這次實驗有力證明了Cerebras架構的實用性。比起傳統新員工培訓,AI知識庫讓員工無需提問他人,直接與系統對話就能獲得完整上下文答案。這才是真正能提升企業投資報酬率的工具。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。