KeyFrame內部研究專用

Context Engineering in 2026 — Louis-François Bouchard, Omar Solano & Samridhi Vaid, Towards AI

AI Engineer·8月17日週一·63 min英文

三句話摘要

2026年上下文工程:如何通過優化LLM的上下文管理來降成本、提升回憶、加快速度。 ## 別預設要壓縮——先列出約束(成本、硬件、延遲),再從提示緩存、RAG、完整歷史中選最優方案,小模型加好檢索往往勝過複雜的摘要策略。 1. 上下文工程的核心矛盾

重點整理

重點
  • 1

    1. 上下文工程的核心矛盾

  • 2

    上下文窗口有限但LLM無狀態,導致要麼重複發送昂貴tokens,要麼摘要會損失細節。傳統壓縮策略(選擇性保留、摘要、滑動窗口)看似聰明,實際上透過降低回憶率和增加工具呼叫,反而更昂貴。

  • 3

    2. 提示緩存的遊戲改變

  • 4

    幾乎所有API(Gemini、DeepSeek、Claude)都支援提示緩存,讓已發送過的tokens便宜50倍。這表示最多tokens的設置反而最便宜——只要不破壞緩存。摘要等轉換會失效緩存,可能無法回本。

  • 5

    3. 實驗的反直覺結果

  • 6

    在96轉以上的長會話中,保留完整歷史達95%的事實回憶率,而摘要只有32%。本地模型因硬件限制(MacBook最多32K tokens)無法競爭;但使用混合RAG檢索可本地達100%精度,適合文件場景。

  • 7

    4. 實務決策框架

  • 8

    根據約束選工具——雲端用DeepSeek V4 Flash(緩存折扣50倍)搭完整歷史+混合檢索;本地受限32K時用RAG而非摘要;超過800K tokens沒看到context rot,只需監控成本與延遲。

  • 9

    ##

實用技巧與重點

乾貨
  • 模型與成本:
  • Gemini 3.5 Flash:單轉$0.50、多轉$0.24/turn、完整歷史最便宜
  • DeepSeek V4 Flash:緩存折扣50倍,100K-1M turns/日成本$1,900-$18,000/月(vs Gemini $40,000/月)
  • 本地7B/8B/32B模型:無成本但context窗口上限32K(MacBook)
  • 檢索與工具:
  • 混合搜尋:語義(cohereai embedding) + BM25關鍵字,rerank前5
  • Dense RAG:50K-200K tokens達80%精度,但超400K掉到0%(buried facts問題)
  • 文件系統瀏覽工具:用bash ls/find/grep,但實驗顯示無回憶提升,反而慢50%
  • 滑動窗口清除:每5,000 tokens清除舊工具輸出但保留最後5筆
  • 評估數據:
  • 單轉任務:60組QA對(自網站學生提問+回答,篩除過時版本問題)
  • 多轉任務:生成式數據集,插入真實facts、filler message、probe問題
  • 長度測試:36轉會話1.78M tokens、96轉對話最多800K tokens、本地化測試25-340秒輸出時間
  • 專案配置:
  • LangChain ReAct型代理 + 中間件特性化行為
  • FastAPI後端 + Next.js前端
  • 知識庫8M+ tokens(2年課程+Langchain/Lamaindex/OpenAI文檔)
  • 工具輸出上限100K tokens,查詢結果top-5
  • ##

結論

結論

別預設要壓縮——先列出約束(成本、硬件、延遲),再從提示緩存、RAG、完整歷史中選最優方案,小模型加好檢索往往勝過複雜的摘要策略。

完整解析

詳細

Towards AI是一間AI教育公司,為工程師開設課程並提供AI家教系統回答學生問題。他們面臨的問題很常見:代理會做出你不想要的事,根本原因往往不是模型變笨,而是上下文窗口填滿了、內容不斷惡化。為了理解如何最佳化上下文,團隊做了一系列系統實驗。

上下文工程的核心在於兩個制約:第一,上下文窗口有限——系統提示、課程內容、工具定義、聊天歷史、工具輸出都擠在同一空間,發送越多tokens成本越高、品質越差;第二,LLM無狀態——學生重新進入對話時,模型毫無記憶。傳統方案是透過壓縮來解決——滑動窗口、摘要、選擇性保留。看起來邏輯完美,但實驗結果完全相反。

關鍵轉折來自提示緩存技術。Gemini、DeepSeek、Claude等都支援它,一旦tokens被緩存,重用時便宜50倍。這改變了計算方式:發送最多tokens的設置實際上成本最低,因為97%的tokens被緩存且極便宜。而摘要等任何上下文轉換會破壞緩存,每轉都要重新計算新的tokens,反而更貴更慢。

實驗分兩類。單轉任務(60組學生提問)中,所有策略都得高分,因為還沒堆積足夠tokens觸發壓縮。多轉任務才顯真章:在96轉對話中,完整歷史達95%事實回憶率,摘要只有32%。成本方面,DeepSeek V4 Flash加完整歷史的設置發送最多tokens,卻是最便宜的——一天100K-1M轉換下來月成本$1,900,比Gemini的$40,000便宜20倍。即使推到800K tokens的長會話,模型也沒出現context rot,一直穩定回憶事實。

本地化測試則暴露了硬件瓶頸。MacBook只能跑32K context窗口,超過就必須壓縮。在這個限制下,摘要不管用,混合RAG檢索才救命——用語義搜尋加BM25關鍵字搜尋,即使面對400K tokens的大文檔也能達100%精度。但對話歷史場景就不同了,32K窗口放不下多轉對話,本地模型最後只回憶32%,遠不如雲端。

最終決策:採用DeepSeek V4 Flash(雲端、有50倍緩存折扣)搭完整歷史保留到30K tokens、混合檢索。這組合在當前學生規模最便宜,回憶率最好,不做主動摘要。

##

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。