Context Engineering in 2026 — Louis-François Bouchard, Omar Solano & Samridhi Vaid, Towards AI
三句話摘要
2026年上下文工程:如何通過優化LLM的上下文管理來降成本、提升回憶、加快速度。 ## 別預設要壓縮——先列出約束(成本、硬件、延遲),再從提示緩存、RAG、完整歷史中選最優方案,小模型加好檢索往往勝過複雜的摘要策略。 1. 上下文工程的核心矛盾
重點整理
重點- 1
1. 上下文工程的核心矛盾
- 2
上下文窗口有限但LLM無狀態,導致要麼重複發送昂貴tokens,要麼摘要會損失細節。傳統壓縮策略(選擇性保留、摘要、滑動窗口)看似聰明,實際上透過降低回憶率和增加工具呼叫,反而更昂貴。
- 3
2. 提示緩存的遊戲改變
- 4
幾乎所有API(Gemini、DeepSeek、Claude)都支援提示緩存,讓已發送過的tokens便宜50倍。這表示最多tokens的設置反而最便宜——只要不破壞緩存。摘要等轉換會失效緩存,可能無法回本。
- 5
3. 實驗的反直覺結果
- 6
在96轉以上的長會話中,保留完整歷史達95%的事實回憶率,而摘要只有32%。本地模型因硬件限制(MacBook最多32K tokens)無法競爭;但使用混合RAG檢索可本地達100%精度,適合文件場景。
- 7
4. 實務決策框架
- 8
根據約束選工具——雲端用DeepSeek V4 Flash(緩存折扣50倍)搭完整歷史+混合檢索;本地受限32K時用RAG而非摘要;超過800K tokens沒看到context rot,只需監控成本與延遲。
- 9
##
實用技巧與重點
乾貨- 模型與成本:
- Gemini 3.5 Flash:單轉$0.50、多轉$0.24/turn、完整歷史最便宜
- DeepSeek V4 Flash:緩存折扣50倍,100K-1M turns/日成本$1,900-$18,000/月(vs Gemini $40,000/月)
- 本地7B/8B/32B模型:無成本但context窗口上限32K(MacBook)
- 檢索與工具:
- 混合搜尋:語義(cohereai embedding) + BM25關鍵字,rerank前5
- Dense RAG:50K-200K tokens達80%精度,但超400K掉到0%(buried facts問題)
- 文件系統瀏覽工具:用bash ls/find/grep,但實驗顯示無回憶提升,反而慢50%
- 滑動窗口清除:每5,000 tokens清除舊工具輸出但保留最後5筆
- 評估數據:
- 單轉任務:60組QA對(自網站學生提問+回答,篩除過時版本問題)
- 多轉任務:生成式數據集,插入真實facts、filler message、probe問題
- 長度測試:36轉會話1.78M tokens、96轉對話最多800K tokens、本地化測試25-340秒輸出時間
- 專案配置:
- LangChain ReAct型代理 + 中間件特性化行為
- FastAPI後端 + Next.js前端
- 知識庫8M+ tokens(2年課程+Langchain/Lamaindex/OpenAI文檔)
- 工具輸出上限100K tokens,查詢結果top-5
- ##
結論
結論“別預設要壓縮——先列出約束(成本、硬件、延遲),再從提示緩存、RAG、完整歷史中選最優方案,小模型加好檢索往往勝過複雜的摘要策略。”
完整解析
詳細Towards AI是一間AI教育公司,為工程師開設課程並提供AI家教系統回答學生問題。他們面臨的問題很常見:代理會做出你不想要的事,根本原因往往不是模型變笨,而是上下文窗口填滿了、內容不斷惡化。為了理解如何最佳化上下文,團隊做了一系列系統實驗。
上下文工程的核心在於兩個制約:第一,上下文窗口有限——系統提示、課程內容、工具定義、聊天歷史、工具輸出都擠在同一空間,發送越多tokens成本越高、品質越差;第二,LLM無狀態——學生重新進入對話時,模型毫無記憶。傳統方案是透過壓縮來解決——滑動窗口、摘要、選擇性保留。看起來邏輯完美,但實驗結果完全相反。
關鍵轉折來自提示緩存技術。Gemini、DeepSeek、Claude等都支援它,一旦tokens被緩存,重用時便宜50倍。這改變了計算方式:發送最多tokens的設置實際上成本最低,因為97%的tokens被緩存且極便宜。而摘要等任何上下文轉換會破壞緩存,每轉都要重新計算新的tokens,反而更貴更慢。
實驗分兩類。單轉任務(60組學生提問)中,所有策略都得高分,因為還沒堆積足夠tokens觸發壓縮。多轉任務才顯真章:在96轉對話中,完整歷史達95%事實回憶率,摘要只有32%。成本方面,DeepSeek V4 Flash加完整歷史的設置發送最多tokens,卻是最便宜的——一天100K-1M轉換下來月成本$1,900,比Gemini的$40,000便宜20倍。即使推到800K tokens的長會話,模型也沒出現context rot,一直穩定回憶事實。
本地化測試則暴露了硬件瓶頸。MacBook只能跑32K context窗口,超過就必須壓縮。在這個限制下,摘要不管用,混合RAG檢索才救命——用語義搜尋加BM25關鍵字搜尋,即使面對400K tokens的大文檔也能達100%精度。但對話歷史場景就不同了,32K窗口放不下多轉對話,本地模型最後只回憶32%,遠不如雲端。
最終決策:採用DeepSeek V4 Flash(雲端、有50倍緩存折扣)搭完整歷史保留到30K tokens、混合檢索。這組合在當前學生規模最便宜,回憶率最好,不做主動摘要。
##
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


