KeyFrame內部研究專用

We Cut 94% of AI Coding Tokens With a Local Code Index - Rajkumar Sakthivel, Tesco

AI Engineer·6月28日週日·10 min英文

三句話摘要

AI Coding Tools 的真正成本瓶頸不在模型選擇,而在上下文精度——如何用本地搜索層減少 94% token 消耗。 AI coding tools 的成本瓶頸在於冗餘上下文而非模型選擇,用本地智能搜索層精確控制輸入能達成最高投資回報率。 成本結構的真相:AI coding tools 的成本中 90% 來自發送給模型的輸入(上下文和檔案),僅 10% 來自模型回應。因此降低成本的槓桿點是精確控制輸入內容,而非優化輸出或選擇更便宜的模型。

重點整理

重點
  • 1

    成本結構的真相:AI coding tools 的成本中 90% 來自發送給模型的輸入(上下文和檔案),僅 10% 來自模型回應。因此降低成本的槓桿點是精確控制輸入內容,而非優化輸出或選擇更便宜的模型。

  • 2

    簡單公式勝過複雜模型:團隊試過讓模型自我評估搜尋結果品質,但速度太慢(增加 2-3 秒延遲)。最後用簡單的加權公式(50% 語義分數 + 30% 關鍵字分數 + 20% 程式碼新舊度)替代,毫秒級執行,效果更好。

  • 3

    雙搜索策略的互補性:語義搜索擅長找相關概念但易漏掉準確名稱;關鍵字搜索精準命中但忽略相關思路。單獨使用各漏掉 25% 結果,組合使用則僅漏 10%,是核心省成本招數。

  • 4

    跨工具記憶共享的長期收益:開發者通常同時用多個 AI 工具(Cloud Code、Cursor、Copilot),每個都獨立重新解析專案。建立共享索引和記憶層使知識跨工具複用,該專案的實測報告顯示 247 次查詢共省 1,240 萬 tokens。

實用技巧與重點

乾貨
  • 核心數字:
  • 測試對象:FastAPI 開源專案(53 個檔案,20 個真實開發者問題)
  • 不用工具:每問題 83,000 tokens
  • 使用工具:每問題 4,900 tokens
  • 額外壓縮後:523 tokens
  • 減少幅度:94%
  • 準確度維持:90%(正確找到相關代碼)
  • 搜索層的五步流程:
  • 將程式碼分解成語義單位(函數、類別、方法)而非隨機分塊
  • 同時執行語義搜索和關鍵字搜索,合併結果
  • 將結果簡化:50 行函數壓縮為 5 行(僅保留函數名和描述)
  • 追蹤函數調用連接,找到一段代碼可找出所有相關部分
  • 評分並過濾低分結果(分數公式:50% 語義 + 30% 關鍵字 + 20% 新舊度)
  • 評分運算成本:0.4 毫秒,無需額外 API 呼叫
  • 成本結構分析:
  • 輸入成本:90%(包含搜尋結果、上下文、檔案)
  • 輸出成本:10%(模型回應)
  • 實測節省報告(真實專案):
  • 總查詢數:247 次
  • 總節省 tokens:1,240 萬
  • 節省成本來源:84% 來自搜索層,16% 來自輸出壓縮
  • 未花費成本:186 萬 tokens × 模型價格
  • 工具名稱與平台:
  • 測試工具:Cloud Code、Cursor、Copilot
  • 搜索層工具:CC(開源免費)
  • 搜尋模型:小型快速模型(重新索引 < 1 秒)
  • 限制條件:
  • 94% 的節省是相對完整檔案的最差情況
  • 在實際應用中(工具已有基礎優化)實際節省幅度更低
  • 大型混合程式碼庫(396 個檔案)效果下降
  • 適用情景:檔案各司其職且邏輯集中的專案

結論

結論

AI coding tools 的成本瓶頸在於冗餘上下文而非模型選擇,用本地智能搜索層精確控制輸入能達成最高投資回報率。

完整解析

詳細

Raj 和朋友 Foss 在使用 AI coding tools(Cloud Code、Cursor、Copilot 等)開發專案時遇到一個令人困擾的問題:每月帳單突然暴增,而他們的開發工作流並無改變。經過調查,他們發現成本並非來自 AI 模型本身的計算,而來自一個常被忽視的地方——每次查詢時發送給模型的上下文量過於龐大。

在他們的專案中,一個典型查詢會發送 45,000 個 tokens 作為上下文,但實際被模型有效使用的僅約 5,000 個。這意味著每次查詢都在為不相關的 40,000 個 tokens 付費,就像訂購一份披薩卻為額外九份披薩付款。他們首先嘗試了幾個直觀的解法,但都沒有效果。調整提示詞要求「只顯示相關代碼」看似合理,但成本已在模型讀取提示詞前產生。改變模型設定(如最大 token 數、溫度值)只影響輸出,不影響輸入。壓縮輸出雖然將回應長度縮減 75%,但由於輸出成本僅佔總成本的 10%,實際省成本不超過 8%。

真正的突破來自一個關鍵洞察:成本結構中 90% 來自輸入(上下文和檔案),10% 來自輸出。因此解決方案必須從精確控制輸入著手。他們開發了一個運行在本地的搜索層,位於程式碼庫和 AI 模型之間。這個搜索層不再傳送整個檔案,而是通過智能搜索和索引,只返回真正需要的代碼片段。系統的核心是五步流程:首先將程式碼分解成有意義的單位(函數、類別、方法),而非隨機分塊;其次同時執行語義搜索(基於意義尋找相關概念)和關鍵字搜索(精確匹配名稱),這兩種搜索互補,組合使用的漏掉率從各自的 25% 降至 10%;第三步將搜索結果進一步簡化,將 50 行函數壓縮為 5 行的函數簽名和描述;第四步追蹤函數之間的呼叫連接,找到一段代碼能延伸找出所有相依的部分;第五步用簡單的加權公式(50% 語義分數、30% 關鍵字分數、20% 程式碼新舊度)評分結果,低分項不送給模型,整個評分過程在 0.4 毫秒內完成,無需額外 API 呼叫。

實測結果來自 FastAPI 開源專案:53 個檔案,20 個真實開發者提問。不使用搜索層時每問題消耗 83,000 tokens;使用後降至 4,900 tokens,減幅 94%;加上輸出壓縮後進一步降至 523 tokens,同時保持 90% 的代碼查詢準確性。真實專案測試報告顯示,247 次查詢共節省 1,240 萬 tokens,其中 84% 的節省來自搜索層優化,16% 來自輸出壓縮。團隊誠實地指出 94% 的節省幅度是相對完整檔案的極限情況,實際工具(如 Cloud Code)已有基礎優化,真實節省幅度會更低;大型混合代碼庫則面臨準確度下降的挑戰。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。