KeyFrame內部研究專用

Stop Renting Your Cognitive Infrastructure - Thiyagarajan Maruthavanan, Kalmantic Labs

AI Engineer·7月18日週六·7 min英文

三句話摘要

AI 推論成本失控的現象與危機,以及何時應該從租賃轉向自建推論基礎設施。 租賃用於學習,擁有用於營利——初創透過租賃平台驗證想法,但企業必須自建推論基礎設施才能控制成本與命運。 --- 註:此份逐字稿來自 AIEWF 2026 的演講,講者為 Manish Rajan。

重點整理

重點
  • 1

  • 2

    推論成本的心理陷阱:使用租賃 AI 平台就像在賭場儲值籌碼,初期感覺便宜但會逐漸上癮,導致花費遠超預期;這與每月固定帳單的手機服務完全不同,用戶無法建立成本錨點。

  • 3

    成本爆炸的多重原因:代理循環造成冗余調用、輸入 token 壓縮不足、推論端點對工作負載形狀無感知,加上講者親身經歷的 API 密鑰被盜(中國駭客竊用,三週內成本從 $7k 衝到 $10k)。

  • 4

    Token Factory 的侷限性:雖然開源模型部署成本較低,但企業級應用無法依賴租賃(法務審計、供應商依賴問題)、控制力受限、可重現性缺陷,使得自建成為必然。

  • 5

    成長階段決定策略:初創在 Product-Market Fit 前可租賃試驗,但過了這個階段必須自建;企業預算已定的項目更無法承受租賃波動,類似搬到新城市最終還是要買房而非永遠租住。

  • 6

實用技巧與重點

乾貨
  • 具體成本案例
  • 某大零售商:$200 百萬推論開支
  • Uber:年度預算在第 4 個月用完
  • 講者 Ulta Suno 應用:成本暴增至數百萬美元
  • API 被盜三週:成本從 $7,000 → $10,000(險些達 $100k)
  • 推論平台與工具
  • Anthropic、OpenAI(租賃對象)
  • DGX Parks(本地 GPU 叢集)
  • Netflix Headroom(基準工具)
  • JustTokenMax(開源專案,主要優化工具)
  • 推論端點供應商、Near Clouds
  • 企業應用場景與問題
  • 投資基金:需要速率限制控制權
  • 醫院:審計要求無第三方供應商依賴
  • 稅務事務所:需要模型推論可重現性
  • JustTokenMax 主要功能
  • 相對 Netflix Headroom 優於多個參數
  • 優化推論基礎設施層的成本
  • 講者背景
  • 推特:@mt_rajan
  • 網站:mtrajan.com
  • 著作:《Peak Inference: Infra Economics of AI Inference》

結論

結論

租賃用於學習,擁有用於營利——初創透過租賃平台驗證想法,但企業必須自建推論基礎設施才能控制成本與命運。 --- 註:此份逐字稿來自 AIEWF 2026 的演講,講者為 Manish Rajan。

完整解析

詳細

推論成本危機已成為 AI 應用的普遍痛點。某大零售商花費近 $200 百萬後決定自建基礎設施,Uber 也經歷年度預算在第四個月用盡的窘境。講者本身也遭遇類似慘劇:開發的 Ulta Suno 應用(用 AI 反推音樂提示詞)迅速獲得數十萬用戶,卻導致推論成本暴漲至數百萬美元。成本失控的根本原因並非平台定價過高,而是使用模式的心理陷阱——租賃 AI 服務就像在賭場儲值,每次的小額支出累積成無法預控的巨額開支,與月租手機的固定成本截然不同。

成本爆炸還有技術層面的原因。代理循環中充斥冗余 API 呼叫,輸入 token 的壓縮不足,以及推論端點對實際工作負載毫無感知。講者親身經歷最慘烈的教訓:API 密鑰被中國駭客竊用,三週內成本從 $7,000 狂飆至 $10,000,若非聯合創辦人及時截斷,恐怕會燒到 $100,000。

面對這個困境,業界普遍討論的方案是「Token Factory」——部署開源模型到雲端或本地,按 token/秒計費。講者曾購買 DGX Parks 將 Ulta Suno 遷移至本地運行,也為研究室開發了多個代理應用。然而,企業實踐証明了 Token Factory 的侷限:投資基金擔心速率限制失控、醫院面臨審計要求禁用第三方依賴、稅務事務所需要推論可重現性而開源模型無法保證。

這些經驗驅動了講者的核心結論:企業成長階段決定基礎設施策略。初創在 Product-Market Fit 前可租賃 AI 服務探索可行性,但一旦確認商業模式、進入規模化階段,就必須自建基礎設施以掌控成本與依賴性——就像搬到新城市最初可能選擇租住或 Airbnb,但最終還是得買房才能安心。基於這套經驗,講者開源了 JustTokenMax 專案(相對 Netflix Headroom 更優),並著書《Peak Inference: Infra Economics of AI Inference》,系統性地闡述 AI 推論基礎設施的經濟學與決策框架。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。