KeyFrame內部研究專用

Your Voice Agent Doesn't Need a Frontier Model - Joel Allou & Ornella Bahidika, Microsoft

AI Engineer·7月20日週一·5 min英文

三句話摘要

實時語音 AI 導師如何通過將邏輯提取到代碼層而非模型層,用小型模型達成毫秒級延遲。 實時語音應用的關鍵不在於使用最大的模型,而在於將推理、邏輯從模型中剝離出來,讓模型只做一件事,用架構層的投入換取延遲的極速化和成本的大幅降低。 延遲預算決定模型選擇:語音對話中用戶感知到 1 秒停頓就等於系統崩潰,因此 AI 必須在 950ms 內開始產生回應,這個硬性約束排除了所有思考時間較長的模型。

重點整理

重點
  • 1

    延遲預算決定模型選擇:語音對話中用戶感知到 1 秒停頓就等於系統崩潰,因此 AI 必須在 950ms 內開始產生回應,這個硬性約束排除了所有思考時間較長的模型。

  • 2

    模型只做一件事:Ace 架構中,課程邏輯、知識追蹤、場景協調全部交給狀態機和程式碼負責,模型的唯一職責是將已處理完的內容用自然語音表達出來。

  • 3

    架構一次、省費用多次:雖然小模型需要嚴格的腳手架支持,但這份代碼只需投入一次,之後每次推理都只需支付小模型的低廉成本,整體成本遠低於反覆使用大模型。

  • 4

    適用於所有延遲敏感場景:這個模式不限於語音應用,任何需要低延遲的即時應用或高容量系統都適用,因為 AI 模型變成系統中「最小的組成部分」。

實用技巧與重點

乾貨
  • 模型選擇:Claude 4.7(原方案)→ Haiku 4.5(最終方案)
  • 關鍵延遲指標:950ms(AI 必須開始說話的時間限制)
  • 實測對比
  • Opus 4.7:需數秒回傳答案
  • Haiku 4.5:約 900ms 回應
  • 架構組件:狀態機 + 智慧層
  • 狀態機職責:協調每個步驟、推導學生掌握的知識、決定顯示內容、生成上下文摘要
  • 模型職責:接收摘要後,純粹進行語音輸出

結論

結論

實時語音應用的關鍵不在於使用最大的模型,而在於將推理、邏輯從模型中剝離出來,讓模型只做一件事,用架構層的投入換取延遲的極速化和成本的大幅降低。

完整解析

詳細

Ace 是一款實時語音 AI 導師,核心挑戰源於人類感知的延遲門檻。奧內拉與喬爾指出,語音對話中哪怕停頓一秒,用戶的大腦就會判定系統已經失效,這意味著 AI 必須在約 950 毫秒內開始發出回應。這個時間限制徹底改變了模型選擇的邏輯——不再是「用最聰明的模型」,而是「在延遲預算內用最快的模型」。

傳統方案會直接把整個課程理解、學生問題分析、答案推理都交給一個大型模型(如 Claude 4.7)處理。但這導致了致命問題:推理過程本身就需要幾秒鐘,完全無法滿足實時語音的需求。Ace 團隊採取了完全不同的架構設計:將所有邏輯、推理、狀態管理從 AI 模型中剝離出來,轉而交給精心設計的狀態機和程式碼層完成。

具體而言,Ace 構建了一個狀態機,負責協調每堂課的所有場景轉換,追蹤學生掌握的知識進度,決定何時切換到下一個環節,以及預先計算「接下來應該說什麼」。這些信息被實時整理成摘要,傳遞給最終的 AI 模型。這樣一來,模型的工作範圍大幅縮小:它唯一需要做的就是把已經全部準備好的內容用自然語音輸出出來。

這個改變帶來的成效令人矚目。演示對比中可以看到,原版方案用 Opus 4.7 回答相同問題需要幾秒鐘,而改進後用小得多的 Haiku 4.5 模型,相同問題只需約 900 毫秒就能回應,感覺幾乎瞬間完成。用戶感受到的實時性飆升,成本卻大幅下降。

當然,這個優化方案並非完全無代價。小型模型如 Haiku 4.5 在沒有足夠結構支撐的情況下容易在長內容中發散,因此需要嚴格的規則與架構來保持邏輯清晰。這就是「腳手架成本」。但關鍵優勢是這份腳手架只需要開發一次,以程式碼形式存在,之後每次推理都不再產生這份成本。相比之下,使用大模型的成本是反覆的——每次都要付出昂貴的計算代價。

奧內拉總結的原則是:「在延遲預算允許的範圍內選擇最快的模型,然後將剩餘的時間用於實際建立框架。」這個思路適用於任何對實時性有要求的場景。在這些系統中,AI 模型不再是核心,反而變成了整個系統中最小的組成部分,真正的智慧被分散到架構的各個層面。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。