KeyFrame內部研究專用

Don't Let the LLM Drive - Ornella Bahidika & Joel Allou, Microsoft

AI Engineer·7月20日週一·6 min英文

三句話摘要

透過狀態機設計而非模型決策,打造可靠的 AI 語音導師系統。 AI 系統的可靠性不在於模型有多聰明,而在於圍繞它設計的架構有多周密——用狀態機代替模型決策,讓模型專注執行,是構建生產級 AI 應用的關鍵。 LLM 應是執行者,不是決策者 — 傳統做法讓模型負責記憶進度與決定下一步,導致半途變節。Ace 反轉設計:模型只根據當前狀態的具體指令執行,決策由狀態機掌控。

重點整理

重點
  • 1

    LLM 應是執行者,不是決策者 — 傳統做法讓模型負責記憶進度與決定下一步,導致半途變節。Ace 反轉設計:模型只根據當前狀態的具體指令執行,決策由狀態機掌控。

  • 2

    課程是小型狀態機 — 一堂課包含導入、教學、檢查、評分、前進、總結六個階段。系統在每個階段向模型發送「神經契約」(neuron contract),模型完成後返回結果,機制驗證並推進狀態。

  • 3

    模型工程優於模型升級 — 不用更強大的 Opus 4.7 處理所有事項,而是精心設計輸入,讓較小的 Haiku 4.5 在特定場景達到相同效果,從而降低成本、減少延遲。

  • 4

    通用設計原則 — 同樣的狀態機架構適用於語音模型、編碼代理、用戶註冊流程等。核心判斷:若系統可靠性有問題(像拋硬幣),就應從模型中移除控制流。

實用技巧與重點

乾貨
  • 課程階段:導入 → 教學 → 檢查 → 評分 → 前進 → 總結
  • 模型對比:Opus 4.7(功能強大但過度設計) vs Haiku 4.5(輕量但足夠)
  • 系統架構:狀態機決策 → 向模型發送具體指令 → 模型回傳結果 → 機制驗證與推進
  • 三個核心評估維度:課程何時結束、學生是否理解正確、接下來應該怎麼做
  • 適用場景:語音導師、編碼代理、維運手冊、新用戶註冊流程

結論

結論

AI 系統的可靠性不在於模型有多聰明,而在於圍繞它設計的架構有多周密——用狀態機代替模型決策,讓模型專注執行,是構建生產級 AI 應用的關鍵。

完整解析

詳細

Ace 是一款即時 AI 語音導師,核心承諾是「可靠地從頭到尾運行完整的課程」。但開發團隊發現,直接用大型語言模型讓其自主決策步驟時,會出現演示進行到一半代理突然結束的情況,甚至跳過步驟或迴圈——這就是多步驟代理的經典痛點。

團隊初期的直覺是「加大力度」,堆更多參數和技巧。但他們意識到這根本不是可靠性問題,而是控制問題。核心洞察是重新定義模型的角色:不把模型當導演,而當演員。模型確實擅長說台詞(生成合適的回應),但不擅長記住「現在正在第六步中的第三步」這類狀態信息。

因此,Ace 採用了狀態機架構。一堂課被設計為包含六個階段的小型狀態機:導入、教學、檢查、評分、前進、總結。系統在每個階段向模型發送一個明確的指令(稱為「神經契約」),告訴它「就做這一件事,把結果還回來」。機制本身負責驗證返回的信息、推進狀態、決定下一步。模型永遠無法決定系統身處何處。

這樣設計帶來兩個關鍵好處。首先是可靠性:因為所有控制流都在系統層而非模型層,異常情況無法使系統脫軌。其次是經濟性與性能。傳統做法需要用 Opus 4.7 這類功能強大但推理能力強大(因而昂貴和慢)的模型來處理決策和執行。Ace 改用 Haiku 4.5——一個更小、推理能力較弱的模型——因為狀態機已經替模型做了所有的思考。透過優化圍繞模型的架構,而非升級模型本身,團隊在保證性能的同時節省了成本和降低了延遲。

這套設計理念並非 Ace 獨有。同樣的原則適用於編碼代理、維運手冊、新用戶註冊流程等場景。判斷何時應該採用這種架構的一個簡單啟發式是:看系統的可靠性是否像拋硬幣一樣。如果是,就應該將控制流從模型中移除,改為圍繞模型構建決策,並向其提供結構化輸入,讓模型輕鬆產生所需的輸出。換句話說,別讓模型開車,頂多讓它說話

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。