Don't Let the LLM Drive - Ornella Bahidika & Joel Allou, Microsoft
三句話摘要
透過狀態機設計而非模型決策,打造可靠的 AI 語音導師系統。 AI 系統的可靠性不在於模型有多聰明,而在於圍繞它設計的架構有多周密——用狀態機代替模型決策,讓模型專注執行,是構建生產級 AI 應用的關鍵。 LLM 應是執行者,不是決策者 — 傳統做法讓模型負責記憶進度與決定下一步,導致半途變節。Ace 反轉設計:模型只根據當前狀態的具體指令執行,決策由狀態機掌控。
重點整理
重點- 1
LLM 應是執行者,不是決策者 — 傳統做法讓模型負責記憶進度與決定下一步,導致半途變節。Ace 反轉設計:模型只根據當前狀態的具體指令執行,決策由狀態機掌控。
- 2
課程是小型狀態機 — 一堂課包含導入、教學、檢查、評分、前進、總結六個階段。系統在每個階段向模型發送「神經契約」(neuron contract),模型完成後返回結果,機制驗證並推進狀態。
- 3
模型工程優於模型升級 — 不用更強大的 Opus 4.7 處理所有事項,而是精心設計輸入,讓較小的 Haiku 4.5 在特定場景達到相同效果,從而降低成本、減少延遲。
- 4
通用設計原則 — 同樣的狀態機架構適用於語音模型、編碼代理、用戶註冊流程等。核心判斷:若系統可靠性有問題(像拋硬幣),就應從模型中移除控制流。
實用技巧與重點
乾貨- 課程階段:導入 → 教學 → 檢查 → 評分 → 前進 → 總結
- 模型對比:Opus 4.7(功能強大但過度設計) vs Haiku 4.5(輕量但足夠)
- 系統架構:狀態機決策 → 向模型發送具體指令 → 模型回傳結果 → 機制驗證與推進
- 三個核心評估維度:課程何時結束、學生是否理解正確、接下來應該怎麼做
- 適用場景:語音導師、編碼代理、維運手冊、新用戶註冊流程
結論
結論“AI 系統的可靠性不在於模型有多聰明,而在於圍繞它設計的架構有多周密——用狀態機代替模型決策,讓模型專注執行,是構建生產級 AI 應用的關鍵。”
完整解析
詳細Ace 是一款即時 AI 語音導師,核心承諾是「可靠地從頭到尾運行完整的課程」。但開發團隊發現,直接用大型語言模型讓其自主決策步驟時,會出現演示進行到一半代理突然結束的情況,甚至跳過步驟或迴圈——這就是多步驟代理的經典痛點。
團隊初期的直覺是「加大力度」,堆更多參數和技巧。但他們意識到這根本不是可靠性問題,而是控制問題。核心洞察是重新定義模型的角色:不把模型當導演,而當演員。模型確實擅長說台詞(生成合適的回應),但不擅長記住「現在正在第六步中的第三步」這類狀態信息。
因此,Ace 採用了狀態機架構。一堂課被設計為包含六個階段的小型狀態機:導入、教學、檢查、評分、前進、總結。系統在每個階段向模型發送一個明確的指令(稱為「神經契約」),告訴它「就做這一件事,把結果還回來」。機制本身負責驗證返回的信息、推進狀態、決定下一步。模型永遠無法決定系統身處何處。
這樣設計帶來兩個關鍵好處。首先是可靠性:因為所有控制流都在系統層而非模型層,異常情況無法使系統脫軌。其次是經濟性與性能。傳統做法需要用 Opus 4.7 這類功能強大但推理能力強大(因而昂貴和慢)的模型來處理決策和執行。Ace 改用 Haiku 4.5——一個更小、推理能力較弱的模型——因為狀態機已經替模型做了所有的思考。透過優化圍繞模型的架構,而非升級模型本身,團隊在保證性能的同時節省了成本和降低了延遲。
這套設計理念並非 Ace 獨有。同樣的原則適用於編碼代理、維運手冊、新用戶註冊流程等場景。判斷何時應該採用這種架構的一個簡單啟發式是:看系統的可靠性是否像拋硬幣一樣。如果是,就應該將控制流從模型中移除,改為圍繞模型構建決策,並向其提供結構化輸入,讓模型輕鬆產生所需的輸出。換句話說,別讓模型開車,頂多讓它說話。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


