KeyFrame內部研究專用

Voice AI下个界面革命 | 迈克·德雷施 | 语音交互 | 上下文层 | 行业采用 | 合规性 | 重写软件经济学 | 端到端 | 分发的重要性 | 人机移交 | 蓝海方向

Best Partners TV·6月10日週三·16 min中文

三句話摘要

語音AI正在經歷轉折點,從高帶寬數據流入到經濟學改變,正成為被低估的介面革命。 Voice AI的真正價值在於提高數據帶寬和改變經濟學預算邏輯,只有端到端完成整個工作流才配稱做業務,而不僅僅是功能。 帶寬革命重新定義Voice AI價值:語音不只是更自然的輸入方式,而是根本性提高數據流入量。當用戶說話時,AI同時接收語氣、停頓、情緒、措辭習慣、猶豫點等非語言信息,這些信息量遠超文字。AI從只能看到用戶過濾後的結論,升級到看到得出結論的完整思考過程。這不是線性提升,而是質變。

重點整理

重點
  • 1

    帶寬革命重新定義Voice AI價值:語音不只是更自然的輸入方式,而是根本性提高數據流入量。當用戶說話時,AI同時接收語氣、停頓、情緒、措辭習慣、猶豫點等非語言信息,這些信息量遠超文字。AI從只能看到用戶過濾後的結論,升級到看到得出結論的完整思考過程。這不是線性提升,而是質變。

  • 2

    行業採用的反直覺規律:最先採用Voice AI的不是互聯網友好的行業(電商、線上教育),反而是醫療、保險、金融、法律等監管最嚴格的行業。原因是這些行業對流程控制的要求極高——每個對話環節都需嚴格驗證、權限管理、日誌記錄。而成熟的Voice AI平台正是為精細控制對話流程、設置評估機制而生的。可控性變成真正的價值主張,而非技術優勢。

  • 3

    SaaS經濟學的根本改變:傳統SaaS是提升員工效率的工具,預算來自IT部門的固定工具預算。但當Voice AI真正端到端替代人工時,預算來源變成人力成本。同一個會計工作,傳統SaaS年合同額3萬美元(對標工具成本),AI Agent版本15萬美元/年(對標初級會計師6萬薪資),定價能增加5倍。因為企業願意為24小時不休息、不需福利、不會辭職的虛擬員工支付相當於兩個半員工的成本。

  • 4

    真正的護城河是分發和飛輪,不是技術:低延遲、高音質、模型準確只是入場券,不是壁壘。真正難以復制的是開發者社區和評估飛輪。Vapi成功原因是開發者自發涌入,小項目最終成長為企業級客戶,形成Twilio式的分發優勢。同時,每次真實對話成為產品數據,不斷優化模型和對話流程。在大模型時代技術易復制的背景下,分發和數據飛輪才是真正防禦。

實用技巧與重點

乾貨
  • 投資背景
  • Bessemer Venture Partners 已投:Abridge(醫療AI記錄)、Rilla(銷售對話分析)、Vapi(語音AI基礎設施平台)
  • Vapi B輪融資估值達5億美元
  • 經濟數據
  • 會計SaaS傳統版年合同額(ACV):3萬美元
  • AI Agent版本年合同額:15萬美元
  • 初級會計師年薪:約6萬美元
  • 提升倍數:5倍
  • 真實案例
  • Qualitate專家網絡訪談案例:M&A尽職調查從一週工作量壓縮到週末完成200通訪談,週一早上反饋整理完畢
  • 語音優勢在此場景明顯:語氣、停頓、情緒能被準確捕捉,引導下一問題;文字問卷完全看不到
  • 現況數據
  • 人機移交比例:現階段約5-10%通話需升級給人工處理
  • 技術對標:低延遲、高音質、模型準確是入場券,不是護城河
  • 過度擁擠的方向
  • 預約排程(scheduling)
  • 催債(debt collection)
  • 招聘(recruiting)
  • 特點:高頻、高量、容錯率高,最容易驗證,因此創業者最先涌入
  • 機會方向
  • 法律案件初步受理(legal intake):複雜度高、對話質量要求高、經濟價值大、從未被系統化用AI改造
  • 專家網絡訪談:語音優勢明顯,非語言信息關鍵
  • 多模態混合場景:邊監控用戶屏幕操作邊用語音實時指導,效率遠超單一模式
  • 工業現場檢測:工人邊說話邊拍照,數據整合自動生成檢測報告(屋頂檢修、建筑工地、設備維護)
  • 融資看點
  • 產品演示已不是差異化(幾乎所有演示都很神奇)
  • 真正看重:飛輪理論清晰度、團隊執行速度
  • 競爭周期:從有產品到出現模仿者可能只需幾週

結論

結論

Voice AI的真正價值在於提高數據帶寬和改變經濟學預算邏輯,只有端到端完成整個工作流才配稱做業務,而不僅僅是功能。

完整解析

詳細

語音AI領域正經歷深刻但被忽視的轉折。許多人對語音AI的認知停留在自動客服機器人層面,但根據全球頂級風投Bessemer Venture Partners近兩年的系統研究,真實故事要深刻得多。Bessemer合伙人Mike Droesch揭示了一個根本性的真相:語音AI的價值不在於交互更自然,而在於從根本上改變了數據流入AI的帶寬。

傳統軟件交互都是低帶寬方式——用戶通過打字、點擊、填表傳入信息,這些信息是離散的、碎片化的,且經過大腦過濾精簡。比如網上申請理賠,用戶只填表格要求的項目,很多細節信息永遠不會被記錄。但語音完全不同。當用戶說話時,AI同時接收語氣、停頓、情緒、措辭習慣、猶豫的地方等非語言信息。這些看似微妙的細節傳遞的信息量遠遠超過文字輸入。基於這個邏輯,Droesch重新定義了Voice AI的位置——不是一個功能,而是一個「上下文層」,即軟件系統的基礎設施,所有智能決策的數據源。這個定位直接決定了Voice AI的發展天花板。

最反直覺的發現出現在實際應用層面。按照常規推理,互聯網友好的行業(電商、線上教育)應該最先採用Voice AI,因為它們本身數字化程度就高。但現實恰恰相反——採用最快的反而是醫療、保險、金融、法律等監管最嚴格的行業。這乍聽很奇怪,因為這些行業通常被認為最保守。但Droesch的解釋很有說服力:這些行業對流程控制的要求極其苛刻。以醫療為例,AI agent在釋放任何患者健康信息前,必須嚴格驗證身份、確認生日、核對保單號、回答安全問題,每個環節都要通過嚴格的對話關卡,不能有任何疏漏。這種對控制的執著要求,恰好與成熟Voice AI平台的設計能力高度契合——精確規定AI在什麼條件下能說什麼、必須驗證什麼、何時移交人工,每步操作都有詳細日誌。可控性變成了真正的價值主張,成為進入大市場的鑰匙。而一旦客戶切換成本極高,產品粘性遠比技術壁壘持久。

Voice AI還根本性改寫了整個SaaS行業的經濟學。傳統SaaS的邏輯很簡單:企業購買軟件是為了提升員工效率,年合同額(ACV)通常在3萬美元左右,預算來自IT部門相對固定的工具預算。但當Voice AI真正能端到端完成整項工作時,邏輯完全改變——它從優化工具變成替代人工。Droesch舉了個非常具體的例子:一個會計類SaaS傳統版本ACV約3萬美元,而真正能端到端完成整個會計工作流的AI Agent版本——從發票錄入、憑證生成、銀行對賬到稅務申報、財務報表生成全由AI獨立完成——年合同額能達到15萬美元。同一個客戶、同一個問題,定價增加了5倍。這不是廠商漫天要價,而是預算來源變了。客戶實際上是在用虛擬員工的成本與真實員工的薪資競爭——初級會計師年薪約6萬美元,15萬美元相當於購買兩個半的會計師勞動力。而AI的優勢是24小時工作、不需要福利、永遠不會辭職。當然,這一切的前提是AI真的能做到端到端,否則只完成工作流一小部分、最後還靠人來收尾,定價邏輯就完全不成立了。

在護城河層面,Droesch打破了很多行業共識。許多人認為低延遲、高音質、模型準確、音色自然就是Voice AI的壁壘,但Droesch的回答非常直接:這些都不是壁壘,只是入場券。做到了這些不代表有優勢,做不到就直接出局。以Vapi為例,它建立的真實難以復制的優勢有兩個。第一是開發者社區。大量開發者自發涌入使用Vapi的API來構建各種語音AI應用,大多數是小項目(個人開發者的預約助手、小團隊的客服機器人),但其中一小部分最終會把在Vapi上驗證過的東西帶進自己的企業級項目,成為Vapi的大客戶。這個成長路徑與Twilio、Auth0當年的成功路徑完全一致——開發者飛輪一旦轉起來,就成為非常強的分發壁壘。Droesch強調,分發比以往任何時候都更重要,因為達到功能對等太容易了,可能只需幾週。在大模型時代,技術復制成本極低,競爭對手可以快速抄襲你花了幾個月才做出的功能,但開發者社區和分發渠道是抄不走的。第二個優勢是評估飛輪。每次真實對話都是宝贵的產品數據。Vapi收集了大量真實對話數據,不斷測試和優化自己的模型與對話流程,建立越來越強的自我改進機制。這個飛輪跑的次數越多,質量領先就越明顯。基礎設施層面的競爭對手可能在技術上追上你,但這個數據飛輪很難復制。

既然技術已經不是最大問題,Voice AI發展的最大瓶頸是什麼呢?Droesch給出了一個非常微妙但準確的判斷:瓶頸不是能力,而是信任。很多人擔心的是AI夠不夠聰明、能否處理複雜情況、會不會聽不懂口音、會不會說錯話——這些都是技術問題。但Droesch的觀察是,這些技術問題其實在很大程度上已經解決了,或者正在以非常快的速度被解決。真正的瓶頸不是AI能不能做,而是企業敢不敢讓AI做。他說的一句話非常關鍵:「我們正在進入一個Agent理解得比人們預期的更多的世界,但要讓它真正連接到核心系統、幫你轉賬、結案一個理賠、完成一筆預訂或者修改一條關鍵記錄,需要的是完全不同級別的信心」。這種信心不是靠好看的演示建立的。你可以給客戶展示完美的演示,說AI能處理99%的情況,但客戶不會馬上把核心業務交給你。信任的建立靠的是完整的治理框架、強大的可觀測性和不斷重複的驗證。買家需要看到:出了問題能不能被發現?能不能被追溯?能不能被回滾?而且,買家的首席信息安全官(CISO)是否在意這件事,跟你想不想沒有關係——他們就在你的產品路線圖上。任何涉及企業核心系統的AI應用都必須經過CISO的嚴格審核,這是企業採購的必經環節。

人機移交一直是行業裡的爭議話題。長期以來,有一種隱含的假設:AI接了電話又移交給人工,說明AI不夠好,是產品失敗的標誌。很多創業者都在追求100%的自動化率,認為自動化率越高產品就越成功。但Droesch提出了不同的看法。他指出,大多數打進客服電話的用戶本身就已經是在處理邊緣情況。你打電話給銀行,通常是因為網上銀行辦不了。你打電話給保險公司,通常是因為APP裡找不到理賠入口。你打電話給客服,通常是因為已經嘗試了所有自助方式都解決不了問題。所以接進來的電話本身就可能是複雜情況。在這種背景下,AI能處理的就處理,處理不了的流轉給人工,是完全合理的設計,不是失敗。關鍵不在於自動化率有多高,而在於移交的過程有多順暢。移交得好能建立信任,移交得不好,哪怕之前對話再完美,最後那一腳踢給人工的瞬間如果體驗很差,用戶對整個系統的印象就會徹底崩塌。所以Droesch說,人機移交的流暢程度是信任建立還是被摧毀的關鍵時刻。現階段Voice AI實現里確實還有5-10%的通話需要升級給人工,但真正的問題不是這個比例本身。當評估體系足夠成熟、我們對Agent的行為有足夠把握時,我們才會放心地把它連接到更多核心系統、給它更多權限去執行更複雜的任務。這是一個成熟曲線,不是非此即彼的選擇。把移交設計成一個產品功能而不是失敗後的兜底方案,本身就是高水準的產品思維。

在機會地圖層面,Droesch給出了非常實用的行業洞察。首先,已經過度擁擠的方向包括預約排程、催債、招聘。這些方向的邏輯很簡單:高頻、高量、對錯誤的容忍度相對較高,是最容易驗證的場景,所以最先被大量創業者涌入。現在這幾個方向競爭已經非常激烈,沒有明顯差異化很難突圍。那還有機會的地方在哪呢?Droesch提到了幾個很有意思的方向。第一個是法律行業的案件受理(legal intake),比如人身傷害類訴訟的初步案情收集。這是一個複雜度高、對對話質量要求高、之前從來沒人會想到用AI來做的場景,但從成本和規模來看,這裡的經濟價值非常大。第二個是專家網絡訪談。Droesch投資的Qualitate就在做這件事,他分享了一個非常具體的案例:一家企業在做並購前的尽職調查,需要盡量多地進行專家訪談了解目標公司所在行業的情況。以前一個分析師一通電話要花一小時,還要記錄整理,非常耗人力。用Qualitate的方案,整個週末完成了200通專家訪談,週一早上所有反饋都已經整理好了。而且這個場景裡語音的優勢非常明顯——語氣、停頓、情緒這些在郵件或文字問卷裡完全看不到,但在語音裡能被準確捕捉。AI可以根據專家的語氣和停頓判斷哪些信息是重要的、哪些是專家有所保留的,然後自動引導出下一個問題。這是文字交互根本替代不了的場景。第三個方向是多模態混合場景,比如一邊監控用戶的屏幕操作軌跡,一邊用語音實時指導——「往右一點,點那個藍色的按鈕」——或者告訴用戶「你現在需要輸入身份證號碼」。這種客服體驗是完全不同維度的,比單純的語音或文字指導要高效得多。還有工業現場檢測,工人一邊說話一邊拍照,所有的語音數據和圖像數據整合起來給AI判斷,自動生成檢測報告。這是把Voice AI真正帶進物理世界的嘗試。屋頂檢修、建筑工地質檢、設備維護這類場景都有非常大的應用潛力。

最後,Droesch給正在做Voice AI的創業者提出了幾個非常核心的忠告。第一個忠告,也是最重要的一個:不要花時間去做一個只能完成工作流一部分、最後還是要移交給人工的語音Agent。這種東西很容易做出來,演示很好看,對話很流暢,但本質上只是一個功能,不是一個真正的業務。真正值得花時間的是找到一個你可以端到端擁有整個工作流的場景,從第一聲鈴響到最終動作完成全部由AI負責。只有這樣,你才有資格談論真正的規模效應,才有資格談論從IT預算跳到人力成本預算,才能建立真正的護城河。而且這個工作流最好是經濟價值很高的,否則做了一堆低價值的自動化,就算跑得再順,天花板也很低。第二個忠告是關於定價的。現在不要強行做基於結果的定價,因為大多數場景裡結果是很難精確定義和驗證的。現實中做得不錯的公司用的都還是平台費加使用量的組合,對買賣雙方都更清晰、更可預期。等到某個場景的結果足夠標準化、可驗證了,再切換到結果定價也不遲。第三個忠告是關於融資的。什麼樣的公司值得在這個時代拿到A輪融資呢?Droesch說,產品夠不夠神奇已經不是問題了,現在幾乎所有產品演示都很神奇。投資人更看重的是兩個東西:第一,這個團隊有沒有清晰的飛輪理論。他們打算怎麼建立防禦性,怎麼應對競爭。不一定從第一天就要有,但團隊要能清晰表達這個路徑。第二,速度。不是以前意義上的速度,而是現在這個時代定義的速度。從有產品到出現模仿者,可能就是幾週的事。你必須跑得比以前快得多。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。