From Transcription to Live Music: Gemini's Audio Stack — Thor Schaeff, Google DeepMind
三句話摘要
Google DeepMind 在 AI 音頻領域的最新進展:從音頻理解、語音生成到全雙工實時對話模型。 Gemini 3 將音頻理解、語音控制與實時推理無縫整合,透過內建的推理能力與導演指令系統,讓開發者用更少的資源創造更具表現力和適應性的音頻應用。 音頻理解基於深層推理而非單純轉錄:Gemini 3 不只是將語音轉成文字,而是深度理解音頻中的細微差別,包括說話者身份、情感狀態、說話節奏、多語言與方言切換。一次 API 呼叫就能提取摘要、說話者標籤、時間戳、情感分類與翻譯,這個多工能力是傳統轉錄模型做不到的。
重點整理
重點- 1
音頻理解基於深層推理而非單純轉錄:Gemini 3 不只是將語音轉成文字,而是深度理解音頻中的細微差別,包括說話者身份、情感狀態、說話節奏、多語言與方言切換。一次 API 呼叫就能提取摘要、說話者標籤、時間戳、情感分類與翻譯,這個多工能力是傳統轉錄模型做不到的。
- 2
語音生成透過導演指令系統實現高度自訂:不依賴龐大語音庫,而是用少量基礎語音結合結構化提示(場景、指導、口音、情感),讓模型理解並執行特定風格。例如同一個美國口音基礎語音,可通過提示轉換為愛爾蘭口音或新加坡英語,依靠 Gemini 對音頻特性的深度理解來實現。
- 3
實時對話模型將推理內建於音頻層:Gemini 3.1 Flash Life 不採用串聯管道(語音→文字→LLM 推理),而是直接將推理能力內建於音頻模型中,透過 WebSocket 實時處理多模態輸入(文字、語音、視頻)並返回實時音頻回應。
- 4
實用工具與開放試驗平台降低準入門檻:Echo Script、Voice Library、Live Jukebox 等應用內置於 Google AI Studio 免費使用,開發者可直接體驗而無需信用卡;同時提供 Python 和 JavaScript 範例與編碼代理技能協助開發。
實用技巧與重點
乾貨- 模型與產品
- Gemini 3(基礎模型):音頻理解
- Gemini 3.1 Flash Life:全雙工實時音頻對話模型
- Gemma 4:開源模型,內建音頻理解與多模態能力,支援邊緣設備
- Lyra 3:音樂生成模型
- Lyra 3 Clip:30 秒短幀音樂生成
- Lyra 3 Pro:完整歌曲生成(帶歌詞)
- 應用工具
- Echo Script:音頻分析與信息提取(Google AI Studio 相冊)
- Voice Library:語音自訂應用(Google AI Studio 相冊)
- Live Jukebox:實時音樂點播應用(融合 Gemini 3.1 Flash Life + Lyra 3)
- ai.studio/live:免費試用實時音頻對話
- 技術能力
- 基礎語音庫:30 多個
- 影片幀率:最高 1 幀/秒
- 支援語言:多種語言與方言無縫切換
- 情感分類:開心、悲傷、憤怒、中性
- 多模態輸入:文字、語音、視頻同時處理
- 輸出格式:支援結構化輸出(響應模式)
- 開發資源
- 範例代碼:Python(伺服器間連接)、JavaScript(客戶端到伺服器)
- Gemini Skills:編碼代理技能,包含所有 Gemini API 的指引(包括 Life API)
- 文檔連結:examples linked from docs
結論
結論“Gemini 3 將音頻理解、語音控制與實時推理無縫整合,透過內建的推理能力與導演指令系統,讓開發者用更少的資源創造更具表現力和適應性的音頻應用。”
完整解析
詳細Thor 開場便釐清了這場講座的範圍:專注於 Google DeepMind 在 AI 音頻領域的工作,而非整個業界的所有進展。他於去年 11 月加入團隊,恰好經歷了 Gemini 3 的發布、Gemma 4 開源模型的推出(支援邊緣設備音頻理解),以及最近的 Gemini 3.1 Flash Life(全雙工實時對話模型)等重要里程碑。
Gemini 3 的核心創新在於其音頻理解超越單純轉錄。傳統語音辨識服務只輸出文字,但 Gemini 3 深度理解音頻中的所有細節:說話者身份、情感狀態、口音、說話節奏,甚至多人同時說話的情況。Thor 展示了 Echo Script 應用,它接收一段包含多種語言的自我介紹錄音,在一次 API 呼叫中完成多個任務:自動標籤說話者、識別語言、提取時間戳、分類情感(快樂、悲傷、憤怒、中性),以及生成英文翻譯和摘要。這種能力得益於 Gemini 的結構化輸出功能,允許開發者定義響應格式並自動填充。
語音生成部分展示了如何用少量基礎語音實現高度客製化。與傳統 TTS 服務依賴龐大語音庫不同,Gemini 只提供 30 多個基礎語音,但透過「導演指令」系統,開發者可精確控制語音的表現方式。Thor 演示的 Voice Library 應用讓用户定義音頻檔案(聲音特徵)、場景設定、導演指示與樣本內容,然後使用 Gemini 3 Flash 自動構建系統提示詞。例如,為了將標準美國口音改造成愛爾蘭口音,他在系統提示中加入「強大真實的愛爾蘭口音」、「舒適擁擠的酒吧場景」等指令,結果模型就能精確執行。同樣的方式也適用於新加坡英語(Singlish)的方言特徵,包括獨特的語調和用語習慣。
實時對話模型 Gemini 3.1 Flash Life 代表了架構上的根本轉變。它不採用串聯管道(語音轉文字、文字進入 LLM、LLM 生成回應、文字轉語音),而是將推理能力直接內建於音頻層,透過 WebSocket 連接實時處理多模態輸入(文字、語音、視頻,最高 1 幀/秒)並立即返回音頻回應及文字轉錄。這意味著智能推理發生在音頻空間,而非文字空間,大幅降低延遲。Thor 在 ai.studio/live 展示了這個模型的實時能力:它可接收系統指令(如「用友善的愛爾蘭口音說話」)、攝像頭視頻、自然語言提問,並用擬定的口音即時回應,甚至當用户轉換到德語時,它會應用相同的口音特徵到德語發音上。
最後,Thor 展示了如何將這些元件組合成實用應用。Life Jukebox 結合了 Gemini 3.1 Flash Life 與 Lyra 3 音樂生成模型,讓用户與虛擬 DJ 實時對話並點播自訂歌曲。在演示中,用户要求「德國科技施萊格爾風格的英國新創場景歌曲」,模型不僅理解這個複雜的跨文化請求,還透過工具呼叫觸發 Lyra 3 生成完整的德語歌曲,包括編碼的能量與英國新創業界的故事元素。
為了降低開發者的進入門檻,Google 提供了多層支援:Google AI Studio(免費試用,無需信用卡)、Echo Script 與 Voice Library 等預製應用、Python 和 JavaScript 範例程式碼,以及 Gemini Skills(編碼代理技能),這些工具可直接整合到開發流程中加強引導。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


