KeyFrame內部研究專用

From Transcription to Live Music: Gemini's Audio Stack — Thor Schaeff, Google DeepMind

AI Engineer·6月9日週二·19 min英文

三句話摘要

Google DeepMind 在 AI 音頻領域的最新進展:從音頻理解、語音生成到全雙工實時對話模型。 Gemini 3 將音頻理解、語音控制與實時推理無縫整合,透過內建的推理能力與導演指令系統,讓開發者用更少的資源創造更具表現力和適應性的音頻應用。 音頻理解基於深層推理而非單純轉錄:Gemini 3 不只是將語音轉成文字,而是深度理解音頻中的細微差別,包括說話者身份、情感狀態、說話節奏、多語言與方言切換。一次 API 呼叫就能提取摘要、說話者標籤、時間戳、情感分類與翻譯,這個多工能力是傳統轉錄模型做不到的。

重點整理

重點
  • 1

    音頻理解基於深層推理而非單純轉錄:Gemini 3 不只是將語音轉成文字,而是深度理解音頻中的細微差別,包括說話者身份、情感狀態、說話節奏、多語言與方言切換。一次 API 呼叫就能提取摘要、說話者標籤、時間戳、情感分類與翻譯,這個多工能力是傳統轉錄模型做不到的。

  • 2

    語音生成透過導演指令系統實現高度自訂:不依賴龐大語音庫,而是用少量基礎語音結合結構化提示(場景、指導、口音、情感),讓模型理解並執行特定風格。例如同一個美國口音基礎語音,可通過提示轉換為愛爾蘭口音或新加坡英語,依靠 Gemini 對音頻特性的深度理解來實現。

  • 3

    實時對話模型將推理內建於音頻層:Gemini 3.1 Flash Life 不採用串聯管道(語音→文字→LLM 推理),而是直接將推理能力內建於音頻模型中,透過 WebSocket 實時處理多模態輸入(文字、語音、視頻)並返回實時音頻回應。

  • 4

    實用工具與開放試驗平台降低準入門檻:Echo Script、Voice Library、Live Jukebox 等應用內置於 Google AI Studio 免費使用,開發者可直接體驗而無需信用卡;同時提供 Python 和 JavaScript 範例與編碼代理技能協助開發。

實用技巧與重點

乾貨
  • 模型與產品
  • Gemini 3(基礎模型):音頻理解
  • Gemini 3.1 Flash Life:全雙工實時音頻對話模型
  • Gemma 4:開源模型,內建音頻理解與多模態能力,支援邊緣設備
  • Lyra 3:音樂生成模型
  • Lyra 3 Clip:30 秒短幀音樂生成
  • Lyra 3 Pro:完整歌曲生成(帶歌詞)
  • 應用工具
  • Echo Script:音頻分析與信息提取(Google AI Studio 相冊)
  • Voice Library:語音自訂應用(Google AI Studio 相冊)
  • Live Jukebox:實時音樂點播應用(融合 Gemini 3.1 Flash Life + Lyra 3)
  • ai.studio/live:免費試用實時音頻對話
  • 技術能力
  • 基礎語音庫:30 多個
  • 影片幀率:最高 1 幀/秒
  • 支援語言:多種語言與方言無縫切換
  • 情感分類:開心、悲傷、憤怒、中性
  • 多模態輸入:文字、語音、視頻同時處理
  • 輸出格式:支援結構化輸出(響應模式)
  • 開發資源
  • 範例代碼:Python(伺服器間連接)、JavaScript(客戶端到伺服器)
  • Gemini Skills:編碼代理技能,包含所有 Gemini API 的指引(包括 Life API)
  • 文檔連結:examples linked from docs

結論

結論

Gemini 3 將音頻理解、語音控制與實時推理無縫整合,透過內建的推理能力與導演指令系統,讓開發者用更少的資源創造更具表現力和適應性的音頻應用。

完整解析

詳細

Thor 開場便釐清了這場講座的範圍:專注於 Google DeepMind 在 AI 音頻領域的工作,而非整個業界的所有進展。他於去年 11 月加入團隊,恰好經歷了 Gemini 3 的發布、Gemma 4 開源模型的推出(支援邊緣設備音頻理解),以及最近的 Gemini 3.1 Flash Life(全雙工實時對話模型)等重要里程碑。

Gemini 3 的核心創新在於其音頻理解超越單純轉錄。傳統語音辨識服務只輸出文字,但 Gemini 3 深度理解音頻中的所有細節:說話者身份、情感狀態、口音、說話節奏,甚至多人同時說話的情況。Thor 展示了 Echo Script 應用,它接收一段包含多種語言的自我介紹錄音,在一次 API 呼叫中完成多個任務:自動標籤說話者、識別語言、提取時間戳、分類情感(快樂、悲傷、憤怒、中性),以及生成英文翻譯和摘要。這種能力得益於 Gemini 的結構化輸出功能,允許開發者定義響應格式並自動填充。

語音生成部分展示了如何用少量基礎語音實現高度客製化。與傳統 TTS 服務依賴龐大語音庫不同,Gemini 只提供 30 多個基礎語音,但透過「導演指令」系統,開發者可精確控制語音的表現方式。Thor 演示的 Voice Library 應用讓用户定義音頻檔案(聲音特徵)、場景設定、導演指示與樣本內容,然後使用 Gemini 3 Flash 自動構建系統提示詞。例如,為了將標準美國口音改造成愛爾蘭口音,他在系統提示中加入「強大真實的愛爾蘭口音」、「舒適擁擠的酒吧場景」等指令,結果模型就能精確執行。同樣的方式也適用於新加坡英語(Singlish)的方言特徵,包括獨特的語調和用語習慣。

實時對話模型 Gemini 3.1 Flash Life 代表了架構上的根本轉變。它不採用串聯管道(語音轉文字、文字進入 LLM、LLM 生成回應、文字轉語音),而是將推理能力直接內建於音頻層,透過 WebSocket 連接實時處理多模態輸入(文字、語音、視頻,最高 1 幀/秒)並立即返回音頻回應及文字轉錄。這意味著智能推理發生在音頻空間,而非文字空間,大幅降低延遲。Thor 在 ai.studio/live 展示了這個模型的實時能力:它可接收系統指令(如「用友善的愛爾蘭口音說話」)、攝像頭視頻、自然語言提問,並用擬定的口音即時回應,甚至當用户轉換到德語時,它會應用相同的口音特徵到德語發音上。

最後,Thor 展示了如何將這些元件組合成實用應用。Life Jukebox 結合了 Gemini 3.1 Flash Life 與 Lyra 3 音樂生成模型,讓用户與虛擬 DJ 實時對話並點播自訂歌曲。在演示中,用户要求「德國科技施萊格爾風格的英國新創場景歌曲」,模型不僅理解這個複雜的跨文化請求,還透過工具呼叫觸發 Lyra 3 生成完整的德語歌曲,包括編碼的能量與英國新創業界的故事元素。

為了降低開發者的進入門檻,Google 提供了多層支援:Google AI Studio(免費試用,無需信用卡)、Echo Script 與 Voice Library 等預製應用、Python 和 JavaScript 範例程式碼,以及 Gemini Skills(編碼代理技能),這些工具可直接整合到開發流程中加強引導。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。