Voice agents with Realtime Video — Sidney Primas, LemonSlice
三句話摘要
LemonSlice開發實時AI虛擬頭像技術,目標打破Avatar圖靈測試,讓AI虛擬形象在視訊通話中與真人無法區分。 打造商用級、實時、互動的AI虛擬頭像的核心成功因素在於技術創新(世界模型、單向互動、誤差累積解決方案)與工程紀律(硬體優化、成本控制、系統框架設計)的有機結合。 世界模型策略優於傳統做法:雖然訓練難度初期較高,但模型一旦完成,全身動作、物體互動、微表情等複雜特性能自然涌現,無須逐一編程,大幅降低後期工程成本。
重點整理
重點- 1
世界模型策略優於傳統做法:雖然訓練難度初期較高,但模型一旦完成,全身動作、物體互動、微表情等複雜特性能自然涌現,無須逐一編程,大幅降低後期工程成本。
- 2
實時互動的雙重技術突破:訓練單向注意力遮罩使模型只看過去(無法預知未來輸入),再將生成步驟從30步壓縮到1步,才能在對話中達成即時反應。
- 3
錯誤累積是長時間生成的核心挑戰:每幀生成都包含微小誤差,這些誤差在後續幀生成時被參考並放大,使長程生成品質衰減;LemonSlice開發全新解決方案讓虛擬頭像可連續運行16小時無明顯劣化。
- 4
成本最佳化啟動商業化:硬體與演算法優化將AI視頻生成成本壓至與語音模型相當,使消費應用(語言學習、娛樂)成為可能。
實用技巧與重點
乾貨- 案例與合作
- 微軟合作案例:泰迪·羅斯福虛擬化,於其紐約總統圖書館的橢圓形辦公室複製中供訪客互動
- 驗證測試:前總統川普出席開幕式,與虛擬羅斯福互動10分鐘(超出預定1分鐘)
- 核心技術
- 世界模型(video model):專注人類的視頻生成模型
- 音訊編碼器自建:不用現成音樂書籍訓練的編碼器,需客製化提升表現力
- 單向注意力遮罩(unidirectional attention mask):訓練模型只看過去
- 1步生成:壓縮從30步至單一步驟
- 專有錯誤累積解決方案:支持16小時+連續生成
- 模型框架編排:多線程GPU/CPU協調,保證實時無卡頓
- 應用與商業模式
- 應用場景:語言學習、娛樂、消費應用
- API層模式:提供虛擬頭像視覺層;客戶自帶LLM與語音服務
- 定價水準:與語音模型相當
- 近期與遠期計畫
- 1-2個月:推出獨立情感引擎,驅動更自然的情感反應與動作
- 2-3年:終端到終端EQ模型(統一接收使用者視訊/音訊,輸出虛擬頭像視訊/音訊)
- 現況:正在招聘
結論
結論“打造商用級、實時、互動的AI虛擬頭像的核心成功因素在於技術創新(世界模型、單向互動、誤差累積解決方案)與工程紀律(硬體優化、成本控制、系統框架設計)的有機結合。”
完整解析
詳細LemonSlice的使命是開發圖靈測試等級的AI虛擬頭像——在視訊通話中與真人無法區分。2024年8月,公司與微軟宣布一項重大合作,將已故美國總統泰迪·羅斯福虛擬化。這個虛擬頭像被部署在位於紐約的羅斯福總統圖書館內,館內複製了著名的橢圓形辦公室。訪客可以在這個環境中進行全身、實時的互動——虛擬羅斯福會揮手、做出動作、移動身體、甚至與環境中的物件互動。最令人印象深刻的時刻發生在開幕式上,前總統川普親臨出席,本預計只進行一分鐘的簡短互動,但他實際停留了十分鐘,甚至離開後又折返繼續與虛擬羅斯福交談。這次現場驗證充分說明了高保真虛擬頭像的吸引力與說服力。
LemonSlice採取了與業界主流截然不同的技術路徑。公司的核心策略是採用世界模型(本質上是視頻生成模型),並將其專注於人類形象的建模。這個決策看似違反直覺——初期訓練難度更高、成本更大——但一旦模型訓練完成,許多複雜的人類特徵便能自然涌現,包括全身動作、精細的手勢、與環境的物體互動、微表情,乃至情感表現。這些特性無須額外手工編程,大幅簡化了產品化的工程複雜度。值得一提的是,模型對音訊的處理至關重要。講者特別強調,現成的音訊編碼器(多數基於單調的有聲書訓練)無法捕捉足夠的表現力;LemonSlice不得不開發自己的音訊嵌入層,才能讓視頻模型產生足夠生動的表情與情感。
從靜態模型轉變為實時互動系統涉及兩項關鍵突破。第一項是實現互動性:典型的視頻擴散模型是雙向的,既能回溯過去也能預測未來,透過同時生成所有潛在層;但在實時對話中,虛擬頭像無法預知即將到來的語音或文字輸入。LemonSlice的解決方案是在訓練時加入單向注意力遮罩,限制模型只能回顧已生成的過去幀,完全無法存取未來資訊。第二項突破是加快推理速度:標準視頻生成通常需要30多個去噪迭代步驟才能從純噪聲逐步精化為清晰視頻;為達成即時性,團隊開發了技術將其壓縮至單一步驟,模型在一次前向傳播中直接生成完整的視頻幀。
長期連續生成過程中,錯誤累積成為最嚴重的技術挑戰。由於模型只能查看過去,每次生成新幀時都參考前一幀的內容;而前一幀本身包含細微誤差,這些誤差在下一幀生成時被進一步放大。隨著時間推移,誤差呈指數級複合增長,導致後期生成的視頻品質顯著衰減。泰迪·羅斯福虛擬頭像需要在某些測試中連續運行超過16小時,期間沒有任何重置。LemonSlice開發了迥異於業界其他方案的專有技術來應對這一問題,成功延長了無明顯品質劣化的生成時間,這是整個系統的核心技術優勢之一。
商業可行性需要成本控制。AI視頻生成通常用於創建五秒短片,一次性輸出後分享;但虛擬頭像需要連續生成數分鐘至數小時的內容。LemonSlice透過演算法優化與硬體加速,成功將AI視頻生成的邊際成本控制到與語音模型相當的水準——這令人吃驚,因為視頻在資料密度與計算量上遠超純音訊。低廉的成本使消費類應用成為現實,許多客戶已在語言學習軟體、娛樂平台等領域部署這項技術。此外,隨著成本繼續下降,公司能夠投資於更高的視頻解析度,進一步提升虛擬頭像的視覺保真度。
技術架構採用API層模式:LemonSlice提供虛擬頭像的視覺生成能力,而客戶自帶大型語言模型以實現智能對話,自帶或整合語音轉文字與文字轉語音服務。模型框架本身——即系統的編排層——往往被低估,但實際上是極為困難的工程課題。它涉及多線程管理、實時資料流編排、GPU與CPU工作分配協調,必須確保視頻流始終保持即時性,不出現卡頓或延遲。這層細節的精細工程是確保產品可靠性與用戶體驗的關鍵。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


