KeyFrame內部研究專用

Voice agents with Realtime Video — Sidney Primas, LemonSlice

AI Engineer·8月18日週二·26 min中文

三句話摘要

LemonSlice開發實時AI虛擬頭像技術,目標打破Avatar圖靈測試,讓AI虛擬形象在視訊通話中與真人無法區分。 打造商用級、實時、互動的AI虛擬頭像的核心成功因素在於技術創新(世界模型、單向互動、誤差累積解決方案)與工程紀律(硬體優化、成本控制、系統框架設計)的有機結合。 世界模型策略優於傳統做法:雖然訓練難度初期較高,但模型一旦完成,全身動作、物體互動、微表情等複雜特性能自然涌現,無須逐一編程,大幅降低後期工程成本。

重點整理

重點
  • 1

    世界模型策略優於傳統做法:雖然訓練難度初期較高,但模型一旦完成,全身動作、物體互動、微表情等複雜特性能自然涌現,無須逐一編程,大幅降低後期工程成本。

  • 2

    實時互動的雙重技術突破:訓練單向注意力遮罩使模型只看過去(無法預知未來輸入),再將生成步驟從30步壓縮到1步,才能在對話中達成即時反應。

  • 3

    錯誤累積是長時間生成的核心挑戰:每幀生成都包含微小誤差,這些誤差在後續幀生成時被參考並放大,使長程生成品質衰減;LemonSlice開發全新解決方案讓虛擬頭像可連續運行16小時無明顯劣化。

  • 4

    成本最佳化啟動商業化:硬體與演算法優化將AI視頻生成成本壓至與語音模型相當,使消費應用(語言學習、娛樂)成為可能。

實用技巧與重點

乾貨
  • 案例與合作
  • 微軟合作案例:泰迪·羅斯福虛擬化,於其紐約總統圖書館的橢圓形辦公室複製中供訪客互動
  • 驗證測試:前總統川普出席開幕式,與虛擬羅斯福互動10分鐘(超出預定1分鐘)
  • 核心技術
  • 世界模型(video model):專注人類的視頻生成模型
  • 音訊編碼器自建:不用現成音樂書籍訓練的編碼器,需客製化提升表現力
  • 單向注意力遮罩(unidirectional attention mask):訓練模型只看過去
  • 1步生成:壓縮從30步至單一步驟
  • 專有錯誤累積解決方案:支持16小時+連續生成
  • 模型框架編排:多線程GPU/CPU協調,保證實時無卡頓
  • 應用與商業模式
  • 應用場景:語言學習、娛樂、消費應用
  • API層模式:提供虛擬頭像視覺層;客戶自帶LLM與語音服務
  • 定價水準:與語音模型相當
  • 近期與遠期計畫
  • 1-2個月:推出獨立情感引擎,驅動更自然的情感反應與動作
  • 2-3年:終端到終端EQ模型(統一接收使用者視訊/音訊,輸出虛擬頭像視訊/音訊)
  • 現況:正在招聘

結論

結論

打造商用級、實時、互動的AI虛擬頭像的核心成功因素在於技術創新(世界模型、單向互動、誤差累積解決方案)與工程紀律(硬體優化、成本控制、系統框架設計)的有機結合。

完整解析

詳細

LemonSlice的使命是開發圖靈測試等級的AI虛擬頭像——在視訊通話中與真人無法區分。2024年8月,公司與微軟宣布一項重大合作,將已故美國總統泰迪·羅斯福虛擬化。這個虛擬頭像被部署在位於紐約的羅斯福總統圖書館內,館內複製了著名的橢圓形辦公室。訪客可以在這個環境中進行全身、實時的互動——虛擬羅斯福會揮手、做出動作、移動身體、甚至與環境中的物件互動。最令人印象深刻的時刻發生在開幕式上,前總統川普親臨出席,本預計只進行一分鐘的簡短互動,但他實際停留了十分鐘,甚至離開後又折返繼續與虛擬羅斯福交談。這次現場驗證充分說明了高保真虛擬頭像的吸引力與說服力。

LemonSlice採取了與業界主流截然不同的技術路徑。公司的核心策略是採用世界模型(本質上是視頻生成模型),並將其專注於人類形象的建模。這個決策看似違反直覺——初期訓練難度更高、成本更大——但一旦模型訓練完成,許多複雜的人類特徵便能自然涌現,包括全身動作、精細的手勢、與環境的物體互動、微表情,乃至情感表現。這些特性無須額外手工編程,大幅簡化了產品化的工程複雜度。值得一提的是,模型對音訊的處理至關重要。講者特別強調,現成的音訊編碼器(多數基於單調的有聲書訓練)無法捕捉足夠的表現力;LemonSlice不得不開發自己的音訊嵌入層,才能讓視頻模型產生足夠生動的表情與情感。

從靜態模型轉變為實時互動系統涉及兩項關鍵突破。第一項是實現互動性:典型的視頻擴散模型是雙向的,既能回溯過去也能預測未來,透過同時生成所有潛在層;但在實時對話中,虛擬頭像無法預知即將到來的語音或文字輸入。LemonSlice的解決方案是在訓練時加入單向注意力遮罩,限制模型只能回顧已生成的過去幀,完全無法存取未來資訊。第二項突破是加快推理速度:標準視頻生成通常需要30多個去噪迭代步驟才能從純噪聲逐步精化為清晰視頻;為達成即時性,團隊開發了技術將其壓縮至單一步驟,模型在一次前向傳播中直接生成完整的視頻幀。

長期連續生成過程中,錯誤累積成為最嚴重的技術挑戰。由於模型只能查看過去,每次生成新幀時都參考前一幀的內容;而前一幀本身包含細微誤差,這些誤差在下一幀生成時被進一步放大。隨著時間推移,誤差呈指數級複合增長,導致後期生成的視頻品質顯著衰減。泰迪·羅斯福虛擬頭像需要在某些測試中連續運行超過16小時,期間沒有任何重置。LemonSlice開發了迥異於業界其他方案的專有技術來應對這一問題,成功延長了無明顯品質劣化的生成時間,這是整個系統的核心技術優勢之一。

商業可行性需要成本控制。AI視頻生成通常用於創建五秒短片,一次性輸出後分享;但虛擬頭像需要連續生成數分鐘至數小時的內容。LemonSlice透過演算法優化與硬體加速,成功將AI視頻生成的邊際成本控制到與語音模型相當的水準——這令人吃驚,因為視頻在資料密度與計算量上遠超純音訊。低廉的成本使消費類應用成為現實,許多客戶已在語言學習軟體、娛樂平台等領域部署這項技術。此外,隨著成本繼續下降,公司能夠投資於更高的視頻解析度,進一步提升虛擬頭像的視覺保真度。

技術架構採用API層模式:LemonSlice提供虛擬頭像的視覺生成能力,而客戶自帶大型語言模型以實現智能對話,自帶或整合語音轉文字與文字轉語音服務。模型框架本身——即系統的編排層——往往被低估,但實際上是極為困難的工程課題。它涉及多線程管理、實時資料流編排、GPU與CPU工作分配協調,必須確保視頻流始終保持即時性,不出現卡頓或延遲。這層細節的精細工程是確保產品可靠性與用戶體驗的關鍵。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。