KeyFrame內部研究專用

Clone Yourself in 10 Seconds! Is Gemini Omni Video Generation Too Scary!? Can It Even Perfectly R...

泛科學院·5月27日週三·9 min中文

三句話摘要

Google Gemini Omni 的影片生成與 Avatar 功能展示,說明如何用 AI 快速轉換影片風格與生成數位分身。 Gemini Omni 透過多模態輸入與風格統一解決了 AI 影片生成的核心痛點,但 Avatar 功能在技術門檻、語言支援與效果自然度上仍需改進才能真正實用化。 Omni 核心突破是多模態輸入且風格統一,過去AI影片「換風格人崩掉、換場景聲音跑掉」的問題被解決,精準保留人物的聲音特徵和五官表情,只轉換視覺元素,讓製作速度從數小時降至分鐘級。

重點整理

重點
  • 1

    Omni 核心突破是多模態輸入且風格統一,過去AI影片「換風格人崩掉、換場景聲音跑掉」的問題被解決,精準保留人物的聲音特徵和五官表情,只轉換視覺元素,讓製作速度從數小時降至分鐘級。

  • 2

    提示詞精度直接影響輸出品質,簡略指令容易生成偏離預期的結果(如眼神不夠堅定),需多次修正與 detail 補充才能達成理想效果,這是反覆迭代的過程。

  • 3

    Avatar 功能存在 uncanny valley 現象,系統透過推論和生成方式想像講者嘴形動作,導致細節如鼻子、褶皺、嘴形動作與原人有微妙差異,被測試者稱為「美國人化」特徵。

  • 4

    使用限制門檻高且功能受限,需付費版且切換英文、手機操作才能建立,生成內容僅支援英文、一帳號一個 Avatar、生成額度受限(Pro 一天 3 支),想換造型需刪除重建。

實用技巧與重點

乾貨
  • Omni 內建風格(18 種):
  • 動漫、賽博龐克、油畫、3D、復古、未來感、電影感等
  • Avatar 建立條件:
  • 付費版 Gemini(Google AI Plus / Pro / Ultra 都可)
  • 語言必須設定為英文
  • 必須用手機操作(網頁版強制掃 QR code)
  • 拍攝自拍影片進行臉部掃描確認
  • Avatar 限制:
  • 僅支援英文輸出,不支援中文
  • 每帳號限建 1 個 Avatar
  • Pro 版一天限生 3 支影片
  • 課金越多生成次數越多
  • 提示詞範例:
  • 「維持影片中的人物形象與聲音、人物穿著太空人月球裝、場景在月球上、鏡頭從腰部慢慢推進到眼球大特寫、最後眼神堅定盯著鏡頭有種看穿全世界的感覺」
  • 已知問題:
  • 太多文字會生成錯誤
  • 背景元素有時消失(如錢袋不見)
  • 出現「美國人化」現象(鼻子形狀、口音)
  • 嘴形與講話方式不夠自然

結論

結論

Gemini Omni 透過多模態輸入與風格統一解決了 AI 影片生成的核心痛點,但 Avatar 功能在技術門檻、語言支援與效果自然度上仍需改進才能真正實用化。

完整解析

詳細

Google 5 月發表的 Gemini Omni 解決了傳統 AI 影片生成工具的核心痛點:過去換風格會導致人物面部特徵崩壞、改變場景會讓聲音跑掉。Omni 透過多模態輸入架構(接受文字、圖片、影片、音檔),能精準保留源影片中的人物聲音特徵和五官表情,同時提供 18 種預設風格模板包括動漫、賽博龐克、油畫、3D、復古、未來感與電影感等,讓使用者只需提供不超過 10 秒的源影片和文字指令,系統就能快速生成風格轉換後的新影片。

實測中,測試人員用一段錄製影片指定要轉換成太空人月球場景、鏡頭從腰部推進到眼球特寫的效果,Omni 成功複製了講者聲音和表情,只改變服裝、背景與整體視覺風格,整個過程耗時數分鐘。相比傳統製作流程(先製作會走路的太空人角色,再把講者臉部挖出來貼上),速度提升顯著。提示詞精度直接影響生成品質,過於簡略的指令容易生成不符預期的結果,例如初始指令「看到未來的感覺」導致生成的眼神漂移猶豫,需要後續修正為「眼神堅定盯著鏡頭有種看穿全世界的感覺」才達到理想效果。

新推出的 Avatar 數位分身功能讓使用者建立 AI 化身代替真人出現在影片中,但門檻較高。建立 Avatar 需滿足三項條件:必須使用付費版 Gemini(任何付費層級都可)、語言設定必須切換到英文、建立模板必須用手機操作(網頁版會強制要求掃描 QR code),過程包括拍攝自拍影片進行臉部掃描確認以驗證真人身份。生成的 Avatar 存在 uncanny valley 現象,系統透過推論和生成的方式想像講者嘴形動作,導致鼻子形狀、臉部褶皺、嘴形動作與原人有微妙差異,測試者形容為「美國人化」特徵。

使用限制包括:生成內容目前僅支援英文,中文尚未開放;每個帳號只能建立一個 Avatar,想改變造型需先刪除重建;Avatar 影片生成與日常生成功能共用額度限制,Pro 版一天限生 3 支影片,課金越多可提升生成次數。任何影像生成都採抽卡機制,不滿意的結果需要多次生成才能得到理想效果。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。