Clone Yourself in 10 Seconds! Is Gemini Omni Video Generation Too Scary!? Can It Even Perfectly R...
三句話摘要
Google Gemini Omni 的影片生成與 Avatar 功能展示,說明如何用 AI 快速轉換影片風格與生成數位分身。 Gemini Omni 透過多模態輸入與風格統一解決了 AI 影片生成的核心痛點,但 Avatar 功能在技術門檻、語言支援與效果自然度上仍需改進才能真正實用化。 Omni 核心突破是多模態輸入且風格統一,過去AI影片「換風格人崩掉、換場景聲音跑掉」的問題被解決,精準保留人物的聲音特徵和五官表情,只轉換視覺元素,讓製作速度從數小時降至分鐘級。
重點整理
重點- 1
Omni 核心突破是多模態輸入且風格統一,過去AI影片「換風格人崩掉、換場景聲音跑掉」的問題被解決,精準保留人物的聲音特徵和五官表情,只轉換視覺元素,讓製作速度從數小時降至分鐘級。
- 2
提示詞精度直接影響輸出品質,簡略指令容易生成偏離預期的結果(如眼神不夠堅定),需多次修正與 detail 補充才能達成理想效果,這是反覆迭代的過程。
- 3
Avatar 功能存在 uncanny valley 現象,系統透過推論和生成方式想像講者嘴形動作,導致細節如鼻子、褶皺、嘴形動作與原人有微妙差異,被測試者稱為「美國人化」特徵。
- 4
使用限制門檻高且功能受限,需付費版且切換英文、手機操作才能建立,生成內容僅支援英文、一帳號一個 Avatar、生成額度受限(Pro 一天 3 支),想換造型需刪除重建。
實用技巧與重點
乾貨- Omni 內建風格(18 種):
- 動漫、賽博龐克、油畫、3D、復古、未來感、電影感等
- Avatar 建立條件:
- 付費版 Gemini(Google AI Plus / Pro / Ultra 都可)
- 語言必須設定為英文
- 必須用手機操作(網頁版強制掃 QR code)
- 拍攝自拍影片進行臉部掃描確認
- Avatar 限制:
- 僅支援英文輸出,不支援中文
- 每帳號限建 1 個 Avatar
- Pro 版一天限生 3 支影片
- 課金越多生成次數越多
- 提示詞範例:
- 「維持影片中的人物形象與聲音、人物穿著太空人月球裝、場景在月球上、鏡頭從腰部慢慢推進到眼球大特寫、最後眼神堅定盯著鏡頭有種看穿全世界的感覺」
- 已知問題:
- 太多文字會生成錯誤
- 背景元素有時消失(如錢袋不見)
- 出現「美國人化」現象(鼻子形狀、口音)
- 嘴形與講話方式不夠自然
結論
結論“Gemini Omni 透過多模態輸入與風格統一解決了 AI 影片生成的核心痛點,但 Avatar 功能在技術門檻、語言支援與效果自然度上仍需改進才能真正實用化。”
完整解析
詳細Google 5 月發表的 Gemini Omni 解決了傳統 AI 影片生成工具的核心痛點:過去換風格會導致人物面部特徵崩壞、改變場景會讓聲音跑掉。Omni 透過多模態輸入架構(接受文字、圖片、影片、音檔),能精準保留源影片中的人物聲音特徵和五官表情,同時提供 18 種預設風格模板包括動漫、賽博龐克、油畫、3D、復古、未來感與電影感等,讓使用者只需提供不超過 10 秒的源影片和文字指令,系統就能快速生成風格轉換後的新影片。
實測中,測試人員用一段錄製影片指定要轉換成太空人月球場景、鏡頭從腰部推進到眼球特寫的效果,Omni 成功複製了講者聲音和表情,只改變服裝、背景與整體視覺風格,整個過程耗時數分鐘。相比傳統製作流程(先製作會走路的太空人角色,再把講者臉部挖出來貼上),速度提升顯著。提示詞精度直接影響生成品質,過於簡略的指令容易生成不符預期的結果,例如初始指令「看到未來的感覺」導致生成的眼神漂移猶豫,需要後續修正為「眼神堅定盯著鏡頭有種看穿全世界的感覺」才達到理想效果。
新推出的 Avatar 數位分身功能讓使用者建立 AI 化身代替真人出現在影片中,但門檻較高。建立 Avatar 需滿足三項條件:必須使用付費版 Gemini(任何付費層級都可)、語言設定必須切換到英文、建立模板必須用手機操作(網頁版會強制要求掃描 QR code),過程包括拍攝自拍影片進行臉部掃描確認以驗證真人身份。生成的 Avatar 存在 uncanny valley 現象,系統透過推論和生成的方式想像講者嘴形動作,導致鼻子形狀、臉部褶皺、嘴形動作與原人有微妙差異,測試者形容為「美國人化」特徵。
使用限制包括:生成內容目前僅支援英文,中文尚未開放;每個帳號只能建立一個 Avatar,想改變造型需先刪除重建;Avatar 影片生成與日常生成功能共用額度限制,Pro 版一天限生 3 支影片,課金越多可提升生成次數。任何影像生成都採抽卡機制,不滿意的結果需要多次生成才能得到理想效果。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


