KeyFrame內部研究專用

How to Use Gemini Omni Flash API (Step-by-step Tutorial)

Prompt Engineering·6月30日週二·12 min英文

三句話摘要

介紹 Google Gemini Omni Flash API 的影片生成與編輯功能,展示文本驅動的影片編輯能力與最佳實踐。 Gemini Omni Flash 透過多轉對話式編輯與參考圖像支援,將影片創作從「一次性生成」轉變為「迭代精煉」的工作流程,是影片 AI 應用的重要範式轉變。 成本與能力的平衡 — Gemini Omni Flash 建立在 Flash 模型基礎上,定價保持在每秒 10 美分,與 View 3.1 Fast 相同。這反映了當前 AI 模型的發展趨勢:在維持高能力的同時追求效率與成本優化,使影片編輯能力不再只限於高端應用。

重點整理

重點
  • 1

    成本與能力的平衡 — Gemini Omni Flash 建立在 Flash 模型基礎上,定價保持在每秒 10 美分,與 View 3.1 Fast 相同。這反映了當前 AI 模型的發展趨勢:在維持高能力的同時追求效率與成本優化,使影片編輯能力不再只限於高端應用。

  • 2

    多轉對話式編輯的強大性 — 核心創新是支援迭代式編輯,使用者無需重新生成整部影片,只需文本指令即可進行精準編輯(改變背景、隱藏物體、改變攝機角度),同時完全保留原始姿勢與音頻,展現模型對視覺空間和時間連貫性的深層理解。

  • 3

    參考圖像與音頻同步能力 — 最多可輸入 7 張參考圖像驅動內容生成,模型能理解複雜多角色場景(如同一角色的多個職業蒙太奇),並能生成與視覺內容同步的音頻效果,例如咖啡館場景中的機器聲與環境音樂完美配合。

  • 4

    應用限制與安全考量 — 解析度限制 720p、影片最長 10 秒,不支援原生音頻驅動生成,安全過濾器嚴格禁止名人圖像。講者建議充分利用參考圖像與視頻組合進行有針對性編輯,而非依賴首次生成完美結果。

實用技巧與重點

乾貨
  • 模型與定價
  • 模型名稱:Gemini Omni Flash(預覽版:gemini-omni-flash-preview)
  • 定價:10 美分/秒
  • 基礎:Flash 模型
  • 技術規格
  • 最高解析度:720p
  • 最長影片時長:10 秒
  • 支援縱橫比:16:9 及其他選項
  • 參考圖像上限:7 張
  • API:Google Interaction API
  • 功能清單
  • 輸入方式:文本提示、參考圖像、參考視頻 ID、攝機指令(如「slow push in」)
  • 音頻支持:生成同步音頻,可定義特定音頻類型
  • 編輯能力:多轉對話式編輯、保持視覺一致性、音頻保留
  • 設置方式:需設定 API key、選擇縱橫比、定義視頻時長、提供 interaction ID
  • 限制條件
  • 不支援原生音頻輸入驅動生成(可編輯已有音頻的視頻)
  • 禁止使用名人圖像作為參考
  • 某些詞彙觸發過濾器
  • 仍為預覽模型

結論

結論

Gemini Omni Flash 透過多轉對話式編輯與參考圖像支援,將影片創作從「一次性生成」轉變為「迭代精煉」的工作流程,是影片 AI 應用的重要範式轉變。

完整解析

詳細

Google Gemini Omni Flash 是新一代影片編輯模型,已透過 Interaction API 開放給開發者使用。該模型建立在 Flash 基礎上,保持每秒 10 美分的合理定價,反映當今 AI 發展的趨勢——在維持高能力同時追求效率與成本優化。

該模型最革命性的創新是多轉對話式編輯能力。傳統影片編輯需從零開始重新生成,但 Gemini Omni Flash 允許使用者對同一影片進行多次迭代。講者示範了將小提琴手背景從室內改為野外環境,同時完全保留人物姿勢的例子;接著在第二轉將小提琴隱形;第三轉改變攝機角度到小提琴手肩膀上方。每一步編輯都精確執行指令,同時維持視覺連貫性,這展現了模型對空間與時間理解的深度。

在影片生成方面,模型支援最多 7 張參考圖像驅動內容。講者展示了將靜止貓咪圖像轉化為「茶蒸汽緩緩上升、攝機緩慢推進」的動畫;更複雜的例子是提供同一角色的多個設定圖(廚師、遊戲玩家、農民),指令要求「create a fast-moving montage of this character in different roles」,模型不僅理解複雜場景,還驚人地保持了角色一致性。此外,模型能生成與視覺完美同步的音頻——例如咖啡館場景中,牛奶起泡聲、咖啡機嘶鳴聲與背景爵士樂完全協調。

講者特別強調安全過濾器相當嚴格,禁止名人圖像,某些詞彙也會觸發過濾。解析度限制於 720p、單個影片最長 10 秒、不支援以原生音頻驅動生成(只能編輯已有音頻的視頻)。基於這些限制,講者建議的最佳實踐是:不要期待首次生成完美結果,而應充分利用參考圖像與參考視頻的組合進行有針對性的迭代編輯,這樣能發揮該模型的最大潛力。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。