KeyFrame內部研究專用

Why Image Generation Needs More Than Bigger Models with Fatih Porikli - #773

TWIML AI·8月12日週三·56 min英文

三句話摘要

Qualcomm 在 CVPR 2024 發表的多項文本生成圖像研究,解決可控性、效率和品質的三大前沿挑戰。 文本生成圖像的下一步前沿不在視覺逼真,而在於用智能目標函數、分層任務設計和潛在空間優化,讓 AI 系統從「能生成好看圖像」升級到「精確滿足使用者需求,且在裝置端高效運行」。 單一模型做太多事是瓶頸:要求一個模型同時決定人數、位置、身份、互動關係、姿態、渲染,過載了。解決辦法是分解任務或用智能路由器選擇專用模型。

重點整理

重點
  • 1

    單一模型做太多事是瓶頸:要求一個模型同時決定人數、位置、身份、互動關係、姿態、渲染,過載了。解決辦法是分解任務或用智能路由器選擇專用模型。

  • 2

    訓練目標函數比架構更關鍵:DISCO 的創新不在模型本身,而在明確加入「圖像內多樣性」和「跨生成一致性」的獎勵函數,配合課程學習(curriculum learning)讓學習穩定高效。

  • 3

    分層處理優於暴力擴展:Pixel Rush 沒有擴大潛在空間(會爆炸記憶體),而是分塊處理,用語義引導噪聲注入在邊界實現無瑕疵拼接——在潛在空間而非像素空間處理邊界,避免模糊。

  • 4

    影像反演銜接現實與生成:Inverfill 用反向去噪將實際圖像映射為圖像特定噪聲,在修復區域添加新的隨機噪聲,讓背景和前景在潛在空間同一層自然協調,消除修復邊界的典型瑕疵。

實用技巧與重點

乾貨
  • DISCO 論文:
  • 獎勵函數包含:圖像內多樣性(intra-image diversity)、跨生成多樣性(inter-run diversity)、正確人數
  • 評估基準:「Diverse Humans」benchmark
  • 效果:獨特臉部準確率(Unique Face Accuracy)提升 10-20 百分點;DISCO 達 98-99%
  • 訓練方法:GRPO(Group Predictive Policy Optimization)強化學習 + 課程學習
  • 資料需求:無需大量真實資料,用合成臉部可自動化訓練
  • R2CAM 論文:
  • 架構(Architect)階段輸出:臉部位置的三維座標(XY 點)
  • 藝術家(Artist)階段:接收座標點,執行單次推理(迭代式擴散內部進行)
  • 獎勵函數:構圖對齊、身份保留、姿態一致性、人物計數、人物感知評分
  • 訓練用臉部:支援真實臉部或自動生成的合成臉部
  • 推理流程:離線訓練 GRPO → 推理時逐句提示 + 提供臉部 → 建築師生成位置 → 藝術家渲染
  • Pixel Rush 論文:
  • 輸出解析度:4 百萬像素、16 百萬像素(vs 當前模型 1K×1K = 1 百萬像素)
  • 加速倍數:35 倍(10 分鐘 → 20 秒)
  • 潛在空間維度:保持不變(原始 1K 解析度的潛在空間大小)
  • 分塊策略:4K 圖像分為 16 塊 1K×1K 子圖片
  • 邊界處理:潛在空間中疊加區域注入更多噪聲,讓擴散模型自動協調邊界
  • 無需模型微調:基於任何現成 T2I 模型(如 Flux)
  • Inverfill 論文:
  • 反演速度:60 毫秒(將整張大圖反演為潛在空間噪聲)
  • 初始化:反演噪聲 + 遮罩內的新隨機噪聲
  • 邊界消除:同時使用兩種噪聲(反演 + 隨機)降低邊界瑕疵
  • 應用場景:物體移除、物體插入、場景修編
  • 視頻生成論文提及:
  • Van 加速:5 倍快速(公開開源模型)
  • 混合注意力(Hybrid Attention)
  • 注意力手術(Attention Surgery)

結論

結論

文本生成圖像的下一步前沿不在視覺逼真,而在於用智能目標函數、分層任務設計和潛在空間優化,讓 AI 系統從「能生成好看圖像」升級到「精確滿足使用者需求,且在裝置端高效運行」。

完整解析

詳細

文本生成圖像在過去一年進展顯著,視覺品質已相當逼真,但講者 Qualcomm 副總 Fatih Parikhli 指出,「好看」與「正確」是兩回事。當使用者要求生成多個人物時,模型常生成幾乎相同的臉孔;指定特定構圖、身份或人數時,模型會忽視這些細節;要求高分辨率時,記憶體和速度瞬間成為瓶頸。這些是影像生成的真正前沿——不是視覺逼真度,而是可控性、效率與可靠性。

在可控性方面,團隊首先發現現有 T2I 模型雖然像素級品質無瑕,但沒有明確學習到「創造真正不同身份」。既有訓練目標過度關注寫實性和提示匹配,卻忽略人物間的多樣性。DISCO 論文的洞察是:與其收集更多資料,不如改進訓練目標函數。團隊保留基礎模型,用強化學習微調,在獎勵函數中明確加入「圖像內多樣性」(同一圖內臉部應不同)和「跨生成一致性」(相同提示的多次生成應各異),以及正確人數計數。結果是獨特臉部準確率從低於 20% 躍升至 98-99%——只改變訓練目標,無需新架構。

更進一步,R2CAM 論文質疑「要求單一模型完成所有事」的根本假設。要生成多人場景,模型必須理解提示、決定人數、推理人物位置和互動、保留身份、最終渲染——這是人工藝術家也會分解的工作。論文將其分為兩階段:建築師模組生成場景構圖(純粹位置規劃),藝術家模組基於這些座標渲染高品質圖像。訓練時建築師和藝術家都用 GRPO 優化,推理時建築師一次生成座標(無學習過程),藝術家執行單次推理。這種分解不只改善身份保留,構圖本身也更自然——因為模型不必同時兼顧十個目標。

在效率方面,Pixel Rush 直接挑戰「如何在有限裝置記憶體上生成 16 百萬像素圖像」。關鍵洞察是在潛在空間而非像素空間工作。流程是:生成 1K 基礎圖像 → 用傳統超解析度放大到 4K → 分解為 16 個 1K 塊,各自編碼到潛在空間 → 在潛在空間做細化(不擴大空間維度,只注入語義引導噪聲) → 最後解碼。關鍵在邊界處理:相鄰塊的邊界區域注入更多噪聲,讓擴散模型有「自由度」在那些區域生成協調的細節,中心區域噪聲較少以保留內容。這樣既避免了潛在空間爆炸(無需按輸出解析度擴展),也避免了像素空間拼接的模糊——對比基線需 10 分鐘,此方法只要 20 秒,快 35 倍。

在修復品質方面,Inverfill 解決圖像編輯常見的邊界瑕疵。傳統方法在遮罩區域生成新內容時,背景完全凍結,導致邊界不協調。Inverfill 的創新是反演:先用去噪擴散的逆過程,將整張輸入圖像 60 毫秒內映射為圖像特定噪聲(與隨機噪聲不同),再在遮罩區域疊加新隨機噪聲。擴散時背景用反演噪聲初始化(保留原圖資訊),前景用反演 + 新隨機噪聲初始化(允許生成新內容),兩者在同一潛在空間層自然協調,消除邊界瑕疵。

整體而言,這些論文傳達的核心訊息是:改進 AI 生成的方式不只有建築革新,更多來自聰慧的訓練目標、任務分解、以及對模型內部表示(如潛在空間)的深入理解。Qualcomm 也正探索智能路由框架,根據輸入提示自動選擇專用模型或流程,這被視為最終解決方案——不是用單一萬能模型,而是根據需求動態編排多個特化工具。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。