Why Image Generation Needs More Than Bigger Models with Fatih Porikli - #773
三句話摘要
Qualcomm 在 CVPR 2024 發表的多項文本生成圖像研究,解決可控性、效率和品質的三大前沿挑戰。 文本生成圖像的下一步前沿不在視覺逼真,而在於用智能目標函數、分層任務設計和潛在空間優化,讓 AI 系統從「能生成好看圖像」升級到「精確滿足使用者需求,且在裝置端高效運行」。 單一模型做太多事是瓶頸:要求一個模型同時決定人數、位置、身份、互動關係、姿態、渲染,過載了。解決辦法是分解任務或用智能路由器選擇專用模型。
重點整理
重點- 1
單一模型做太多事是瓶頸:要求一個模型同時決定人數、位置、身份、互動關係、姿態、渲染,過載了。解決辦法是分解任務或用智能路由器選擇專用模型。
- 2
訓練目標函數比架構更關鍵:DISCO 的創新不在模型本身,而在明確加入「圖像內多樣性」和「跨生成一致性」的獎勵函數,配合課程學習(curriculum learning)讓學習穩定高效。
- 3
分層處理優於暴力擴展:Pixel Rush 沒有擴大潛在空間(會爆炸記憶體),而是分塊處理,用語義引導噪聲注入在邊界實現無瑕疵拼接——在潛在空間而非像素空間處理邊界,避免模糊。
- 4
影像反演銜接現實與生成:Inverfill 用反向去噪將實際圖像映射為圖像特定噪聲,在修復區域添加新的隨機噪聲,讓背景和前景在潛在空間同一層自然協調,消除修復邊界的典型瑕疵。
實用技巧與重點
乾貨- DISCO 論文:
- 獎勵函數包含:圖像內多樣性(intra-image diversity)、跨生成多樣性(inter-run diversity)、正確人數
- 評估基準:「Diverse Humans」benchmark
- 效果:獨特臉部準確率(Unique Face Accuracy)提升 10-20 百分點;DISCO 達 98-99%
- 訓練方法:GRPO(Group Predictive Policy Optimization)強化學習 + 課程學習
- 資料需求:無需大量真實資料,用合成臉部可自動化訓練
- R2CAM 論文:
- 架構(Architect)階段輸出:臉部位置的三維座標(XY 點)
- 藝術家(Artist)階段:接收座標點,執行單次推理(迭代式擴散內部進行)
- 獎勵函數:構圖對齊、身份保留、姿態一致性、人物計數、人物感知評分
- 訓練用臉部:支援真實臉部或自動生成的合成臉部
- 推理流程:離線訓練 GRPO → 推理時逐句提示 + 提供臉部 → 建築師生成位置 → 藝術家渲染
- Pixel Rush 論文:
- 輸出解析度:4 百萬像素、16 百萬像素(vs 當前模型 1K×1K = 1 百萬像素)
- 加速倍數:35 倍(10 分鐘 → 20 秒)
- 潛在空間維度:保持不變(原始 1K 解析度的潛在空間大小)
- 分塊策略:4K 圖像分為 16 塊 1K×1K 子圖片
- 邊界處理:潛在空間中疊加區域注入更多噪聲,讓擴散模型自動協調邊界
- 無需模型微調:基於任何現成 T2I 模型(如 Flux)
- Inverfill 論文:
- 反演速度:60 毫秒(將整張大圖反演為潛在空間噪聲)
- 初始化:反演噪聲 + 遮罩內的新隨機噪聲
- 邊界消除:同時使用兩種噪聲(反演 + 隨機)降低邊界瑕疵
- 應用場景:物體移除、物體插入、場景修編
- 視頻生成論文提及:
- Van 加速:5 倍快速(公開開源模型)
- 混合注意力(Hybrid Attention)
- 注意力手術(Attention Surgery)
結論
結論“文本生成圖像的下一步前沿不在視覺逼真,而在於用智能目標函數、分層任務設計和潛在空間優化,讓 AI 系統從「能生成好看圖像」升級到「精確滿足使用者需求,且在裝置端高效運行」。”
完整解析
詳細文本生成圖像在過去一年進展顯著,視覺品質已相當逼真,但講者 Qualcomm 副總 Fatih Parikhli 指出,「好看」與「正確」是兩回事。當使用者要求生成多個人物時,模型常生成幾乎相同的臉孔;指定特定構圖、身份或人數時,模型會忽視這些細節;要求高分辨率時,記憶體和速度瞬間成為瓶頸。這些是影像生成的真正前沿——不是視覺逼真度,而是可控性、效率與可靠性。
在可控性方面,團隊首先發現現有 T2I 模型雖然像素級品質無瑕,但沒有明確學習到「創造真正不同身份」。既有訓練目標過度關注寫實性和提示匹配,卻忽略人物間的多樣性。DISCO 論文的洞察是:與其收集更多資料,不如改進訓練目標函數。團隊保留基礎模型,用強化學習微調,在獎勵函數中明確加入「圖像內多樣性」(同一圖內臉部應不同)和「跨生成一致性」(相同提示的多次生成應各異),以及正確人數計數。結果是獨特臉部準確率從低於 20% 躍升至 98-99%——只改變訓練目標,無需新架構。
更進一步,R2CAM 論文質疑「要求單一模型完成所有事」的根本假設。要生成多人場景,模型必須理解提示、決定人數、推理人物位置和互動、保留身份、最終渲染——這是人工藝術家也會分解的工作。論文將其分為兩階段:建築師模組生成場景構圖(純粹位置規劃),藝術家模組基於這些座標渲染高品質圖像。訓練時建築師和藝術家都用 GRPO 優化,推理時建築師一次生成座標(無學習過程),藝術家執行單次推理。這種分解不只改善身份保留,構圖本身也更自然——因為模型不必同時兼顧十個目標。
在效率方面,Pixel Rush 直接挑戰「如何在有限裝置記憶體上生成 16 百萬像素圖像」。關鍵洞察是在潛在空間而非像素空間工作。流程是:生成 1K 基礎圖像 → 用傳統超解析度放大到 4K → 分解為 16 個 1K 塊,各自編碼到潛在空間 → 在潛在空間做細化(不擴大空間維度,只注入語義引導噪聲) → 最後解碼。關鍵在邊界處理:相鄰塊的邊界區域注入更多噪聲,讓擴散模型有「自由度」在那些區域生成協調的細節,中心區域噪聲較少以保留內容。這樣既避免了潛在空間爆炸(無需按輸出解析度擴展),也避免了像素空間拼接的模糊——對比基線需 10 分鐘,此方法只要 20 秒,快 35 倍。
在修復品質方面,Inverfill 解決圖像編輯常見的邊界瑕疵。傳統方法在遮罩區域生成新內容時,背景完全凍結,導致邊界不協調。Inverfill 的創新是反演:先用去噪擴散的逆過程,將整張輸入圖像 60 毫秒內映射為圖像特定噪聲(與隨機噪聲不同),再在遮罩區域疊加新隨機噪聲。擴散時背景用反演噪聲初始化(保留原圖資訊),前景用反演 + 新隨機噪聲初始化(允許生成新內容),兩者在同一潛在空間層自然協調,消除邊界瑕疵。
整體而言,這些論文傳達的核心訊息是:改進 AI 生成的方式不只有建築革新,更多來自聰慧的訓練目標、任務分解、以及對模型內部表示(如潛在空間)的深入理解。Qualcomm 也正探索智能路由框架,根據輸入提示自動選擇專用模型或流程,這被視為最終解決方案——不是用單一萬能模型,而是根據需求動態編排多個特化工具。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


