Building Closed-Loop Evals for a Multimodal Agent at Scale — Soumya Gupta & Jai Chopra, Uber
三句話摘要
Uber Eats 如何用多代理編排系統自動改進用戶上傳的食物照片,在保持真實性和消費者信任的前提下,大規模提升平台視覺內容品質。 離線黃金資料集確保方向一致性,在線自動漂移檢測驅動持續自調優,這是讓 AI 系統在大規模生產中既保持品質又保持真實性的關鍵。 真實性與品質改進的張力:消費者既需要高品質照片又排斥AI生成感。系統設計在忠實原貌與選擇性改進之間找平衡,避免過度編輯導致失真(如產生幻覺添加菜品)或無謂計算成本(為已高品質圖進行不必要增強)。
重點整理
重點- 1
真實性與品質改進的張力:消費者既需要高品質照片又排斥AI生成感。系統設計在忠實原貌與選擇性改進之間找平衡,避免過度編輯導致失真(如產生幻覺添加菜品)或無謂計算成本(為已高品質圖進行不必要增強)。
- 2
多代理編排的可評估架構:圖像理解→路由決策→有選擇增強→迴圈自糾→多層質檢→發佈,每步都生成結構化輸出用於診斷。路由器基於多模態輸入決定增強或跳過,圖像編輯代理接收質檢反饋自動迭代,最終通過發佈就緒品質保證(瑞士起司模型多層檢查)。
- 3
離線黃金資料集驅動一致性:人工標註員按客觀指南標註代表性樣本(涵蓋不同切法、地理、菜系、圖像品質),消除主觀偏見。所有模型版本都必須對標這套黃金資料集進行基準測試,確保方向不偏。
- 4
配置驅動的自動漂移修復:定期採樣生產資料再次人工標註,診斷代理發現不匹配時自動定位問題、觸發調優管道(反思代理找根因→合成代理更新配置)。新配置通過黃金資料集測試即直接推送生產,整個過程無人工干預。
實用技巧與重點
乾貨- 業務規模
- Uber Eats 年交易額:900 億美元
- 年成長率:20%
- 月均新增商品:數百萬件
- 業務覆蓋:全球 10,000 個城市
- 系統目標
- 保持真實性和信任 / 選擇性品質提升 / 全球市場優化(避免割裂商家市場佔有率) / 安全運輸 / 持續學習 / 經濟高效大規模運作
- 核心架構與流程
- 圖像理解與路由代理:多模態描述 → 結構化輸出 → 及格/不及格評分 → 決策增強或跳過
- 圖像編輯代理(可迴圈):接收質檢回饋 → 自我糾正 → 多次失敗則放棄發佈
- 後處理與發佈就緒品質保證:政策檢查 + 額外品質檢查(瑞士起司模型)
- 評估指標
- 路由器:精確率、召回率、混淆矩陣(2×2 或 n×n 依複雜度);護欄指標為召回率(不允許低品質圖洩漏)
- 圖像編輯:K 次迭代通過率、成對比較(輸入 vs 輸出是否更好)
- 市場監控:轉換率(加購、完成訂單)、按地理位置/設備類型/天線類型分段分析
- 質檢維度
- 忠誠度(原貌一致) / 完整性(所有元素未缺失) / 自然性(非過度編輯) / 真實性(物理合理)/ 擺盤 / 顏色 / 保真度
- 故障案例
- 高品質清晰圖被誤判為低品質→增加成本無益
- 產生幻覺添加菜品項目不符菜單描述
- 編輯過度(過於創意或過於保守)
- 增強過程中遮擋關鍵元素(醬汁被盤子擋住)
- 無法確認具體數量無法確定(如8個餛飩實則無法驗證)
- 黃金資料集構成
- 不同切法 / 不同地理位置 / 不同菜餚類型 / 不同圖像品質類型;人工標註指南須客觀以消除偏見
- 自動調優管道
- 反思代理(reflect agent):審視不匹配項 → 過濾噪聲 → 尋找系統性問題 → 產生反饋
- 合成代理(compose agent):接收回饋 + 代理配置 → 生成新配置 → 基準測試 → 通過則註冊新版本
- 反饋迴路
- 內部狗狗餵食(用戶點贊/點踩、自由形式回饋) / 商家反饋 / 設計團隊回饋 / 產品團隊回饋 → 診斷器(高層抽象)識別需優化的代理 → 觸發調優
- 診斷器模式
- 收集多個反饋迴路 → 反映整體系統狀態 → 引導特定代理專門修復 → 可能涉及單個或多個代理
結論
結論“離線黃金資料集確保方向一致性,在線自動漂移檢測驅動持續自調優,這是讓 AI 系統在大規模生產中既保持品質又保持真實性的關鍵。”
完整解析
詳細Uber Eats 面臨的核心挑戰是照片品質與消費者信任間的矛盾。年交易額達 900 億美元、全球覆蓋 10,000 個城市、月均新增數百萬商品的規模下,視覺內容對用戶體驗至關重要——一張好照片直接影響用戶的點擊與購買轉化。但小商家因缺乏時間、專業知識和資金限制而無法提供高品質照片,尤其當菜單頻繁變化時問題更嚴重。更複雜的是,消費者既想要真實照片反映實際食物,卻對 AI 生成圖片天然排斥。這種「穿針引線」的難題要求系統既保持原貌忠誠度,又要有選擇性地改進品質,同時避免市場同質化與跨商家競爭割裂。
為解決此問題,Uber 建構了多代理編排系統。首先是圖像理解與路由代理,用多模態 LLM 描述照片內容、生成結構化輸出,路由器據此及格/不及格標準決定是否需要增強或直接發佈原圖。若需增強,進入圖像編輯代理環節——這裡可循環運行,編輯代理接收質檢反饋自我糾正,多次失敗則放棄發佈。最後通過發佈就緒品質保證(採瑞士起司模型設計,多層檢查確保最低故障率)。整個過程的關鍵是日誌記錄——所有代理輸出被扁平化至 JSON,使任何人都能診斷具體案例並匯總分析。
系統真正創新在於自動漂移檢測與閉環自調優。首先建立黃金資料集:團隊收集代表性樣本(涵蓋不同切法、地理、菜系、圖像品質),交由人工標註員按客觀指南標註。模型訓練後與黃金資料集對標。上線後定期採樣生產數據並再次人工標註,將代理輸出與標註者答案比較。發現不匹配時,診斷代理自動定位問題根源並觸發自動調優管道——反思代理找出系統性問題,合成代理基於反饋更新配置。若新代理在黃金資料集上通過基準測試即直接推送生產,無需人工干預。
系統內建多維質檢與反饋迴路。圖像編輯包括三步:生成編輯指令、執行增強、多維質檢(評估忠誠度、完整性、自然性、真實性等),質檢未過即迴圈重新編輯。常見故障如誤判高品質圖、產生幻覺添加菜品、過度編輯、遮擋關鍵元素。除了模型循環,系統還收集內部狗狗餵食反饋(用戶點贊/點踩、商家意見)、設計與產品團隊反饋,通過診斷器協調多反饋迴路持續引導代理調整。市場監控則追蹤轉換率、按地理/設備等多維分段分析,確保優化在全市場均衡推進。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


