KeyFrame內部研究專用

Building Closed-Loop Evals for a Multimodal Agent at Scale — Soumya Gupta & Jai Chopra, Uber

AI Engineer·7月24日週五·21 min英文

三句話摘要

Uber Eats 如何用多代理編排系統自動改進用戶上傳的食物照片,在保持真實性和消費者信任的前提下,大規模提升平台視覺內容品質。 離線黃金資料集確保方向一致性,在線自動漂移檢測驅動持續自調優,這是讓 AI 系統在大規模生產中既保持品質又保持真實性的關鍵。 真實性與品質改進的張力:消費者既需要高品質照片又排斥AI生成感。系統設計在忠實原貌與選擇性改進之間找平衡,避免過度編輯導致失真(如產生幻覺添加菜品)或無謂計算成本(為已高品質圖進行不必要增強)。

重點整理

重點
  • 1

    真實性與品質改進的張力:消費者既需要高品質照片又排斥AI生成感。系統設計在忠實原貌與選擇性改進之間找平衡,避免過度編輯導致失真(如產生幻覺添加菜品)或無謂計算成本(為已高品質圖進行不必要增強)。

  • 2

    多代理編排的可評估架構:圖像理解→路由決策→有選擇增強→迴圈自糾→多層質檢→發佈,每步都生成結構化輸出用於診斷。路由器基於多模態輸入決定增強或跳過,圖像編輯代理接收質檢反饋自動迭代,最終通過發佈就緒品質保證(瑞士起司模型多層檢查)。

  • 3

    離線黃金資料集驅動一致性:人工標註員按客觀指南標註代表性樣本(涵蓋不同切法、地理、菜系、圖像品質),消除主觀偏見。所有模型版本都必須對標這套黃金資料集進行基準測試,確保方向不偏。

  • 4

    配置驅動的自動漂移修復:定期採樣生產資料再次人工標註,診斷代理發現不匹配時自動定位問題、觸發調優管道(反思代理找根因→合成代理更新配置)。新配置通過黃金資料集測試即直接推送生產,整個過程無人工干預。

實用技巧與重點

乾貨
  • 業務規模
  • Uber Eats 年交易額:900 億美元
  • 年成長率:20%
  • 月均新增商品:數百萬件
  • 業務覆蓋:全球 10,000 個城市
  • 系統目標
  • 保持真實性和信任 / 選擇性品質提升 / 全球市場優化(避免割裂商家市場佔有率) / 安全運輸 / 持續學習 / 經濟高效大規模運作
  • 核心架構與流程
  • 圖像理解與路由代理:多模態描述 → 結構化輸出 → 及格/不及格評分 → 決策增強或跳過
  • 圖像編輯代理(可迴圈):接收質檢回饋 → 自我糾正 → 多次失敗則放棄發佈
  • 後處理與發佈就緒品質保證:政策檢查 + 額外品質檢查(瑞士起司模型)
  • 評估指標
  • 路由器:精確率、召回率、混淆矩陣(2×2 或 n×n 依複雜度);護欄指標為召回率(不允許低品質圖洩漏)
  • 圖像編輯:K 次迭代通過率、成對比較(輸入 vs 輸出是否更好)
  • 市場監控:轉換率(加購、完成訂單)、按地理位置/設備類型/天線類型分段分析
  • 質檢維度
  • 忠誠度(原貌一致) / 完整性(所有元素未缺失) / 自然性(非過度編輯) / 真實性(物理合理)/ 擺盤 / 顏色 / 保真度
  • 故障案例
  • 高品質清晰圖被誤判為低品質→增加成本無益
  • 產生幻覺添加菜品項目不符菜單描述
  • 編輯過度(過於創意或過於保守)
  • 增強過程中遮擋關鍵元素(醬汁被盤子擋住)
  • 無法確認具體數量無法確定(如8個餛飩實則無法驗證)
  • 黃金資料集構成
  • 不同切法 / 不同地理位置 / 不同菜餚類型 / 不同圖像品質類型;人工標註指南須客觀以消除偏見
  • 自動調優管道
  • 反思代理(reflect agent):審視不匹配項 → 過濾噪聲 → 尋找系統性問題 → 產生反饋
  • 合成代理(compose agent):接收回饋 + 代理配置 → 生成新配置 → 基準測試 → 通過則註冊新版本
  • 反饋迴路
  • 內部狗狗餵食(用戶點贊/點踩、自由形式回饋) / 商家反饋 / 設計團隊回饋 / 產品團隊回饋 → 診斷器(高層抽象)識別需優化的代理 → 觸發調優
  • 診斷器模式
  • 收集多個反饋迴路 → 反映整體系統狀態 → 引導特定代理專門修復 → 可能涉及單個或多個代理

結論

結論

離線黃金資料集確保方向一致性,在線自動漂移檢測驅動持續自調優,這是讓 AI 系統在大規模生產中既保持品質又保持真實性的關鍵。

完整解析

詳細

Uber Eats 面臨的核心挑戰是照片品質與消費者信任間的矛盾。年交易額達 900 億美元、全球覆蓋 10,000 個城市、月均新增數百萬商品的規模下,視覺內容對用戶體驗至關重要——一張好照片直接影響用戶的點擊與購買轉化。但小商家因缺乏時間、專業知識和資金限制而無法提供高品質照片,尤其當菜單頻繁變化時問題更嚴重。更複雜的是,消費者既想要真實照片反映實際食物,卻對 AI 生成圖片天然排斥。這種「穿針引線」的難題要求系統既保持原貌忠誠度,又要有選擇性地改進品質,同時避免市場同質化與跨商家競爭割裂。

為解決此問題,Uber 建構了多代理編排系統。首先是圖像理解與路由代理,用多模態 LLM 描述照片內容、生成結構化輸出,路由器據此及格/不及格標準決定是否需要增強或直接發佈原圖。若需增強,進入圖像編輯代理環節——這裡可循環運行,編輯代理接收質檢反饋自我糾正,多次失敗則放棄發佈。最後通過發佈就緒品質保證(採瑞士起司模型設計,多層檢查確保最低故障率)。整個過程的關鍵是日誌記錄——所有代理輸出被扁平化至 JSON,使任何人都能診斷具體案例並匯總分析。

系統真正創新在於自動漂移檢測與閉環自調優。首先建立黃金資料集:團隊收集代表性樣本(涵蓋不同切法、地理、菜系、圖像品質),交由人工標註員按客觀指南標註。模型訓練後與黃金資料集對標。上線後定期採樣生產數據並再次人工標註,將代理輸出與標註者答案比較。發現不匹配時,診斷代理自動定位問題根源並觸發自動調優管道——反思代理找出系統性問題,合成代理基於反饋更新配置。若新代理在黃金資料集上通過基準測試即直接推送生產,無需人工干預。

系統內建多維質檢與反饋迴路。圖像編輯包括三步:生成編輯指令、執行增強、多維質檢(評估忠誠度、完整性、自然性、真實性等),質檢未過即迴圈重新編輯。常見故障如誤判高品質圖、產生幻覺添加菜品、過度編輯、遮擋關鍵元素。除了模型循環,系統還收集內部狗狗餵食反饋(用戶點贊/點踩、商家意見)、設計與產品團隊反饋,通過診斷器協調多反饋迴路持續引導代理調整。市場監控則追蹤轉換率、按地理/設備等多維分段分析,確保優化在全市場均衡推進。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。