KeyFrame內部研究專用

NVIDIA's AI Learns Why Copying Humans Isn't Enough

Two Minute Papers·8月2日週日·6 min英文

三句話摘要

教 AI 虛擬人物既能精確複製人類跑酷動作,又能靈活應對未見過的障礙物。 用極少的人類示範數據,透過雙路徑學習和對抗訓練,成功讓 AI 既能像人一樣優雅地移動,又能像真正的運動員一樣靈活適應新情況。 數據極少卻有效:只用 30 秒網路跑酷視頻就能訓練,打破了需要大量數據的迷思,這在深度學習領域是反直覺的成就。

重點整理

重點
  • 1

    數據極少卻有效:只用 30 秒網路跑酷視頻就能訓練,打破了需要大量數據的迷思,這在深度學習領域是反直覺的成就。

  • 2

    雙課堂架構解決矛盾:同一個 AI 在兩個課堂同時學習——一個教它模仿人類動作(優雅但死板),一個教它解決新關卡(靈活但可能不自然),兩個目標互相制約與補充。

  • 3

    判別器機制是核心:訓練一個「裁判」來分辨真實人類動作 vs AI 生成動作,AI 試圖欺騙裁判同時保持通關能力,這個對抗過程迫使 AI 既自然又有效。

  • 4

    現實權衡:相比前代技術追蹤誤差更低,但長關卡成功率約 40%,且可能出現不自然的恢復動作,這是實用化的代價。

實用技巧與重點

乾貨
  • 訓練數據:19 個視頻片段,30 秒的跑酷內容
  • 方法名稱:雙課堂學習 + 判別器訓練
  • 輸入信息:角色身體狀態、障礙物配置、目標位置
  • 量化結果:長關卡成功率約 40%;相比前代技術有更低的追蹤誤差
  • 前代技術問題:無法完成關卡,動作僵硬或作弊規避障礙
  • 資源:論文免費公開,可能稍後開源代碼
  • 工具提及:Lambda GPU 服務用於複現研究論文

結論

結論

用極少的人類示範數據,透過雙路徑學習和對抗訓練,成功讓 AI 既能像人一樣優雅地移動,又能像真正的運動員一樣靈活適應新情況。

完整解析

詳細

教虛擬人物執行跑酷是一個經典難題:你可以讓 AI 完美複製人類視頻中的每個動作,但它會被困在那些動作裡,遇到新的障礙配置就無能為力;反過來,如果讓 AI 學會解決問題,它往往會做出不自然的動作,甚至用作弊的方式規避障礙。這篇論文提出的方案是:何不兩者兼得?

研究團隊用一個巧妙的雙課堂架構來解決這個矛盾。第一個課堂裡,AI 學習模仿人類的跑酷動作。訓練數據出奇地少——只有 19 個視頻片段、共 30 秒的內容,卻能產生流暢、自然的人類動作。但這種模仿是有天花板的,AI 無法超越訓練數據中沒有的動作。第二個課堂裡,AI 同時學習如何通過各種障礙物課關。這時關鍵來了:同一個 AI 控制器在兩個課堂裡同時學習,它既要產出像人類一樣的動作,又要有能力完成新關卡。

這個想法背後有個精巧的數學結構。研究者訓練了一個「判別器」(類似評審),讓它學會分辨真實的人類動作和 AI 生成的動作。然後用這個判別器來訓練 AI。如果 AI 的動作看起來很人工、很生硬,判別器就會給它打低分;但當 AI 的動作既自然又能適應障礙時,判別器就給予獎勵。AI 試著去欺騙判別器,判別器則變得更精銳,雙方互相進化。最後還有一個穩定項,防止細微的動作變化導致判別結果完全改變。

結果令人印象深刻。在影片中,AI 虛擬人物在各種關卡上表現得像忍者一樣靈活,不只是通過設計好的關卡,連面對未見過的障礙配置也能流暢地適應。但這不是完美的解決方案,長關卡的成功率約 40%,有時也會出現不自然的恢復動作,這是技術權衡的結果。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。