KeyFrame內部研究專用

HTML Is All Agents Need — James Russo, HeyGen

AI Engineer·7月21日週二·15 min英文

三句話摘要

HeyGen 推出 Hyperframes 框架,用 HTML/CSS/JavaScript 作為 LLM 原生語言生成完整高質量影片。 HTML 是 LLM 的原生語言,Hyperframes 證明了將其作為影片生成中間格式,可讓 AI 代理輕鬆建立完整產品釋出影片,解決從開發到釋出的最後一公里問題。 HTML 作為 LLM 母語的核心價值:LLM 大部分訓練資料都是網頁(HTML/CSS/JavaScript),讓其用母語交流比強行學習自定義 DSL 獲得更好結果。就像與其讓莎士比亞用中文寫詩,不如讓他用英文——這樣才能發揮最佳創意。

重點整理

重點
  • 1

    HTML 作為 LLM 母語的核心價值:LLM 大部分訓練資料都是網頁(HTML/CSS/JavaScript),讓其用母語交流比強行學習自定義 DSL 獲得更好結果。就像與其讓莎士比亞用中文寫詩,不如讓他用英文——這樣才能發揮最佳創意。

  • 2

    解決瀏覽器非同步與影片確定性的矛盾:瀏覽器允許資源非同步載入,但影片需每一幀都 100% 確定內容。Hyperframes 透過"凍結時鐘逐幀搜尋"確保所有資源載入完畢才截圖,保證輸出一致性。

  • 3

    技能設計聚焦品味而非語法:既然 LLM 已懂 HTML/CSS/JavaScript,技能重點是教 AI 如何製作好影片(敘事、視覺、動畫原則),而非程式碼語言本身,這直接提升輸出質量。

  • 4

    專業創意控制權完全保留:Hyperframes Studio 支援關鍵幀編輯、逐幀調整等功能,使用者可像在 After Effects 中一樣工作,創意控制權永不交給 AI。

實用技巧與重點

乾貨
  • 執行規模(90 天):1,300,000 影片渲染 | 267,000 創作者 | 15,000 影片/天 | 32,000 GitHub 星標
  • 支援渲染元素:Three.js、圖表、SVG、著色器、WebGL、WebGPU、Lottie 動畫及所有瀏覽器可渲染內容
  • 相容工具:Cloud Code、Codex、Cursor 及所有支援 HTML/CSS/JavaScript 的程式碼代理
  • 架構特點:最小化包裝(純 HTML + 資料屬性)| 凍結時鐘逐幀搜尋渲染 | 瀏覽器預覽 = 最終影片
  • 訪問方式:GitHub 開源倉庫 | 永久免費 | 支援關鍵幀編輯
  • 聯絡方式:Twitter @Reems_Juso

結論

結論

HTML 是 LLM 的原生語言,Hyperframes 證明了將其作為影片生成中間格式,可讓 AI 代理輕鬆建立完整產品釋出影片,解決從開發到釋出的最後一公里問題。

完整解析

詳細

HeyGen 的使命是透過影片解決溝通問題。雖然團隊先打造了市面上最好的 AI 虛擬形象,但講者意識到好影片遠不止虛擬形象加旁白。優質影片需要 A 卷素材(虛擬人物)、B 卷素材(背景影象和媒體)、動畫、字幕、音樂等多重元素配合。為讓 AI 代理能自動生成這些完整影片,團隊需要找到最優的中間表示格式。

經過一年多的探索,團隊嘗試過多種方案。After Effects 和 Premiere Pro 是行業金標準,但輸出雖好、對代理不友好。Lottie 和 Rive 用 JSON 或自定義 XML,能產生不錯的輸出但不是代理母語,可控性受限。Remotion 是優秀範例,但必須先教 LLM 這個框架,這扼殺了大量創造力。轉折點出現在去年 11 月 Gemini 3 釋出時——當展示 HTML 輸出示例後,LLM 自然而然傾向於生成 HTML/CSS/JavaScript,質量明顯更好。

這背後的原因很簡單:HTML/CSS/JavaScript 是 LLM 的原生語言。LLM 訓練資料中絕大多數都是網頁內容,這就是它們的母語。強行讓模型學習新的領域特定語言(DSL)無異於讓莎士比亞用日文或中文寫詩——即使給再多例子、再多教學,也得不到最好成果。與其對抗這種模式,不如讓 LLM 用母語交流。

團隊從 Gemini 3 Flash 這樣的小模型開始實驗,驗證如果小模型能用框架寫執行程式碼,大模型和程式碼代理也完全可以。經過多次嘗試不同的包裝方式,最終發現勝者是最輕薄的方案——純 HTML 加一些資料屬性作為後設資料。這個簡單設計驗證了關鍵洞察:隨著模型改進和訓練資料增加,它們對 HTML 的理解會自然深化。

然而,從 HTML 到確定性 MP4 影片並非易事。瀏覽器設計本質是非同步的——允許字型、圖片、影片等資源動態載入,頁面載入時內容可能變化。但影片需要每一幀都 100% 確定所有內容已載入、已準備就緒。Hyperframes 的創新解決方案是"凍結時鐘並逐幀搜尋"。具體做法是凍結瀏覽器的時鐘,對每一個時間點/幀確定性地等待,確保頁面所有內容載入完畢,然後截圖繼續下一幀,反覆操作直至獲取完整影片素材。結果是瀏覽器預覽的畫素最終就是影片中看到的畫素。

Hyperframes 的強大之處在於,任何瀏覽器能渲染的東西——Three.js 3D 效果、各類圖表、SVG、著色器、WebGL、WebGPU、Lottie 動畫等——現在都可出現在影片中。這極大擴充套件了創意可能。技能設計上,因為 LLM 已懂 HTML/CSS/JavaScript,HeyGen 的技能不再教程式碼語言本身,而專注於教 AI 如何製作好影片——品味、視覺原則、故事敘述、動畫邏輯。這與其他框架形成鮮明對比,其他框架的技能往往是"如何在該框架中寫程式碼"。

為保證高質量輸出,團隊持續用代理評估和迭代改進模型能力。Hyperframes Studio 支援專業動畫功能如關鍵幀編輯,允許使用者逐幀或逐關鍵幀調整所有動作,做到專業動畫師在 After Effects 中能做的一切。製作流程遵循傳統影視工作:思考敘事方式、願景使命,逐幀繪製故事板,逐幀用 HTML/CSS/JavaScript 新增動態效果,最後在 Studio 進行專業剪輯調整。這確保使用者始終擁有完全創意控制權。

自今年初發布以來,Hyperframes 已實現規模化執行。過去 90 天內,開源使用者渲染超過 130 萬個影片,267,000 位創作者嘗試使用,每天約 15,000 個影片,GitHub 獲得 32,000 星標。這是開源永久免費的框架,相容任何支援 HTML/CSS/JavaScript 編寫的程式碼代理——包括 Cloud Code、Codex、Cursor 等。講者坦誠這些模型在創意工作上仍有進步空間,團隊正推動程式碼到影片基準測試,與 LLM 實驗室和創意工作者合作,共同提升影片生成質量。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。