KeyFrame內部研究專用

Demonstrate It Once, and AI Replicates the Workflow? My Hands-On Test of Codex Record & Replay

灵姐说AI | Ling Talk AI·6月21日週日·22 min中文

三句話摘要

OpenAI Codex推出的Record and Replay功能,讓用戶通過演示工作流程自動生成可重複使用的AI技能資產,代表了AI對白領工作內容的系統性抽象化能力。 OpenAI通過Record and Replay補全了從工作觀察到自動執行的完整閉環,在民主化自動化門檻的同時,大規模收集數位工作操作數據,加速企業知識轉化為AI資產的過程,這標誌著AI正在為從虛擬世界向實體世界的擴張做最後的準備。 工作自動化民主化的關鍵突破:過去需要編寫複雜提示詞才能驅動AI,現在普通人直接演示一遍操作流程就能生成Skill。這大幅降低了自動化的技術門檻,任何能完成的工作都能被記錄和複製,職員的工作經驗可直接沉澱為企業的可重用資產。

重點整理

重點
  • 1

    工作自動化民主化的關鍵突破:過去需要編寫複雜提示詞才能驅動AI,現在普通人直接演示一遍操作流程就能生成Skill。這大幅降低了自動化的技術門檻,任何能完成的工作都能被記錄和複製,職員的工作經驗可直接沉澱為企業的可重用資產。

  • 2

    AI取代的臨界點是100%而非90%:如果AI完成工作的90%但最後10%需要人工確認,這份工作仍保有高價值;但若100%被AI取代,工作就面臨消亡。Record and Replay通過觀察完整工作流程,逼近這條致命臨界線。

  • 3

    傳統GUI軟體正被削弱的信號:OpenAI明確建議用戶改用MCP和API接口而非圖形界面,因為API模式效率更高、更穩定。而Record and Replay正是在大規模收集這些GUI操作數據用於訓練,加速傳統軟體的邊緣化。

  • 4

    企業工作流從SOP文檔到AI Skill的轉變:未來企業的工作經驗將自動沉澱為Skill資產庫而非靜態文檔,由Agent執行、人類把關,形成全新的「SkillOps」工作模式,改變企業知識管理的本質。

實用技巧與重點

乾貨
  • 功能架構
  • 第一層Record:觀察記錄操作、窗口內容、交互過程
  • 第二層Skill Drafting:抽象為Skill,說明使用時機、輸入參數、執行步驟、驗證方法
  • 第三層Replay:用Skill作為可重用上下文,結合Computer Use和瀏覽器插件執行
  • 技術支援
  • 目前僅支持macOS用戶,Windows暫不支持
  • 啟動方式:Codex左側插件 → 搜索Record and Replay → 新對話框斜杠調用
  • 用戶規模與增長
  • OpenAI全球用戶10億+,Codex周活用戶500萬+且持續增長
  • 定價調整:100美元充值用戶額度從10倍降至5倍,剩餘額度全用於用戶拉新
  • 拉新機制:邀請好友可獲得數據重置次數,邀請越多重置越多
  • 官方建議
  • 能用MCP、API介面解決的問題盡量不要用GUI方式
  • GUI操作穩定性較差,批量操作效率低
  • 實測案例1:YouTube完整發佈流程
  • 任務內容:上傳視頻、標題、簡介、封面、字幕、播放列表、創收設置
  • 生成時間:約5分鐘
  • Skill命名:「Youtube studio folder upload」
  • 結果:基礎內容(視頻、標題、簡介、封面、字幕)100%完成,片尾畫面和播放列表選擇有遺漏
  • 實測案例2:剪映智慧剪口播
  • 任務:智能刪除重複表達、錯誤段落、停頓
  • 關鍵發現:AI自主發現並啟用了講者原工作流未使用的智能粗檢功能
  • 執行過程:自動導入→啟用智慧功能→時間線校準→迭代優化→匯出

結論

結論

OpenAI通過Record and Replay補全了從工作觀察到自動執行的完整閉環,在民主化自動化門檻的同時,大規模收集數位工作操作數據,加速企業知識轉化為AI資產的過程,這標誌著AI正在為從虛擬世界向實體世界的擴張做最後的準備。

完整解析

詳細

OpenAI在Codex上線的Record and Replay功能,代表著AI在白領工作自動化中的一次範式轉換。這個功能的核心創新在於打破了自動化對技術能力的依賴——過去只有懂編程或寫提示詞的人才能驅動AI完成工作,現在任何人通過一次完整的工作演示就能生成可復用的Skill資產。講者特別強調這感受到「後背發涼」,因為它暗示了OpenAI在下一步有多大的野心。

從技術實現看,Record and Replay包含三個層次的設計。首先是Record層,Codex觀察用戶的所有操作、窗口內容、交互路徑,整個過程越乾淨越好以減少噪音。其次是Skill Drafting層,AI在大約5分鐘的思考中,將捕獲的工作流程抽象為一份明確的Skill說明書,包括何時使用、需要哪些輸入參數、按什麼順序執行步驟、如何驗證結果。最後是Replay層,當新任務到來時,AI將該Skill作為可重用的上下文,配合Computer Use插件和瀏覽器操作能力,自動在新的環境和數據下執行相同邏輯的任務。講者在實測中演示了兩個典型場景:一是YouTube完整視頻發佈流程,涵蓋視頻、標題、簡介、封面、字幕、播放列表、創收設置等多個步驟,AI成功生成了「Youtube studio folder upload」Skill,重放時基礎內容完全正確;二是剪映智慧剪口播任務,AI不僅完成了口播視頻中重複表達和停頓的刪除,甚至自主發現並啟用了講者原工作流中未用過的智能粗檢功能進行優化。

這個功能的深層意義在於OpenAI正在系統地吃掉數字世界的操作數據。過去OpenAI的訓練數據來自文本、代碼和多模態內容,現在它通過每次用戶的Record過程,獲得了數百萬人與GUI軟體交互的第一手記錄。這種數據特別寶貴,因為Codex的周活用戶已超500萬且在指數級增長——OpenAI甚至通過激進的邀請碼拉新機制(充值額度從10倍降至5倍,剩餘額度全用於拉新)加速這個數據收集。每一次的操作記錄都代表著真實的、有商業價值、高頻重複的工作內容,這些數據會被用來訓練模型在更廣泛的場景中完成相似的任務。

更根本的是,這個功能揭示了AI取代工作的真正邊界——並非90%與100%的差別看起來不大,實質卻是生死之別。如果一份工作90%由AI完成但最後10%需要人工確認和決策,那這份工作仍然保有高價值且無法被徹底替代;但一旦100%被AI接管,這份工作就面臨消亡。Record and Replay通過觀察和記錄人類完整的工作流程,正在逼近這條致命的100%臨界線。與此同時,傳統的GUI軟體正在被削弱——OpenAI官方建議改用MCP和API接口而非圖形界面,因為API模式的效率更高、穩定性更好;但這也意味著GUI操作的數據越來越多地被用於訓練AI,最終加速這些傳統軟體的邊緣化。從企業視角,工作流程的沉澱方式也在轉變:過去企業用SOP文檔記錄工作流程,未來這些經驗將自動沉澱為Skill資產庫,由Agent執行、人類把關最後的結果。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。