KeyFrame內部研究專用

Let AI Handle Your Entire Workflow? ChatGPT’s Latest Super Useful Feature Tutorial! | VS MEDIA x ...

VS MEDIA Taiwan·8月9日週日·13 min中文

三句話摘要

ChatGPT 的 Record & Replay 功能如何讓 AI 學習並自動執行重複性任務。 Record & Replay 讓 AI 從被動的執行者升級為主動的流程學習者,只要設定清楚的邊界,就能自動化看似複雜的多步驟工作,減少重複性勞動。 技能自動化的核心:不只是錄屏,而是讓 AI 理解你的操作思路與流程邏輯。錄製越直接清楚(避免中斷或切換任務),AI 學習效果越好。

重點整理

重點
  • 1

    技能自動化的核心:不只是錄屏,而是讓 AI 理解你的操作思路與流程邏輯。錄製越直接清楚(避免中斷或切換任務),AI 學習效果越好。

  • 2

    跨平台操作能力:AI 可直接操作桌面應用、瀏覽器、Google 表格、Excel 等,甚至需要時會自己判斷用替代方案(如 Google Sheet 失效時改用瀏覽器輸入)。

  • 3

    邊界設定重要:在錄製時告訴 AI 哪些情況需停止並確認(驗證碼、敏感資料、確認訊息),可大幅提升自動化的可靠性與安全性。

  • 4

    對話優化技能:建立技能後可與 AI 溝通優化指令,如「之後直接完成訂票,只報告車次即可」,AI 會更新技能包的執行邏輯。

實用技巧與重點

乾貨
  • 功能安裝:ChatGPT 桌面版 → Work 模式 → 搜尋 Recorder Skill → 安裝
  • 錄製限制:最多 30 分鐘內容;避免操作中斷(接 Line、Facebook)
  • 建議做法:事先登入網站、直線式操作、設定明確的停止條件
  • 案例流程
  • 台鐵訂票:查詢時刻表 → 選票 → 填登入/信用卡驗證時停止
  • 發票整理:手機拍照 → AI 辨識 → Google 表格自動填入
  • 團購管理:LINE 群組收集訂單 → Excel 整理 → 自動計算總價
  • Excel 整合:需在增益集安裝 ChatGPT 應用程式(應用程式商店搜尋 OpenAI 官方)
  • 遠端協作:可配對手機與電腦版 GPT,由電腦遠端完成驗證與確認動作

結論

結論

Record & Replay 讓 AI 從被動的執行者升級為主動的流程學習者,只要設定清楚的邊界,就能自動化看似複雜的多步驟工作,減少重複性勞動。

完整解析

詳細

ChatGPT 的 Record & Replay 功能解決了 AI 難以理解複雜多步操作流程的問題。傳統上,用戶很難用文字描述「如何線上訂火車票」或「怎樣整理發票到試算表」,但這個功能讓 AI 直接透過觀察你的操作來學習。講者先從最基礎的安裝開始——在桌面版 ChatGPT 的 Work 模式下找到 Recorder Skill,按下安裝即可。

第一個示範是台鐵訂票。講者錄製了完整的訂票流程:選擇日期、出發地(桃園)、目的地(台北)、時間範圍,然後選擇票次。AI 從這次錄製中學到了邏輯,創建了一個名為「Book Taiwan Rail Tiki」的技能。隨後,講者叫 AI 直接訂票時,AI 在瀏覽器中自動操作,甚至在遇到 ReCAPTCHA 驗證時懂得停下來求助。這展示了 AI 不只是重複動作,而是理解了流程中的風險點。

第二個示範是發票整理。講者用手機拍攝高鐵票照片,請 AI 將金額、日期等資訊輸入到 Google 表格。AI 先嘗試直接調用 Google Sheet 的 API,失敗後自動改用瀏覽器方案,逐欄位填入資訊。這說明 AI 具備靈活的替代方案能力。當講者後來上傳兩張發票時,AI 更是分別辨識、逐一新增,沒有重複遺漏。

第三個示範涉及 LINE 群組的團購管理——這是最具挑戰性的場景。講者錄製了從群組訊息提取訂購人名、商品、金額,整理到既賬檔案的全流程。之後每當有新的團購時,只要指示 AI 使用這個技能,AI 就能自動監看 LINE、提取新訊息、更新 Excel。值得注意的是,講者先在 Excel 增益集中安裝了 ChatGPT 官方應用程式,確保 Excel 能與 ChatGPT 通訊。過程中 AI 甚至主動寫出 Excel 公式計算總價,展示了它不只會執行錄製的動作,也理解任務背後的邏輯。

整個過程的成功關鍵在於邊界設定。講者強調了在錄製時要告訴 AI 何時停止(如遇驗證、需要確認),避免 AI 自行決定敏感操作。同時,建立技能後可與 AI 對話微調指令,例如「之後別問那麼多,直接完成」,AI 會更新執行邏輯。這種互動的優化過程讓技能越來越精準。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。