KeyFrame內部研究專用

Codex's New Superpower Explained & More AI News You Can Use

The AI Advantage·6月26日週五·9 min英文

三句話摘要

AI 新聞篩選——大多發布無關緊要,只有少數功能真正改變工作方式。 不是所有新發布都值得關注;只有達到可靠度臨界點、真正改變工作流的功能才算成熟產品。 Codex 錄製功能達到實用臨界點。 過去類似功能(如 Claude 的 Chrome 擴充程式)在理論上很吸引人,但實際使用可靠性不足以信賴。Codex 這次版本在自動化工作流上表現顯著更好,讓使用者願意真正依賴它,而非只當玩具。

重點整理

重點
  • 1

    Codex 錄製功能達到實用臨界點。 過去類似功能(如 Claude 的 Chrome 擴充程式)在理論上很吸引人,但實際使用可靠性不足以信賴。Codex 這次版本在自動化工作流上表現顯著更好,讓使用者願意真正依賴它,而非只當玩具。

  • 2

    自動化程度仍需人工監督。 雖然可靠率達 8-9 成,但 AI 執行時仍會卡住、需要權限確認或做出錯誤決定。實況是用戶不再自己做整個工作,而是變成「人工監察者」,讓 AI 執行後驗證結果,可並行處理多個任務。

  • 3

    ChatGPT 的小更新著重便利性。 釘選聊天功能看似簡單,卻改善日常工作流;足球產品展示 AI 做入口化介面的價值——整合資訊、去除廣告、降低初學者門檻。

實用技巧與重點

乾貨
  • Codex Record and Replay:
  • 平台:Mac only(測試階段)
  • 訂閱費用:$20 以上方案
  • 錄製時限:30 分鐘
  • 功能:錄製螢幕操作 + 麥克風語音註解,生成可重複執行的「技能」
  • 可靠度:約 8-9 成,首次運行需測試多次
  • 實測案例:上傳影片到 YouTube → 轉換為草稿 → 移動檔案到歸檔資料夾(三步工作流)
  • 限制:AI 無法自我修正錯誤,會卡住需人工介入
  • ChatGPT 更新:
  • 釘選功能:可從菜單釘選聊天和項目,建立收藏清單
  • 足球產品:chatgpt.com/football,顯示賽程、積分榜、分組資訊
  • 行動裝置:圖片上傳速度提升
  • Claude Tags:
  • 狀態:測試中,可靠性低
  • 問題:上下文丟失、無法維持對話脈絡、返回無意義答案

結論

結論

不是所有新發布都值得關注;只有達到可靠度臨界點、真正改變工作流的功能才算成熟產品。

完整解析

詳細

本週 AI 領域發布眾多功能,但大多數不符合實際使用需求。節目主持人採取嚴格篩選標準——只推薦真正能改變工作方式的功能,而非單純「新穎聽起來棒」的東西。

Codex Record and Replay 是本週焦點。這個概念並非全新——Anthropic 的 Claude 和其他提供商早已推出類似功能,使用者可錄製操作讓 AI 學習並重複。然而,過去版本可靠性不足,實際運用效果不如預期。Codex 這次發布改變了這個局面。透過 Mac 桌面應用程式,使用者進入「Create」選單後選擇「Record Skill」,即可開始 30 分鐘的錄製。在此期間,系統同時記錄螢幕活動和麥克風輸入。使用者邊操作邊透過麥克風描述每一步驟,如同向同事解釋工作流程。之後,系統將聲音轉錄為文字,整合為「技能」——一個可隨時執行的自動化指令。實測案例為:從資料夾取出影片、上傳至 YouTube Studio、轉換為草稿、上傳完成後驗證檔名、移動原檔案到歸檔資料夾。整個錄製耗時約 10 分鐘,執行時只需輸入「/」加技能名稱。

然而,理想與現實存在差距。該功能可靠度約 8-9 成,首次執行會遇到權限確認、應用程式權限提示等障礙。重複運行幾次後方能穩定。即使如此,AI 仍無法像經驗豐富的人類一樣自我糾正——若發生錯誤(如複製無關螢幕截圖),系統會卡住等待人類指示。實際意義不在於「一次錄製,終身自動化」,而是將 10 分鐘的手動工作化為 2-3 分鐘的檢查監督工作,同時支援並行執行多個任務。與之相比,Claude 的類似功能仍未達到值得信賴的程度。

除此之外,ChatGPT 推出的釘選聊天功能雖細微卻實用——使用者可為常用聊天或專案建立快速存取清單。足球產品(chatgpt.com/football)則展示了 AI 整合資訊的價值:提供無廣告、結構清晰的賽程與積分榜,對足球新手特別友善。另一個失敗案例是 Claude Tags,該功能承諾可在任何對話中引入 Claude,但測試中頻繁丟失上下文,返回無關答案,目前尚不可靠。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。