KeyFrame內部研究專用

Full Workshop: Setting Yourself Up for Success —Jason Liu, OpenAI Codex

AI Engineer·7月24日週五·75 min英文

三句話摘要

OpenAI工程師分享如何用Claude Code(Codex)應用構建AI增強的個人工作系統,透過執行緒管理、自動化、外掛和計算機控制來處理200+並行專案。 透過壓縮、語音、引腳執行緒、自動化和計算機控制的組合,可以把AI助手從工具升級為真實的工作隊友,最終實現從個人生產力到團隊增強的飛躍。 --- ## 補充說明 如何立即開始 1. 下載Claude Code應用 2. Clone講者的模板:`jxnl/personal-monorepo-template` 3. 開啟專案,用App shots指令"幫我設定這個" 4. 建立第一個引腳執行緒,命名為"Chief of Staff",新增簡單提示:"每天9 a.m.檢查我的日程、郵件、Slack,告訴我最重要的三件事" 5. 啟用心跳自動化:`keep an eye on this daily` 6. 嘗試用語音輸入替代鍵盤 常見陷阱 - X high reasoning不一定更好——低/中等推理對日常工作足夠,還能省token - 不要讓模型過於謹慎——加上"Auto Review"許可權,讓AI主動承擔風險 - 記憶系統需要幾周才能自我最佳化,不要期望第一天就完美 - 在Agent.md中明確限制——如"不修改生產程式碼",防止意外破壞 壓縮(Compaction)是基礎 — 過去認為長執行緒會衰退,現在單條執行緒可執行5周、容納400個子代理,關鍵是壓縮讓模型能持續理解上下文。這打破了"20條訊息後新開執行緒"的舊規則。

重點整理

重點
  • 1

    壓縮(Compaction)是基礎 — 過去認為長執行緒會衰退,現在單條執行緒可執行5周、容納400個子代理,關鍵是壓縮讓模型能持續理解上下文。這打破了"20條訊息後新開執行緒"的舊規則。

  • 2

    語音輸入是生產力乘數 — 講者用腳踏板控制錄音,每天用15分鐘語音備忘替代文字。AI會自動讀取會議記錄、郵件來理解模糊的語音指令,效率比鍵盤輸入快3倍,工程師可保持"手放在背後"的姿態工作。

  • 3

    App shots是上下文黑科技 — 截圖工具同時捕獲影象和應用的完整輔助功能樹。傳送Slack截圖時,AI自動知道頻道ID、使用者ID,函式呼叫從讀取OCR、查詢列表、匹配人名的35次跳轉,降至1次精準呼叫。

  • 4

    執行緒即隊友,自動化即經理 — 引腳執行緒可以列表其他執行緒、傳送訊息、相互協作。加上心跳自動化(heartbeat)定期喚醒,執行緒可自主執行支援、監控、內容更新。未來架構是:管理員執行緒 → IC執行緒,執行緒間可互相委派工作。

實用技巧與重點

乾貨
  • 工具名稱與功能
  • Claude Code (Codex) — 主應用
  • App shots — 捕獲應用完整上下文的截圖工具
  • Chrome Extension & Computer Use — 分別控制瀏覽器和全系統
  • 外掛生態:Slack, Gmail, Notion, Linear, Obsidian, Twitter
  • 技能系統:skills.sh / Versailles skills tool 可搜尋已有技能庫
  • 具體步驟與方法
  • 個人monorepo模板:`jxnl/personal-monorepo-template`
  • Chief of Staff執行緒:每天9 a.m.自動執行,檢查所有聯結器,優先順序排序
  • 心跳自動化指令:`keep an eye on this`(定期檢查)、`keep an eye on this every 30 minutes`(指定間隔)
  • 目標設定:在檔案中編寫Goal.md + Plan.md,可邊執行邊修改範圍
  • 執行緒控制工具:`list_threads`(列表其他執行緒)、`send_message_to_thread`(跨執行緒通訊)
  • 具體案例資料
  • 單條執行緒存活:5周、400個子代理
  • App shots最佳化:函式呼叫從35次降至1次
  • 技能複用:公司內最受歡迎的"finalize Codex skill"被100%團隊成員使用
  • 檢查功能用量:個人Check Notes技能在2-3個月內從15萬次呼叫降至0(因記憶系統接手)
  • 模型選擇:Chief of Staff預設用Medium reasoning(非X high),低計算成本高效率
  • 自動處理案例:Amazon客服等候檢查(每5分鐘→每1分鐘),成功追回$400
  • 作業系統化
  • 三幕工作法:輸入上下文 → 處理 → 輸出行動
  • 記憶體系統結構:
  • /projects — 每個專案含README、Agent.md(指令集)、關聯Slack頻道
  • /people — 每個人物的郵箱、Slack ID、工作地址、關聯專案
  • 日誌類:Daily Summary、Work Log(長期任務追蹤)
  • 許可權模式:Ask Me, Auto Review, Full Auto (YOLO)
  • 遠端控制:iOS掃QR碼→控制Mac執行任務

結論

結論

透過壓縮、語音、引腳執行緒、自動化和計算機控制的組合,可以把AI助手從工具升級為真實的工作隊友,最終實現從個人生產力到團隊增強的飛躍。 --- ## 補充說明 如何立即開始 1. 下載Claude Code應用 2. Clone講者的模板:`jxnl/personal-monorepo-template` 3. 開啟專案,用App shots指令"幫我設定這個" 4. 建立第一個引腳執行緒,命名為"Chief of Staff",新增簡單提示:"每天9 a.m.檢查我的日程、郵件、Slack,告訴我最重要的三件事" 5. 啟用心跳自動化:`keep an eye on this daily` 6. 嘗試用語音輸入替代鍵盤 常見陷阱 - X high reasoning不一定更好——低/中等推理對日常工作足夠,還能省token - 不要讓模型過於謹慎——加上"Auto Review"許可權,讓AI主動承擔風險 - 記憶系統需要幾周才能自我最佳化,不要期望第一天就完美 - 在Agent.md中明確限制——如"不修改生產程式碼",防止意外破壞

完整解析

詳細

Jason在OpenAI從事廣泛的知識工作,從原型設計、程式碼編寫、影片編輯到合作關係和教育工作。在AI賦能的時代,他面臨的核心挑戰是:過去可能有10個隊友各負責一件事,現在每個人都在處理10個專案,他需要追蹤200多個專案的進展,同時不錯過任何Slack訊息或郵件。Claude Code應用成了他的解決方案。

這個解決方案的核心是壓縮技術的突破。早年的AI模型會在20條訊息後逐漸遺忘上下文,迫使使用者頻繁啟動新執行緒。如今,壓縮讓單條執行緒可以執行五週、容納數百個子代理,而模型仍能準確理解工作背景。這改變了工作組織的邏輯——一個"引腳執行緒"可以像真實隊友一樣持續工作。

Jason打破了對AI互動的傳統想象。他不是透過鍵盤輸入指令,而是用腳踏板錄音。當他騎腳踏車回家時,可以告訴AI"在某處找個影片,匯出它,上傳到Google Drive",AI會自動搜尋會議記錄、Slack訊息來理解模糊的指令。語音比鍵盤快3倍,更重要的是,它讓工程師可以"保持手放在背後",在真實的人類對話中獲得上下文,而不是埋在螢幕前。

App shots是一項被他稱為"所有時代最滿足"的功能。普通截圖只是影象,模型需要做OCR、查詢資料庫、匹配使用者ID,往往需要35次函式呼叫。App shots同時捕獲應用的完整輔助功能樹——Slack截圖時,模型立即知道頻道ID、所有使用者ID,一個函式呼叫就能精準傳送訊息。這種上下文效率差異是巨大的。

工作流的核心是執行緒系統和自動化。每個專案、每個支援工單、每個監控任務都對應一個引腳執行緒。透過"心跳自動化"(heartbeat automation)——只需告訴AI"keep an eye on this every 30 minutes"——執行緒可以定期喚醒自己,檢查Slack、Twitter、郵件,自動路由問題、更新狀態。更強大的是,執行緒間可以通訊:一個監控執行緒發現新問題時,會建立新的子執行緒,甚至發訊息給已有的相關執行緒說"這個問題又出現了"。

支撐這一切的是個人知識庫系統——Jason稱之為monorepo。它包含三個核心目錄:projects(每個專案的README、指令集Agent.md、關聯的Slack頻道)、people(每個聯絡人的郵箱、Slack ID、過往郵件)以及各類記憶檔案。當他告訴AI"找一個執行緒,更新所有自動化用最新的模型版本"時,AI會遍歷整個知識庫。這不是魔法——是透過記憶系統和結構化文件,讓模型對他的工作有完整理解。

計算機使用(computer use)功能讓AI能控制整個桌面。Jason第一次體驗到"感受到AGI"的時刻,就是看到游標在iMovie中自動操作,找到音效、設定時間戳。現在他可以說"填這個表格",AI會判斷是在Chrome還是Safari,選擇合適的控制方式完成。他甚至設定過自動檢查Amazon客服佇列的自動化,每5分鐘檢查一次,如果等候時間變短就更頻繁地檢查,最終成功追回$400退款。

所有這些都建立在對AI"提問"能力的充分信任上。不是給AI寫詳細提示詞,而是傳送10分鐘的語音備忘說"這件事有點奇怪,我想Dylan有回覆過我",AI自動搜尋Gmail、Slack、會議記錄來理解。這種信任需要時間培養——新執行緒、新隊友的前幾周需要詳細指導,但隨著記憶積累,AI逐漸學會"知道自己需要做什麼"。

最後一個關鍵點是技能共享。Jason在公司內建立的自動化技能——如自動化開發者支援分類、合規檢查、新聞撰寫——被整個團隊使用。這不僅提升了自己的效率,更讓他成為公司的"AI冠軍"。這也解釋了為什麼他的工作角色模糊:"我實際上不知道我的工作是什麼了。"——因為他已經自動化了大部分工作,剩下的主要是確保AI系統的質量和與人類的連線。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。