KeyFrame內部研究專用

9 AI Agent Skills To Get Ahead of 99% of People

Riley Brown·6月18日週四·33 min英文

三句話摘要

掌握 AI Agent 領域九大不變趨勢,讓你成為公司內最懂 AI 的人。 --- AI Agent 時代的核心競爭力不是學最新技巧,而是理解「精準描述需求 + 建立自動化 Skill + 善用 SuperApp 平台」這三件事,其餘一切工具都只是這個框架下的執行手段。 描述能力取代提示技巧:從 2023 年的「Act as…」咒語到 2026 年的直接對話,AI 模型的進化讓最有效的「提示技巧」就是把你想要的事說清楚,誰能精準描述需求,誰就掌握優勢。

重點整理

重點
  • 1

    描述能力取代提示技巧:從 2023 年的「Act as…」咒語到 2026 年的直接對話,AI 模型的進化讓最有效的「提示技巧」就是把你想要的事說清楚,誰能精準描述需求,誰就掌握優勢。

  • 2

    Skills 是 Agent 的記憶與習慣:Skills 本質上是任務專屬的指令檔,存放在 Codex 或 Claude 中。最高效的做法不是手動撰寫,而是讓 Agent 先執行任務、再告訴它「把這個變成一個技能」,之後每次互動都能自動改善該技能。

  • 3

    超級應用程式 + 工具整合是主戰場:Codex 與 Claude Desktop 已整合聊天、vibe coding、網站發布、內建瀏覽器等功能,同時可透過 Chorus.com 等平台,讓 Agent 直接在 iMessage 或 Slack 裡回應並執行複雜任務,電腦不需開著。

  • 4

    基礎軟技能的重要性反而上升:當 AI 工具愈來愈好用,真正決定輸出品質的是使用者本身的領域判斷力——你得知道「什麼是好的」,才能引導 Agent 產出真正有價值的結果。

  • 5

    --

實用技巧與重點

乾貨
  • 數字與成本
  • 使用 GPT-5(API)做 9-10 個提示的複雜計算,費用約 $250
  • GLM 5.2 被評為目前最強開源模型,性能接近 Claude Opus 4.8,成本顯著更低
  • 工具與平台
  • 超級應用程式:Codex(OpenAI)、Claude Desktop(Anthropic)
  • Agent 整合管道平台:Chorus.com(支援 iMessage、Slack、WhatsApp、Telegram)
  • 模型路由器:OpenRouter(單一 API Key 使用所有主流模型)
  • 開源模型:GLM 5.2(智譜 AI,昨日發布)
  • 電腦控制工具:Codex Computer Use(支援桌面控制 + 內建瀏覽器 + 外部 Chrome 控制)
  • 即時語音 + 電腦控制範例:作者自建的「Riley's Jarvis」桌面應用(用 GPT-5.5 + Codex 約 3 小時完成)
  • 類似產品:Thinking Machines(Computer Use 示範)
  • 操作步驟:在 Cursor 使用 GLM 5.2
  • 前往 OpenRouter,建立帳號並取得 API Key
  • 在 Cursor → Settings → Models → API Keys,刪除原 OpenAI API Key 與 Base URL
  • 點擊 View All Models → Add Model,輸入 `z-ai/glm-5.2`
  • 確認後即可切換使用
  • Skill 自動化流程
  • 讓 Agent 執行任務 → 要求它「把這個做法變成 Skill」 → Agent 自動寫入技能檔 → 之後反饋時自動更新技能
  • Cron / 排程範例
  • 告訴 Codex:「每天早上 9 點幫我做一份 Hook Outline 發給我」→ Agent 自動建立排程,以自然語言設定 Cron Job
  • --

結論

結論

AI Agent 時代的核心競爭力不是學最新技巧,而是理解「精準描述需求 + 建立自動化 Skill + 善用 SuperApp 平台」這三件事,其餘一切工具都只是這個框架下的執行手段。

完整解析

詳細

這支影片的核心論點是:AI Agent 工具會持續演變,但背後有九個結構性趨勢是不變的,理解這些趨勢比學任何技巧都更有長期價值。

第一個趨勢是 AI 模型的智能提升,使得 2023 年流行的「提示詞技巧」(如 Act as、at mention 檔案、Midjourney 參數)幾乎全部失效。作者示範用 GPT Image 2,僅用口語化的英文描述(更改衣服顏色、頭髮顏色、背景等),就能精準生成圖片,完全不需要任何參數。結論很直白:「He who can describe what they want the best will inherit the world(最能精準描述需求的人,將繼承世界)。」

第二個趨勢是 Skills 的崛起與自動化。Skills 是儲存在 Codex 或 Claude 中的任務專屬指令檔,作者目前已建立超過 100 個。他不手動撰寫 Skill,而是讓 Agent 先執行一次任務、優化輸出後,再告訴 Agent「把這個做法變成一個叫 Hook Outline 的 Skill」,Agent 就會自動寫入並在未來使用。更進一步,未來的 Agent(如 Hermes)將在使用者互動過程中自動更新 Skill,不需要明確指令。

第三和第四個趨勢描述了平台的整合方向。Codex 和 Claude Desktop 已成為「超級應用程式」,集聊天、vibe coding、網站發布、內建瀏覽器於一體。更關鍵的是,這些 Agent 透過 Chorus.com 等平台,能直接嵌入 iMessage 和 Slack——作者示範在 iMessage 群組裡對 Agent 下指令「幫我分析最新 20 支 YouTube 影片,建一個 Sponsor Landing Page」,幾分鐘後 Agent 直接在對話中回傳公開連結。電腦不需要開著,Agent 在雲端完成所有工作。

第五到第九趨勢則聚焦於更深層的結構變化。基礎軟技能(溝通、品味、領域判斷力)的重要性因 AI 強化而上升,因為工具本身愈來愈好用,差異化來自使用者能否判斷輸出品質。AI Agent 的「持續運作」能力讓 Cron Job 變成自然語言指令——告訴 Codex「每天早上 9 點送我一份 Hook Outline」,它就幫你設定好排程。電腦控制(Computer Use)方面,Codex 可以點擊、輸入、操控整個桌面,也能控制 Chrome 瀏覽器,作者預估 12 到 18 個月內 AI Agent 操控電腦的效率將超越人類。成本面上,Frontier 模型(GPT-5)一次複雜任務可達 $250,但中國開源模型 GLM 5.2 性能已接近 Claude Opus 4.8,且成本遠更低,搭配 OpenRouter 可用單一 API Key 靈活切換。影片最後,作者展示了他用約 3 小時自建的「Riley's Jarvis」——一個即時語音控制的桌面 Agent,能透過語音指令開網頁、切換應用程式、在 Cursor 中發送提示,示範了 AI Agent + 電腦控制 + 即時語音三者結合的雛形。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。