KeyFrame內部研究專用

AI Agent基本功 EP05:三層一次講清楚 搞定 技能/全域/專案

三師爸Sense Bar·7月12日週日·45 min中文

三句話摘要

AI 代理的技能系統:如何用使用說明書組織電腦能力,跨代理共享和複合成項目 AI Agent 的技能系統核心是將電腦能力記錄成通用、可共享的使用說明書,透過全局和項目設定靈活調用,複雜項目可由 GitHub repo 作為「超大說明書」實現跨 Agent 複現。 技能的本質是使用說明書,具有通用性:技能不是代碼,而是將電腦已有能力(內部 Python 工具、外部應用連結)打包成純文本說明。所有 AI Agent(Claude Code、ChatGPT、OpenCode 等)都能讀懂並執行,實現跨代理無縫共用。

重點整理

重點
  • 1

    技能的本質是使用說明書,具有通用性:技能不是代碼,而是將電腦已有能力(內部 Python 工具、外部應用連結)打包成純文本說明。所有 AI Agent(Claude Code、ChatGPT、OpenCode 等)都能讀懂並執行,實現跨代理無縫共用。

  • 2

    全局設定與項目設定各司其職:全局設定用於放置工作效率最高、最常用的功能(如「用語音回答我」「語音輸入文字正規化」),在所有對話中都會載入;但過多的全局設定會消耗 Token,故應謹慎取捨。項目設定則僅在特定項目中生效。

  • 3

    複雜項目是技能的複合體,以 GitHub repo 作為「超大使用說明書」分享:多個技能可組合成複雜項目。例如台語教材項目整合了語音生成、PPT 製作、測驗生成、網站生成等功能。由於本地檔案過大,GitHub repo 內儲存的是構建項目的完整說明書,讓其他 Agent 按說明自動下載教材、安裝工具、連接外部應用,最終在自己電腦上重建相同的項目環境。

實用技巧與重點

乾貨
  • 工具與功能清單:
  • Edge TTS:免費語音合成,預設台幣 0.3 元/圖片,升級 20 美金/月可 2000 張
  • yt-dlp:下載 YouTube 影片、字幕、音訊
  • MarkItDown:檔案轉換工具
  • Matplotlib:生成各種資料圖表
  • FFmpeg:常用音視訊處理工具
  • Seedance:編輯生成影片(價格較貴,少用)
  • Draw 技能:使用 GPT-Image 生圖
  • Voice Clone:用三師爸或指定人聲生成語音
  • Audio to SRT:音訊/影片轉 SRT 字幕,使用免費 Groq Whisper API
  • 具體方法與設定:
  • 三層備援機制:Edge TTS → 備選方案 → 離線 Windows 內建語音
  • 技能分享方式:存成資料夾 OR 上傳 GitHub repo
  • 語音回答觸發詞:在對話中輸入「用語音回答我」
  • 語音輸入文字正規化規則:自動修正同音錯字、斷詞錯誤、工具名音譯

結論

結論

AI Agent 的技能系統核心是將電腦能力記錄成通用、可共享的使用說明書,透過全局和項目設定靈活調用,複雜項目可由 GitHub repo 作為「超大說明書」實現跨 Agent 複現。

完整解析

詳細

講者將技能放在基本功第五集講解,因為前四集奠定了基礎。第三集講電腦本地能力(Python 工具安裝懒人包),第四集講外部工具連結(API 與網頁應用)。只有掌握了這些基礎,才能理解和創建技能。

技能的核心定義是一份使用說明書——純 Markdown 文本檔案,記錄你電腦能做的事情。它不是代碼,而是將已有的內部工具(如 Edge TTS 語音合成、yt-dlp 視頻下載)和外部工具連結(如 NotebookLM、Gmail)的使用流程文檔化。講者強調,技能具有通用性,無論使用哪個 Agent,都能讀懂並執行這份說明書。

講者分享了兩個重要的全局設定。第一個是「用語音回答我」——在對話後的提示詞中加入這句話,Agent 會自動使用 Edge TTS 生成語音回覆。採用串流播放,無需等待整段完成,約一秒就能聽到第一個字,且在後台執行不會彈出視窗。第二個是「語音輸入文字正規化」,這不是獨立的轉寫程式,而是全局理解規則。Agent 收到語音輸入的轉寫文字後,會自動依上下文修正同音錯字、斷詞錯誤和工具名音譯,實現雙重保險且幾乎不消耗 Token。講者本人已實現全語音工作流,無需手動修字。

對於分享技能,講者提供了兩種方式。第一種是存成資料夾:在 Agent 中指示「將某技能存成資料夾」,便可用於備份或讓其他 Agent 讀取。第二種是上傳 GitHub repo,將使用說明書公開在網路上,供他人獲取。

講者最後說明了項目的概念。項目是多個複雜技能的組合,例如他的台語教材項目整合了語音生成、投影片製作、影片生成、考卷生成、互動網站生成等功能。由於項目包含大量本地檔案(超過 1GB),無法完整上傳 GitHub,因此策略是編寫「超大使用說明書」的 GitHub repo。其他 Agent 拿到這份說明書後,會自動下載所需教材、安裝程式、連接外部工具,最終在自己的電腦上重建相同的項目環境。這樣,GitHub repo 不再是單純的代碼倉庫,而是承載工作智慧和經驗的使用說明書倉庫。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。