KeyFrame內部研究專用

AI Agent基本功EP01:用Agent來學習Agent_一個 GitHub repo,複製我的整套 AI 工作流到你的 Agent

三師爸Sense Bar·6月15日週一·48 min中文

三句話摘要

AI Agent 基本功第一集:從生成式 AI 轉型到本地代理 AI 的核心概念與入門工具選擇。 AI Agent 的本質是把雲端 AI 搬進本機、讓它直接操控電腦,一旦學會「專案資料夾 + 雙層 .md 記憶檔 + 問 Agent 代替看教學」這個工作邏輯,效率就能從根本上突破生成式 AI 的上限。 生成式 AI vs. AI Agent 的本質差異

重點整理

重點
  • 1

    生成式 AI vs. AI Agent 的本質差異

  • 2

    雲端 AI 只能在瀏覽器對話框內工作,使用者必須手動在各工具間複製貼上、切換視窗;AI Agent 直接在本機執行,可讀寫檔案、操控程式與瀏覽器,把人類從勞務中解放出來。

  • 3

    Agent 的記憶架構是雙層 .md 檔

  • 4

    Agent 只記得兩個地方的內容:全域 agents.md(所有專案通用的設定與身份資訊)和專案目錄內的 agents.md(該專案的工作藍圖)。換電腦或換專案目錄,其餘對話內容一概不保留,這是與雲端 AI 最大的操作差異。

  • 5

    「用 Agent 學 Agent」的方法論

  • 6

    講者將自己頻道所有影片字幕(繁體中文,專為演算法與 AI 上傳)批次下載到本機專案資料夾,讓 Agent 以此為知識庫,使用者直接問問題就能得到「該看哪集影片、具體怎麼做」的精確指引,省去逐集觀看的時間。

  • 7

    工作流程可透過 GitHub repo 共享給任何人的 Agent

  • 8

    將工作流程寫成 README/MD 檔放到公開 GitHub repo,任何人的 Agent 讀取該網址後即可完整複製整套流程。現代 repo 的讀者已不是人類,而是 AI Agent。

實用技巧與重點

乾貨
  • 工具與平台
  • Claude Code:付費,額度消耗快,不推薦一般教育工作者訂閱
  • Codex(OpenAI):月費 $20 美元,最推薦,速度略慢但聰明、功能全面、可畫圖
  • AntiGravity(Google Gemini 桌面代理版):需 Google Pro 訂閱 $20 美元/月
  • OpenCode:開源免費,設定較繁瑣,需自行申請 API key
  • NotebookLM:可貼入 YouTube 網址抓取字幕作為知識庫(每次最多 10 條)
  • 免費方案推薦模型
  • OpenCode Zen 方案 → DeepSeek V4 Flash Free(推薦首選)
  • NVIDIA 免費方案 → DeepSeek V4 Flash(需排隊,速度較慢)
  • Python 工具(影片中刻意未唸出名稱以避免 YouTube 版權警告)
  • 可批次抓取 YouTube 字幕,支援多種輸出格式,安裝後直接在 Agent 指令中呼叫
  • Agent 記憶檔命名規則
  • Codex 預設:`agent.md`
  • Claude Code 預設:`claude.md`
  • AntiGravity 預設:`antigravity.md`(各系統略有不同)
  • 操作流程(AntiGravity 示範)
  • 新增本機資料夾作為專案目錄
  • 在 Agent 介面選 New Project,指向該資料夾
  • 開啟 Turbo Mode(自動核准所有操作)
  • 讓 Agent 安裝 Python 字幕抓取工具
  • 指定 YouTube 頻道,批次下載所有字幕檔至專案資料夾
  • 在對話中直接提問,Agent 從字幕檔找答案並回傳影片名稱與網址
  • 輸出工作流程說明至公開 GitHub repo,供他人 Agent 複製
  • 效益數字
  • 宣稱效率提升:5–10 倍(相較使用生成式 AI)
  • Codex 月費:$20 美元(約新台幣 600 元)
  • Claude Code 額度:拍攝當天已用盡,距重置仍剩 17 分鐘

結論

結論

AI Agent 的本質是把雲端 AI 搬進本機、讓它直接操控電腦,一旦學會「專案資料夾 + 雙層 .md 記憶檔 + 問 Agent 代替看教學」這個工作邏輯,效率就能從根本上突破生成式 AI 的上限。

完整解析

詳細

這支影片是三師爸「AI Agent 基本功」系列的第一集,專為從未接觸過本地代理 AI 的教育工作者設計,核心問題是:生成式 AI 和 AI Agent 到底差在哪裡,以及怎麼用最低成本開始入門。

講者首先釐清兩者的根本差異。過去大家熟悉的 ChatGPT 對話、Gemini、NotebookLM 都屬於生成式 AI,所有對話資料存在雲端伺服器,換電腦登入帳號即可取回,使用上毫無門檻。然而正因為它跑在雲端,AI 無法觸及使用者的本機檔案,使用者必須在不同工具之間手動複製貼上、切換視窗,工作流程被切割成一段一段。AI Agent 則是把 AI「請進」本機電腦,透過一個像作業系統的桌面應用程式作為執行環境(Codex Desktop、AntiGravity 桌面版、OpenCode 等),讓 AI 能夠讀寫任意檔案、操控瀏覽器、執行程式,完全取代人類在電腦上所有的勞務操作。講者強調,這種效率差距是 5 至 10 倍,一旦使用過 Agent,便幾乎不會再回頭開 ChatGPT 或 Gemini 的網頁版。

工具選擇上,講者根據訂閱費用與使用體驗給出明確建議。Claude Code 功能強大但額度燒得極快,拍攝當天已耗盡額度,不推薦資源有限的教育工作者訂閱。Codex(OpenAI)月費 20 美元、功能全面且支援繪圖,是他最推薦付費的選擇。Google 的 AntiGravity 桌面版同樣月費 20 美元,適合已有 Google Pro 訂閱的用戶。完全不想花錢的話,可以安裝開源的 OpenCode,搭配免費的 DeepSeek V4 Flash Free 模型使用,雖然設定步驟較繁瑣,但足以體驗 Agent 的基本能力。

在觀念建立後,講者現場示範了這集的核心主題——「用 Agent 學 Agent」。他的 YouTube 頻道每部影片都有繁體中文字幕,這些字幕並非只為觀眾而上,而是同時為 YouTube 演算法和觀眾自己的 AI Agent 準備的機器可讀語料。示範中,他在 AntiGravity 裡建立一個新的本機專案資料夾,讓 Agent 安裝一套 Python 字幕抓取工具(因版權疑慮刻意未口頭點名),批次下載頻道內所有影片的字幕檔存到本機。接著直接在對話框提問:「我要從零開始學 AI Agent 處理教學檔案,應該看哪幾集影片?」Agent 立刻從字幕檔中找出相關內容,回傳具體做法、影片名稱與直達網址。這套流程讓使用者不必再逐集瀏覽播放清單,只需問 Agent,它就充當一個懂得所有頻道內容的私人助理。

最後講者展示了 Agent 時代的知識共享方式。他當場讓 Agent 把剛才的整套工作流程寫成一份 Markdown 說明文件,推送到公開 GitHub repo,並將網址貼到直播聊天室。任何人只要把這個網址丟給自己的 Agent,Agent 讀取後就能完整複製這套工作流程,無需再看影片或閱讀教學。這個示範說明了現代 GitHub repo 的真正讀者已經不是人類,而是 AI Agent 本身。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。