KeyFrame內部研究專用

How I Use Hermes Agent? 🧠 Practical Agentic AI Tutorial & Full Workflow

Wanderloots·7月1日週三·28 min英文

三句話摘要

Hermes 桌面應用:開源自學習 AI 代理的完整設置與自動化工作流實踐指南。 ## Hermes 的核心價值在於透過持久記憶、自動技能生成與反饋循環,實現 AI 代理的真正自進化,使每日自動化任務在用戶無感知的情況下逐漸優化,最終達到「一次設置、持續自我完善」的理想狀態。 Hermes 的核心優勢在於持續進化機制。每次對話中提供的反饋不只被代理記住,還會自動觸發「技能」(skills)的創建與更新,使得同一個自動化任務在每次執行時都比前一次更精準。這不同於傳統 AI 工具在第一天和第 100 天的功能完全相同的狀況。

重點整理

重點
  • 1

    Hermes 的核心優勢在於持續進化機制。每次對話中提供的反饋不只被代理記住,還會自動觸發「技能」(skills)的創建與更新,使得同一個自動化任務在每次執行時都比前一次更精準。這不同於傳統 AI 工具在第一天和第 100 天的功能完全相同的狀況。

  • 2

    安全隔離設計讓使用者保持對代理的實際控制權。執行後端可選擇本地電腦、Docker 容器或遠端 VPS/SSH,防止代理不當操作影響主系統。結合 Obsidian 筆記工具,代理可維護持久記憶層(memory stack),跨多台裝置同步單一「大腦」。

  • 3

    消息閘道打破工具邊界。支援 Telegram、Discord、WhatsApp、Email 等多通道,讓用戶從任何地方觸發代理執行工作,形成一個反饋循環:用戶給予偏好 → 代理更新技能 → 次日工作流更優化。

  • 4

    自動化任務的迭代流程中,先在聊天界面測試完成,再轉換為定時自動執行(cron),降低日後失敗風險。同時可附加多個技能到單一 cron 任務,支援複雜工作流。

  • 5

    ##

實用技巧與重點

乾貨
  • 安裝與基礎設置:
  • Hermes 支援 macOS 桌面應用或終端安裝
  • Ollama 模型拉取指令:`ollama pull gemma:latest`(4B 版本適合小型電腦)、`ollama pull gemma:12b`(12B 版本)
  • 預設 Ollama 上下文窗口:2048 token(不足)
  • Hermes 最低要求:64,000 token 上下文窗口
  • 自定義上下文擴展方法:創建 Gemma 變體,上下文設為 65,536
  • 模型配置:
  • 本地模型端點:`http://localhost:11434`(Ollama 預設)
  • 開啟 AI 集成(Codex)與 Anthropic 集成
  • 配置指令範例:`hermes config set model provider <base-url> && hermes config set default model gemma:12b-64k-latest`
  • 技能與工具:
  • Hermes 內建 71+ 預設技能
  • 關鍵技能:Obsidian 整合、LLM Wiki、技能編寫器(skill authoring)、網頁瀏覽、程式執行
  • 技能存儲格式:Markdown 檔案(`.md`),存於 `~/.hermes/skills/` 目錄
  • 記憶系統:
  • 記憶檔案位置(macOS):`~/.hermes/memories/`
  • 核心檔案:`user.md`(用戶偏好)、`memory.md`(對話記憶)
  • 記憶預算可配置,代理自動修剪過時資訊
  • Telegram 訊息閘道設置:
  • 建立機器人:在 Telegram 搜尋 BotFather → `/newbot`
  • 獲取 Bot Token(API 金鑰)
  • 獲取 Telegram 用戶 ID:搜尋「Raw Data Bot」
  • 填入 Hermes 設定後點擊「Gateway Ready」並重啟訊息閘道
  • 自動化任務(Cron Job):
  • 建立方式:Hermes 介面 → 新增 Cron → 設定執行間隔(每日、每週等)
  • 執行目標位置:Telegram 聊天、電郵等訊息通道
  • 附加技能:可將預先編寫的技能與 cron 任務綁定
  • 調試方法:先在聊天中執行乾跑(dry run),確認結果後再自動化
  • 實戰案例:每日 AI 新聞摘要機器人
  • 自動化頻率:每日早上 8 點
  • 執行步驟:網頁搜尋 → 篩選 AI 相關新聞 → 提取三個主要觀點 → Telegram 傳送報告 → 用戶反饋 → 代理更新技能
  • 反饋循環:使用者在 Telegram 回覆評論 → 代理寫入 `memory.md` → 次日執行前另一 cron 任務讀取反饋並更新技能
  • 執行環境:完全本地(Ollama + Gemma)或切換到 GPT-4o(更快、更準確)
  • 多設備同步:
  • 本地閘道:代理運行在主電腦
  • 遠端閘道:透過 SSH 連接其他裝置,共享單一記憶系統
  • 執行後端選項:
  • 本地執行(無沙盒)
  • Docker 容器(沙盒保護)
  • 遠端 VPS 或 SSH
  • Web 搜尋配置:
  • 瀏覽器搜尋與 Web API 搜尋需分別配置
  • 某些瀏覽器可能遭自動化阻擋,需切換瀏覽器或搜尋引擎
  • ##

結論

結論

Hermes 的核心價值在於透過持久記憶、自動技能生成與反饋循環,實現 AI 代理的真正自進化,使每日自動化任務在用戶無感知的情況下逐漸優化,最終達到「一次設置、持續自我完善」的理想狀態。

完整解析

詳細

Hermes 是由 Nous Research 開發的開源 AI 代理框架,核心理念是打造一個「會學習的」智能系統,而不是市面上大多數 AI 工具在第一天和第 100 天功能完全相同的狀況。講者 Callum(網名 Waterloots)在本影片中展示了如何從零開始設置 Hermes、並構建一個真實的自動化工作流。

設置過程涉及兩條路線。對於注重隱私的用戶,可選用本地模型(透過 Ollama 拉取 Gemma 12B)搭配本地計算。然而預設的 Ollama 模型上下文窗口僅 2,048 token,不足以支撐 Hermes 的完整工具調用。講者示範如何手動創建 Gemma 4 64K 變體,將上下文加倍至 65,536 token。配置完成後,代理可在本地運行網頁搜尋、程式執行等複雜任務,所有數據留在用戶電腦上。對於需要更強運算能力的任務,Hermes 也支援切換至 OpenAI 的 GPT-4 或 Anthropic 的 Claude,用戶甚至可建立多個獨立檔案(profiles),一個使用本地 Gemma、一個使用雲端 GPT,並隔離它們的配置、技能和會話歷史。

Hermes 的自進化能力源於其持久記憶與技能系統。每次對話中,用戶的偏好、工作習慣、甚至反饋意見都被系統寫入 `user.md` 和 `memory.md` 檔案。更關鍵的是,代理不僅會記住這些資訊,還會根據需求自動生成或更新「技能」——即可重複使用的工作流。講者展示了 71 個內建技能,包括 Obsidian 整合、LLM Wiki、技能編寫者等。當用戶要求代理執行某項任務時,代理會檢查現有技能庫,甚至在需要時自己編寫新技能。這形成了一個正反饋循環:用戶提供反饋 → 代理更新技能 → 下次執行時品質更高。

消息閘道功能是 Hermes 的一大特色,它打破了傳統 AI 聊天工具被限制在電腦上的囿限。透過簡單配置(以 Telegram 為例,只需 BotFather 的 Token 和用戶 ID),用戶可以從手機、任何通訊軟體與代理互動,就像與真人聊天一樣。講者實現了一個「每日 AI 新聞摘要機器人」的完整案例。首先,他在桌面端與 GPT-4o 對話,要求代理制定實現計畫而不要立即執行。代理隨之生成了實現策略:建立一個名為「AI Daily Intel」的技能作為報告的大腦,然後創建一個每日 cron 任務來執行它。講者隨後在計畫中加入了對 Hermes 文檔的引用,確保代理基於實際能力而非幻覺設計方案。代理確認了實現順序:創建技能 → 乾跑測試 → 根據反饋調整 → 設置 cron 任務。

乾跑測試在桌面聊天界面中執行,代理搜尋網路、篩選 AI 新聞、提取三個主要觀點(例如「研究代理可能透過搜尋洩露機密」),然後模擬傳送 Telegram 報告。講者對報告提出反饋「希望了解技術信息的實際意義,而不僅是技術細節」,代理隨即更新了技能文件(Markdown 格式),新增了一個「用戶視角」的透視窗口。經過三四次迭代微調後,自動化任務正式生效:每日早上 8 點,cron 任務觸發「AI Daily Intel」技能,代理執行網頁搜尋、整理信息、傳送報告到 Telegram。用戶在 Telegram 回覆反饋時,代理不僅更新了 `memory.md`,講者還額外配置了一個在每日報告前執行的「技能更新 cron」,讀取反饋並修改技能文件,確保明天的報告品質進一步提升。

安全設計也是 Hermes 的亮點。講者強調,執行後端可選擇本地電腦、Docker 容器、遠端 VPS 或 SSH 連接。若使用 Docker 沙盒執行代理的程式碼,即使代理出錯也不會影響主系統。此外,Hermes 支援遠端閘道設置:代理後端可在桌面上運行,而筆電可作為遠端前端連接,共享同一記憶系統。這意味著用戶可以維護跨多台裝置的「統一大腦」。講者提及未來計畫包括建構記憶堆棧(使用 Hindsight、Hancho 等外部記憶提供者)以及更複雜的自動化流程。

##

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。