How I Use Hermes Agent? 🧠 Practical Agentic AI Tutorial & Full Workflow
三句話摘要
Hermes 桌面應用:開源自學習 AI 代理的完整設置與自動化工作流實踐指南。 ## Hermes 的核心價值在於透過持久記憶、自動技能生成與反饋循環,實現 AI 代理的真正自進化,使每日自動化任務在用戶無感知的情況下逐漸優化,最終達到「一次設置、持續自我完善」的理想狀態。 Hermes 的核心優勢在於持續進化機制。每次對話中提供的反饋不只被代理記住,還會自動觸發「技能」(skills)的創建與更新,使得同一個自動化任務在每次執行時都比前一次更精準。這不同於傳統 AI 工具在第一天和第 100 天的功能完全相同的狀況。
重點整理
重點- 1
Hermes 的核心優勢在於持續進化機制。每次對話中提供的反饋不只被代理記住,還會自動觸發「技能」(skills)的創建與更新,使得同一個自動化任務在每次執行時都比前一次更精準。這不同於傳統 AI 工具在第一天和第 100 天的功能完全相同的狀況。
- 2
安全隔離設計讓使用者保持對代理的實際控制權。執行後端可選擇本地電腦、Docker 容器或遠端 VPS/SSH,防止代理不當操作影響主系統。結合 Obsidian 筆記工具,代理可維護持久記憶層(memory stack),跨多台裝置同步單一「大腦」。
- 3
消息閘道打破工具邊界。支援 Telegram、Discord、WhatsApp、Email 等多通道,讓用戶從任何地方觸發代理執行工作,形成一個反饋循環:用戶給予偏好 → 代理更新技能 → 次日工作流更優化。
- 4
自動化任務的迭代流程中,先在聊天界面測試完成,再轉換為定時自動執行(cron),降低日後失敗風險。同時可附加多個技能到單一 cron 任務,支援複雜工作流。
- 5
##
實用技巧與重點
乾貨- 安裝與基礎設置:
- Hermes 支援 macOS 桌面應用或終端安裝
- Ollama 模型拉取指令:`ollama pull gemma:latest`(4B 版本適合小型電腦)、`ollama pull gemma:12b`(12B 版本)
- 預設 Ollama 上下文窗口:2048 token(不足)
- Hermes 最低要求:64,000 token 上下文窗口
- 自定義上下文擴展方法:創建 Gemma 變體,上下文設為 65,536
- 模型配置:
- 本地模型端點:`http://localhost:11434`(Ollama 預設)
- 開啟 AI 集成(Codex)與 Anthropic 集成
- 配置指令範例:`hermes config set model provider <base-url> && hermes config set default model gemma:12b-64k-latest`
- 技能與工具:
- Hermes 內建 71+ 預設技能
- 關鍵技能:Obsidian 整合、LLM Wiki、技能編寫器(skill authoring)、網頁瀏覽、程式執行
- 技能存儲格式:Markdown 檔案(`.md`),存於 `~/.hermes/skills/` 目錄
- 記憶系統:
- 記憶檔案位置(macOS):`~/.hermes/memories/`
- 核心檔案:`user.md`(用戶偏好)、`memory.md`(對話記憶)
- 記憶預算可配置,代理自動修剪過時資訊
- Telegram 訊息閘道設置:
- 建立機器人:在 Telegram 搜尋 BotFather → `/newbot`
- 獲取 Bot Token(API 金鑰)
- 獲取 Telegram 用戶 ID:搜尋「Raw Data Bot」
- 填入 Hermes 設定後點擊「Gateway Ready」並重啟訊息閘道
- 自動化任務(Cron Job):
- 建立方式:Hermes 介面 → 新增 Cron → 設定執行間隔(每日、每週等)
- 執行目標位置:Telegram 聊天、電郵等訊息通道
- 附加技能:可將預先編寫的技能與 cron 任務綁定
- 調試方法:先在聊天中執行乾跑(dry run),確認結果後再自動化
- 實戰案例:每日 AI 新聞摘要機器人
- 自動化頻率:每日早上 8 點
- 執行步驟:網頁搜尋 → 篩選 AI 相關新聞 → 提取三個主要觀點 → Telegram 傳送報告 → 用戶反饋 → 代理更新技能
- 反饋循環:使用者在 Telegram 回覆評論 → 代理寫入 `memory.md` → 次日執行前另一 cron 任務讀取反饋並更新技能
- 執行環境:完全本地(Ollama + Gemma)或切換到 GPT-4o(更快、更準確)
- 多設備同步:
- 本地閘道:代理運行在主電腦
- 遠端閘道:透過 SSH 連接其他裝置,共享單一記憶系統
- 執行後端選項:
- 本地執行(無沙盒)
- Docker 容器(沙盒保護)
- 遠端 VPS 或 SSH
- Web 搜尋配置:
- 瀏覽器搜尋與 Web API 搜尋需分別配置
- 某些瀏覽器可能遭自動化阻擋,需切換瀏覽器或搜尋引擎
- ##
結論
結論“Hermes 的核心價值在於透過持久記憶、自動技能生成與反饋循環,實現 AI 代理的真正自進化,使每日自動化任務在用戶無感知的情況下逐漸優化,最終達到「一次設置、持續自我完善」的理想狀態。”
完整解析
詳細Hermes 是由 Nous Research 開發的開源 AI 代理框架,核心理念是打造一個「會學習的」智能系統,而不是市面上大多數 AI 工具在第一天和第 100 天功能完全相同的狀況。講者 Callum(網名 Waterloots)在本影片中展示了如何從零開始設置 Hermes、並構建一個真實的自動化工作流。
設置過程涉及兩條路線。對於注重隱私的用戶,可選用本地模型(透過 Ollama 拉取 Gemma 12B)搭配本地計算。然而預設的 Ollama 模型上下文窗口僅 2,048 token,不足以支撐 Hermes 的完整工具調用。講者示範如何手動創建 Gemma 4 64K 變體,將上下文加倍至 65,536 token。配置完成後,代理可在本地運行網頁搜尋、程式執行等複雜任務,所有數據留在用戶電腦上。對於需要更強運算能力的任務,Hermes 也支援切換至 OpenAI 的 GPT-4 或 Anthropic 的 Claude,用戶甚至可建立多個獨立檔案(profiles),一個使用本地 Gemma、一個使用雲端 GPT,並隔離它們的配置、技能和會話歷史。
Hermes 的自進化能力源於其持久記憶與技能系統。每次對話中,用戶的偏好、工作習慣、甚至反饋意見都被系統寫入 `user.md` 和 `memory.md` 檔案。更關鍵的是,代理不僅會記住這些資訊,還會根據需求自動生成或更新「技能」——即可重複使用的工作流。講者展示了 71 個內建技能,包括 Obsidian 整合、LLM Wiki、技能編寫者等。當用戶要求代理執行某項任務時,代理會檢查現有技能庫,甚至在需要時自己編寫新技能。這形成了一個正反饋循環:用戶提供反饋 → 代理更新技能 → 下次執行時品質更高。
消息閘道功能是 Hermes 的一大特色,它打破了傳統 AI 聊天工具被限制在電腦上的囿限。透過簡單配置(以 Telegram 為例,只需 BotFather 的 Token 和用戶 ID),用戶可以從手機、任何通訊軟體與代理互動,就像與真人聊天一樣。講者實現了一個「每日 AI 新聞摘要機器人」的完整案例。首先,他在桌面端與 GPT-4o 對話,要求代理制定實現計畫而不要立即執行。代理隨之生成了實現策略:建立一個名為「AI Daily Intel」的技能作為報告的大腦,然後創建一個每日 cron 任務來執行它。講者隨後在計畫中加入了對 Hermes 文檔的引用,確保代理基於實際能力而非幻覺設計方案。代理確認了實現順序:創建技能 → 乾跑測試 → 根據反饋調整 → 設置 cron 任務。
乾跑測試在桌面聊天界面中執行,代理搜尋網路、篩選 AI 新聞、提取三個主要觀點(例如「研究代理可能透過搜尋洩露機密」),然後模擬傳送 Telegram 報告。講者對報告提出反饋「希望了解技術信息的實際意義,而不僅是技術細節」,代理隨即更新了技能文件(Markdown 格式),新增了一個「用戶視角」的透視窗口。經過三四次迭代微調後,自動化任務正式生效:每日早上 8 點,cron 任務觸發「AI Daily Intel」技能,代理執行網頁搜尋、整理信息、傳送報告到 Telegram。用戶在 Telegram 回覆反饋時,代理不僅更新了 `memory.md`,講者還額外配置了一個在每日報告前執行的「技能更新 cron」,讀取反饋並修改技能文件,確保明天的報告品質進一步提升。
安全設計也是 Hermes 的亮點。講者強調,執行後端可選擇本地電腦、Docker 容器、遠端 VPS 或 SSH 連接。若使用 Docker 沙盒執行代理的程式碼,即使代理出錯也不會影響主系統。此外,Hermes 支援遠端閘道設置:代理後端可在桌面上運行,而筆電可作為遠端前端連接,共享同一記憶系統。這意味著用戶可以維護跨多台裝置的「統一大腦」。講者提及未來計畫包括建構記憶堆棧(使用 Hindsight、Hancho 等外部記憶提供者)以及更複雜的自動化流程。
##
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


