KeyFrame內部研究專用

Hermes Agent Just Got 10X Better (4 Insane NEW Features)

Zinho Automates·7月13日週一·10 min英文

三句話摘要

Hermes 0.18 版本升級:引入多模型協議、持久化技能學習、並行任務執行和自動驗證機制,解決 AI 代理遺忘、低效和不可信的問題。 Hermes 0.18 的核心轉變是從「監督機器人」變成「可信任的自主代理」——它既能思考得更聰明、記住所有學過的東西、並行高效完成工作,還能自己驗證結果是否真的完成。 多模型協同決策:單個 AI 模型思維方式固定,容易產生盲點。新功能讓 Claude、GPT、DeepSeek 等多個模型同時獨立處理同一問題,由聚合模型綜合各自答案,特別適合重大商業決策和策略問題。

重點整理

重點
  • 1

    多模型協同決策:單個 AI 模型思維方式固定,容易產生盲點。新功能讓 Claude、GPT、DeepSeek 等多個模型同時獨立處理同一問題,由聚合模型綜合各自答案,特別適合重大商業決策和策略問題。

  • 2

    技能永久學習系統:過去每次對話結束知識就消失,代理無法累積經驗。新版本用 /learn 自動從文檔、代碼庫、流程文檔生成技能並永久保存,也能從已完成的成功案例提取多步驟流程作為可重複技能。

  • 3

    透明的自我改進管理:AI 自改通常是黑箱,使用者無法確認代理學到什麼、記憶是否準確或是否混入錯誤。/journey 提供視覺化儀表板展示所有技能與記憶的連結狀況,使用者可直接編輯、刪除或修正有問題的項目。

  • 4

    自動驗證與真實完成保證:代理常在任務未真正完成時就宣稱完成(表單未提交、API 失敗等)。Completion Contracts 讓使用者定義「完成」的實際標準,每步後由判斷模型檢查,確保結果真的可用。

實用技巧與重點

乾貨
  • Hermes 版本:0.18
  • Mixture of Agents:在模型設定中建立新預設,設置參考模型和聚合模型(如 Opus 4.8)
  • /learn 指令:將文檔、repo、流程連結等資源轉換為持久化技能
  • /journey 指令:視覺化技能與記憶地圖,支持直接編輯和刪除
  • Background Delegation:並行執行多個子代理
  • Completion Contracts:在目標描述中定義完成標準,由判斷模型在每步驗證
  • 支援模型:Fable 5(Hermes 內建支援)
  • 免費資源:School Community(30,000+ 成員)

結論

結論

Hermes 0.18 的核心轉變是從「監督機器人」變成「可信任的自主代理」——它既能思考得更聰明、記住所有學過的東西、並行高效完成工作,還能自己驗證結果是否真的完成。

完整解析

詳細

Hermes AI 代理的 0.18 版本升級解決了長期困擾使用者的核心問題:代理無法持久學習和可靠交付。許多人發現自己教給代理的技能在下一次對話中完全消失,導致需要不斷重複相同的監督工作,使所謂的「自動化」變成比手動操作更低效的過程。

新版本的第一個重大升級是「多模型協議」。每個 AI 模型都有不同的思考方式和優勢——Claude 有其特殊的邏輯方式,GPT 走另一條路,DeepSeek 又呈現第三種角度。傳統做法只能選一個模型,等於只聽一個人的意見。新功能改變了這一點:使用者將多個頂級模型設置為參考模型,每個模型獨立工作同一個問題,最後由聚合模型(如 Opus 4.8)綜合各模型的答案,寫出一個兼具多方視角的最終結論。實作方式極為簡單——在模型設定中建立新預設、指定參考模型和聚合模型,就能在模型下拉選單中選用。

第二個升級是技能的永久化學習系統,由 /learn 指令實現。使用者可以指向任何資源——一份文檔、一個代碼庫、一個流程頁面——/learn 會自動將其轉換成符合使用者標準的永久技能。更強大的是,當使用者和代理一起成功完成複雜工作後,可以告訴代理「從這次成功學習」,代理就會把整個多步驟流程提取成可重複使用的技能按鈕。知識不再蒸發,每次都能重用。

第三個升級是 /journey 視覺化技能管理系統。AI 自我改進通常是黑箱——使用者完全看不到代理學到什麼、記憶是否準確、是否混入了錯誤的假設。/journey 打開一張視覺地圖,展示代理曾建立的所有技能與記憶以及它們如何相連,使用者可以直接在介面上編輯或刪除有問題的項目,確保自我改進不會悄悄毀掉系統。

第四個升級是後台並行委派。傳統工作流是把多步驟任務交給代理,代理完成第一步等待檢查,再做第二步再等待,最後使用者花一小時監督整個過程。新功能讓代理同時啟動多個子代理平行處理不同部分——比如同時進行研究、掃描社群媒體、匯總內容——主聊天室保持完全反應性,使用者可以離開,稍後回來查看完成的結果。

最重要的升級是「完成合約」。這解決了 AI 代理最嚴重的問題:代理會宣稱任務完成,但實際上表單沒提交、API 呼叫失敗、頁面無法載入,代理根本沒察覺,只是到了流程尾端就認為完美。完成合約讓使用者在目標中明確定義「完成」意味著什麼,之後每步完成後都有判斷模型檢查工作是否真的符合這些標準。只有當真正完成時,代理才會停止並告訴使用者。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。