KeyFrame內部研究專用

我的贾维斯开源了,可以语音交互,控制多Agent编排

小天fotos·7月8日週三·9 min中文

三句話摘要

讲者开源了Home Rail项目——一个运行在家庭数据中心的多Agent语音控制系统,阐述其定位、现状与发展方向。 Home Rail是讲者为家庭数据中心设计的本地多Agent系统,当前需投入时间理解和配置,但长期目标是成为NAS上的通用Agent平台,改变家庭使用AI的方式。 1. 明确产品边界与定位

重點整理

重點
  • 1

    1. 明确产品边界与定位

  • 2

    Home Rail不是为软件开发自动化设计,只适合人工检查成果不是必须的场景。讲者认为AI擅长创造软件而非替代工程师,因此产品专注于内容创造类任务自动化,而非代码质量控制。

  • 3

    2. 坦诚当前阶段的不足

  • 4

    产品尚未开箱即用,需要深入理解Agent编排机制。由于Token消耗未优化且讲者靠大量并发探索边界,没有本地部署条件或充足订阅的用户应先观望。

  • 5

    3. 推荐的使用方式是AI辅助

  • 6

    用户不需掌握DAG原理,而是让Coding Agent直接读代码库、理解系统、生成编排文件并调试。这样可以降低使用门槛,避免技术细节阻挡。

  • 7

    4. 三阶段发展路线清晰

  • 8

    短期聚焦稳定性与易用性;中期优化生成式UI与编排模板;长期目标是让系统在家庭NAS上成为Agent的通用运行平台。讲者自己已在256GB内存、96GB显存的NAS上部署运行。

實用技巧與重點

乾貨
  • 系统与部署
  • 项目名:Home Rail
  • 支持系统:Windows(需Docker Desktop + Git Bash)、Mac(需Docker Desktop)、Linux(赋予用户Docker权限)
  • 讲者的NAS配置:Finnows NAS,256GB内存,96GB显存
  • 支持的工具与模型
  • Coding Agent支持:Claude Code、Kimi Code、Codex
  • 语音功能:支持小米模型的ASR和TTS
  • 控制设备:键盘、PS5手柄、投影、电视、车机
  • 核心组件
  • Manager Agent(负责Coding Agent职能)
  • DAG引擎(用于编排工作流)
  • 生成式UI(动态面板展示进度)
  • 桌面版应用
  • 发展阶段
  • 短期:多系统兼容、无障碍使用、Manager Agent skill优化
  • 中期:生成式UI改进、编排模板库、编排skill优化
  • 长期:NAS原生支持、成为家庭Agent载体

結論

結論

Home Rail是讲者为家庭数据中心设计的本地多Agent系统,当前需投入时间理解和配置,但长期目标是成为NAS上的通用Agent平台,改变家庭使用AI的方式。

完整解析

詳細

讲者在一个月前承诺开源自己的项目,今天正式发布了Home Rail。这是一个运行在个人电脑或NAS上的多Agent语音控制系统,用户可以用它来编排多个Agent完成复杂任务。项目原本命名为"牛马",Logo也已设计,但因商标被注册,最终改名为"Home Rail"——"Home"代表家庭数据中心的定位(讲者本身是Home Lab爱好者),理想环境是运行在NAS上但也支持多设备访问;"Rail"则代表可动态调整的工作流轨道。

讲者计划采用"build in public"模式,在社区监督下分享开发心得。但在介绍产品能力前,他先坦诚说明了局限性。首先,Home Rail不适合软件开发自动化。虽然在一定程度上可做这类任务,但软件工程涉及复杂的质量保证问题,不是流程自动化能解决的。讲者的核心观点是:AI应该创造内容而非代替工程师。以他自己为例,作为博主最终交付物是视频,软件只是生产工具。因此Home Rail只针对"人工检查成果不是必须"的场景设计。

其次,当前产品远未开箱即用。虽然架构已搭建,但每个任务的流畅运行需要用户理解Agent编排机制并测试适配场景。加上Token消耗未优化——讲者因自己拥有多个订阅,靠大量并发来探索系统边界——没有本地部署或充足订阅资源的用户应先等待。

讲者建议的最佳实践是:不要手动部署或编写编排文件,而是让Coding Agent直接读代码库理解系统,然后由AI负责部署与编排。用户完全不需理解DAG引擎原理,只需告诉AI自己的工作流逻辑,由AI生成对应的编排配置。如果任务需要特定环境(如视频制作需FFmpeg),可让AI Agent帮助构建定制镜像。

在交互层面,讲者已开发桌面版支持Coding Agent(Claude Code、Kimi Code或Codex)进行语音控制。若用户有小米API Key,可接入其ASR和TTS能力。他还加入了PS5手柄控制作为实验功能。长期来看,系统应支持手机、平板、电视、投影等多种设备。讲者曾分享过理想场景:出门旅游时用车机和电视盒子完成任务。

发展路线分三阶段:短期目标是强化稳定性、支持多系统、降低新手使用门槛、优化Manager Agent的能力库。中期着重改进生成式UI(让用户交互界面更直观)和编排模板库。长期目标则是让Home Rail稳定运行在家庭NAS上。讲者指出,NAS计算能力不断提升,正从单纯存储工具演变成Agent的运行平台。他自己已在一台256GB内存、96GB显存的Finnows NAS上部署运行,用投影和手柄控制完成各种任务——这正是他心中AI在家庭中的未来样貌。

后续讲者会推出系列教程,讲解如何接入模型、接入skill、调试编排等实操内容,希望社区耐心等待项目完善。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。