KeyFrame內部研究專用

我做了一个牛马语音Agent,用旅行碎片时间帮我完成工作

小天fotos·6月5日週五·6 min中文

三句話摘要

用本地AI Agent系統實現邊旅行邊工作的數字游民生活。 Agent時代的真正瓶頸是多Agent的管理與編排,而語音控制配合生成式UI正是實現數字游民生活的技術基石。 語音是Agent時代的任務控制器,不只是輸入方式。當任務異步並發運行時,語音能隨時汇報進度,用戶可即時插入語音指令糾正任務偏差,這是移動場景高效工作的關鍵。

重點整理

重點
  • 1

    語音是Agent時代的任務控制器,不只是輸入方式。當任務異步並發運行時,語音能隨時汇報進度,用戶可即時插入語音指令糾正任務偏差,這是移動場景高效工作的關鍵。

  • 2

    Codex的commentary通道設計卓越。Codex輸出分為思考、工具調用、最終回複三個通道,其中工具調用時的"喃喃自語"精確適合用於進度汇報,顯著提升了長任務監控的體驗。

  • 3

    生成式UI比語音回覆更高效。預設結構讓AI用可視化方式呈現進度——車機屏幕顯示DAG圖中各任務狀態,手機確認戶外進度,這是移動場景中的必要設計。

  • 4

    自學習的任務編排系統持續優化。通過圖譜捕捉任務中的成功/失敗信號,經複盤迭代Agent編排方式,逐漸積累適合本地模型和多Agent執行的任務模式。

實用技巧與重點

乾貨
  • 語音輸入:本地部署實時ASR + Web HID方式支持大疆無線麥克風
  • 主Agent:Codex SDK(顶級智能,負責編排和實時監控)
  • 子Agent:Qwen 3.6 27B(本地部署,執行具體任務)
  • 技術細節:Harmony格式(GPT-4o、GPT-4.5訓練格式)、Codex commentary通道用於進度汇報
  • 架構流程:本地ASR → 主Agent(文本提交) → DAG引擎(工作流編排) → 多Agent執行 → 生成式UI(結果呈現)
  • 設備配置:Mac mini + 移動硬盤 + 無人機 + 打印機 + 智能眼鏡(規劃中)

結論

結論

Agent時代的真正瓶頸是多Agent的管理與編排,而語音控制配合生成式UI正是實現數字游民生活的技術基石。

完整解析

詳細

講者以陪伴12歲女兒在海邊生活一個月的故事開篇,揭示了一個根本矛盾:邊陪伴孩子邊工作。傳統做法是在沙灘上打開電腦工作,但現實是碎片化行程讓效率極低。不工作他會焦慮,但這迫使他重新定義問題:與其找時間工作,不如讓工作在陪伴孩子時自動完成。這正是AI Agent時代的新機遇。

為此他開發了「牛馬」系統。架構設計上,本地部署的實時ASR接收語音指令——支持通過大疆無線麥克風按鍵觸發,無需點鼠標。語音轉文本後提交給主Agent(用Codex SDK實現),由它做智能決策和任務拆分。具體任務由本地部署的Qwen 3.6 27B模型執行。講者特別指出一個技術洞察:Codex輸出包含commentary通道(使用工具時的思考過程),這些簡潔的中間狀態汇報非常適合進度通知,配合智能眼鏡時尤其有效,允許用戶隨時用語音插入新指令。

在呈現層面,講者採用生成式UI而非語音回覆。他觀察到AI用語音讀出長段文字很煩人,所以預設多種結構讓AI用可視化方式匯報。例如當任務由多Agent組成DAG圖協作時,車機屏幕能一眼看到各節點執行狀態,戶外則用手機確認,大幅提升了移動場景中的效率。

執行層由DAG引擎驅動,把任務匹配到預設的多Agent工作流。Codex作為編排者實時監控,能重啟或回滾出問題的節點,並管理多個並發任務。更進階的是自學習能力:他建立了圖譜來捕捉任務中的成功與失敗信號,經複盤來迭代Agent編排,逐漸找到更多適合本地模型執行的任務組合。長期願景是完全無人值守——人在路上旅行,任務在家自動完成。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。