KeyFrame內部研究專用

How Slack Solves AI Agent Memory and Context Management

Micro Learning·6月20日週六·9 min英文

三句話摘要

精心設計的結構化記憶通道比無限擴張的上下文窗口更有效——對AI系統而言,有針對性的已驗證數據遠勝於海量原始數據。 上下文窗口危機的根本原因:語言模型API是無狀態的,每次推理都必須將完整的對話歷史重新發送。短期應用還好,但長期複雜任務會跨越數百次推理請求、生成MB級輸出,導致質量下降、成本暴增,最後硬性碰上技術上限。傳統的「堆積消息」方法根本行不通。

重點整理

重點
  • 1

    上下文窗口危機的根本原因:語言模型API是無狀態的,每次推理都必須將完整的對話歷史重新發送。短期應用還好,但長期複雜任務會跨越數百次推理請求、生成MB級輸出,導致質量下降、成本暴增,最後硬性碰上技術上限。傳統的「堆積消息」方法根本行不通。

  • 2

    多層驗證的Critic機制:Slack部署批評者智能體來審計專家的發現,使用get_tool_call和get_tool_result等工具直接查看原始數據和方法論,而不是盲目接受輸出。17萬條發現中超25%被識別為不可信,證明這個驗證環節對防止hallucination至關重要。

  • 3

    時間線作為真實性的最終過濾器:批評者構建經過驗證的事件時間線,通過嚴格的時間順序規則自動識別虛假事件。任何編造的事件都很難邏輯上融入實際發生的帶時間戳事件序列。同時故意限制報告的數據空白點不超過三個,避免決策者被過多未知淹沒。

  • 4

    線上上下文摘要的根本轉變:用日誌、評審、時間線三個高度專門化的結構化記憶通道,完全取代原始累積的消息歷史。這消除了上下文窗口限制、降低API成本,反而因為智能體只看精炼的已驗證信息而提升創意和專注力。

實用技巧與重點

乾貨
  • Slack多智能體系統的三層角色:Director(編排整個調查)、Specialist Experts(從服務器日誌收集證據)、Critic(嚴格審查發現)
  • Director日誌的六個條目類型:決策、觀察、發現、問題、行動、假設
  • Critic的核心驗證工具:get_tool_call、get_tool_result(直接查看原始數據和方法論)
  • 關鍵統計數據:17萬條發現通過系統,其中超25%未通過可信度閾值
  • 時間線限制規則:最多報告三個最重要的數據空白點
  • 真實案例數據:開發者安裝標準軟體包觸發安全警報,實際原因是腳本路徑包含「KMOD」字樣被誤識別
  • 核心實踐原則:除了日誌、評審、時間線外,不傳遞任何消息歷史

結論

結論

精心設計的結構化記憶通道比無限擴張的上下文窗口更有效——對AI系統而言,有針對性的已驗證數據遠勝於海量原始數據。

完整解析

詳細

現代語言模型面臨一個根本的技術侷限:它們在架構上是無狀態的。每當用戶提問時,模型都會以「失忆」狀態啟動,為了營造持續對話的假象,系統必須在每次推理時將整份對話歷史重新發送給模型。這種蠻力記憶戰術對短期應用是可行的,比如寫個快速郵件或問幾個基礎問題。但當任務跨越數小時、需要數百次推理請求、生成MB級別的輸出時,簡單地堆積消息歷史會導致AI回應品質下降、API成本暴增,最終硬性撞上上下文窗口的技術天花板,AI系統會徹底無法工作。

Slack工程團隊在處理內部安全調查時碰到了這個難題。他們構建了一個多智能體系統來自動化調查安全警報,由三個層次組成:Director智能體負責協調整個調查,Specialist Expert智能體從服務器日誌中收集證據,Critic智能體則嚴格審查所有發現。以一個真實案例作為參考點:一名開發者在工作站上安裝了標準軟體包,卻觸發了大規模安全警報。乍看是重大問題,但AI團隊最終發現這是虛驚一場。

Slack的第一個創新是給Director配備一個結構化的「日誌」作為工作記憶。Director不是被動接收原始的專家報告和混亂的數據轉儲,而是被要求持續更新日誌,將其思考分類為六種條目類型:決策、觀察、發現、問題、行動或假設。這個日誌成為整個團隊的共享敘事,所有智能體都能看到它。這個設計非常高明,因為共享精煉的日誌而非原始嘈雜的日誌檔案,使整個團隊對宏觀情況保持一致,避免過多的細節資訊觸發確認偏差。在那個開發者案例中,Director在上午9點34分記錄了關鍵突破:安全警報實際上是因為腳本路徑包含「KMOD」字樣,而非真正試圖執行危險的核心修改。

但從何處保證這些資訊的源頭可靠?這引出了第二個創新:Critic的評審機制。當Expert智能體從日誌中提取資訊時,它可能會幻覺或誤解數據。Critic智能體被部署來審計專家們,使用get_tool_call和get_tool_result等工具直接查看Expert查看的原始數據,以及它們用來得出結論的確切方法論。本質上是在別人做完題目後檢查他們的算數。Slack運行了17萬條發現通過這個批評者系統,結果非常震撼:超過25%的發現未通過可信度閾值,要麼是純粹猜測,要麼完全誤導。這個數據證明了為什麼Critic的嚴格審查是絕對必要的。如果只是將原始AI輸出往下傳,任何長期應用最終都會被hallucination鑽蛀。

第三個創新是時間線。Critic篩選出那些可信的發現後,將它們整合成一條乾淨的、經過驗證的事件時間線,去除重複的數據。如果兩名專家報告同樣的警報,它在時間線上只出現一次。通過嚴格的時間順序規則,任何虛假事件都很難邏輯上融入真實的、帶時間戳的事件序列——就像拼圖,假的拼片根本拼不進去。Critic還故意限制報告的數據空白點不超過三個最重要的,避免Director被無窮的小謎團淹沒。

最後,Slack做了一個激進的選擇:除了這些資源,他們不傳遞任何消息歷史。這完全背離了標準AI框架的做法。通過用日誌、評審、時間線這三個高度專門化的結構化記憶通道取代原始累積的消息歷史,Slack消除了上下文窗口的限制、大幅降低了API成本,甚至反而因為智能體只能看到精煉的已驗證資訊而不是數千行無關的歷史對話,提升了它們的創意和專注力。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。