KeyFrame內部研究專用

Scientists Found A Better Language For AI Agents

Two Minute Papers·6月19日週五·6 min英文

三句話摘要

AI 多代理人系統拋棄自然語言通訊,改用潛在向量直接傳遞思維信號,可大幅提升效能與降低成本。 --- 讓 AI 代理人直接傳遞潛在向量取代自然語言通訊,可在低成本小型模型上將推理準確率提升 13 個百分點並減少 50–75% token 用量,是多代理人架構值得追蹤的重要突破方向。 多代理人協作的根本問題是語言轉換浪費:現有架構中每個代理人必須將思維轉成完整英文文字,下一個再讀取,這既耗費 token 又引入語義損失。

重點整理

重點
  • 1

    多代理人協作的根本問題是語言轉換浪費:現有架構中每個代理人必須將思維轉成完整英文文字,下一個再讀取,這既耗費 token 又引入語義損失。

  • 2

    潛在向量通訊取代自然語言:研究提出讓代理人直接傳遞「純數值向量」給下一個代理人,不經文字轉換,AI 本就在潛在空間中思考,無需繞道人類語言。

  • 3

    準確率顯著提升,成本大幅下降:在數學問答任務上準確率從 73% 升至 86%,且 token 用量減少 50–75%,以更低成本達到更好效果。

  • 4

    研究仍有兩項關鍵限制:目前僅在小型模型上驗證,能否擴展至大型模型未知;推理鏈最佳長度約為 80 步,超過後效益遞減。

  • 5

    --

實用技巧與重點

乾貨
  • 數學推理準確率:73% → 86%(提升約 13 個百分點)
  • Token 使用量減少:50%–75%
  • 測試模型規模:約 10 億參數(免費/低成本模型)
  • 方法名稱:潛在向量通訊(Latent Vector Communication)/ 腦際連接(Brain Linking)
  • 研究者:Dr. Károly Zsolnai-Fehér
  • 最佳推理步驟數:80 步(超過後效益遞減)
  • 對照實驗設計:同一訓練教師(大型 AI 模型)+ 不同架構,新方法仍有效
  • 潛在效益:減少系統錯誤、提供新型計算算法
  • --

結論

結論

讓 AI 代理人直接傳遞潛在向量取代自然語言通訊,可在低成本小型模型上將推理準確率提升 13 個百分點並減少 50–75% token 用量,是多代理人架構值得追蹤的重要突破方向。

完整解析

詳細

近年來 AI 代理人在網路上以驚人速度增長,旅遊規劃、行程管理、保險處理等多代理人應用場景隨之大量湧現。然而這類系統的問題也層出不窮:詐騙、安全漏洞、系統崩潰屢見不鮮。影片以旅遊代理人為例說明——兩個代理人共同規劃假期,其中一個為了省錢選了距離目的地 400 公尺的住宿,另一個進一步找到更便宜但未經授權的房間,最終訂到一個旅客根本不會入住的地方。這些問題的根源,往往在於多代理人之間的協作架構本身存在缺陷。

目前主流的多代理人架構採用自然語言作為代理人之間的通訊媒介:第一個代理人寫出計畫,第二個批評,第三個解決問題,每次傳遞都必須將思維完整轉成英文文字,下一個代理人再逐字讀取。講者提出一個根本性的質疑:語言是為人類書寫與溝通設計的,但 AI 的思維本質是數值向量,為何要繞道走自然語言這條路?既然 AI 是在潛在空間中運算,不如直接在代理人之間傳遞「純數值向量」,完全跳過文字轉換的步驟。

這個方法被稱為「腦際連接」(Brain Linking)或潛在向量通訊。根據 Dr. Károly Zsolnai-Fehér 的研究,在數學推理任務上,採用此方法後準確率從 73% 提升至 86%,且所用的是約 10 億參數的免費小型模型,並非昂貴的大型系統。Token 使用量同時減少 50%–75%,意即以更低成本獲得更好結果。研究亦進行了對照實驗,使用相同的訓練教師(大型 AI 模型)搭配不同架構做比較,確認效能提升確實來自潛在向量通訊本身,而非訓練品質的差異。

不過講者也強調應保持科學嚴謹。該研究目前有兩個主要限制:第一,實驗僅在小型模型上驗證,能否推廣至大型模型尚不清楚;第二,推理鏈最佳長度約為 80 步,超過此閾值後效益快速遞減。儘管如此,這項研究已展示出一個極具潛力的方向——讓 AI 代理人用「自己的語言」而非人類語言溝通,有望從根本上提升多代理人系統的效能與可靠性。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。