KeyFrame內部研究專用

Models, Harnesses, and Multi-Agent Systems

Practical AI·8月6日週四·49 min英文

三句話摘要

解釋AI模型、代理程式、多代理系統的基礎概念,以及企業建立數位工作隊伍時的技術選擇策略。 企業應小規模試驗代理系統,保持架構靈活,準備廠商備選方案,因為代理技術快速演進且業務需求不斷變化。 模型作為函數的本質:AI模型將輸入轉換為輸出,包括語言模型(文本→文本)、視覺語言模型(圖像+文本→文本)、圖像生成模型(文本→圖像)等。執行模型需要軟體與參數權重兩個組件,這兩種方案對應開源與閉源模型的差異。

重點整理

重點
  • 1

    模型作為函數的本質:AI模型將輸入轉換為輸出,包括語言模型(文本→文本)、視覺語言模型(圖像+文本→文本)、圖像生成模型(文本→圖像)等。執行模型需要軟體與參數權重兩個組件,這兩種方案對應開源與閉源模型的差異。

  • 2

    開源vs閉源的經濟與技術權衡:開源模型(如Gemma)可本地運行,成本低但需自行維護基礎設施;閉源模型透過API訪問,成本高但性能強。企業根據實際需求與預算在兩者間選擇,中國模型已成開源領導者。

  • 3

    代理的自主性差異:代理不是簡單的聊天介面,而是可訪問郵件、行事曆、CRM、資料庫等企業系統的任務導向軟體,能夠自主執行目標而不需逐步人工干預,這是它與傳統AI應用的根本區別。

  • 4

    多代理協作的現實價值:單個代理面對複雜或即時問題時能力有限,多代理系統讓各代理各司其職(如網路安全防禦、供應鏈自動化、機器人隊伍協作),並相互協調以高效解決無法由單人或單代理完成的任務。

實用技巧與重點

乾貨
  • 模型類型:LLM、Vision Language Models、Image Generation、Video Generation、Forecasting、Anomaly Detection、Autoregressive models
  • 開源模型:Gemma(Google)、歐洲與中國開源模型
  • 閉源模型:Claude、GPT(OpenAI)、Gemini(Google)
  • Agent框架:LangGraph、Pydantic agents、Hermes agent、Open Claude
  • 垂直整合堆棧:Anthropic、OpenAI、IBM、AWS Agent Core、Google Workspace Gemini、Microsoft 365 Copilot
  • 應用場景
  • 網路安全:多代理防禦DDoS與系統入侵
  • 機器人配送:Walmart與Amazon無人機配送
  • 供應鏈:供應商通知→代理1處理→代理2搜尋替代商→自動生成NetSuite訂單
  • 評估建議:小規模開始、快速迭代、準備多個備選方案、注意廠商鎖定風險

結論

結論

企業應小規模試驗代理系統,保持架構靈活,準備廠商備選方案,因為代理技術快速演進且業務需求不斷變化。

完整解析

詳細

AI應用的演進從簡單聊天機器人進入代理時代。傳統的聊天介面是單純的輸入-輸出對話,但代理不同——它是連結企業整體系統的自主軟體,可訪問郵件、行事曆、CRM、財務系統等多個資源。一個具體例子是製造企業設定代理監控供應商狀態,當發現供應商無法供應時,代理自動觸發另一個尋找替代商的代理,搜尋完成後自動在NetSuite中生成採購單,整個過程無需人工干預。

模型選擇涉及開源與閉源的權衡。開源模型如Gemma可在本地運行,成本低且不受廠商限制,但需自行管理基礎設施。閉源模型通過API訪問,成本高但性能強,特別是大型前沿模型。有趣的是,在開源領域,中國模型已成領導者,而在閉源API領域美國企業仍領先。實踐中,企業應根據具體任務混合使用兩種模型,而非全押一種。

多代理架構的價值在於處理單代理無法應對的複雜性。網路安全防禦是最佳例子:攻擊發生時速度極快,跨越多個系統。人工防禦者無法跟上,但多個專業化代理可同時監控不同系統、偵測威脅、實施防禦並相互協調。機器人領域也類似——無人機配送時需要多個代理協作,有些負責路線規劃,有些負責安全判斷,有些負責與其他系統的協調。

技術棧的選擇影響深遠。垂直整合堆棧(如Gemini for Google Workspace或Copilot for Microsoft 365)提供無縫體驗但造成廠商鎖定。開放框架允許在模型間切換,提供靈活性。大多數企業最終需混合方案:利用現成集成的便利,同時在核心業務系統上保持獨立性與控制權。

從組織層面,代理改變了工作結構。不再是員工執行單一任務,而是被提升到戰略層次,領導由多個代理組成的團隊,類似F1賽車隊的車隊主管而非單一技師。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。