KeyFrame內部研究專用

Will Models Devour the Scaffolding? | Why Harness Will Be Worthless in a Year | Logan Kilpatrick ...

最佳拍档·6月26日週五·16 min中文

三句話摘要

大模型會原生整合現有的Agent編排能力,獨立Harness在12個月內的獨立價值將大幅下降。 Agent時代的核心競爭力正在從編排技術和Harness轉向大模型的原生能力、產品飛輪和場景落地,搞清楚哪些能力會被模型消化、哪些是真正的長期壁壘,是行業參與者接下來最重要的戰略選擇。 模型吞噬架構的歷史規律:編排技術會先領先模型幾步,但最終模型會將外置能力原生化。現在的Agent Harness正處於這個週期中,未來模型自帶的Agent能力會使獨立Harness的防鎖定價值淡化。

重點整理

重點
  • 1

    模型吞噬架構的歷史規律:編排技術會先領先模型幾步,但最終模型會將外置能力原生化。現在的Agent Harness正處於這個週期中,未來模型自帶的Agent能力會使獨立Harness的防鎖定價值淡化。

  • 2

    AI擴大而非蠶食現有業務:雖然AI直接回答降低搜尋次數,但實際數據顯示搜尋反而增加,且Agent本身產生新搜尋需求,創造全新市場,這是極其正合的遊戲。

  • 3

    編程領域已達超人水平:編程Agent能力已接近超級智能,但不會取代程式設計師,反而為每個開發者加裝加速器,提高野心邊界,讓個人處理的問題複雜度提升數個量級。

  • 4

    大公司缺乏專注力優勢:Google組合能力強但難在細分領域極度專注,創業公司若深耕垂直場景、理解客戶需求,能跑得比大公司更快,且AI編程普及反而縮小了創業與大公司的研發差距。

實用技巧與重點

乾貨
  • 組織結構與產品線
  • Google有13個10億級用戶產品
  • D-Mind內部編程團隊被稱為「AI界復仇者聯盟」
  • AntiGravity是Google全產品線的Agent底座(80%通用能力+20%場景優化)
  • 模型與能力數據
  • Gemini 3.5 Flash純靠後訓練優化就超過所有Pro版本
  • Gemini 3發布時(去年12月)市場評估Google領先,但隨後編程Agent賽道爆發,風向改變
  • 新模型長任務數據持續飆升,顯示往複雜任務發展的明確趨勢
  • 應用產出
  • AIDudely上線安卓應用生成功能1週產出35萬個應用
  • 遊戲類應用占20%、金融類(主要加密貨幣工具)占約20%,其餘為生產力工具與生成媒體
  • Logan 2025年底目標:普通人能靠AI編程開發可玩小遊戲
  • 技術架構
  • Omni是真正的單一模型,而非多模型路由架構(以前需訓練8個不同模型分別處理文本、音頻、音樂、視頻)
  • Omni Flash首先落地視頻編輯能力,能理解人物動作、場景邏輯、情緒反應的細節
  • 評估標準
  • 未來需要Harness基準測試,專門評測不同模型適配各類編排框架的能力

結論

結論

Agent時代的核心競爭力正在從編排技術和Harness轉向大模型的原生能力、產品飛輪和場景落地,搞清楚哪些能力會被模型消化、哪些是真正的長期壁壘,是行業參與者接下來最重要的戰略選擇。

完整解析

詳細

訪談的核心觀點源自Google D-Mind核心負責人Logan的判斷:現在行業普遍將Agent Harness視為核心競競力和Alpha來源,但在12個月內,獨立Harness的價值就會大幅折扣。這個判斷看似反常識,但其實遵循了AI發展的歷史規律。

過去兩年間,工程編排技術確實領先於模型能力,許多創業公司和大企業都在自建專屬Harness。然而Logan指出,現在我們說的「模型」已經不再是單純的權重參數,而是圍繞權重搭建的整套龐大系統——包括工具調用、代碼執行、搜尋、託管服務等。這些曾經外置的編排能力,最終會被模型原生整合進去。歷史上編排技術總是先於模型幾步領先,隨後模型會逐步內化這些能力。當模型本身就能原生支持現有Harness的功能時,外置編排的防鎖定價值就會大幅淡化。

同時,Logan對AI對現有產品業務的影響有著樂觀的判斷。雖然直觀上看,強大的AI會減少用戶停留時間(如搜尋次數減少、郵件自動回覆等),但實際數據呈現相反結果。有了AI之後,人們搜尋反而更頻繁,能做的事情更多。更重要的是,Agent本身也會產生大量搜尋需求,相當於憑空創造了全新市場。整個生態的價值創造遠大於存量減少,這是極其正合的遊戲,而非零合博弈。

在編程領域,AI已經達到超人水平的能力,這是目前Agent落地最成熟的賽道。Gemini 3.5 Flash純靠後訓練優化編程能力就超過了所有Pro版本,說明不需要龐大的預訓練規模,高效的後訓練就能實現能力突破。但超級智能的到來不會均勻分布,而是呈現巨舌狀突破——結果容易驗證的領域會先達到超人水平,如數學、金融、科學研究。在編程領域的超級智能不會取代程式設計師,反而給每個開發者加裝加速器,提高處理問題的複雜度邊界,讓個人開發者能力倍增。

Google在AI時代的戰略已從最大化用戶停留時間轉向最大化用戶成果,幫助用戶更快更好地完成目標本身就是產品成功的標誌。訪談中用「爬行、行走、奔跑」三個階段評估Google的Agent進度,整體仍處於謹慎的爬行階段,因為涉及13個10億級用戶產品,每步改動都影響海量用戶。相對走得較快的包括Gemini App中的Spark Agent(已接近行走階段)和AntiGravity中的自主編程Agent(能處理數十億token任務)。

Omni世界模型代表了新一代生成模型的演進方向。傳統世界模型是動作條件驅動的視頻生成,但Omni的核心是對世界有深度的理解能力,同時具備強大的多模態生成能力。最關鍵的是,Omni是真正的單一統一模型,而非多個模型的路由組合——以前Google需訓練8個不同模型分別處理不同模態,現在一個Omni模型搞定所有事情。其視頻編輯能力已能處理人物動作、場景邏輯、情緒反應的細節級銜接,這種對世界的理解能力是傳統生成模型所不具備的。Logan本人對生成式媒體的立場是增強而非替代,保留人的真實表達和聲音,用AI優化非人格化的背景環境元素,這才是正確的打開方式。

對於創業者最關心的問題——如果Harness價值被模型吞噬,創業機會是否縮窄,Logan給出了樂觀的判斷。實際上創業機會正在擴大而非縮小。大公司雖然模型能力強大,但由於業務線廣泛無法在單個領域極度專注,而專注正是創業公司的超能力。深耕垂直領域、理解客戶場景能比大模型公司跑得更快。編程能力的普及反而縮小了創業與大公司的研發差距——不需要養龐大技術團隊也能快速迭代產品。AIDudely一週就產出35萬個應用,其中大部分是以前不會被開發的個人工具,反映出個人開發者賦能的巨大空間。

Google D-Mind的組織文化體現了三個核心特點:第一,組合能力極強但偶爾專注力不足——產品線廣、技術儲備厚,但難免在細分領域投入不夠被更專注的對手領先;第二,深入骨髓的科學家基因——源自德米斯的影響,整個文化重視科學探索,做技術是為了解決疾病、能源等人類核心問題;第三,同時承擔前沿研究和大規模工程部署的責任——能將前沿技術部署到13個10億級用戶的產品中,這種工程規模全世界屈指可數。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。