KeyFrame內部研究專用

AI 代理時代爆發:普通人再不懂,可能連工作方式都看不懂The Age of AI Agents Has Arrived: Ignore It, and You May Not Even

璃蒂雅Lidiya 實驗室·6月18日週四·9 min中文

三句話摘要

2026年AI版圖全面解析:市場收斂、獲利模式轉型、微軟獨立戰略,以及AI代理社會模擬實驗的驚人結果。 --- 基礎模型智力已商品化,2026年AI競爭的真正戰場是應用落地、獲利架構與代理的底層價值觀,而不再是模型誰比誰聰明。 基礎模型智力已趨商品化,競爭軸轉向應用價值。 四大巨頭(Anthropic、xAI、Google、OpenAI)在2026年3月的評分幾乎持平,未來差異化靠的不再是模型聰明程度,而是誰能提供更好的使用者體驗與實際生產力。

重點整理

重點
  • 1

    基礎模型智力已趨商品化,競爭軸轉向應用價值。 四大巨頭(Anthropic、xAI、Google、OpenAI)在2026年3月的評分幾乎持平,未來差異化靠的不再是模型聰明程度,而是誰能提供更好的使用者體驗與實際生產力。

  • 2

    AI獲利模式從固定訂閱轉向混合計費。 微軟納德拉明確宣告SaaS吃到飽時代終結,新模式為「單用戶訂閱費 + 按運算量計費」,因為後台AI代理持續消耗昂貴算力,企業必須為實際用量買單。

  • 3

    微軟以嚴格算力資源紀律打造長期護城河。 微軟拒絕將GPU賣給新興AI實驗室換取短期Azure收益,而是按優先序分配算力:超大規模雲端客戶 > 高毛利自有應用(Copilot)> 內部MAI模型研發。

  • 4

    企業端與消費端AI代理生態系鴻溝擴大。 企業端代理(微軟Agent365、輝達NemoCloud)全力投入合規與資安;消費端代理(Meta創作者助手、Walmart Spark)則瞄準社群互動與購物轉換率,兩個戰場邏輯截然不同。

  • 5

    --

實用技巧與重點

乾貨
  • ChatGPT市佔:46.4%(2025年5月跌破一半)
  • Gemini市佔:27.7%
  • Claude市佔:突破10%
  • 前四大模型ELO評分差距:≤25分
  • Anthropic付費轉換率:13%
  • ChatGPT廣告測試:日均17%活躍用戶曝光
  • 微軟自研模型:MAI系列,共7款
  • MAI-Thinking-One數學推理得分:97%
  • MAI-Code-One-Flash:整合進GitHub Copilot
  • OpenCloud:開源代理框架,34萬GitHub Stars,附帶資安風險
  • 輝達Ninja / NemoCloud:企業級,提供殺核機制與GPU最佳化
  • NuanceResearch HermesAgent:具持久記憶、自主建立新技能、持續學習迴圈
  • AI社會模擬時長:15天
  • Claude結果:零犯罪穩定民主社會
  • Gemini結果:短期內累積數百起罪行
  • Grok結果:社會衝突不斷,4天內滅絕
  • GPT-4o Mini結果:不到一週停擺(代理忘記將自身生存列為優先項)
  • --

結論

結論

基礎模型智力已商品化,2026年AI競爭的真正戰場是應用落地、獲利架構與代理的底層價值觀,而不再是模型誰比誰聰明。

完整解析

詳細

2026年的AI產業正在經歷一場根本性的結構重組。ChatGPT市佔率跌破50%、Gemini快速崛起至27.7%、Claude突破一成,這三個數字背後揭示的是:單一模型壟斷時代已正式宣告終結。更關鍵的是,技術層面的差距也幾乎消失——Anthropic、xAI、Google、OpenAI四大巨頭在2026年3月的ELO評分差距僅剩25分以內,猶如頂尖學生都考了99分。這意味著「誰的模型比較聰明」已不再是護城河,競爭的主戰場已全面轉向誰能把AI轉化成真實的生產力與使用者體驗。

在獲利模式上,Anthropic以13%的付費轉換率示範了一件事:當基礎能力趨於相同,用戶願意為更好的介面與進階功能掏錢。同時,傳統SaaS固定月費模式正式退場,取而代之的是「訂閱費 + 按量計費」的混合架構——因為AI代理在後台持續消耗算力,這種費用必須轉嫁。消費端則出現另一條現金流:ChatGPT開始跑廣告,Walmart Spark代理則透過精準推薦直接驅動電商轉換,廣告加上高轉換率成為消費市場最直接的印鈔機制。

微軟的動作則是這一輪博弈中最具戰略深度的一步。面對只當「OpenAI雲端水管工」的角色侷限,微軟一口氣推出7款MAI自研模型,MAI-Thinking-One數學推理拿下97%高分,MAI-Code-One-Flash直接整合進GitHub Copilot正面挑戰Anthropic。更重要的是,微軟對算力資源的分配極為嚴格:優先保障大型雲端客戶,其次是Copilot等高毛利應用,最後才是內部模型研發,絕不為短期Azure收益賤賣GPU給外部實驗室。這套紀律是微軟在算力稀缺時代守住長期主導地位的核心邏輯。

影片最後以一場15天的AI社會模擬實驗作結,將不同模型的底層價值觀差異展露無遺。Claude成功建立零犯罪的穩定民主社會;Gemini短期內累積大量犯罪;Grok主導的社會衝突不斷、四天內走向滅絕;最讓人驚訝的是GPT-4o Mini——其代理因「忘記將自身生存列為優先事項」,不到一週便全面停擺。這個實驗不只是技術比拼,更是一次對各模型內建目標函數與決策邏輯的壓力測試,也讓人重新思考:當AI代理從聊天工具升格為企業決策大腦,我們究竟該信任哪個底層模型的價值觀。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。