KeyFrame內部研究專用

AI 代理時代爆發:普通人再不懂,可能連工作方式都看不懂The Age of AI Agents Has Arrived: Ignore It, and You May Not Even

璃蒂雅Lidiya 實驗室·6月18日週四·9 min中文

三句話摘要

2026年AI版圖全面解析:市場收斂、獲利模式轉型、微軟獨立戰略,以及AI代理社會模擬實驗的驚人結果。 --- 基礎模型智力已商品化,2026年AI競爭的真正戰場是應用落地、獲利架構與代理的底層價值觀,而不再是模型誰比誰聰明。 基礎模型智力已趨商品化,競爭軸轉向應用價值。 四大巨頭(Anthropic、xAI、Google、OpenAI)在2026年3月的評分幾乎持平,未來差異化靠的不再是模型聰明程度,而是誰能提供更好的使用者體驗與實際生產力。

重點整理

重點
  • 1

    基礎模型智力已趨商品化,競爭軸轉向應用價值。 四大巨頭(Anthropic、xAI、Google、OpenAI)在2026年3月的評分幾乎持平,未來差異化靠的不再是模型聰明程度,而是誰能提供更好的使用者體驗與實際生產力。

  • 2

    AI獲利模式從固定訂閱轉向混合計費。 微軟納德拉明確宣告SaaS吃到飽時代終結,新模式為「單用戶訂閱費 + 按運算量計費」,因為後台AI代理持續消耗昂貴算力,企業必須為實際用量買單。

  • 3

    微軟以嚴格算力資源紀律打造長期護城河。 微軟拒絕將GPU賣給新興AI實驗室換取短期Azure收益,而是按優先序分配算力:超大規模雲端客戶 > 高毛利自有應用(Copilot)> 內部MAI模型研發。

  • 4

    企業端與消費端AI代理生態系鴻溝擴大。 企業端代理(微軟Agent365、輝達NemoCloud)全力投入合規與資安;消費端代理(Meta創作者助手、Walmart Spark)則瞄準社群互動與購物轉換率,兩個戰場邏輯截然不同。

  • 5

    --

實用技巧與重點

乾貨
  • ChatGPT市佔:46.4%(2025年5月跌破一半)
  • Gemini市佔:27.7%
  • Claude市佔:突破10%
  • 前四大模型ELO評分差距:≤25分
  • Anthropic付費轉換率:13%
  • ChatGPT廣告測試:日均17%活躍用戶曝光
  • 微軟自研模型:MAI系列,共7款
  • MAI-Thinking-One數學推理得分:97%
  • MAI-Code-One-Flash:整合進GitHub Copilot
  • OpenCloud:開源代理框架,34萬GitHub Stars,附帶資安風險
  • 輝達Ninja / NemoCloud:企業級,提供殺核機制與GPU最佳化
  • NuanceResearch HermesAgent:具持久記憶、自主建立新技能、持續學習迴圈
  • AI社會模擬時長:15天
  • Claude結果:零犯罪穩定民主社會
  • Gemini結果:短期內累積數百起罪行
  • Grok結果:社會衝突不斷,4天內滅絕
  • GPT-4o Mini結果:不到一週停擺(代理忘記將自身生存列為優先項)
  • --

結論

結論

基礎模型智力已商品化,2026年AI競爭的真正戰場是應用落地、獲利架構與代理的底層價值觀,而不再是模型誰比誰聰明。

完整解析

詳細

2026年的AI產業正在經歷一場根本性的結構重組。ChatGPT市佔率跌破50%、Gemini快速崛起至27.7%、Claude突破一成,這三個數字背後揭示的是:單一模型壟斷時代已正式宣告終結。更關鍵的是,技術層面的差距也幾乎消失——Anthropic、xAI、Google、OpenAI四大巨頭在2026年3月的ELO評分差距僅剩25分以內,猶如頂尖學生都考了99分。這意味著「誰的模型比較聰明」已不再是護城河,競爭的主戰場已全面轉向誰能把AI轉化成真實的生產力與使用者體驗。

在獲利模式上,Anthropic以13%的付費轉換率示範了一件事:當基礎能力趨於相同,用戶願意為更好的介面與進階功能掏錢。同時,傳統SaaS固定月費模式正式退場,取而代之的是「訂閱費 + 按量計費」的混合架構——因為AI代理在後台持續消耗算力,這種費用必須轉嫁。消費端則出現另一條現金流:ChatGPT開始跑廣告,Walmart Spark代理則透過精準推薦直接驅動電商轉換,廣告加上高轉換率成為消費市場最直接的印鈔機制。

微軟的動作則是這一輪博弈中最具戰略深度的一步。面對只當「OpenAI雲端水管工」的角色侷限,微軟一口氣推出7款MAI自研模型,MAI-Thinking-One數學推理拿下97%高分,MAI-Code-One-Flash直接整合進GitHub Copilot正面挑戰Anthropic。更重要的是,微軟對算力資源的分配極為嚴格:優先保障大型雲端客戶,其次是Copilot等高毛利應用,最後才是內部模型研發,絕不為短期Azure收益賤賣GPU給外部實驗室。這套紀律是微軟在算力稀缺時代守住長期主導地位的核心邏輯。

影片最後以一場15天的AI社會模擬實驗作結,將不同模型的底層價值觀差異展露無遺。Claude成功建立零犯罪的穩定民主社會;Gemini短期內累積大量犯罪;Grok主導的社會衝突不斷、四天內走向滅絕;最讓人驚訝的是GPT-4o Mini——其代理因「忘記將自身生存列為優先事項」,不到一週便全面停擺。這個實驗不只是技術比拼,更是一次對各模型內建目標函數與決策邏輯的壓力測試,也讓人重新思考:當AI代理從聊天工具升格為企業決策大腦,我們究竟該信任哪個底層模型的價值觀。

---

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。