KeyFrame內部研究專用
每日

今日 KeyFrame

管線分析的每一部影片,最新的優先。每張卡片都直接連回原始影片。

7月24日星期五

29
OpenAI模型自己“越狱”了?背后有哪些投资机会?
3 min
AI 技術中文7月24日

OpenAI模型自己“越狱”了?背后有哪些投资机会?

马儿聊世界Pony Talk

  • AI攻擊的自主性:AI模型不是在命令驅動下攻擊,而是為達成目標自主發現並利用系統漏洞。這表明AI的思維方式越來越接近人類——在無法完成任務時會尋找workaround,包括作弊。
  • 防守思維必須改變:以前網路安全只需把關進入(搜身檢查),但現在進來的考生會互相協作作弊。防守方必須轉為持續監督學生在考場內的行為,即從靜態防護轉向動態監控。
  • 未來是AI對抗AI:人類無法應對由AI發動的快速、廣泛、不間斷的攻擊。唯一的解決方案是用AI防守AI,導致企業必須部署AI網路安全系統。
Full Workshop: Setting Yourself Up for Success —Jason Liu, OpenAI Codex
75 min
AI 技術英文7月24日

Full Workshop: Setting Yourself Up for Success —Jason Liu, OpenAI Codex

AI Engineer

  • 壓縮(Compaction)是基礎 — 過去認為長執行緒會衰退,現在單條執行緒可執行5周、容納400個子代理,關鍵是壓縮讓模型能持續理解上下文。這打破了"20條訊息後新開執行緒"的舊規則。
  • 語音輸入是生產力乘數 — 講者用腳踏板控制錄音,每天用15分鐘語音備忘替代文字。AI會自動讀取會議記錄、郵件來理解模糊的語音指令,效率比鍵盤輸入快3倍,工程師可保持"手放在背後"的姿態工作。
  • App shots是上下文黑科技 — 截圖工具同時捕獲影象和應用的完整輔助功能樹。傳送Slack截圖時,AI自動知道頻道ID、使用者ID,函式呼叫從讀取OCR、查詢列表、匹配人名的35次跳轉,降至1次精準呼叫。
Vibe Coding 經驗談:分享最新 AI 工具與模型選擇!
12 min
AI 技術中文7月24日

Vibe Coding 經驗談:分享最新 AI 工具與模型選擇!

阿石OMP

  • 工具選擇的實踐邏輯:講者區分使用場景——Claude用於需要創意與深度思考的問題(因為Legacy model有品味),GPT用於需求清晰的任務(因為有時建議過於複雜),而非單純選貴或流行的模型。
  • 本地AI模型的優勢:Whisper語音輸入在本地運行,CPU即可驅動,不依賴網路,且準確度遠勝Google舊版語音輸入法,是實務中高效的替代方案。
  • 工具堆棧的成本效益:Calvuc完全免費建站,OpenRouter一次設置後只需改model名稱即可切換,降低多個API的管理複雜度與成本。
ChatGPT 5.6 徹底進化!這 8 個 Work 實戰場景,讓它從助手變成你的「全職員工」
13 min
AI 技術中文7月24日

ChatGPT 5.6 徹底進化!這 8 個 Work 實戰場景,讓它從助手變成你的「全職員工」

七七行銷筆記

  • 三層模式分工清晰:Trade 適合臨時對話,Work 負責長期專案執行並持續優化,Codex 則專攻編程和技術落地。選對模式是提升效率的前提。
  • Computer Use 真正解放雙手:AI 可自行打開瀏覽器、操作滑鼠完成退訂、表單填寫等重複性任務,且不會完全佔據使用者的操作空間,允許同時進行其他工作。
  • 逐字稿是關鍵輸入:提供逐字稿而非原始音頻/影片,能幫助 AI 更精準定位內容,減少額外識別和猜測的步驟,大幅提升輸出品質。
Learn 98% of Higgsfield AI in 18 Minutes
18 min
AI 技術英文7月24日

Learn 98% of Higgsfield AI in 18 Minutes

Youri van Hofwegen

  • 一個平台取代多個工具:傳統創作需在圖像、影片、編輯軟體間反覆切換,Higgs field 在頂部導航列統一組織所有功能,讓創作者在同一介面完成從概念到成片的全流程。
  • 角色一致性透過多角度參考解決:影片生成中人物會變臉的根本原因是 AI 只能從單張照片推測,預先製作角色表(展示正面、背面、特寫)讓模型有完整參考,確保不同鏡頭中角色保持一致。
  • 直接控制而非依賴提示詞:Cinema Studio 讓創作者設定焦距、光圈、鏡頭類型等專業參數,不再只能用自然語言描述希望模型自動判斷,這才是真正的導演控制。
How AI Agents Work: Prompt, Context, Harness & Loop Explained
12 min
AI 技術英文7月24日

How AI Agents Work: Prompt, Context, Harness & Loop Explained

JetBrains

  • 提示工程的三要素:加上角色定義、明確問題、指定輸出格式就能戲劇性提升模型品質。同一個模型、同樣的空白起點,改變措辭方式就得到完全不同的結構化回答。
  • 上下文工程的陷阱:不是餵進去更多資訊就更好,Chroma Research測試18個前沿模型發現全部都隨輸入長度增加而性能下降,200k token窗口的模型在50k就開始失效,這叫「上下文腐爛」。正確的上下文比數量多的上下文更重要。
  • 管道工程的轉變:把AI從被動的「問答機」變成主動的「工作代理人」,給它工具(讀檔案、執行程式)、護欄、反饋迴圈,讓它觀察結果、自我反應、驗證修正,不用等待用戶每步輸入。
大语言模型是如何工作的 | LLM | Transformer | 注意力机制 | 位置编码 | 多头注意力 | 前馈网络 | 残差连接 | MoE | RoPE | 人工智能
25 min
AI 技術中文7月24日

大语言模型是如何工作的 | LLM | Transformer | 注意力机制 | 位置编码 | 多头注意力 | 前馈网络 | 残差连接 | MoE | RoPE | 人工智能

Best Partners TV

  • 分詞策略影響計算效率與泛化:分詞器選擇決定token數量和跨語言覆蓋能力;不同模型族用不同分詞器(GPT系列用BPE變種,Llama用SentencePiece),同樣句子分成更少token意味著更少計算成本。
  • 嵌入空間自然涌現語義幾何結構:Token嵌入是模型學到的內部表示,意義相近的token在空間中相鄰(如「國王」靠近「女王」),這種幾何關係完全由訓練自發產生,甚至可對向量做算術運算。
  • 注意力機制通過QKV三角色交換信息:每個token扮演Query(找什麼)、Key(提供什麼)、Value(傳遞何物)三角色,相似度打分後加權求和;多頭注意力並行處理不同語言關係(語法一致、代詞指代、長程引用等)。
GitHub 上月第一名,居然是个做 office的命令行工具
6 min
AI 技術中文7月24日

GitHub 上月第一名,居然是个做 office的命令行工具

YAHA学堂

  • 統一的路徑層級系統:無論 PPT、Excel 還是 Word,都用斜杠路徑表示文檔結構(如 /Slide1/Title),就像操作文件夾一樣直觀,大大降低 AI 的學習成本。
  • 顏色對比是關鍵坑點:背景深色必須搭配淺色文字,否則渲染出來無法閱讀,這是用 AI 做文檔最容易翻車的地方之一。
  • 內置計算引擎省 Token:Excel 公式無需打開軟體即可計算結果(內建 350+ 函數),避免 AI 反復打開應用的 Token 往返成本,對批量生成報表特別有效。
Everything Is a Rollout — Alex Shaw + Ryan Marten, Terminal-Bench, Harbor, Laude Institute
21 min
AI 技術英文7月24日

Everything Is a Rollout — Alex Shaw + Ryan Marten, Terminal-Bench, Harbor, Laude Institute

AI Engineer

  • 代理開發典範轉移:2018年代碼執行前已知結果;2026年代理行為則不確定,需像對待機器學習模型一樣,透過實證評估來管理代理性能。代理本質上是黑盒、需要通過rollout來理解和改進。
  • 機器學習與代理開發的系統類比:訓練集→環境/Avals、權重→技能/提示/工具、損失函數→環境獎勵、梯度下降→PR提交。這套完整類比說明代理開發工具應如何設計。
  • 評估優先策略:Satya Nadella的建議是先建立eval再優化,一旦掌握評估方法就掌握主動權——能選擇任何模型、不必依賴品牌或公開基準。這轉移了決策權從廠商到開發者。
Claude Opus 4.8 Is Acting Like Opus 5...
10 min
AI 技術英文7月24日

Claude Opus 4.8 Is Acting Like Opus 5...

World of AI

  • Opus 5 已在測試階段:雖然官方未正式公布,但後端模型切換痕跡明顯,Opus 4.8 回答超出其知識庫範圍的問題(如 Gemini 3 Pro 上線時間),說明模型已升級。
  • 3D 生成能力為核心升級:針對 Gemini 3 Pro 上周表現強勢的領域,Anthropic 特意加強 Opus 5 在 Three.js 和 3D 世界生成上的能力,家居場景細節與物體擺放的一致性達到前所未有的水準。
  • Token 效率問題依然存在:Opus 5 token 消耗量更大,而 OpenAI 的 GPT 5.6 soul 主打用更少 token 達成相同或更好效果,這是 Anthropic 模型的持續痛點。
Laguna S 2.1: The Best Local Agentic Coder?
15 min
AI 技術英文7月24日

Laguna S 2.1: The Best Local Agentic Coder?

Prompt Engineering

  • 强化学习恢复思考过程
  • 人类写下的是答案而非推理过程,Poolside用强化学习补齐这个空缺。模型在虚拟任务环境中反复尝试,仅奖励真正解决问题的方案,在9周内用4000块H200完成训练。结果是模型生成异常冗长的思考链,多次验证结果才输出答案。
  • 多层防护应对Reward Hacking
Kimi K3把Gemini压下去了?SemiAnalysis这期播客,排名反而不是重点
8 min
AI 技術中文7月24日

Kimi K3把Gemini压下去了?SemiAnalysis这期播客,排名反而不是重点

Why QQ

  • 參數量不能直接比較,真正看的是縮放效率和硬件成本:K3 雖有 2.8T 參數,但相對於 K2 的縮放效率提升約 2.5 倍。單張 B200 無法部署此模型(顯存僅 1.44TB vs 模型需求 1.4TB+),官方建議 64 卡以上的 Supernode 正是因為 K3 的超高稀疏 MoE 架構對大規模高帶寬通信的依賴。
  • 權重分階段發布背後是工程同步,不是營銷策略:K3 API 先上線、完整權重 7 月 27 日前發布,這段時間乐制暗面在與推理服務商和開源社區協調代碼、適配 VLLM 的 KDA 實現。如果權重直接放出而推理引擎未準備好,模型上線當天就會因吞吐量低而口碑崩塌。
  • MXFP4/MXFP8 量化不是硬件兼容性的承諾,而是標準化低精度格式的前置優化:採用 AMD、Intel、Meta、Microsoft、NVIDIA 等共同推動的 OCP 標準,既降低推理成本也為國產加速器等多元硬件後端預留適配空間,反映出模型在底層架構上已為多硬件生態做準備。
Why AI Agents Need a Data Harness, Not Just a Lakehouse
37 min
AI 技術英文7月24日

Why AI Agents Need a Data Harness, Not Just a Lakehouse

Tessl AI

  • 亞秒級性能是AI的硬需求而非奢侈品。傳統分析採用email-pace(分鐘至小時級查詢),人可以離開座位等待,但AI代理無法忍受此延遲,否則工作流卡頓、tokens浪費、上下文丟失,因此現代數據平台必須在次秒內交付結果。
  • 語義層解決AI的上下文盲點。業務術語跨團隊定義不同(「客戶」「Q2」「收入」各有各的理解),AI在沒有統一定義層的情況下會隨意選擇,導致查詢錯誤且結果不可信;通過在平台內集中語義層,AI可靠地查找指標定義、理解表關係、執行正確操作。
  • 開源標準比單一產品更關鍵。Apache Iceberg的REST規範讓任何查詢引擎(Spark、Trino、Snowflake、Athena)都能與任何目錄(Polaris、Nessie、Glue)互操作,避免廠商鎖定並降低遷移成本,使用者可按成本或性能自由選擇堆棧。
Brian Douglas - The beginners guide to training AI on your own code - AI Native DevCon June 2026
31 min
AI 技術英文7月24日

Brian Douglas - The beginners guide to training AI on your own code - AI Native DevCon June 2026

Tessl AI

  • 會話數據是被忽視的資產。用戶每天付費使用 Claude/Cursor 產生的所有互動數據在 30 天後自動刪除。講者用 tapes.dev 持續記錄 77,000 個會話(約 4GB 數據),相當於每週 1GB,年度可達 50-100GB,這些都可轉化為學習信號。
  • 通過觀察與反饋實現代理自我改進。講者用 10 個並行代理各執行 Pokemon 遊戲 1000 轉,不是直接告訴代理「跟 NPC 說話」,而是記錄失敗點和結構化觀測狀態(移動方向、冷卻時間、位置),代理逐漸自主發現規則——過門需要 7 秒冷卻、選擇寶可夢要按 B 鍵。這套循環適用於任何複雜系統的代碼庫學習。
  • 技能生成管道。將向量化的會話數據庫用自然語言搜索,抽取高價值的互動模式,自動或手工生成可復用 skills。用小模型(Haiku、Qwen 4B)也能完成特定領域任務,成本遠低於 Opus,且可轉移到其他 AI 工具(Codex、Cursor)。
【2026 企業高層必看】AI Agent 對公司的四大管理建議與四大致命警告 | 混合智能組織與資安治理全解析
7 min
AI 技術中文7月24日

【2026 企業高層必看】AI Agent 對公司的四大管理建議與四大致命警告 | 混合智能組織與資安治理全解析

資安快報

  • 動態授權架構:企業應根據業務風險與財務金額設定分級標準。低風險的日常排程、資料彙整可授權Agent自主執行;涉及高額財務、法律簽署、敏感客戶溝通則必須強制納入人類審查。清晰的授權邊界是確保自動化與安全平衡的首要關鍵。
  • 混合智能組織與人才轉型:傳統基層執行者須轉型為Agent指揮官與品質審查員。企業應重新定義KPI與職能評估,從考核個人執行速度轉向考核流程設計、Agent團隊驾馭能力與非結構化問題解決。先完成這種心態與管理流程轉變的企業,將獲得數倍生產力優勢。
  • 知識庫與數據治理:Agent輸出品質完全取決於企業提供的知識與數據質量。必須對內部SOP、歷史專案資產、法規文件進行結構化清理,建立高安全性且持續更新的知識庫。這是Agent釋放商業價值的底層基石。
壟斷 85% 的市場,為什麼還是慘賠?
18 min
企業管理中文7月24日

壟斷 85% 的市場,為什麼還是慘賠?

商談・不廢話 Real Biz Chat

  • 供應短缺驅動成本暴漲:美國牛隻數從 1975 年的 1.32 億頭跌至 2026 年 8,620 萬頭(75 年新低),物以稀為貴導致養牛成本在過去五年上漲 107%,屠宰場被迫以高於預期的價格收購活牛。
  • 超市通路壟斷掌握定價權:沃爾瑪、Costco 等零售巨頭擁有多個商品類別(肉類、蔬菜、進口肉品等),對屠宰場說「你不降價我就進口便宜肉」,屠宰場無力反制,只能勉強跟漲 49%。
  • 利潤分配結構的三十年逆轉:1970 年牧場主拿走零售價的 64%,到 2020-2021 年疫情期間屠宰場短暫享受 1.56 美元的高利差,但 2025 年回歸平衡後屠宰場利潤崩盤,超市零售商則穩定拿走 40% 以上。
[約翰的資產管理學] EP1:如何評估一個人的財務狀況(上)
30 min
企業管理中文7月24日

[約翰的資產管理學] EP1:如何評估一個人的財務狀況(上)

John資產管理

  • 月付債比是評估個人財務狀況最直觀的指標。講者以小明為例,薪資 8 萬、購房貸款 1200 萬的情況下,月付債比達 0.81(包含生活開銷),這反映出年輕時提早購房所承擔的實際生活壓力。
  • 總負債比反映資本結構的健全度。小明購房後負債比達 80%,而健康的上市公司通常維持在 30-45% 以下。將自己視為企業評估,高負債比代表未來缺乏競爭力與成長空間。
  • 年齡與風險承受度決定負債策略。年輕時可承擔較高負債追求成長,但隨年紀增長應逐步降低負債壓力。講者建議先透過指數投資累積股票部位,待有足夠實力時再購房。
痛失北車金雞母,昔日百貨資優生微風最大挑戰?高餐飲比重、二房東策略為何開始失效?【懂商業看商周】Ep.153
14 min
企業管理中文7月24日

痛失北車金雞母,昔日百貨資優生微風最大挑戰?高餐飲比重、二房東策略為何開始失效?【懂商業看商周】Ep.153

商業周刊

  • 黑松工廠到精品帝國:微風從1994年黑松廢棄工廠舊址起家,2001年開幕首家廣場後遭SOGO「維豐條款」絕殺,卻透過挖角日籍高層打造精品百貨,創造VIP派對與名媛經濟等台灣百貨業首創模式。
  • 二房東宿命與租金陷阱:微風採用極輕資產模式快速擴張,但每間店房東不同,租金負擔遠高於競爭對手,南山廣場租金堪稱全台最貴,從招商階段就比別人困難。
  • 餐飲高占比的雙刃劍:微風南山將餐飲比重提升至45%力圖差異化,卻面臨餐廳低毛利、投資龐大、合約綁約長、客流無天花板等結構性問題,近年消費者對名店蜜月期更縮短至三個月。
Daily English Conversations | Real-Life English Speaking Practice (Funny & Natural)
28 min
英文學習英文7月24日

Daily English Conversations | Real-Life English Speaking Practice (Funny & Natural)

Easy English Practice

  • 小事激發情緒:起床時的壞脾氣、頭髮亂翹、點餐意見不合、搶奪被子——都是微不足道的日常細節,卻能引發真實的挫折感和爭執。
  • 衝突中的耐心回應:伴侶並不試圖「贏」,而是傾聽、理解、陪伴——用「我來幫你」「你並不孤單」化解對方的焦慮。
  • 共同面對問題:冰箱壞了、沒有熱水、煮飯失敗,夫妻一起想辦法、一起調整計畫,問題不再是絕望而是「我們一起解決」。
5 AI Tools That Will Save You 10+ Hours Every Week (2026)
4 min
AI 技術英文7月24日

5 AI Tools That Will Save You 10+ Hours Every Week (2026)

AI Operator

  • 研究與決策輔助的升級:Perplexity AI 不只提供連結,而是直接給出經過驗證、帶來源引用的答案,消除典型聊天機器人的幻覺風險,特別適合需要快速、可信資訊的企業領導者和研究人員。
  • 跨系統自動化的可能性:Zapier AI Actions 通過 AI Canvas(可視化繪圖介面)讓非技術人員構建自主工作流,例如新客戶簽約後自動進行公司研究、撰寫客製化郵件、更新 CRM,徹底減少人工干預。
  • 上下文感知的企業知識整合:Microsoft 365 Copilot 2026 版本深度整合 Microsoft Graph,理解團隊關係、文件和會議,能夠跨整個企業系統拉取相關數據,而不只是單純對話。
GitHub Trending Today - GameNative, syft, WeKnora & More | #112
17 min
GitHub 熱點英文7月24日

GitHub Trending Today - GameNative, syft, WeKnora & More | #112

GitHub Trending Digest

  • 企業與開發者工具的整合 — Weeknora將文件管理、RAG檢索與多智能體編排結合,解決企業從非結構化數據中提取知識的問題;SIFT透過單一CLI命令生成供應鏈安全清單,支援Docker與OCI格式,實現CI/CD自動化集成。
  • 隱私與本地運算成為核心價值 — PDFCraft、Air Connect等工具堅持完全本地運行,使用WebAssembly加速,讓敏感數據永遠不離用戶設備,成為廣泛信任的關鍵。
  • AI與自動化的深度融合 — Style TTS2用風格擴散技術實現接近人類水平的語音合成、Tad UI提供無程式碼RPA自動化、AI Crawler以自然語言驅動的網頁爬蟲,降低技術門檻同時提升效率。
From Signal to PR: Anatomy of a Self-Improving Agent — Jason Lopatecki, Arize
20 min
AI 技術英文7月24日

From Signal to PR: Anatomy of a Self-Improving Agent — Jason Lopatecki, Arize

AI Engineer

  • 可觀測性範式轉變 — 傳統可觀測性為人類設計(點擊 UI、查看圖表),但 Observability 2.0 是為 AI 代理而生。代理需要從追蹤、日誌、程式碼庫獲取結構化數據,而非人類友善的視覺化。
  • 自動修復循環的三個階段 — 第一代是人看問題→代理修復。第二代是代理先看數據→人類審查修復方案。目標是第三代:代理自動提出假說→自動測試→自動修復,人類只做高級決策。
  • 技能與上下文的關鍵性 — 不是簡單讓 Claude 讀日誌,而是精心設計「技能」(如 Pyroscope、Google Cloud 日誌工具),讓代理知道如何提取相關數據、按客戶分組、找出記憶體問題。技能幫助代理從海量數據中找到正確的信息。
Building Closed-Loop Evals for a Multimodal Agent at Scale — Soumya Gupta & Jai Chopra, Uber
21 min
AI 技術英文7月24日

Building Closed-Loop Evals for a Multimodal Agent at Scale — Soumya Gupta & Jai Chopra, Uber

AI Engineer

  • 真實性與品質改進的張力:消費者既需要高品質照片又排斥AI生成感。系統設計在忠實原貌與選擇性改進之間找平衡,避免過度編輯導致失真(如產生幻覺添加菜品)或無謂計算成本(為已高品質圖進行不必要增強)。
  • 多代理編排的可評估架構:圖像理解→路由決策→有選擇增強→迴圈自糾→多層質檢→發佈,每步都生成結構化輸出用於診斷。路由器基於多模態輸入決定增強或跳過,圖像編輯代理接收質檢反饋自動迭代,最終通過發佈就緒品質保證(瑞士起司模型多層檢查)。
  • 離線黃金資料集驅動一致性:人工標註員按客觀指南標註代表性樣本(涵蓋不同切法、地理、菜系、圖像品質),消除主觀偏見。所有模型版本都必須對標這套黃金資料集進行基準測試,確保方向不偏。
How Evals and Prompts Shape Agent Behavior — Preetika Bhateja & Daniel Bump, YouTube Ads
19 min
AI 技術英文7月24日

How Evals and Prompts Shape Agent Behavior — Preetika Bhateja & Daniel Bump, YouTube Ads

AI Engineer

  • 評估體系的演進路徑:先從小規模的直觀評估開始(PM+核心團隊手動測試),只需幾個核心任務;隨著進度擴展到專業評估團隊、更大的黃金標準資料集,最後整合LLM評判者和人類評判者的混合模式。過早擴展自動化評估會導致頻繁的評估校準工作,反而拖累代理開發速度。
  • 評分標準的精確性決定執行質量:規模評估者最常遇到的問題是邊界情況的判斷不明確。必須提供極為清晰的評分標準配合具體範例,讓評估者理解什麼是合格、什麼是不合格,團隊內部對好案例要達成高度共識。詢問評估者「為什麼這樣評分」能挖掘代理的真實改進空間。
  • 多維度評估比簡單的通過/失敗更有價值:不只看通過率,要從品牌安全、準確度、邏輯可追溯性等多個維度評估。檢查代理的思考過程(追蹤日誌)比只看最終結果更能找到問題根源;一個廣告可能在品牌安全上合格但準確度失格,這些細節指導代理的針對性改進。
The Future of Evals: From LLM as a Judge to Agent as a Judge — Aparna Dhinakaran, Arize AI
6 min
AI 技術英文7月24日

The Future of Evals: From LLM as a Judge to Agent as a Judge — Aparna Dhinakaran, Arize AI

AI Engineer

  • 評估的複雜度隨代理進化而跳躍:2023 年只需評估單一問題回答,2024 年代理加入工具調用、推理、長期任務執行後,每次系統的故障方式都質變,需要本質不同的評估方法。
  • 傳統 LLM 評判者的侷限性:LLM 評委只能給出固定評分標準和固定分數,但代理每次使用者交互都走不同軌跡(動態流程),導致傳統評估無法捕捉上下文忽略、循環卡頓、工具重複調用等問題。
  • 代理評委的適應性:Signal 可讀取執行痕跡、識別問題模式、發現確定性評分標準永遠無法解決的細微故障(如工具被長時間反覆調用、軌跡效率低下),並主動提交修復方案。
Agentics: The Future of Business Interactions
5 min
AI 技術英文7月24日

Agentics: The Future of Business Interactions

Practical AI

  • 交互範式根本轉變:未來系統互動不再透過圖形界面或API,而是智能體與智能體之間的直接交互,絕大多數跨系統流程將無需人工介入而自動進行。
  • 軟體供應商的兩條路徑:一是像NetSuite提供MCP連接器,將現有資料和功能以智能體友善的方式暴露;二是構建專有智能體生態,不接入通用系統。兩者各有取捨。
  • 複雜的治理與架構挑戰:大規模部署智能體需要解決權限設定、資源分配、MCP伺服器配置等問題,整個產業仍在探索如何在企業規模下管理此類系統。

7月23日星期四

1
Inside the Model Factory — Eiso Kant, Poolside AI
114 min
AI 技術英文PODCAST7月23日

Inside the Model Factory — Eiso Kant, Poolside AI

Latent Space

  • 從關閉到開源的信念轉變:Fibu 在 2015 年因 Karpathy 的 RNN 論文投身機器學習代碼領域,用 4-5 年和 1200 萬美元打造開源的 Sourced,卻在 2019 年失敗(沒認識到擴展的重要性)。Poolside 初期同樣是關閉式,相信強化學習是主要進展驅動力。2025 年初他重新思考,決定開源是因為他寧可活在有 100 家基礎模型公司的烏托邦,也不要只有 3-4 家壟斷導致的反烏托邦。
  • 模型工廠的核心創新:傳統方法是預先打包數據集、複製到集群才訓練。Poolside 改革為將數據流式傳輸到訓練中,用內部系統和 AWS/Spark 構建動態數據管道。關鍵是不可變數據層 + 版本化代碼,使得研究人員能快速改動數據混合(用「混合器」系統指定比例),且每個實驗完全可重現——Fibu 聲稱可以重現 2 年前的運行。
  • 代理自動化與零故障運營:隨著系統成熟,代理開始參與訓練流程本身,自動啟動實驗、評估結果、提議修改。現在每月運行 10,000+ 實驗,整年零有效值班事件(只有首 6 小時有偶發干預)。模型變成流程的副產品,而非獨立事物,就像 SpaceX 對火箭的態度。