KeyFrame內部研究專用

2026 State of AI Engineering — Barr Yaron, Amplify Partners

AI Engineer·7月21日週二·19 min英文

三句話摘要

2026年AI工程師現狀調查:從實驗走向生產,成本與控制成新課題 AI工程正從探索期快速進入生產期,Agent成為實際決策者、成本成為一流約束、但基礎控制機制仍顯原始——這是增長與風險並存的轉折點,要求工程文化的深度調整。 模態邊界擴展但仍有層級:文字仍占絕對主導,但圖像生成已從18%翻倍到36%真正進入生產環境,反映模型質量臨界點已跨越。音頻雖未廣泛使用,56%的非使用者計劃採用,延續去年37%的趨勢加速,這是最強的採用信號。

重點整理

重點
  • 1

    模態邊界擴展但仍有層級:文字仍占絕對主導,但圖像生成已從18%翻倍到36%真正進入生產環境,反映模型質量臨界點已跨越。音頻雖未廣泛使用,56%的非使用者計劃採用,延續去年37%的趨勢加速,這是最強的採用信號。

  • 2

    多模型混合成標配,標準化在上層:87%團隊使用多個模型按任務類型路由,開源模型作為閉源的補充而非替代品。組織試圖在平台工具層面而非模型層面標準化,因為發現不同模型擅長不同任務,單一選擇反而成本更高。

  • 3

    成本從虛到實的轉變:40%受訪者稱成本定期影響使用雄心,36%稱有時影響,75%整體受成本驅動。成本監控已升至生產SLA第二位(僅次於質量),這是過去一年最顯著的新信號,直接影響工程師選擇模型和功能搭配的方式。

  • 4

    Agent進入實戰但缺乏成熟控制:95%採用Agent(去年48%),89%可寫入數據(去年52%),意味著Agent從讀寫升級為系統內行動者。但控制機制仍依賴人工審批與權限管理等初級工具,2/3工程師仍因幻覺和上下文丟失而沮喪,反映控制層尚未成熟。

實用技巧與重點

乾貨
  • 調查基礎
  • 受訪者:1,048名AI工程師
  • 經驗分布:50%以上10年+軟體經驗者AI經驗<3年;最新工程師AI經驗中位數≈10年資深工程師
  • 模態採用數據
  • 文字:主導(具體比例未明,但領先其他模態)
  • 圖像生成:18%→36%(翻倍),相關模型包括DALL-E 3、Grok、ChatGPT Images 2.0、Nano Banana 2
  • 音頻意願:56% intent to adopt(去年37%,加速中)
  • 模型選擇
  • 閉源模型使用率:94%
  • 開源模型使用率:45%
  • 同時使用兩者:90%(開源作補充而非替代)
  • 模型選擇前三考量:質量(dominates)→Tool Calling等能力→成本(開源vs閉源僅5%提及)
  • 團隊使用多模型比例:87%
  • Agent採用與權限
  • Agent使用率:95%(去年~48%)
  • 具寫入權限Agent比例:89%(去年52%)
  • 全體受訪者使用具寫入權限Agent比例:vs去年增長3倍
  • 成本影響
  • 定期影響使用雄心:40%
  • 有時影響:36%
  • 總體受成本驅動:75%
  • 生產監控優先級:成本&Token usage排第二(僅次於質量)
  • 技術棧挑戰排序
  • 第一名:Evals(連年領先,margin縮小中)
  • 後續:監控指標散亂,96%受訪者同意存在某種棧問題
  • 構建 vs 購買
  • 購買最多:Inference & 模型服務
  • 自建最多:Prompt管理(61%自建)、RAG、Evals
  • 未決態:Fine-tuning(大多未啟動)
  • 組織影響
  • 淨正面效應:97%
  • 淨負面效應:90%+(深層技能流失、代碼庫理解下降)
  • AI模糊角色邊界:81%
  • 非開發者發佈功能:34%的團隊(多為內部)
  • 非開發者定期發佈客戶面向功能:17%
  • 工作與未來展望
  • 工作滿意度提升:76%
  • 長期負債隱憂:59%
  • 五年內實驗室宣布AGI:67%預期會發生
  • Transformer在五年後仍為SOTA:9%押注
  • 空間vs陸地AI計算五年後比例:36% space > land,38% land > space(最具爭議)

結論

結論

AI工程正從探索期快速進入生產期,Agent成為實際決策者、成本成為一流約束、但基礎控制機制仍顯原始——這是增長與風險並存的轉折點,要求工程文化的深度調整。

完整解析

詳細

Amplify投資公司合夥人Bar Yarin每年進行AI工程現狀調查,2026年共收集1,048名工程師的回應。調查首先呈現一個發現:AI工程正在演變為跨越職能邊界的學科。受訪者既有軟體業資深人士轉身學習新範式,也有從未經歷過無AI世界的新手工程師,經驗層級與背景差異極大。這反映出AI能力已不再是專項職位,而是影響從創辦人到CTOs的普遍技能。

在實際應用層面,文字仍然是AI產品的核心基礎,但增長最快的是圖像生成。過去一年內,生成式圖像的使用者從18%上升至36%,幾乎翻倍,並與DALL-E 3、ChatGPT Images 2.0等模型的重大迭代同步發生。這表明圖像能力已從實驗玩具躍升至生產級別。更有趣的是音頻的信號——雖然當前使用者占比不高,但在未使用音頻的工程師中,56%明確表示計劃採用,這個數字比去年的37%有明顯加速。這種「intent to adopt」最高的狀態預示著音頻將是下一波主流採用的浪潮。

模型選擇的故事尤其值得關注,因為它打破了Twitter圈子裡的「開源vs閉源」二元論。調查顯示,94%的團隊使用閉源模型,45%同時使用開源模型,但最關鍵的是,90%同時使用兩者的團隊將開源視為補充而非替代品。當被問及選擇模型的核心考量時,質量絕對主導(沒有比較),其次是Tool Calling等智能化能力,第三是成本。相反地,「開源vs閉源」這個在技術論壇上激烈爭論的問題,僅被5%的受訪者列為前三考量——實務決策遠比意識形態務實。事實上,87%的團隊在生產中使用多個模型,按任務特性路由或比較輸出結果,這已經成為標配策略。組織開始嘗試平台與工具層面的標準化而非模型層面,因為發現試圖只用一個模型往往無法達到最優成本與質量的平衡。

成本管理的變化最值得重視。12個月前,成本還不是工程師討論的主流話題,但今年40%的受訪者說成本定期影響他們使用AI的雄心程度,另外36%表示有時會影響。換言之,75%的工程師已經在根據成本調整使用策略。這不是抽象討論,而是真實限制——在生產監控項目中,成本與Token使用已躍升至第二位重要指標(僅次於質量),與SLA並列監控。這直接改變了工程師的架構選擇,從「要什麼功能」轉變為「能用什麼預算實現什麼」。

Agent的演進是本年最戲劇化的轉變。95%的團隊現在使用Agent,相比去年的約48%直接翻倍。但更關鍵的是權限的升級:具有數據寫入權限的Agent從去年52%升至89%。這意味著Agent已經從「讀取與總結資訊」轉變為「在實際系統內採取行動」。把兩個變化結合,全體受訪者中使用具寫入權限Agent的比例相比去年增長超過三倍——這是從demo級走向生產級的真實跨越。但問題隨之而來:如何控制這些自主行動的系統?調查顯示,大多數團隊仍依賴人工審批與權限管理——本質上是用管理實習生的工具來管理AI Agent。下層則是各種實驗性嘗試:任務分解、檢索增強、內存管理、沙箱隔離,但沒有一種方案已成為行業標準。2/3的工程師表示,幻覺(hallucination)和mid-task上下文丟失是最大挫折,反映出控制層仍未成熟。

技術棧層面,Eval持續多年排名第一大挑戰,但有趣的是margin正在縮小——這可能意味著其他問題正在浮出水面。實際上,96%的受訪者都同意存在某種棧問題,只是無法達成共識。在構建vs購買的取捨上,模式相當清晰:Inference與模型服務是最多被購買的層(因為構建推理基礎設施成本與複雜度高),而Prompt管理(61%自建)、RAG、Evals等靠近產品邏輯的層則傾向自建——因為每個組織的需求獨特,很難用通用產品滿足。Fine-tuning則處於「還不成熟」態,大多團隊尚未探索。

在組織層面的影響,97%報告AI帶來淨正面效應,但核心不只是「速度」,而是「廉價失敗」——實驗變得幾乎免費,原型數倍增加,團隊願意下更多小賭注。但硬幣另一面同樣真實:90%以上感受到負面下游效應,最普遍的是深層技術技能流失和對代碼庫理解下降——廉價代碼生成的必然代價。更激進的轉變發生在組織邊界本身:81%表示AI正模糊工程師與產品/行銷角色的界線。軟體發佈曾經是工程師的獨占領地,但現在34%的團隊有非開發者發佈功能(大多數是內部工具或小範圍實驗),17%甚至定期讓非開發者發佈客戶面向功能。這表明AI民主化已經真實發生,不再是未來可能。

展望未來,76%的工程師表示AI提升了工作滿足感,但同時59%擔心今日構建的AI代碼將帶來長期負債——這是增長與風險並存的真實寫照。五年預測中,67%預期某家領導實驗室會宣布實現AGI(需注意:調查問的是宣布press release,不是實現本身),但只有9%押注Transformer在五年後仍為最先進架構,多數人態度是「未確定」或傾向於新架構。調查中最具爭議的問題(也最具趣味)是「未來五年空間內的AI計算會否超過陸地」,結果近乎平分:36%認為會,38%認為不會,反映出對AI計算地理分佈的根本不確定。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。