KeyFrame內部研究專用

Tammuz Dubnov - When Our PM Started Writing Code: What Merge Rate Taught Us About AI Adoption - AI N

Tessl AI·7月26日週日·26 min英文

三句話摘要

企業如何正確建立 AI-native 組織,讓決策者直接執行工作、加快功能交付,而非浪費預算。 企業應精準配置工具和清晰劃分邊界,讓各角色決策者在其領域直接執行,而非盲目增加 AI 支出預算。 真正的瓶頸是交接,不是寫程式速度。 傳統流程讓一個想法要經過 PM → Designer → 等待對齐 → Developer → 審視規格 → 等 sprint 排程 → 實裝,整個過程耗時數週。AI-native 的價值在於壓縮這些層層 handoff,讓決策者直接在 agent 輔助下執行、立即迭代、滿意後才送審,將數週流程壓縮到分鐘級。

重點整理

重點
  • 1

    真正的瓶頸是交接,不是寫程式速度。 傳統流程讓一個想法要經過 PM → Designer → 等待對齐 → Developer → 審視規格 → 等 sprint 排程 → 實裝,整個過程耗時數週。AI-native 的價值在於壓縮這些層層 handoff,讓決策者直接在 agent 輔助下執行、立即迭代、滿意後才送審,將數週流程壓縮到分鐘級。

  • 2

    錯誤做法燒錢卻無成效。 Uber 將 AI 支出增加 6 倍卻在 4 個月內用完預算;Microsoft 給全員 Cloud Code 最後因成本失控而回收。根據對 2400 家企業的分析,每花 $100 在 AI 上,只有 $18 實際流向可出貨的程式碼,其餘被 bug 修復循環和重做浪費。

  • 3

    工具需精準配置,而非「給所有人更多 token」。 正確做法是給 PM 和 Designer 適配他們角色的工具(如 Tonya),而不是 Cloud Code;給開發者時僅在他們感興趣的工作上使用,否則會導致無限 agent 迴圈。Shopify 購買數千份 Cursor 授權給非技術人員,50% 的 PR 直接合併無需修改。

  • 4

    保留工程守衛,明確分工邊界。 非技術人員應專注前端和 UX 變更,不涉及後端架構決策(如資料存儲方案)。Harness 系統應自動學習這些邊界,對每個 PR 標註風險等級,幫助開發者優先審視。

實用技巧與重點

乾貨
  • 具體數字:
  • Uber:2024 年 AI 支出增加 6 倍,4 個月內用完全年預算
  • 分析 2400 企業:$100 AI 支出中只有 $18 變成可運送程式碼
  • Shopify:非技術人員 PR 50% 直接合併、完全無需開發修改
  • Autonomy AI 客戶數據:非技術人員平均每季 50 個 PR、合併率 74%、84% 的 PR 無需開發者調整
  • 工具與方案:
  • Cloud Code(Microsoft,適合開發者)
  • Cursor(代碼編輯器授權)
  • Tonya(Autonomy AI 專為非技術人員設計)
  • 流程方法:
  • Plan Merge Polish(計畫→合併→潤飾):容許開發者快速用 feature flag 推送、後續 PR 優化
  • 自動 PR 分類系統:每個 PR 標註風險等級和規模大小,讓開發者有效優先順序

結論

結論

企業應精準配置工具和清晰劃分邊界,讓各角色決策者在其領域直接執行,而非盲目增加 AI 支出預算。

完整解析

詳細

組織都想成為 AI-native,但大多數誤解了它的定義。Thomas Dubnov 指出,AI-native 的核心是「決策權和執行能力合一」。在傳統企業中,PM 有想法卻要等 Designer 做 Figma、再等一週對齐、然後寫規格、再等開發者排進 sprint、開發完成還要進行像素完美迭代。這套層層 handoff 的流程才是真正的瓶頸——不是寫程式慢,而是交接慢。一個功能從想法到使用者看到可能要數週。

AI-native 打破這個模式。當 PM 或 Designer 配備合適的 AI 工具時,他們可以迅速原型化、立即看到效果、按需調整,直到滿意再發給開發者進行最終技術審查。這樣做的結果是設計評論、產品評論都已經完成,開發者收到的不是模糊規格而是幾乎完整的方案。整個流程從數週壓縮到分鐘。

然而許多企業走錯了方向。Uber 將 AI 支出在 2024 年增加 6 倍,四個月內就燒完全年預算,但 CFO 無法看到功能上線速度的提升。Microsoft 給全員 Cloud Code 工具,最後因成本失控而收回。分析 2400 家企業的數據更具說服力:每花 100 美元在 AI 上,只有 18 美元變成真正可運送的程式碼,其餘被重做、bug 修復循環吃掉。常見的錯誤做法包括:單純增加開發者的 token 預算卻不改變任務(導致不感興趣的開發者無限丟給 agent);只加速原型製作卻不解決交接問題(結果只是加速等待);給非技術人員 Cloud Code 導致環境問題和垃圾 PR。

Shopify 做對了——購買數千份 Cursor 授權給非技術人員在他們擅長的領域執行,結果 50% 的 PR 品質高到直接合併。Autonomy AI 的實際數據:非技術人員平均每季 50 個 PR、74% 合併率(即 25% 被拒,這很正常)、84% 的合併 PR 完全無需開發者調整。關鍵是「harness」系統——當 agent 出錯時自動防止同類錯誤再犯,逐漸演化。同時要明確分工邊界:非技術人員負責前端和 UX,工程師保留後端架構決策。每個 PR 自動標註風險和規模,幫助團隊優先順序。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。