KeyFrame內部研究專用

Why Off-the-Shelf AI Doesn't Understand Money — Udi Menkes, Intuit

AI Engineer·7月29日週三·19 min英文

三句話摘要

LLM雖能流暢談論金錢,卻因缺乏實際運作經驗而給出危害業務的建議,解決方案是用實際結果訓練模型而非依賴文本知識。 現成LLM不了解金錢的實際運作,但基於驗證結果訓練的模型就了解了——差距不在模型大小,而在於是否掌握因果認知與實績數據。 情境堆積不等於經驗

重點整理

重點
  • 1

    情境堆積不等於經驗

  • 2

    LLM能存取公司全部財務數據,但這只是數據點集合,無法理解因果關係與實際運作邏輯。三歲女兒說「再買一個就好」與LLM建議「買第二套房」犯同樣錯誤——看不到約束條件與風險。

  • 3

    虛張聲勢的根源在於學習源頭

  • 4

    LLM從互聯網、博客、書籍、建議專欄學習金錢知識,這些來源傳遞的是敘事與理論,不是驗證過的因果關係。教科書說「削成本」,但若該供應商貢獻97%收入,削成本反而致命。

  • 5

    因果測量需要對照設計

  • 6

    用條件平均處理誤差(CATE)衡量行動效果。提價看似讓利潤增加1400美元,但提價的企業本身就更成功,實際效果是1150美元。LLM無法從單一時間序列數據中解構這種因果。

  • 7

    基於實際結果的模型倍增性能

  • 8

    普林斯頓研究給模型100萬美元模擬500天決策,大多數LLM導致破產,簡單規則系統反而勝出。演講者團隊用強化學習訓練判斷器篩選LLM生成的行動候選,用中等規模模型超越所有前沿模型。

實用技巧與重點

乾貨
  • 量化案例對比
  • | 場景 | LLM建議 | 實際最優 | 風險 |
  • |-----|--------|--------|-----|
  • | 租賃房東 | 買第二套房 | 提租5-10%(續約前) | 負現金流狀態提議擴張 |
  • | 雞蛋供應商 | 提價15-20% | 協商供應商降成本5-10% | 一客戶70%收入、一供應商100%成本 |
  • | 衣服公司 | 削減80%最大成本 | 保護該供應商 | 供應商雖占成本80%卻創造收入97% |
  • 研究規模
  • 研究覆蓋成千上萬家企業、約10萬種情況、跨時間範圍
  • 普林斯頓實驗:模型各獲100萬美元、模擬500天、大多數導致破產
  • 方法論步驟
  • 數據源:QuickBooks、Turbotax、Credit Karma、Mailchimp
  • 創建「業務狀態」:在特定時點詳細總結(含總帳、損益表、現金流、發票)
  • 推導行動集合:從數據反推企業採取的行動(行銷投資、員工薪資、招募成本等)
  • 構造訓練集:數百萬個(狀態-行動-結果)向量
  • 訓練強化學習模型:判斷類似業務情況下哪些行動最佳
  • 訓練LLM層:生成建議並以同類企業實績為論證
  • 關鍵指標
  • CATE(Conditional Average Treatment Effect):衡量控制混淆變數後的因果效應
  • 模型表現:中等規模模型(較便宜)超越所有前沿模型
  • 工具與服務
  • 產品名稱:AI商業顧問(測試階段、研究預覽中)
  • 功能:主動提示機會、說明同類企業實績、支援情況深入與行動計劃

結論

結論

現成LLM不了解金錢的實際運作,但基於驗證結果訓練的模型就了解了——差距不在模型大小,而在於是否掌握因果認知與實績數據。

完整解析

詳細

演講者Udy Menquez開場用三歲女兒的故事類比LLM在金錢上的問題:女兒看到刮花的車說「再買一個就好」,恰好反映LLM在金融決策中流暢卻危險的虛張聲勢。他在金融AI工作15年,最近面臨投資決策時用最新LLM尋求建議——模型連續修改假設後的結論完全反轉,這觸發了他的研究課題。

核心發現是LLM的學習機制決定了其局限。LLM從互聯網、書籍、建議專欄習得的金錢知識是敘述與理論,而非驗證過的因果關係。這導致兩種虛張聲勢:一是給出聽起來合理但實際危害的建議(如房東案例建議買第二套房來補現金流,而該企業正負債累累),二是超過半數建議本質上就是「獲取新客戶」與「提升定價」這類教科書解答。普林斯頓大學最近的研究證實了這一點——給LLM模型各100萬美元進行500天模擬決策,大多數導致破產,反而是簡單的規則系統勝出。

他的團隊採用了結果導向的方法。第一步從QuickBooks、Turbotax等整合企業財務全景,包括總帳、損益表、現金流、發票;第二步精細構造「業務狀態」——在特定時點詳細描述企業處境,同時從數據反推其採取過哪些行動;第三步構造數百萬個(狀態-行動-結果)向量,訓練強化學習模型理解在類似企業的類似情況下哪些行動帶來最佳結果;第四步訓練LLM模型生成建議並以同類企業實績為論證基礎。關鍵技術工具是CATE(條件平均處理誤差),它能在控制混淆變數後測量因果效應,例如區分「提價導致利潤增加」與「成功企業才能提價」。

成果出人意料:中等規模、成本更低的模型在直接對標測試中超越所有前沿模型。這不是大小競賽,而是數據與因果理解的護城河。他們將此應用於AI商業顧問產品(目前測試階段),能主動為企業創造機會並解釋「你應該這樣做,因為類似你這樣的企業做過且我們有驗證結果」。從宏觀看,這代表AI領域進入結果導向時代——贏家將是擁有最佳記錄系統、從中創建獨特數據集、訓練模型實現預期結果的人。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。