Why Off-the-Shelf AI Doesn't Understand Money — Udi Menkes, Intuit
三句話摘要
LLM雖能流暢談論金錢,卻因缺乏實際運作經驗而給出危害業務的建議,解決方案是用實際結果訓練模型而非依賴文本知識。 現成LLM不了解金錢的實際運作,但基於驗證結果訓練的模型就了解了——差距不在模型大小,而在於是否掌握因果認知與實績數據。 情境堆積不等於經驗
重點整理
重點- 1
情境堆積不等於經驗
- 2
LLM能存取公司全部財務數據,但這只是數據點集合,無法理解因果關係與實際運作邏輯。三歲女兒說「再買一個就好」與LLM建議「買第二套房」犯同樣錯誤——看不到約束條件與風險。
- 3
虛張聲勢的根源在於學習源頭
- 4
LLM從互聯網、博客、書籍、建議專欄學習金錢知識,這些來源傳遞的是敘事與理論,不是驗證過的因果關係。教科書說「削成本」,但若該供應商貢獻97%收入,削成本反而致命。
- 5
因果測量需要對照設計
- 6
用條件平均處理誤差(CATE)衡量行動效果。提價看似讓利潤增加1400美元,但提價的企業本身就更成功,實際效果是1150美元。LLM無法從單一時間序列數據中解構這種因果。
- 7
基於實際結果的模型倍增性能
- 8
普林斯頓研究給模型100萬美元模擬500天決策,大多數LLM導致破產,簡單規則系統反而勝出。演講者團隊用強化學習訓練判斷器篩選LLM生成的行動候選,用中等規模模型超越所有前沿模型。
實用技巧與重點
乾貨- 量化案例對比
- | 場景 | LLM建議 | 實際最優 | 風險 |
- |-----|--------|--------|-----|
- | 租賃房東 | 買第二套房 | 提租5-10%(續約前) | 負現金流狀態提議擴張 |
- | 雞蛋供應商 | 提價15-20% | 協商供應商降成本5-10% | 一客戶70%收入、一供應商100%成本 |
- | 衣服公司 | 削減80%最大成本 | 保護該供應商 | 供應商雖占成本80%卻創造收入97% |
- 研究規模
- 研究覆蓋成千上萬家企業、約10萬種情況、跨時間範圍
- 普林斯頓實驗:模型各獲100萬美元、模擬500天、大多數導致破產
- 方法論步驟
- 數據源:QuickBooks、Turbotax、Credit Karma、Mailchimp
- 創建「業務狀態」:在特定時點詳細總結(含總帳、損益表、現金流、發票)
- 推導行動集合:從數據反推企業採取的行動(行銷投資、員工薪資、招募成本等)
- 構造訓練集:數百萬個(狀態-行動-結果)向量
- 訓練強化學習模型:判斷類似業務情況下哪些行動最佳
- 訓練LLM層:生成建議並以同類企業實績為論證
- 關鍵指標
- CATE(Conditional Average Treatment Effect):衡量控制混淆變數後的因果效應
- 模型表現:中等規模模型(較便宜)超越所有前沿模型
- 工具與服務
- 產品名稱:AI商業顧問(測試階段、研究預覽中)
- 功能:主動提示機會、說明同類企業實績、支援情況深入與行動計劃
結論
結論“現成LLM不了解金錢的實際運作,但基於驗證結果訓練的模型就了解了——差距不在模型大小,而在於是否掌握因果認知與實績數據。”
完整解析
詳細演講者Udy Menquez開場用三歲女兒的故事類比LLM在金錢上的問題:女兒看到刮花的車說「再買一個就好」,恰好反映LLM在金融決策中流暢卻危險的虛張聲勢。他在金融AI工作15年,最近面臨投資決策時用最新LLM尋求建議——模型連續修改假設後的結論完全反轉,這觸發了他的研究課題。
核心發現是LLM的學習機制決定了其局限。LLM從互聯網、書籍、建議專欄習得的金錢知識是敘述與理論,而非驗證過的因果關係。這導致兩種虛張聲勢:一是給出聽起來合理但實際危害的建議(如房東案例建議買第二套房來補現金流,而該企業正負債累累),二是超過半數建議本質上就是「獲取新客戶」與「提升定價」這類教科書解答。普林斯頓大學最近的研究證實了這一點——給LLM模型各100萬美元進行500天模擬決策,大多數導致破產,反而是簡單的規則系統勝出。
他的團隊採用了結果導向的方法。第一步從QuickBooks、Turbotax等整合企業財務全景,包括總帳、損益表、現金流、發票;第二步精細構造「業務狀態」——在特定時點詳細描述企業處境,同時從數據反推其採取過哪些行動;第三步構造數百萬個(狀態-行動-結果)向量,訓練強化學習模型理解在類似企業的類似情況下哪些行動帶來最佳結果;第四步訓練LLM模型生成建議並以同類企業實績為論證基礎。關鍵技術工具是CATE(條件平均處理誤差),它能在控制混淆變數後測量因果效應,例如區分「提價導致利潤增加」與「成功企業才能提價」。
成果出人意料:中等規模、成本更低的模型在直接對標測試中超越所有前沿模型。這不是大小競賽,而是數據與因果理解的護城河。他們將此應用於AI商業顧問產品(目前測試階段),能主動為企業創造機會並解釋「你應該這樣做,因為類似你這樣的企業做過且我們有驗證結果」。從宏觀看,這代表AI領域進入結果導向時代——贏家將是擁有最佳記錄系統、從中創建獨特數據集、訓練模型實現預期結果的人。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


