KeyFrame內部研究專用

How Kepler Built Verifiable AI for Financial Services — Vinoo Ganesh

AI Engineer·7月29日週三·22 min英文

三句話摘要

如何為金融服務建立可驗證的AI,而非只追求生產效率。 AI在金融服務的真正價值不在產生更多內容,而在通過確定性驗證機制讓每個決策都完全可追蹤到真實數據來源。 驗證危機被偽裝成引用問題:業界把「列出資料來源」當成驗證,但真正的驗證需要確定性證明數字正確且符合組織邏輯。引用只解決50%,剩下50%是確保提取的資訊代表公司獨特的理念。

重點整理

重點
  • 1

    驗證危機被偽裝成引用問題:業界把「列出資料來源」當成驗證,但真正的驗證需要確定性證明數字正確且符合組織邏輯。引用只解決50%,剩下50%是確保提取的資訊代表公司獨特的理念。

  • 2

    傳統金融工具是唯讀瓶頸:彭博社、FactSet之所以被採用,是用來推卸責任,而非因為數據準確。它們無法改變工作流,分析師仍然在凌晨四點手工將PDF數字輸入Excel,LLM無法負責這類決策性工作。

  • 3

    AI與確定性系統必須分層:LLM應決定「要計算什麼」,不應執行「如何計算」。數據庫和數值引擎才該寫入、計算數字;用十億參數模型算1+1是浪費,應讓CPU週期處理。

  • 4

    可驗證的工作流才是真價值:通過原子溯源、作用域決定論、推導鏈三機制,可在秒級完成合併財務報表,每數字可溯源,讓年薪600-700萬美元的分析師從重複性勞動解放——聽財報逐字稿、翻年度10-K表格、建立基礎財務模型。

實用技巧與重點

乾貨
  • Kepler平台三核心機制:
  • 原子溯源:模型決定從何提取,程式負責寫入和驗證;模型無法篡改數字
  • 作用域決定論:模型決策層與計算層分離;模型不執行數學,由確定性工具計算
  • 推導鏈:追蹤每個數字來源,全流程可重播和倒帶
  • 具體做法:
  • 確定性檢查:無法獨立驗證的數字直接刪除
  • 數字必須遵循確定性檢查、簿記邏輯
  • 平台知道什麼能從結構化數據提取、什麼不能
  • 避免從散文、原始表格提取(容易幻覺)
  • 應用場景與效果:
  • 秒級完成合併財務報表(vs.傳統承包商服務CapIQ、Deloopa)
  • 按需求格式生成DCF模型,無虛假行
  • 分析師從重複性工作解放(年薪600-700萬美元)
  • 財報電話會議逐字稿自動分析
  • 歷年8-K、10-K表格快速回顧

結論

結論

AI在金融服務的真正價值不在產生更多內容,而在通過確定性驗證機制讓每個決策都完全可追蹤到真實數據來源。

完整解析

詳細

金融服務業對AI陷入了一個看似矛盾的困境。LLM能以驚人速度生成龐大內容量——程式碼、文案、財務分析——但業界卻幾乎無法驗證這些內容的準確性。Venu Ganesh指出,當前討論都聚焦於「如何讓AI做更多工作」,卻很少涉及「如何讓AI產出可信結果」。根本問題在於業界將「信任與可驗證性」這兩個術語濫用,用非確定性LLM得出確定性結論,但LLM本質是機率機器,無法保證確定性。

傳統金融工具如彭博社和FactSet被廣泛採用的真實原因並非數據更準確,而是能推卸責任——給所有華爾街人提供「共同的事實基礎」。但這些都是唯讀系統,無法改變工作流程。分析師依然需要消費資訊後產出分析,這導致分析師凌晨四點還在工作,投資銀行員工因過度勞累瀕臨崩潰。AI雖能快速給出答案,卻無法支撐任何有意義的工作流。

監管機構(如SEC、OCC)的硬性要求使問題更加複雑:所有交易決策必須有可追蹤的信息來源支撐。傳統做法是透過引用列出資料來源,但這只是成功的一半。真正的驗證需要確定性證明某個數字確實正確,並符合組織特定的邏輯規範。舉例來說,兩個投資人可能持有相同信息卻做出相反決策,驗證的不是「事實真相」,而是「輸出是否符合我們組織的邏輯」。

Kepler的解決方案在於分離AI的能力邊界。LLM擅長推理和決策規劃,卻不應進行數學計算——為什麼要用十億參數模型算1+1而不用CPU週期?平台採用三個核心機制:首先是原子溯源,模型決定從何處提取數字,由確定性程式寫入和驗證,模型本身無法篡改數字;其次是作用域決定論,模型決策層與計算層完全分離,模型決定「要計算什麼」,由數據庫等確定性工具執行「如何計算」;最後是推導鏈,每個數字都能被追蹤到來源,整個過程可重播和驗證。

這個設計帶來實際收益。複雜工作如合併財務報表能在幾秒內完成,每個數字都可溯源,且不會產生虛假引用。不再需要依賴CapIQ、Deloopa等使用海外承包商的服務。更重要的是,分析師能從消耗數年職業生涯的重複性勞動中解放——不用再花時間聽財報電話逐字稿、翻閱多年10-K表格、手工建立財務模型V0版本。這類工作通常佔據年薪600-700萬美元分析師的大量時間。

Ganesh認為這種轉變是不可避免的。他將其類比於電商的SSL前時代——在加密技術出現前,沒有人願意在線輸入信用卡號。同樣地,若不建立可驗證機制,AI永遠無法在金融領域達成真正的規模應用。這不是技術問題,而是系統設計的根本性轉變。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。