KeyFrame內部研究專用

Build for the Memo, Not the Demo — Shawn Chan, China Resources Holdings

AI Engineer·7月30日週四英文

三句話摘要

AI 在金融決策中的信任危機:流暢自信不等於正確,系統須透明化每項聲明來源並強制人為監督。 AI 財務產品的致勝點不在模型智能,而在系統的透明度與人為問責——再流暢的 AI 也必須通過「溯源、一致、分離、浮現、簽名」五道防線,才能贏得金融決策者的信任。 自信≠正確的陷阱:AI 從不說「我不確定」,這讓人難以判斷輸出可靠性。2023 年 2 月,一家大科技公司因行銷示範中一句關於太空望遠鏡的錯誤資訊,股價單日下跌 8%、市值蒸發約 1000 億美元。問題不在 AI 不聰明,而在金錢一旦開始看著你的文件,就沒有安全的示範。

重點整理

重點
  • 1

    自信≠正確的陷阱:AI 從不說「我不確定」,這讓人難以判斷輸出可靠性。2023 年 2 月,一家大科技公司因行銷示範中一句關於太空望遠鏡的錯誤資訊,股價單日下跌 8%、市值蒸發約 1000 億美元。問題不在 AI 不聰明,而在金錢一旦開始看著你的文件,就沒有安全的示範。

  • 2

    信任來自程序而非模型:金融決策真正重要的不是更大的 AI 模型,而是五項系統級設計——聲明有出處、數字一致、事實與猜測分離、矛盾被浮現、真人最終簽名。這些都是工程和透明度問題。

  • 3

    示範與備忘錄的深度差異:AI 產品展示只需五分鐘內看起來聰明,但投資委員會須承受完整審查——數百頁文件、多個來源互相矛盾、需證明每項陳述。系統必須區分來源可信度:審計檔案(法庭作證)vs 群組聊天(閒聊)。演講人見過 AI 信任了群聊中的粗略數據,勝過三行外審計檔案中的官方數字。

  • 4

    溯源能力是真正的產品:「點擊一次即達確切來源段落」是終極考驗。演講人親身經歷過在投資委員會會議中打開七個瀏覽器分頁試圖驗證陳述的尷尬。系統若無法立即證明聲明出處,在金融環境就無法信任。

實用技巧與重點

乾貨
  • 具體失敗案例與數據:
  • 太空望遠鏡事件(2023年2月):股價單日下跌8%、市值蒸發約1000億美元
  • 美國房地產公司:演算法購買房產預測錯誤,核銷約5億美元、關閉整個部門、裁員約四分之一
  • 律師案例:用 ChatGPT 引用六個不存在的案例,案例甚至有逼真的名稱和頁碼
  • 航空公司聊天機器人:機器人編造「先全價購票再申請折扣」政策,引發仲裁
  • 六大信任破裂方式:
  • 未區分來源可信度(審計檔案 vs 群組聊天)
  • 數字不一致(營收成長18% vs 17.4%)
  • 矛盾被平滑處理(CEO說法 vs 官方檔案不同卻選擇好聽的版本)
  • 事實與猜測混淆(「可能下季獲批」是猜測但讀起來像事實)
  • 無法溯源(無法一鍵驗證聲明來源)
  • 無人簽名負責(問責外包給軟體)
  • 修復五大方案:
  • 每項聲明附帶來源段落連結與信任等級
  • 事實與猜測視覺分離
  • 系統自動檢查數字一致性、拒絕提交不匹配文件
  • 矛盾被主動浮現而非平滑處理
  • 真人審批門檢(附完整審計日誌)

結論

結論

AI 財務產品的致勝點不在模型智能,而在系統的透明度與人為問責——再流暢的 AI 也必須通過「溯源、一致、分離、浮現、簽名」五道防線,才能贏得金融決策者的信任。

完整解析

詳細

演講人是一位金融投資委員會的資深成員,15年來在亞洲、美國等地處理跨國併購與重大投資決策,出席過 200 場投資委員會會議。他的核心觀察很簡單但深刻:金融決策中,真正影響融資批准的不是數字本身,而是信任。金錢追隨信任,而信任極脆弱,尤其當撰寫文件的東西從未說過「我不確定」時。

AI 財務產品的根本問題在於它們被設計來在五分鐘內令人印象深刻,而非經得起真實投資委員會的完整審查。演講人區分了兩種場景的本質差異:「示範」是單份乾淨文件進、流暢答案出,目的就是製造五分鐘的「哇」;「備忘錄」則是投資委員會的現實——數百頁文件、相互矛盾的資訊源、筆記、試算表,系統必須經受激烈辯論。

這個差異極為關鍵。2023 年 2 月,一家大科技公司在其新 AI 助手的行銷示範中犯了一個錯誤——關於太空望遠鏡的問題答錯了。單單一句錯誤的事實,市場注意到,股價單日下跌約 8%,市值蒸發 1000 億美元。沒有人在文件離開公司前問最基本問題:「這來自哪裡?有人檢查過嗎?」。這個故事證明硬道理:示範若不通過備忘錄測試就不安全。一旦真實的金錢在看著你,就沒有安全的示範了。

演講人接著詳述信任悄然破裂的六個方式。首先,並非每個資訊來源值得同等信任,但多數 AI 系統都把它們看作一樣。審計檔案中的數字是會計師法庭作證;分析師筆記像聚會上朋友的言論;內部郵件像電梯裡聽到的閒聊。他見過一個昂貴的 AI 系統信任了群組聊天中的粗略數據,勝過三行外審計檔案中的官方數字,因為 AI 更喜歡那段訊息周圍的熱情語氣。

第二個問題是數字必須彼此一致。一份已經失敗的備忘錄例子:第一頁說營收成長 18%,第 11 頁小表格說 17.4%。沒人在乎那 0.6% 差異,他們在乎的是它說明了什麼——如果連簡單數學都沒檢查,複雜的東西上漏掉什麼?房地產業有臭名昭著的案例:美國公司讓演算法大規模購買房產,演算法對房價充滿信心,結果房產不同意,公司核銷約 5 億美元並關閉部門。

第三個洞察令人驚訝:矛盾不是 bug,是禮物。CEO 在獲利電話會和官方檔案說法不同時,那個差距是真相最有趣的部分。但 AI 被訓練得很順滑,遇到衝突就默默選擇讀起來更好聽的版本,你甚至不知道曾有分歧。演講人見過 CEO 數字和檔案數字有意義上的不同,但更漂亮的那個被使用了,沒人標記。他們碰巧同時打開兩份文件才發現。運氣不是控制,系統的工作是確保辯論發生在人類面前。

第四個問題是事實和猜測必須住在不同盒子裡。「公司可能下季獲批」讀起來像事實但是猜測。投資委員會的工作是同意那些猜測同時信任那些事實。如果系統把它們融成一句流暢句子,委員會無法看到接縫,只能根據文件「感覺」批准或拒絕。演講人見過示範在三個草稿中從「預期批准」變成「收到批准」,沒人說謊,猜測只是假扮事實變得越來越久。當批准沒按時到達,那通電話很尷尬。

第五個是當沒人質問聲明來自哪裡時,再怎麼對都不重要。紐約律師的故事廣為人知——用 ChatGPT 撰寫法庭簡狀引用六個不存在的案例,甚至有真實相似的名稱和頁碼。AI 不只說謊,用精美格式引用了自己的謊言。三十秒測試就是:某人指著一句話說「給我看這來自哪裡」,你要嘛點一次到達來源,要嘛打開七個瀏覽器分頁。演講人親身經歷過在會議室成為那個滾動分頁的人。

第六個是最人性化的:某個真人必須簽名。航空公司聊天機器人告訴悲傷客戶可以先全價購票再申請折扣(政策根本不存在),航空公司辯稱聊天機器人是獨立法律實體,結果賠了錢。真實決策底部有個真人簽名。沒有問責制的人的架構不是產品,是藉口生成器。

演講人的修復方案既簡潔又實用:五項東西,每項對應一個故事。一,每項聲明附帶收據——連結到來源段落並標示信任等級。二,猜測保持視覺分離。三,數字自動彼此同意——系統拒絕提交不匹配的文件。四,矛盾被浮現從不平滑處理。五,真實的人類審批門檢並鎖定審計日誌。注意清單上沒有「更聰明的模型」。這都是工程和誠實問題。這個類別的贏家會因為懷疑金融人士能在晚上 11 點信任輸出而不用打開七個分頁而贏。

最後,他給融資中的創業者忠告:融資會議後,提案變成備忘錄——像他這樣的人寫內部備忘錄,檢查每個大聲說出的數字。所有關於文件的一切都適用於你個人。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing
編輯精選
83 min
AI 技術英文PODCAST8月26日

🔬“We have foundation models for language, not for physics” — Anima Anandkumar, Bren Professor of Computing

Latent Space

  • 加速傳統物理模擬的典範轉移:氣象科學家原本認為 AI 無法匹敵數十年的物理建模工作,但傅里葉神經算子不僅達到同等精度,還快了一萬多倍。原本需要超級計算機的計算現在用消費級 GPU 就能完成,這改變了整個領域的思維方式。
  • 傅里葉域的非局部現象捕捉:傅里葉域能有效表示非局部現象(如大氣河流跨越千里的影響),且計算複雜度為準線性,遠優於完全連接的全局模型。這特別適合流體動力學、量子化學等自然現象中普遍存在的非局部相互作用。
  • 多解析度連續函數表示:神經算子將輸入輸出視為連續函數而非固定維度向量,可在推論時以任意解析度查詢,並能在更高解析度上疊加物理約束或額外數據,克服了固定解析度神經網路的限制。
Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Why the Next AI Breakthrough May Come from Physics with Max Welling - #774
55 min
AI 技術英文PODCAST8月25日

Why the Next AI Breakthrough May Come from Physics with Max Welling - #774

TWIML AI

  • 多層篩選的材料設計流程:先搜尋文獻資料庫找現有材料,若無合適的就用生成模型產生數十萬個候選分子,用機器學習力場進行分子動力學模擬篩選,再進行實驗驗證。這套流程相比傳統量子力學計算能加速效率數個數量級。
  • 生成AI與熱力學的數學等價性:資訊論是兩個領域的共同基礎,生成模型的擴散過程與非平衡統計力學描述資訊損失的過程在數學上完全對應,許多開發出來的方法工具在兩領域都有精確對應的形式。
  • 基礎模型的遷移學習策略:先在廣泛材料資料集上訓練基礎力場表示,再針對特定材料類別進行蒸餾微調,既能保持計算效率也能獲得專一性。