Build for the Memo, Not the Demo — Shawn Chan, China Resources Holdings
三句話摘要
AI 在金融決策中的信任危機:流暢自信不等於正確,系統須透明化每項聲明來源並強制人為監督。 AI 財務產品的致勝點不在模型智能,而在系統的透明度與人為問責——再流暢的 AI 也必須通過「溯源、一致、分離、浮現、簽名」五道防線,才能贏得金融決策者的信任。 自信≠正確的陷阱:AI 從不說「我不確定」,這讓人難以判斷輸出可靠性。2023 年 2 月,一家大科技公司因行銷示範中一句關於太空望遠鏡的錯誤資訊,股價單日下跌 8%、市值蒸發約 1000 億美元。問題不在 AI 不聰明,而在金錢一旦開始看著你的文件,就沒有安全的示範。
重點整理
重點- 1
自信≠正確的陷阱:AI 從不說「我不確定」,這讓人難以判斷輸出可靠性。2023 年 2 月,一家大科技公司因行銷示範中一句關於太空望遠鏡的錯誤資訊,股價單日下跌 8%、市值蒸發約 1000 億美元。問題不在 AI 不聰明,而在金錢一旦開始看著你的文件,就沒有安全的示範。
- 2
信任來自程序而非模型:金融決策真正重要的不是更大的 AI 模型,而是五項系統級設計——聲明有出處、數字一致、事實與猜測分離、矛盾被浮現、真人最終簽名。這些都是工程和透明度問題。
- 3
示範與備忘錄的深度差異:AI 產品展示只需五分鐘內看起來聰明,但投資委員會須承受完整審查——數百頁文件、多個來源互相矛盾、需證明每項陳述。系統必須區分來源可信度:審計檔案(法庭作證)vs 群組聊天(閒聊)。演講人見過 AI 信任了群聊中的粗略數據,勝過三行外審計檔案中的官方數字。
- 4
溯源能力是真正的產品:「點擊一次即達確切來源段落」是終極考驗。演講人親身經歷過在投資委員會會議中打開七個瀏覽器分頁試圖驗證陳述的尷尬。系統若無法立即證明聲明出處,在金融環境就無法信任。
實用技巧與重點
乾貨- 具體失敗案例與數據:
- 太空望遠鏡事件(2023年2月):股價單日下跌8%、市值蒸發約1000億美元
- 美國房地產公司:演算法購買房產預測錯誤,核銷約5億美元、關閉整個部門、裁員約四分之一
- 律師案例:用 ChatGPT 引用六個不存在的案例,案例甚至有逼真的名稱和頁碼
- 航空公司聊天機器人:機器人編造「先全價購票再申請折扣」政策,引發仲裁
- 六大信任破裂方式:
- 未區分來源可信度(審計檔案 vs 群組聊天)
- 數字不一致(營收成長18% vs 17.4%)
- 矛盾被平滑處理(CEO說法 vs 官方檔案不同卻選擇好聽的版本)
- 事實與猜測混淆(「可能下季獲批」是猜測但讀起來像事實)
- 無法溯源(無法一鍵驗證聲明來源)
- 無人簽名負責(問責外包給軟體)
- 修復五大方案:
- 每項聲明附帶來源段落連結與信任等級
- 事實與猜測視覺分離
- 系統自動檢查數字一致性、拒絕提交不匹配文件
- 矛盾被主動浮現而非平滑處理
- 真人審批門檢(附完整審計日誌)
結論
結論“AI 財務產品的致勝點不在模型智能,而在系統的透明度與人為問責——再流暢的 AI 也必須通過「溯源、一致、分離、浮現、簽名」五道防線,才能贏得金融決策者的信任。”
完整解析
詳細演講人是一位金融投資委員會的資深成員,15年來在亞洲、美國等地處理跨國併購與重大投資決策,出席過 200 場投資委員會會議。他的核心觀察很簡單但深刻:金融決策中,真正影響融資批准的不是數字本身,而是信任。金錢追隨信任,而信任極脆弱,尤其當撰寫文件的東西從未說過「我不確定」時。
AI 財務產品的根本問題在於它們被設計來在五分鐘內令人印象深刻,而非經得起真實投資委員會的完整審查。演講人區分了兩種場景的本質差異:「示範」是單份乾淨文件進、流暢答案出,目的就是製造五分鐘的「哇」;「備忘錄」則是投資委員會的現實——數百頁文件、相互矛盾的資訊源、筆記、試算表,系統必須經受激烈辯論。
這個差異極為關鍵。2023 年 2 月,一家大科技公司在其新 AI 助手的行銷示範中犯了一個錯誤——關於太空望遠鏡的問題答錯了。單單一句錯誤的事實,市場注意到,股價單日下跌約 8%,市值蒸發 1000 億美元。沒有人在文件離開公司前問最基本問題:「這來自哪裡?有人檢查過嗎?」。這個故事證明硬道理:示範若不通過備忘錄測試就不安全。一旦真實的金錢在看著你,就沒有安全的示範了。
演講人接著詳述信任悄然破裂的六個方式。首先,並非每個資訊來源值得同等信任,但多數 AI 系統都把它們看作一樣。審計檔案中的數字是會計師法庭作證;分析師筆記像聚會上朋友的言論;內部郵件像電梯裡聽到的閒聊。他見過一個昂貴的 AI 系統信任了群組聊天中的粗略數據,勝過三行外審計檔案中的官方數字,因為 AI 更喜歡那段訊息周圍的熱情語氣。
第二個問題是數字必須彼此一致。一份已經失敗的備忘錄例子:第一頁說營收成長 18%,第 11 頁小表格說 17.4%。沒人在乎那 0.6% 差異,他們在乎的是它說明了什麼——如果連簡單數學都沒檢查,複雜的東西上漏掉什麼?房地產業有臭名昭著的案例:美國公司讓演算法大規模購買房產,演算法對房價充滿信心,結果房產不同意,公司核銷約 5 億美元並關閉部門。
第三個洞察令人驚訝:矛盾不是 bug,是禮物。CEO 在獲利電話會和官方檔案說法不同時,那個差距是真相最有趣的部分。但 AI 被訓練得很順滑,遇到衝突就默默選擇讀起來更好聽的版本,你甚至不知道曾有分歧。演講人見過 CEO 數字和檔案數字有意義上的不同,但更漂亮的那個被使用了,沒人標記。他們碰巧同時打開兩份文件才發現。運氣不是控制,系統的工作是確保辯論發生在人類面前。
第四個問題是事實和猜測必須住在不同盒子裡。「公司可能下季獲批」讀起來像事實但是猜測。投資委員會的工作是同意那些猜測同時信任那些事實。如果系統把它們融成一句流暢句子,委員會無法看到接縫,只能根據文件「感覺」批准或拒絕。演講人見過示範在三個草稿中從「預期批准」變成「收到批准」,沒人說謊,猜測只是假扮事實變得越來越久。當批准沒按時到達,那通電話很尷尬。
第五個是當沒人質問聲明來自哪裡時,再怎麼對都不重要。紐約律師的故事廣為人知——用 ChatGPT 撰寫法庭簡狀引用六個不存在的案例,甚至有真實相似的名稱和頁碼。AI 不只說謊,用精美格式引用了自己的謊言。三十秒測試就是:某人指著一句話說「給我看這來自哪裡」,你要嘛點一次到達來源,要嘛打開七個瀏覽器分頁。演講人親身經歷過在會議室成為那個滾動分頁的人。
第六個是最人性化的:某個真人必須簽名。航空公司聊天機器人告訴悲傷客戶可以先全價購票再申請折扣(政策根本不存在),航空公司辯稱聊天機器人是獨立法律實體,結果賠了錢。真實決策底部有個真人簽名。沒有問責制的人的架構不是產品,是藉口生成器。
演講人的修復方案既簡潔又實用:五項東西,每項對應一個故事。一,每項聲明附帶收據——連結到來源段落並標示信任等級。二,猜測保持視覺分離。三,數字自動彼此同意——系統拒絕提交不匹配的文件。四,矛盾被浮現從不平滑處理。五,真實的人類審批門檢並鎖定審計日誌。注意清單上沒有「更聰明的模型」。這都是工程和誠實問題。這個類別的贏家會因為懷疑金融人士能在晚上 11 點信任輸出而不用打開七個分頁而贏。
最後,他給融資中的創業者忠告:融資會議後,提案變成備忘錄——像他這樣的人寫內部備忘錄,檢查每個大聲說出的數字。所有關於文件的一切都適用於你個人。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


