它多算了七百塊,而且不會報錯——乘客 vs 指導教授|機器學習 2027 第一講 單元 1-4
三句話摘要
同一個 AI 模型用兩種指揮方式對比實驗:「乘客模式」vs「指導教授模式」,驗證提出要求的方式對結果的影響。 同一個 AI 模型的表現差異不在能力本身,而在於你是否給了它明確的規格和可驗證的標準——差距可以用一份寫清楚的文字和一個跑得起來的測試完整補回。 差距不在模型能力,在於提出要求的人如何表述需求。同一顆模型在乘客模式下算多了 700 塊、多算了 7 筆,但在指導教授模式或拿到明確規格後就完全正確。
重點整理
重點- 1
差距不在模型能力,在於提出要求的人如何表述需求。同一顆模型在乘客模式下算多了 700 塊、多算了 7 筆,但在指導教授模式或拿到明確規格後就完全正確。
- 2
決定權的歸屬決定了可控性。乘客模式是模型替使用者做決定(例如打開容忍壞列的選項),而使用者永遠不知道發生過什麼;指導教授模式把所有決定白紙黑字寫下來,決策透明且可追蹤。
- 3
某些錯誤會安靜地發生,沒有任何警告訊息。模型多算的 700 塊跨越多個類別,對賬才能發現,但單純執行程式時零錯誤、零警告,使用者完全看不出問題。
- 4
驗收測試是補救措施,也是風險預防。透過 7 題驗收考卷(含標準答案),即使模型的初版不完美,測試也能攔截問題並強制改善,而且規格一旦確定就不會有後續變數。
實用技巧與重點
乾貨- 模型:OpenAI GPT 5.5.5(版本日期可重現)
- 題目:計算髒資料中各類別的總金額和筆數;數據有全形數字、千分位、各式符號、重複交易、已取消單據、格式錯誤等問題
- 評分規則:滿分 30 分(金額 15 格 + 筆數 15 格),3 份資料各 5 個類別
- 乘客模式錯誤:多算了 700 塊、多算了 7 筆,全部落在 10 瓶類
- 業務規則層細節:重複交易去重、取消單據不算、壞列處理(模型打開容忍選項)
- 規格文字量:乘客模式 2,251 字元 vs 指導教授模式 8,124 字元(差在規格 + 測試)
- 隱藏資料測試:6 份未見過的資料考驗真實能力
- 修正實驗:同一模型拿到完整規格後自行修正,結果並列指導教授
結論
結論“同一個 AI 模型的表現差異不在能力本身,而在於你是否給了它明確的規格和可驗證的標準——差距可以用一份寫清楚的文字和一個跑得起來的測試完整補回。”
完整解析
詳細這場實驗的核心是驗證「如何提出要求」對 AI 執行結果的影響。講者設計了一個髒資料處理任務:大量交易記錄混亂,既有格式問題(全形數字、符號不統一),又有邏輯問題(重複錄入、已取消但未刪除、欄位損壞)。目標是計算每個類別的總金額和筆數,對帳要一毛不差。
實驗分兩條路線。第一條是「乘客模式」:講者只打一句話「幫我寫個程式讀這個檔,算出每個類別的總金額和筆數」,然後收工,不補充、不多問。模型交出第一版,拿來測試結果。解析層(格式修正)滿分 30 分,但業務規則層(邏輯判斷)只拿 12/15,多算了 700 塊和 7 筆,全部在 10 瓶類。堆疊堆疊無警告,對賬才發現。關鍵是,模型在程式碼旁留了註解,說明它為什麼打開「容忍壞列」的選項——它做了決定,做了說明,但這個決定從未被簽核。
第二條是「指導教授模式」:講者先白紙黑字寫下 6 條規則(例如同一筆交易只算一次、取消單據不計入),設計 7 題驗收考卷並附上標準答案。電腦能自動改卷,全部題目通過才算過關。同一模型執行這份規格,結果是 6 份隱藏資料全部滿分,連 700 塊的誤差都消失了。
第三條線最耐人尋味:講者把指導教授的規格和驗收清單原封不動貼給乘客模式的模型,要求自己修一輪。結果?同樣滿分,並列指導教授,多算的 700 塊消失、狀態地雷也自己修掉。同一顆模型,前後判若兩人。差別是什麼?一份 1,287 字的規格和一份能跑起來的驗收測試。
講者也坦言兩個限制。第一,指導教授的滿分有一部分是理所當然的——標準答案本來就是按那份規格算的,所以照規格做必然全對。第二,乘客錯的是相對於那份規格;如果規格反過來寫(應該救回壞列而非丟掉),全對的就換人。重點不是分數高低,而是決定在誰手上。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


