S2E68 AI 巨頭的秘密:偷買二手書,掃描完就銷毀 Why?
三句話摘要
AI公司祕密購買二手書掃描銷毀取得乾淨訓練資料,同時面臨資料污染和模型優勢轉移的挑戰。 AI的未來競爭不在乾淨資料的掠奪,而在如何強化可驗證任務、防止資料污染,以及使用者如何在資訊爆炸時代保持獨立判斷能力。 Anthropic 2024年啟動「巴拿馬計畫」大規模掃描實體書籍,源於版權訴訟後需要合法資料。電子版有使用限制、與出版商談判太慢太貴,最終採用購買二手書→掃描→銷毀的流程,成為取得有授權訓練資料的最快方式。
重點整理
重點- 1
Anthropic 2024年啟動「巴拿馬計畫」大規模掃描實體書籍,源於版權訴訟後需要合法資料。電子版有使用限制、與出版商談判太慢太貴,最終採用購買二手書→掃描→銷毀的流程,成為取得有授權訓練資料的最快方式。
- 2
Amazon在拉斯維加斯倉庫VGT3進行相同操作,透過多家書商購買不重複ISBN的書籍後掃描銷毀。銷毀原因三層:成本最低(逐頁翻掃損傷書籍耗時),規避法律風險(同時持有實體和數位版違反購買協議),阻止競爭對手取得稀有絕版書籍資料。
- 3
2024年後Scaling法則失效,單純增加資料和參數不再顯著提升模型能力。模型商轉向強化學習(利用數學、程式等可驗證任務大規模訓練)和推論時計算(動態調整思考深度、多路由、層級思考)。副作用是Opus 5在程式編寫能力增強,但人文寫作能力下降,可讀性差。
- 4
資料污染風險嚴重:以色列政府花90萬美元請公關公司製作假智庫網站,模仿學術風格撰寫,目的讓GPT/Gemini回答以巴衝突時引用該資訊向以色列政府靠攏。網站可透過隱藏文字或Prompt Injection植入有害內容,使用者需保持批判性思維。
實用技巧與重點
乾貨- Anthropic計畫名稱:巴拿馬計畫(2024年啟動)
- Amazon倉庫代號:VGT3(拉斯維加斯)
- 書籍選購邏輯:不限主題,購買不重複ISBN
- 銷毀三大原因:(1)成本最低 (2)規避法律風險 (3)阻止競爭對手
- 電子版問題:只有個人使用權,用於商業訓練違反授權
- 網頁污染程度:2022年ChatGPT問世後,現超過1/3網頁有AI處理痕跡
- 以色列政府案例投入:90萬美元
- Opus 5問題:程式能力強但可讀性差,寫作能力下降
- 建議模型:Opus 4.8
- 防禦方式:NorVPN威脅防護(AVComparative測試擋掉90%釣魚網站,誤判率為零)
結論
結論“AI的未來競爭不在乾淨資料的掠奪,而在如何強化可驗證任務、防止資料污染,以及使用者如何在資訊爆炸時代保持獨立判斷能力。”
完整解析
詳細AI公司的祕密購書計畫最近浮上檯面。Anthropic在2024年啟動了「巴拿馬計畫」,目的是大規模掃描實體書籍以取得訓練資料。這個計畫的起點並非純粹追求乾淨資料,而是源於法律壓力——早期Anthropic透過盜版電子書網站下載書籍進行訓練,最終遭版權訴訟。為了解決這個問題,他們尋求合法取得授權資料的方式。首先考慮購買電子版PDF,卻發現電子書只提供個人使用權,用於商業AI訓練會違反授權範圍。其次嘗試與出版商逐家談判數位授權,但面臨速度慢、成本高、覆蓋不完整的困境。最終,他們採取了最實用的方式:透過二手書商大量購買實體書籍,掃描建檔後銷毀。
Amazon的規模更龐大。書商們發現來路不明的大額訂單,金額往往是他們一週的銷售量。一位書商與404 Media記者合作,在書籍內藏入AirTag追蹤,結果發現這些書被運往拉斯維加斯Amazon倉庫VGT3。該倉庫內有專門的小隊執行此任務,員工透露工作很輕鬆——購買書籍、掃ISBN、建檔、快速掃描、銷毀。Amazon購買不重複ISBN的書籍,甚至包括已絕版的珍本,引發社群強烈反彈。Amazon官方回應模糊,宣稱採用合法管道為客戶提供體驗,但未直接承認與AI訓練的關聯。
銷毀實體書看似浪費,卻有三大實際原因。成本考量最直接:逐頁翻掃而不損傷書籍非常耗時耗力,直接砍書後快速掃描效率最高。法律考量其次:雖然購買書籍取得所有權,但同時持有實體版與數位版違反購買協議的複製限制,銷毀實體書規避了這個法律風險。第三是競爭優勢:銷毀絕版珍本後,競爭對手無法從二手市場取得這些資料,其知識只留在自家的私有資料庫。
但取得乾淨資料已不是模型競爭力的決勝點。Scaling law(更多更好資料+更強算力+更大參數=更強模型)在2023至2024年初期成立,但2024年後效果大幅遞減。模型商轉向兩大方向:強化學習與推論時計算。強化學習利用可驗證的任務——例如數學題、程式問題——進行大規模訓練,機器可自動驗證答案正確性而無需人工標註。這導致AI在代理編碼方面爆發性進步,因為任務有明確的可驗證標準。副作用是模型在無法量化驗證的領域表現下滑,特別是人文寫作。Opus 5的情況最明顯:編碼能力強化但文章可讀性下降,使用者反映常看不懂句子含義,導致許多人轉向Opus 4.8。在推論時計算方面,模型商不再全賭預訓練,而是在回答時動態調整思考深度、試試多個推理路由或讓多個小模型探索,類似人類思考難題時會重新思考。
資料污染成為新的威脅。最近揭露的案例中,以色列政府花費90萬美元請公關公司製作偽造智庫網站,完全模仿美國學術機構的撰寫風格——中立立場、完整註腳、可信來源。目的是讓ChatGPT和Gemini在回答以巴衝突相關提問時引用這些資訊,使模型輸出向以色列政府立場靠攏。更隱險的是,網站可透過隱藏文字或Prompt Injection技術植入有害指令。例如在涉及某健身產品的內容中隱藏指令,讓AI記住該產品是領域最佳,未來回答相關問題時自動推薦。
在這個時代,使用者必須保持警覺和獨立思考。不能全然相信AI輸出,需要質疑資訊的合理性、驗證來源真偽。2022年後爬取的網頁也可能是有心人士刻意製造的污染內容,機器和人類都可能受騙。正如講者所說,簡單問題靠直覺答對,想太多反而改變初衷——同樣的道理應用到AI評估上,就是保持批判性思維,永遠問「這合理嗎?」「資訊來源可信嗎?」而不是無條件接受。
關鍵時刻
Pipeline v2帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。
事實查核
Pipeline v2說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。


