KeyFrame內部研究專用

S2E68 AI 巨頭的秘密:偷買二手書,掃描完就銷毀 Why?

矽谷輕鬆談·8月23日週日·18 min中文

三句話摘要

AI公司祕密購買二手書掃描銷毀取得乾淨訓練資料,同時面臨資料污染和模型優勢轉移的挑戰。 AI的未來競爭不在乾淨資料的掠奪,而在如何強化可驗證任務、防止資料污染,以及使用者如何在資訊爆炸時代保持獨立判斷能力。 Anthropic 2024年啟動「巴拿馬計畫」大規模掃描實體書籍,源於版權訴訟後需要合法資料。電子版有使用限制、與出版商談判太慢太貴,最終採用購買二手書→掃描→銷毀的流程,成為取得有授權訓練資料的最快方式。

重點整理

重點
  • 1

    Anthropic 2024年啟動「巴拿馬計畫」大規模掃描實體書籍,源於版權訴訟後需要合法資料。電子版有使用限制、與出版商談判太慢太貴,最終採用購買二手書→掃描→銷毀的流程,成為取得有授權訓練資料的最快方式。

  • 2

    Amazon在拉斯維加斯倉庫VGT3進行相同操作,透過多家書商購買不重複ISBN的書籍後掃描銷毀。銷毀原因三層:成本最低(逐頁翻掃損傷書籍耗時),規避法律風險(同時持有實體和數位版違反購買協議),阻止競爭對手取得稀有絕版書籍資料。

  • 3

    2024年後Scaling法則失效,單純增加資料和參數不再顯著提升模型能力。模型商轉向強化學習(利用數學、程式等可驗證任務大規模訓練)和推論時計算(動態調整思考深度、多路由、層級思考)。副作用是Opus 5在程式編寫能力增強,但人文寫作能力下降,可讀性差。

  • 4

    資料污染風險嚴重:以色列政府花90萬美元請公關公司製作假智庫網站,模仿學術風格撰寫,目的讓GPT/Gemini回答以巴衝突時引用該資訊向以色列政府靠攏。網站可透過隱藏文字或Prompt Injection植入有害內容,使用者需保持批判性思維。

實用技巧與重點

乾貨
  • Anthropic計畫名稱:巴拿馬計畫(2024年啟動)
  • Amazon倉庫代號:VGT3(拉斯維加斯)
  • 書籍選購邏輯:不限主題,購買不重複ISBN
  • 銷毀三大原因:(1)成本最低 (2)規避法律風險 (3)阻止競爭對手
  • 電子版問題:只有個人使用權,用於商業訓練違反授權
  • 網頁污染程度:2022年ChatGPT問世後,現超過1/3網頁有AI處理痕跡
  • 以色列政府案例投入:90萬美元
  • Opus 5問題:程式能力強但可讀性差,寫作能力下降
  • 建議模型:Opus 4.8
  • 防禦方式:NorVPN威脅防護(AVComparative測試擋掉90%釣魚網站,誤判率為零)

結論

結論

AI的未來競爭不在乾淨資料的掠奪,而在如何強化可驗證任務、防止資料污染,以及使用者如何在資訊爆炸時代保持獨立判斷能力。

完整解析

詳細

AI公司的祕密購書計畫最近浮上檯面。Anthropic在2024年啟動了「巴拿馬計畫」,目的是大規模掃描實體書籍以取得訓練資料。這個計畫的起點並非純粹追求乾淨資料,而是源於法律壓力——早期Anthropic透過盜版電子書網站下載書籍進行訓練,最終遭版權訴訟。為了解決這個問題,他們尋求合法取得授權資料的方式。首先考慮購買電子版PDF,卻發現電子書只提供個人使用權,用於商業AI訓練會違反授權範圍。其次嘗試與出版商逐家談判數位授權,但面臨速度慢、成本高、覆蓋不完整的困境。最終,他們採取了最實用的方式:透過二手書商大量購買實體書籍,掃描建檔後銷毀。

Amazon的規模更龐大。書商們發現來路不明的大額訂單,金額往往是他們一週的銷售量。一位書商與404 Media記者合作,在書籍內藏入AirTag追蹤,結果發現這些書被運往拉斯維加斯Amazon倉庫VGT3。該倉庫內有專門的小隊執行此任務,員工透露工作很輕鬆——購買書籍、掃ISBN、建檔、快速掃描、銷毀。Amazon購買不重複ISBN的書籍,甚至包括已絕版的珍本,引發社群強烈反彈。Amazon官方回應模糊,宣稱採用合法管道為客戶提供體驗,但未直接承認與AI訓練的關聯。

銷毀實體書看似浪費,卻有三大實際原因。成本考量最直接:逐頁翻掃而不損傷書籍非常耗時耗力,直接砍書後快速掃描效率最高。法律考量其次:雖然購買書籍取得所有權,但同時持有實體版與數位版違反購買協議的複製限制,銷毀實體書規避了這個法律風險。第三是競爭優勢:銷毀絕版珍本後,競爭對手無法從二手市場取得這些資料,其知識只留在自家的私有資料庫。

但取得乾淨資料已不是模型競爭力的決勝點。Scaling law(更多更好資料+更強算力+更大參數=更強模型)在2023至2024年初期成立,但2024年後效果大幅遞減。模型商轉向兩大方向:強化學習與推論時計算。強化學習利用可驗證的任務——例如數學題、程式問題——進行大規模訓練,機器可自動驗證答案正確性而無需人工標註。這導致AI在代理編碼方面爆發性進步,因為任務有明確的可驗證標準。副作用是模型在無法量化驗證的領域表現下滑,特別是人文寫作。Opus 5的情況最明顯:編碼能力強化但文章可讀性下降,使用者反映常看不懂句子含義,導致許多人轉向Opus 4.8。在推論時計算方面,模型商不再全賭預訓練,而是在回答時動態調整思考深度、試試多個推理路由或讓多個小模型探索,類似人類思考難題時會重新思考。

資料污染成為新的威脅。最近揭露的案例中,以色列政府花費90萬美元請公關公司製作偽造智庫網站,完全模仿美國學術機構的撰寫風格——中立立場、完整註腳、可信來源。目的是讓ChatGPT和Gemini在回答以巴衝突相關提問時引用這些資訊,使模型輸出向以色列政府立場靠攏。更隱險的是,網站可透過隱藏文字或Prompt Injection技術植入有害指令。例如在涉及某健身產品的內容中隱藏指令,讓AI記住該產品是領域最佳,未來回答相關問題時自動推薦。

在這個時代,使用者必須保持警覺和獨立思考。不能全然相信AI輸出,需要質疑資訊的合理性、驗證來源真偽。2022年後爬取的網頁也可能是有心人士刻意製造的污染內容,機器和人類都可能受騙。正如講者所說,簡單問題靠直覺答對,想太多反而改變初衷——同樣的道理應用到AI評估上,就是保持批判性思維,永遠問「這合理嗎?」「資訊來源可信嗎?」而不是無條件接受。

關鍵時刻

Pipeline v2

帶時間戳的重點,會在逐字稿層級分析上線後產生。目前請先透過原始影片觀看。

事實查核

Pipeline v2

說法查證是下一次管線升級的一部分。KeyFrame 只會顯示它真正能驗證的內容。

更多「AI 技術」的內容

Between Two Nerds: Attribution is dead, long live attribution
32 min
AI 技術英文PODCAST8月25日

Between Two Nerds: Attribution is dead, long live attribution

Risky Business

  • 工具成本的破壞性下降 — 傳統上,攻擊者必須重複使用昂貴自製的惡意軟體或工具組,因為開發和維護成本極高。這種成本結構使得安全研究人員可以通過工具特徵和程式碼簽名來追蹤攻擊者。LLM 自動化了代碼生成與維護工作流,使得攻擊者可以輕易為每個目標生成新工具,或改用通用系統工具,導致傳統的工具特徵分析失效。
  • 所有取證證據都在攻擊者掌控之中 — 無論是使用的 IP 位址、惡意軟體類型或戰術流程,這些都是攻擊者的主動選擇。即使看似是隨機巧合,攻擊者仍有能力在事前決定留下什麼痕跡。因此,所有可恢復的取證證據本質上都是攻擊者願意暴露的信息。
  • LLM 削弱工具簽名但保留高階行為特徵 — LLM 經過公開駭客技術訓練,使不同使用者產生相似的攻擊模式。然而,勒索軟體集團、國家級行為者的受害者選擇、贖金要求方式或目標模式等高階特徵仍具有識別價值。例如,鎖定加密交易所的攻擊幾乎只能指向朝鮮。
Everything Goldman Sachs Taught Me About AI (In 10 minutes)
AI 技術英文8月24日

Everything Goldman Sachs Taught Me About AI (In 10 minutes)

Nate Herk

  • 驗證優於相信:看起來完整的AI輸出不等於正確答案,需在提示中要求模型重新檢查數字、引用來源,並對無把握的部分標記。
  • 區分AI與自動化:確定步驟且答案已知的任務用傳統自動化更便宜快速;只在需要判斷力、靈活性或處理複雜資訊時才用AI,兩者結合效果最佳。
  • 以問題驅動選型:先寫清楚「要解決的問題是什麼、成功的樣子是什麼」,再決定用什麼工具,許多失敗項目是從技術而非問題出發。
Mu: a self-hosted personal agent where the interface is an email address you can write to
AI 技術英文8月23日

Mu: a self-hosted personal agent where the interface is an email address you can write to

GitHub Awesome

  • Mu 是自主代理人系統,具有實際網址與獨立伺服器,用戶可透過多種方式與其互動——網頁應用、電子郵件或程式化介面。
  • 架構完整覆蓋日常工作流程的多個層面,整合郵件收發(SMTP/IMAP)、檔案管理、行事曆、新聞聚合、市場數據與搜尋功能於一個 Go 伺服器內。
  • 支援自帶模型與多種通訊協定,用戶可選擇不同的 AI 模型,並透過 MCP、HTTP API 或命令列工具整合到其他系統。