← AI 動態
Simon Willison
AirTag追蹤神祕訂單!揭密亞馬遜狂買實體書訓練AI
外媒利用AirTag追蹤一筆神祕的大宗購書訂單,發現這些書籍最終被送往亞馬遜的設施進行破壞性掃描,證實科技巨頭正大量收購實體書來訓練AI模型。
AI訓練資料
版權爭議
大型語言模型
近期許多書商收到匿名買家不計代價的大量購書訂單。外媒 404 Media 為了追查真相,將蘋果 AirTag 藏入其中一本書中,一路追蹤到亞馬遜位於拉斯維加斯的設施。根據內部員工證實,該設施專門對書籍進行「破壞性掃描」,將實體書大量轉為數位文字。
這起事件凸顯了生成式 AI 發展背後的「資料飢渴」現象。為了訓練更聰明的大型語言模型(LLM),科技巨頭需要海量且高品質的文本資料。當網路上的公開免費資料即將耗盡時,他們便將目標轉向高品質、有版權的實體書籍。
對一般大眾與創作者而言,這不僅引發了關於版權與智慧財產權的深刻爭議,也讓我們看見 AI 企業為了獲取訓練數據所採取的極端手段。未來 AI 模型的資料來源合法性與版權授權,將成為無可迴避的重大治理課題。