如果你開一間二手書店,
有一天突然有人一次買走:
一本老舊農業工具書,
一本 1950 年代賽車手傳記,
一本外文小說,
一本幾十年前的軍艦雜誌,
你大概會想:
這個人到底在研究什麼?
但最近英國與愛爾蘭不少二手書店,
真的開始遇到這種奇怪的客人。
而且不是買十本、二十本。
是幾百本,
甚至幾千本。
Guardian 採訪的英國書商表示,最近幾個月開始收到大量主題毫無關聯的訂單。有人從美國、加拿大、歐洲與英國下單;其中一名匿名書商更表示,今年以來已收到類似買家約 6,000 本書的訂單,而且這些買家願意付高價,大量購買時也不太要求折扣。
這就讓書商開始懷疑:
這些書真的有人要「看」嗎?
還是有人想要的,
其實不是書,
而是裡面的文字?
先說清楚:現在還沒證實是 AI 公司
這一點非常重要。
Guardian 報導的是:
多家二手書店觀察到異常的大量採購,
而一些書商因此懷疑,這些書可能最後會被掃描,拿去做 AI 訓練資料。
但目前沒有證據證明,
這一波神秘訂單背後就是某一家 AI 公司。
甚至連部分書商自己都提出疑問:
有些被買走的書明明早就能免費在網路上找到,
如果真的是拿去訓練 AI,
為什麼還要買實體書?
所以這個故事最有意思的地方,
不是「AI 公司又被抓到了」。
而是:
為什麼在 AI 時代,幾十年前的舊書突然變得值得大量搜尋?
因為最先進的 AI,還是需要吃資料
ChatGPT、Claude 或其他大型語言模型,
不是一出生就懂語言。
它們需要從大量文字裡學習:
一句話通常怎麼接,
不同概念怎麼關聯,
人類怎麼寫故事,
怎麼說明知識,
怎麼表達不同時代與文化的想法。
網路當然是非常大的資料來源。
但問題也慢慢出現了。
現在的網路,
已經和五年前的網路不一樣。
因為今天你看到的一篇文章,
可能是人寫的,
也可能是 AI 寫的,
甚至可能是:
AI 先寫,
人再修改,
另一個 AI 再整理一次。
於是下一個問題就來了:
如果 AI 未來繼續拿網路資料訓練,怎麼知道自己吃到的不是上一代 AI 寫出來的東西?
AI 愈普及,「AI 出現以前的文字」反而可能愈珍貴
這就是老書突然變得有意思的地方。
2026 年的一篇網路文章,
你不一定知道有多少內容曾經經過 AI。
但一本 1983 年印出來的雜誌,
不用猜。
那時候根本沒有今天的生成式 AI。
一本 1970 年出版的地方史,
一本 1950 年的汽車傳記,
甚至一本從來沒有被 Google 完整數位化的冷門書,
都有一個今天突然變得很特別的特徵:
它幾乎可以確定來自人類。
Guardian 報導提到,一個書籍資料庫先前甚至曾用「書架上的書就是 AI 訓練資料」作為市場測試方向,並特別把 2022 年以前出版的內容視為有吸引力,理由正是這些文字比較不容易混入聊天機器人生成內容。該頁面後來已被撤下,業者表示那只是測試市場興趣。
這不是第一次有人為了 AI 大量買實體書
書商之所以會產生這種聯想,
也不是完全沒有前例。
Anthropic 過去就曾大量購買實體書籍,
再把書脊切除,
將書頁掃描成數位內容。
Anthropic 對 Guardian 表示,Claude 的訓練資料來自公開網路資料、商業取得的資料集,以及公司自行產生的資料;公司也表示,取得書籍是大型語言模型產業會使用的一種資料來源。
所以現在二手書商看到:
買家身分模糊,
選書完全沒有主題,
一次大量採購,
又願意支付高價,
自然就會想到:
這會不會又是一波資料收集?
但再次強調,
這次這些訂單的真正用途,目前仍沒有被證實。
為什麼不能只把 AI 寫的內容再餵給 AI?
想像一個學生。
第一年,
老師讓他讀一百本真正的人類作品。
他學完以後,
開始自己寫文章。
第二年,
新的學生進來。
但老師沒有再拿原本那一百本書,
反而拿:
第一個學生寫的文章,
第一個學生的摘要,
第一個學生改寫過的版本,
讓第二個學生繼續學。
到了第三代,
又再讀第二代寫的內容。
久了以後會發生什麼?
原本資料裡的細節、
少數觀點、
特殊寫法,
都有可能慢慢被磨平。
這不代表 AI 生成資料完全不能用。
研究人員確實會使用合成資料訓練與改善模型。
真正的問題是:
你必須知道資料從哪裡來、品質如何,以及裡面到底有多少是人類原始資料。
所以真正有價值的,
不只是「更多文字」。
而是:
來源清楚、品質夠好,而且你知道它是什麼的文字。
這就像種子庫
全世界已經有很多地方建立種子庫。
不是因為現在沒有植物。
而是因為當農業大量使用少數品種之後,
那些比較古老、少見、沒有被取代的種子,
反而可能成為未來重新培育的重要資源。
文字也可能出現類似現象。
網路上的內容只會愈來愈多。
但其中真正能確定:
由人類寫成,
來自特定年代,
有清楚來源,
沒有經過生成式 AI 介入,
這種資料反而可能變得更難找。
於是一本以前只值幾英鎊、
放在角落很多年都沒人翻的書,
突然多出另一種可能的價值:
它保存了一小塊還沒有被生成式 AI 影響過的人類語言。
而且老書裡有網路找不到的東西
還有另一個容易被忽略的問題。
我們常以為:
Google 找不到的東西,
大概就不存在。
其實不是。
世界上還有大量:
地方史,
專業手冊,
舊期刊,
冷門語言作品,
絕版書,
區域性出版品,
私人研究資料,
根本沒有完整數位化。
所以一本非常冷門的舊書,
對普通讀者來說可能完全沒興趣,
對想增加模型資料多樣性的人來說,
卻可能代表網路上根本沒有的內容。
這也是為什麼這些「亂七八糟」的採購,
反而特別引起書商注意。
如果有人是收藏某個主題,
通常會買一整批鐵路書、
汽車書、
軍事書,
或者某個作家的作品。
但現在出現的訂單,
恰恰沒有這種邏輯。
真正稀缺的東西,可能正在改變
AI 熱潮剛開始時,
大家說最缺的是:
GPU。
後來大家發現還缺:
資料中心,
電力,
網路,
變壓器,
甚至土地。
但當模型愈來愈多,
網路也開始出現愈來愈多 AI 生成內容之後,
另一種稀缺資源可能開始浮現:
高品質、來源清楚的人類原始資料。
而它可能藏在非常意想不到的地方。
不是新的資料中心。
不是最先進的晶片工廠。
而是一間幾十年歷史的二手書店裡。
AI 愈進步,人類留下的原始痕跡可能愈重要
這大概是今天這個故事最有趣的反差。
我們一直以為 AI 的方向是:
把所有書數位化,
把所有知識放到網路,
最後實體資料就不重要了。
結果 AI 發展到某個階段後,
可能反過來開始尋找:
那些還沒有被數位世界反覆複製、整理與生成過的內容。
所以今天真正值得思考的,
不是那些神秘買家究竟是不是 AI 公司。
而是:
當 AI 產生的內容愈來愈多,
我們會不會開始重新發現,
「這確定是一個人真正寫下來的」
本身就是一種價值?
幾十年前沒有人想到,
一本老書最珍貴的地方,
有一天可能不是它有多熱門。
而是:
它保存了一段 AI 還沒有出現以前,人類真正寫下來的文字。
今天,和 AI 一起進步一點。
每天學會一個 AI 技巧。
每天節省一點時間。
每天提升一點能力。
SasaDaily,陪你一起成長。
推薦閱讀
AI 幫你整理好新聞,但如果沒有人再點進原網站,未來誰來採訪真相?
AI 今日早報|2026/07/26:Meta AI 開始自動執行定期任務、印度法院支持 AI 訓練使用新聞、馬來西亞資料中心面臨水電壓力