AI企業の希少本大量購入に古書商が警告
何が起きたのか。AI企業が高品質テキストの学習データとして古書を大量購入し、その過程で希少本が破壊されている可能性が指摘されている。最も効率的なスキャン方法が、本を木製チッパーで細断してページを自動スキャンすることだからだ。AI企業は「学習データ量の最大化」と「コスト最小化」の両立を求められているため、時間をかけた丁寧なスキャンよりも、破壊的だが高速な方法を選んでいるわけだ。
ここで引っかかるのは、この破壊が「必然」ではなく「選択」だという点だ。Googleは2009年時点で非破壊スキャン技術を特許化していた。曲率による歪みやページ落ちといった課題があるにせよ、技術は存在している。Internet Archiveは時間と注意深さをかけた丁寧なスキャンが文化遺産を守ると考え、実際にそう実践している。つまり、AI企業が本を潰すのは「やむを得ない」のではなく、「その方が投資効率がいい」という判断の結果だ。言い換えれば、ChatGPTやGeminiのような高能力なAIモデルは、人類が積み上げた知識の一部を消費することで成り立つビジネスモデルになっているということだ。知識そのものが有限だからこそ、最初に吸い上げた企業が有利になるという構図。
貴社がAIを使ってコンテンツを生成したり、データを学習させたりするなら、その学習元がどこから来たのかを一度は問い直してほしい。業界のライバル企業の知識が無償で吸われて他人の学習データになっているかもしれない。同じ構図で、貴社の顧客データやノウハウも誰かのAI学習教材になっているかもしれないのだ。
※ 上記は配信元記事をもとにAIの鬼編集部が要約・再構成したものです。正確な内容は出典元をご確認ください。
このニュースの全文は、配信元でお読みいただけます。 Ars Technica AIで元記事を読む →


