Amazonが購入書籍を裁断しAI学習に使うと報じられました。
米国のテック系メディアが、Amazonが大量に買い集めた印刷書籍の背を切り落としてスキャンし、AIの学習データとして取り込んでいると報じました。追跡装置を本に仕込んで配送先を突き止めた調査で、学習データの調達が紙の本にまで及んでいることが可視化されました。顧問先から「AIの学習に自社の資料が使われているのではないか」と相談されたときの土台になる話でもあります。本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で確認しています。
AirTagが示したAmazonの書籍スキャン工程
報道の骨格は、追跡装置を仕込んだ希少本の行き先がAmazonの倉庫だった、という点にあります。404 Mediaは、AIの学習データとして買われそうな希少本に追跡装置を入れて発送し、最終的にネバダ州ラスベガスのAmazonの倉庫に到着したと報じています。同社の記事によれば、この倉庫で働く従業員は、届いた大量の印刷書籍の背を切り落としてスキャンする作業に従事しており、その工程で紙の本そのものは失われます。倉庫内のチームはVGT3と呼ばれ、本を持った恐竜のロゴを掲げていると説明されています。
スキャンされたデータの用途については、The Decoderが、Amazonが自社のNovaモデルの学習に使っていると伝えています。Amazonは404 Mediaの取材に対し、顧客が使う製品とサービスを改善するために商業的な流通経路を通じて書籍を購入している、と回答したと報じられています。
紙の本が狙われる理由も整理されています。TechCrunchは、絶版本やインターネット上に存在しない書籍が新しい学習データの供給源になっていること、そして2022年より前に出版されたテキストは生成AIが書いた文章を含まないため価値が高いと説明しています。学習データにAI生成文が混ざり込むと出力品質が劣化するモデル崩壊の懸念があり、その回避先として紙の本が浮上した、という文脈です。同じ論点は、AI混入本が市場に与える影響を扱ったAI混入本が2割、1.4万冊調査が示す市場希釈と著作権の新論点でも触れています。
なお同種の取り組みはAmazonだけではないとも報じられています。The Decoderは、Anthropicが書籍を購入して背を切り落とし電子化する取り組みを進めていたことが著作者側の訴訟で明らかになり、裁判所がそのスキャンをフェアユースにあたると判断したと伝えています。判断の理由の一部として、紙の原本が破棄され複製物として再販されなかった点が挙げられたという説明です。
日本の著作権法はどう組み立てられているか
日本でこの種の話題を扱うときの出発点は、著作権法第30条の4です。同条は、著作物に表現された思想または感情を自ら享受し、または他人に享受させることを目的としない場合について、必要と認められる限度で利用できると定めています。情報解析の用に供する場合は、その例として条文に明記されています。一方で同条にはただし書があり、著作物の種類および用途ならびに利用の態様に照らして著作権者の利益を不当に害することとなる場合は、この限りでないとされています(条文はe-Gov法令検索の著作権法で確認)。
複製そのものについては、著作権法第21条が、著作者はその著作物を複製する権利を専有すると定めています。紙の本を裁断してスキャンする行為は物理的には複製を伴いますから、第21条と第30条の4の関係をどう読むかが論点の中心になります。加えて、情報解析の結果提供に付随する軽微利用については第47条の5に規定が置かれています。
ここで押さえておきたいのは、米国のフェアユースと日本の第30条の4が別の制度だという点です。米国の裁判所がフェアユースと判断したからといって、その結論がそのまま日本の事案に持ち込めるわけではありません。第30条の4のただし書の読み方については、文化庁の「AIと著作権について」に整理が公表されています。顧問先から質問を受けたときは、この行政の整理と条文の原文を示したうえで、個別の当てはめは有資格者が担う、という切り分けが現実的です。なお、紙の本を買った人がその本を裁断すること自体は所有権の話であり、そこに収録された著作物を複製して解析に使う評価とは層が分かれます。
顧問先対応と、事務所自身のデータの置き場所
弁理士や弁護士の事務所では、顧問先の資料や制作物がAIの学習に取り込まれる懸念について相談を受ける機会が増えています。相談の入口として確認されるのは、対象物が公開されているか、どの経路で流通したか、利用規約で学習利用への同意が組み込まれていないか、という3点です。プラットフォームの既定設定が学習利用になっている例は実際にあり、その確認手順はTwitch配信がAmazonのAI学習に既定利用|オプトアウト4ステップで整理しています。特許実務側の視点はAI関連発明の審査事例25件を出願実務に落とす 弁理士の確認6視点が参考になります。
事務所自身のデータについても同じ問いが向きます。顧問先から預かった資料を生成AIに入力する場面では、そのサービスが入力内容を学習に使う設定になっているかを、ベンダーの公式ポリシーで確認する運用が広がっています。士業の守秘義務は職種ごとに根拠条文が異なりますから、事務所の規程を作るときは自分の職種の条文に当たったうえで、学習利用の可否とデータの保存期間を書き分ける進め方が採られています。
今後の動き
今回の報道は、学習データの調達がウェブ上のテキストから物理的な出版物へ広がっていることを示しました。注目したいのは3点です。Amazonが購入と裁断の規模について追加の説明を出すか、出版社や著作者団体がどのような立場を示すか、そして日本国内で第30条の4のただし書の読み方をめぐる議論がどう進むかです。
まとめ
Amazonが購入した印刷書籍を裁断してスキャンし、AIの学習に使っていると報じられました。日本で同種の論点を扱うときは、著作権法第30条の4と第21条の関係、そして同条ただし書の読み方が中心になります。米国のフェアユースの判断をそのまま持ち込まず、条文と文化庁の整理に当たるところから始める段階です。
参考文献
- 404 Media We Tracked a Shipment of Rare Books. It Ended at an Amazon AI Training Facility
- The Decoder AirTag reveals how Amazon destroys rare books for AI training
- TechCrunch Amazon, which started off selling books, is destroying rare texts to train AI
- e-Gov法令検索 著作権法
- 文化庁 AIと著作権について
※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/
引用元: The Decoder
本記事の作成体制について
本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。
本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。
記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。