動画1000万時間の学習データが研究公開 士業が読む著作権の4論点

LAIONが動画1000万時間分の学習データを研究用に公開しました。13億URL・8000万本という規模と研究目的限定の条件、削除相談の窓口、日本と欧州の前提の違いを士業向けに整理します。

動画1000万時間の学習データが研究公開 士業が読む著作権の4論点

LAIONが動画1000万時間分の学習データを研究用に公開しました。

ドイツの非営利研究団体LAIONが、動画1000万時間分という規模の学習データを研究用に公開しました。これまで大規模な動画データは一部の企業の内部にとどまっていたため、その中身が外から見える形で出てきたこと自体が転換点になります。士業事務所にとっては、顧問先から「うちの動画が学習に使われているのではないか」と相談されたときの下調べの土台が一つ増えた、という読み方ができます。本記事は公表資料にもとづく事実の整理であり、個別の事案について法律上の判断を示すものではありません。条文は原文で確認したものだけを挙げています。

LAION-BVDで公開されたものの中身

公開されたのは、LAION-BVD(LAION Big Video Dataset)という動画データセットです。arXivに投稿された論文は2026年8月25日付で、テュービンゲン大学のTübingen AI Center、LAION、ユーリッヒ研究センター、Wynd Labs、マックス・プランク知能システム研究所などに所属する12名が名を連ねています。

規模の内訳はプロジェクトページに示されています。まずCommon Crawlの収集データから13億件の動画URLを抽出し、そこから8000万本の動画をダウンロードして合計1000万時間ぶんを確保しています。そのうえで場面の切り替わりを自動検出してクリップに分割し、動画と音声のキャプションをAIで合成生成する、という組み立てです。

配布形態はダウンロードページで分かれています。URLとメタデータだけの軽量版として13億件のBVD-URLsがあり、実データを含むものとしては5500万クリップのBVD-V-55M、音声の170万クリップと1000万クリップ、画像フレーム3億件のBVD-I-300MがHugging Faceで配布されています。8000万本の動画そのものを含むBVD-RAWだけは、研究協力としての個別申請という扱いです。

性能面では、同じプロジェクトページが、LAION-BVDで学習したViCLIPがInternVidで学習したモデルを動画テキストの標準ベンチマークで最大2.1パーセント上回ったと報告しています。

なぜこの公開が注目されるのか

大規模な動画データが公開された意味は、性能の数字よりも「外から検証できるようになった」ことにあります。LAIONは公開に際しての説明のなかで、大規模動画データとそれで学習したモデルが少数の非公開企業に集中しており、独立した科学的検証と再現が制限されている、という問題意識を挙げています。

同時に、利用条件も明示されています。LAION-BVDは研究目的に限って公開され、商用利用は対象外とされています。加えて、利用者に対してコンテンツ制作者の権利と著作権を尊重し、適用される法令とプラットフォームの規約に沿って責任をもって使うことを求めています。ウェブ由来の大規模データに共通する偏りや表現の不均衡が含まれ得ることも、同じ文書のなかで明記されています。

データセンターのサーバーラックと配線

権利関係についてのLAION自身の整理はFAQに書かれています。LAIONのデータセットはオリジナルの映像や画像そのものを保持せず、URLリンクとキャプションなどのメタデータだけを含む、という説明です。そのうえで、ウェブ上から素材そのものを消したい場合はYouTubeやVimeoといったホスティング元に直接連絡することになる、と案内しています。収集の前提となったCommon Crawlのクロールについては、robots.txtの指示を尊重していたとも記載しています。

法的な根拠としてLAIONが挙げているのは、EUのテキスト・データマイニング例外の第3条と、ドイツ著作権法(UrhG)の第60d条です。これはEUとドイツの制度を前提にした説明であり、日本の制度をそのまま説明したものではありません。日本には情報解析のための利用について、著作権法第30条の4(著作物に表現された思想又は感情の享受を目的としない利用)という規定が置かれています。国ごとに前提となる規定が別建てになっている、という構図をまず押さえておく場面です。

士業事務所の視点で読む4つの論点

第一に、動画は書面よりも本人が写り込みやすい素材だという点です。顧問先が公開ウェブに置いているセミナー動画や紹介動画は、URL収集の母集団に含まれ得る性質のものです。相談を受けたときに、どこに何を公開しているかの棚卸しから入る事務所があります。

第二に、削除の相談先が分かれるという整理です。LAIONのFAQは、素材そのものの削除はホスティング元へ、氏名や本人の画像といった個人データに関わる部分はプライバシーポリシーページのフォームへ、と窓口を分けています。同ページのフォームは、氏名・メール・説明に加えてデータセット名・サンプルID・該当URLを記入する形式です。LAIONは、申請を受けて調査し検証できた場合に自分たちの管理下にある全リポジトリから該当エントリを削除するとしつつ、torrentなどで流通した過去のリリースには手が届かないとも書いています。ここは相談を受ける側が最初に切り分ける部分になります。

第三に、ライセンス条件がモデルの出どころを追うときの手がかりになる点です。研究目的限定・商用利用対象外という条件が明示されているデータセットが、どのモデルの学習に使われているかは、ツール選定の際にベンダーへ確認する項目の一つになります。事務所で使う画像生成や動画生成のツールについて、学習データの由来をどこまで開示しているかは、EU AI Actの透明性義務の適用開始とあわせて見ておく論点です。

第四に、国ごとの前提の違いです。米国ではAI学習と著作権をめぐる3つの判決が「学習」と「入手」を分けて扱いました。日本では文化庁のAIと著作権チェックリストが顧問先への説明材料として整理されており、Amazonが希少本を裁断してAI学習に使った件のように、入手の経路そのものが論点になった事例もあります。権利者が分からない著作物については未管理著作物裁定制度という別の道筋も動いています。海外のデータセットの説明文をそのまま日本の相談に持ち込まない、という距離の取り方が要ります。

なお本件は研究用データセットの公開であり、事務所が生成AIツールに入力したデータが学習に使われるかどうかとは別の論点です。後者を確認する先は各ベンダーの利用規約とプライバシーポリシーであり、データセット側の文書ではありません。

今後の動き

注目したいのは、公開規模がここまで来たことで、データの中身に対する検証が外部から始まる点です。過去のLAIONデータセットでも、公開後に第三者の分析によって問題のある素材の混入が指摘された経緯があり、今回も同様の検証が進むと見られます。

日本国内の動画がどの程度含まれているか、国内の権利者団体や文化庁が本件についてどう反応するかは、執筆時点の公表資料からは確認できません(要確認)。またBVD-RAWの個別申請がどのような基準で審査されるかも、公開されている範囲では読み取れません(要確認)。続報が出た段階で、あらためて整理する領域です。

まとめ

LAIONが動画1000万時間分の学習データを研究用に公開しました。研究目的限定・商用利用対象外という条件と、素材そのものは保持せずURLとメタデータだけを配布するという構造が、公表資料に明記されています。士業事務所としては、削除の相談先の切り分けと、日本と欧州で前提となる規定が別建てである点を押さえておく段階です。

参考文献

※士業のチカラでは、生成AIの導入支援から運用最適化まで、貴事務所の業務に合わせたカスタマイズ提案を行っています。無料相談(30分)も実施中ですので、お気軽にお問い合わせください。
https://shigyonochikara.jp/contact/

引用元: The Decoder

本記事の作成体制について

本記事は士業のチカラ編集部が、公表されている一次情報のみを根拠に作成しています。法令の条文はe-Gov法令検索の原文で、行政の見解は各府省庁の公表資料で、それぞれ確認したうえで記載しています。引用元は本文中および参考文献にすべて明示しています。

本記事には特定の資格者による監修は入っていません。個別の事案について法令の当てはめや手続の可否を判断する必要がある場合は、当該分野の有資格者にご相談ください。本記事は一般的な情報提供を目的としたものであり、個別具体的な法律判断・税務判断・労務判断を提供するものではありません。

記載内容に誤りを見つけられた場合は、お問い合わせよりご指摘ください。確認のうえ速やかに訂正し、訂正履歴を記事内に残します。編集方針の詳細は運営者情報をご覧ください。