自分の作品がAIの学習に使われたか知る方法はある?研究では外から確かめるのは難しく、文化庁は「断る技術的な措置」を挙げている

自分の絵や文章が、知らないうちにAIの学習に使われていないか。気になっても、確かめる方法がわからず不安な人は少なくありません。結論から言うと、外から確実に確かめる方法は、研究の段階でもまだ確立していません。文化庁の考え方では、AIの学習は原則として許諾なく行えるとされ、断る手段としては robots.txt などの技術的な措置が挙げられています。
3行でわかる
- 文化庁の考え方では、AIの学習は著作権法第30条の4により、原則として権利者の許諾なく行えるとされています。例外は「享受目的」がある場合と、「著作権者の利益を不当に害する」場合です。
- 学習に使われたかを外から確かめる研究はありますが、大規模な文章AIでは「ほぼ当て推量と変わらない」という結果もあります。取り出せた例は、何度も重複して学習された作品に偏っていました。
- できることは、自分のサイトの robots.txt で学習用クローラを断る、ログインが必要な場所に置く、記録を残して文化庁の無料の弁護士相談を使う、の3つが中心です。
01結論から言うと
自分の作品が学習に使われたかを、外から確実に知る方法はまだありません。文化庁の考え方では学習は原則として許され、断るなら robots.txt などの技術的な措置が中心です。
著作権法第30条の4は、作品を「享受」(鑑賞して楽しむこと)を目的としない利用を、必要な限度で許しています。条文には、情報解析の用に供する場合が例に挙がっています[3]。
文化庁の考え方では、AIの学習のための利用も、この情報解析に当たるとされています[1]。そのため、作品を学習に使うことには、原則として権利者の許諾は要らないと整理されています[2]。
ただし、条文にはただし書があります。「著作権者の利益を不当に害することとなる場合」は、この規定が使えません[3]。どんな場合がこれに当たるかは、下の02で整理します。
この記事は、作品が学習データとして使われることの話です。AIの出力が自分の絵に似ていた場合は自分の絵をAIにまねされた、AIで作ったものを使う側の話はAIで作った文章や画像を仕事で使っても大丈夫?にまとめています。
02研究とデータでわかっていること
文化庁は2024年に、学習が許されない場合と、技術的な措置の位置づけを整理しました。研究では、学習データを取り出せた例はありますが、条件が限られ、大規模な文章AIでの判定は難しいとされています。
文化庁の資料をもとに、作品の学習について整理すると次のとおりです。
| 場面 | 文化庁の考え方 |
|---|---|
| ふつうの学習 | 情報解析に当たり、原則として許諾は不要[1][2] |
| 作品をそのまま出させる目的の学習 | 意図的な過学習や、特定のクリエイターの少量の作品で表現を出力させる目的の追加学習などは、享受目的が併存し、第30条の4が適用されない場合がある[1][2] |
| 「学習しないで」と書いておくだけ | 反対の意思表示があるだけでは、ただし書に当たるとは考えられない[1] |
| robots.txt などの技術的な措置 | 権利者が自由に講じてよい。AI学習用のデータベースを販売する予定が推認される場合、措置を回避した収集は、ただし書に当たり得る[1][2] |
| 学習済みのAIから消す | 学習に使われたデータを取り除くよう求め得るかは、実現可能性に課題があり、今後の技術の動向を見て判断するとされている[1] |
文化審議会 著作権分科会 法制度小委員会(2024)[1]
作風や画風などのアイデアが似た生成物が大量に作られ、特定のクリエイターへの需要が代わられる事態は想定し得るとしています。それでも、学習元の作品の創作的表現と共通しなければ、「不当に害する場合」には当たらないと考えられるとされました。
一方で、需要が代わられる場合は「不当に害する場合」に当たり得る、という意見も一定数あったと記されています。robots.txt などの措置が、著作権法上の「技術的保護手段」に当たるかは、今後検討すべきとされています。
対象: 現行の著作権法の解釈(2024年3月15日時点) / 限界: 文書自体に法的な拘束力はなく、個々の事案ごとに判断されます。
Carliniら(2023, USENIX Security)[5]
画像生成AIに、学習データの中で特に重複が多い35万件の説明文で、1億7,500万枚の画像を作らせました。そのうち、学習画像とほぼ同じと判定されたのは94枚でした。取り出せた画像の多くは、学習データの中に100回以上重複していました。
対象: 公開されている画像生成モデル / 限界: 重複の多い画像を意図して狙った実験です。重複の少ない作品が取り出せるかを示したものではありません。
Carliniら(2021, USENIX Security)[4]
文章生成AIのモデルに問いかけるだけで、学習データの文章を一字一句そのまま数百件取り出せました。大きなモデルほど、取り出されやすい傾向がありました。
対象: 当時公開されていた文章生成モデル(GPT-2) / 限界: 取り出せたのは学習データのごく一部で、ある特定の作品が学習されたかを調べる方法ではありません。
Duanら(2024, COLM)[6]
ある文章が学習に使われたかを当てる「メンバーシップ推論」という手法を、大規模な文章AIで検証しました。多くの条件で、当て推量をわずかに上回る程度の精度しか出ませんでした。うまくいったように見えた例は、比べた文章の時期の違いなど、別の要因で説明できたとされています。
対象: 公開データで学習された1億6,000万〜120億パラメータの文章モデル / 限界: 学習データが公開されたモデルでの検証で、学習データ非公開のサービスに同じ方法が使えるかは示されていません。
03まだわかっていないこと
個人の作品1点が学習に使われたかを、外から確かめる確実な方法はまだありません。技術的な措置を無視した収集がどう扱われるかも、事案ごとの判断で、裁判例の積み重ねを待つ段階です。
- メンバーシップ推論の精度は、モデルの大きさや学習データの量によって大きく変わります。商用のAIサービスで個人が使える確かめ方は、今回の調査では見つかりませんでした[6]。
- robots.txt を無視した収集が「不当に害する場合」に当たるかは、データベースを販売する予定が推認されるかなど、個別の事情しだいとされています[1]。
- robots.txt は、クローラ側が記載に従うよう設定されていることが前提です。学習データを集める事業者の多くは尊重を表明しているとされますが、記載に従わないクローラには効きません[2]。
- 文化庁の考え方は公表時点のもので、技術や裁判例の変化に応じて見直すとされています[1]。
04今日からできること
自分のサイトなら robots.txt で学習用クローラを断り、守りたい作品はログインが必要な場所に置きます。似た生成物を見つけたら記録を残し、文化庁の無料の弁護士相談を使えます。
自分のサイトの robots.txt で学習用クローラを断る
文化庁のガイダンスは、学習データを集めるクローラをブロックする記載で、収集を一定程度防げると説明しています。例えばGoogleは「Google-Extended」、OpenAIは「GPTBot」という名前を公式ヘルプで公開しています。Google-Extended を断っても、Google検索への掲載や順位には影響しないとされています。
目安 初回15分(サーバーの設定ファイルを編集できる場合)
守りたい作品は、ログインが必要な場所に置く
ID・パスワードによるログインが必要な場所への掲載も、クローラによる収集を防ぐうえで役立つとされています。SNSや投稿サイトに載せる作品は、そのサービスの利用規約と設定画面に、AI学習の扱いが書かれていないか確かめます。
目安 サービスごとに10分
作品の公開日と元データを残しておく
学習データの開示は、訴訟の手続などで求められる場合があるとされています。ただ、似た生成物が問題になったとき、依拠性は開示がなくても、高度な類似性などで認められ得るとされています。自分の作品がいつ公開されたかを示せるよう、元のファイルと公開URLを保存しておきます。
目安 作品ごとに2分
迷ったら、文化庁の無料の弁護士相談を使う
文化庁は、AIと著作権に関する無料の弁護士相談を提供しています。相談フォームから申し込み、土日祝日などを除き、原則10日以内にメールで回答が届くとされています。
目安 申し込み20分
AIに入力した自分の文章や画像が学習に使われるかどうかは、ChatGPTに個人情報や会社の情報を入力しても大丈夫?の記事で、学習を止める設定と合わせて整理しています。
文化芸術活動に関する法律相談窓口(文化庁、Webフォーム): AIと著作権に関する相談。弁護士が回答します。
法テラス・サポートダイヤル(0570-078374): どこに相談すればよいかわからないとき。平日9時〜21時、土曜9時〜17時。
05よくある質問
自分の絵が勝手にAIの学習に使われたら、著作権侵害になるの?
文化庁の考え方では、AIの学習は著作権法第30条の4の「情報解析」に当たり、原則として許諾なく行えるとされています。ただし、作品の表現をそのまま出力させる目的の学習や、「著作権者の利益を不当に害する場合」は例外とされています。自分のケースがどちらに当たるかは、弁護士への相談で確かめるものです。
プロフィールに「AI学習禁止」と書いておけば効果はある?
文化庁の考え方では、反対の意思表示があることだけでは、第30条の4のただし書に当たるとは考えられないとされています。一方、robots.txt やログイン制限などの技術的な措置は、権利者の判断で自由に行えるとされています。
AIの会社に、学習データに自分の作品が入っているか聞ける?
問い合わせること自体はできますが、答える義務があるかは別の問題です。文化庁の考え方では、訴訟の手続の中で、書類の提出や文書提出命令などにより、学習に使ったデータの開示を求めることができる場合もあるとされています。
すでに学習されたAIから、自分の作品を消してもらえる?
文化庁の考え方では、学習済みのモデルから特定のデータを取り除くよう求め得るかは、実現可能性に課題があり、今後の技術の動向を見て判断する必要があるとされています。侵害が認められる場合は、将来の学習用データセットからの除去を求められることがあるとされています。
出典
- 文化審議会 著作権分科会 法制度小委員会 (2024). AIと著作権に関する考え方について(令和6年3月15日). https://www.bunka.go.jp/seisaku/bunkashingikai/chosakuken/pdf/94037901_01.pdf
- 文化庁著作権課 (2024). AIと著作権に関するチェックリスト&ガイダンス(第2部 権利者のためのガイダンス). https://www.bunka.go.jp/seisaku/chosakuken/pdf/94097701_01.pdf
- 著作権法(昭和45年法律第48号)第30条の4. e-Gov法令検索. https://laws.e-gov.go.jp/law/345AC0000000048
- Carlini, N., Tramèr, F., Wallace, E., et al. (2021). Extracting Training Data from Large Language Models. 30th USENIX Security Symposium. https://www.usenix.org/conference/usenixsecurity21/presentation/carlini-extracting
- Carlini, N., Hayes, J., Nasr, M., et al. (2023). Extracting Training Data from Diffusion Models. 32nd USENIX Security Symposium. https://www.usenix.org/conference/usenixsecurity23/presentation/carlini
- Duan, M., Suri, A., Mireshghallah, N., et al. (2024). Do Membership Inference Attacks Work on Large Language Models? Conference on Language Modeling (COLM 2024). https://arxiv.org/abs/2402.07841
- Google Search Central. Google's common crawlers(Google-Extended). https://developers.google.com/search/docs/crawling-indexing/google-common-crawlers
- OpenAI. Overview of OpenAI Crawlers(GPTBot). https://developers.openai.com/api/docs/bots
- 文化庁. 文化芸術活動に関する法律相談窓口. https://www.bunka.go.jp/seisaku/bunka_gyosei/kibankyoka/madoguchi/index.html
- 法テラス(日本司法支援センター). 法テラス・サポートダイヤル. https://www.houterasu.or.jp/