Минюст США поддержал обучение AI на защищённых текстах: что это значит для будущего авторского права

Минюст США поддержал обучение AI на защищённых текстах: что это значит для будущего авторского права

Минюст США впервые поддержал позицию AI-компаний в споре об обучении моделей на защищённых текстах. Разбираем, что такое fair use, почему дело The New York Times против OpenAI может повлиять на всю индустрию и какие риски остаются для бизнеса, авторов и пользователей.

Минюст США заявил, что обучение языковых моделей на защищённых авторским правом текстах может подпадать под добросовестное использование, или fair use. Условие связано с целью: модель должна создавать новый, трансформативный контент, а не воспроизводить исходные материалы в ответах.

Правительство изложило эту позицию в правовом заключении для федерального суда Манхэттена, где рассматривается спор The New York Times против OpenAI и Microsoft. Минюст впервые публично вмешался в американские споры об авторском праве и AI, поддержав аргументы технологических компаний.

Бриф усиливает позицию AI-индустрии, но не закрывает спор. Документ носит рекомендательный характер и не заменяет судебное решение. Суду предстоит отдельно оценить источник текстов, объём использования, коммерческий эффект и случаи, когда модель выдаёт близкие к оригиналу фрагменты.

Что заявил Минюст США и почему это важно

В центре позиции Минюста находится понятие трансформативности. Правительство считает, что AI-модель использует текст с иной целью, чем обычный читатель или издатель: она анализирует огромный массив данных, выявляет языковые закономерности и затем создаёт ответы на новые запросы.

Такой подход может привести к признанию обучения добросовестным использованием даже тогда, когда исходные тексты защищены copyright. Для десятков исков против OpenAI, Anthropic и Meta это означает появление сильного аргумента в пользу ответчиков.

Ключевые аргументы Минюста

  • Обучение создаёт новый результат. Языковая модель получает миллиарды строк текста, анализирует связи между словами и формирует статистическую систему для генерации новых ответов. По позиции правительства, такой процесс отличается от публикации копии статьи или книги.
  • Ограничения могут затормозить прогресс. В брифе сказано, что ограничение развития больших языковых моделей из-за неверного толкования fair use способно препятствовать научному и творческому прогрессу.
  • AI связан с государственными интересами США. Заместитель генерального прокурора США Стэнли Вудворд-младший назвал лидерство страны в AI критичным для национальной безопасности, экономического процветания и экономической мобильности американцев.
  • Речь не идёт о безусловном разрешении. Позиция Минюста касается обучения и трансформативного характера такого использования. Прямое копирование защищённого произведения в ответе модели требует отдельной оценки.

Похожий сигнал ранее подал министр торговли США Говард Латник. Он призвал принять fair use и позволить AI-компаниям обучать модели на произведениях создателей. При этом окончательное толкование закона остаётся за судьями, а не за отдельным ведомством.

Добросовестное использование: простое объяснение

Fair use, или добросовестное использование, представляет собой американское правовое исключение из общего запрета на использование чужих произведений. Оно позволяет применять защищённый материал без отдельного разрешения в некоторых ситуациях, когда общественная польза и характер использования перевешивают интерес правообладателя.

Суд обычно оценивает четыре группы обстоятельств:

  1. Цель и характер использования. Коммерческое применение оценивают строже, чем образовательное или исследовательское. Трансформативный результат может улучшить позицию ответчика.
  2. Характер исходного произведения. Для художественных и высокооригинальных текстов защита обычно сильнее, чем для фактических материалов.
  3. Объём использованной части. Суд смотрит на количество заимствованного текста и на то, насколько важны использованные фрагменты для исходного произведения.
  4. Влияние на рынок. Если новый продукт заменяет оригинал или лишает автора потенциальной лицензии, это усиливает позицию правообладателя.

Ни один фактор не решает спор самостоятельно. Суд сопоставляет обстоятельства и оценивает конкретную технологию, конкретные данные и конкретные ответы модели.

Почему обучение может считаться трансформативным

Во время обучения модель обрабатывает тексты статистически. Она не читает статью как человек и не готовит её репродукцию для публикации. Система ищет закономерности: какие слова обычно встречаются рядом, как строятся предложения, какие конструкции связаны с определённой темой.

После обучения модель генерирует ответ, предсказывая следующее слово или фрагмент текста. Например, запрос о причинах изменения климата может привести к новому объяснению на основе языковых паттернов, встречавшихся в книгах, статьях и справочных материалах.

Такой механизм поддерживает аргумент о трансформативности: исходный текст служит материалом для анализа, а итоговый ответ создаётся заново. Параметры модели отражают статистические связи, а не представляют собой обычную библиотеку статей, доступную пользователю для чтения.

У этого аргумента есть границы. Модель может запомнить отдельные фрагменты, особенно если они часто повторялись в обучающих данных. Если чат-бот выдаёт абзацы The New York Times почти дословно, спор смещается к копированию, рыночному ущербу и объёму воспроизведения.

Похожее разделение между обучением и незаконным хранением источников обсуждалось в деле Anthropic. Суд признал обучение на легально полученных данных добросовестным использованием, но отдельно оценил хранение миллионов пиратских книг. Подробнее этот конфликт разобран в разборе дела Anthropic и его последствий для AI-компаний.

Дело The New York Times против OpenAI: почему оно показательно

The New York Times обвиняет OpenAI и Microsoft в использовании миллионов газетных статей без разрешения для обучения AI-систем. Microsoft выступает соответчиком и крупнейшим финансовым партнёром OpenAI. Истец утверждает, что материалы издательства помогли создать коммерческие продукты, способные отвечать на запросы пользователей и частично заменять посещение новостных сайтов.

Для суда здесь сходятся сразу несколько спорных вопросов:

  • можно ли использовать большие массивы защищённых текстов для обучения коммерческой модели;
  • отличается ли статистический анализ публикаций от традиционного копирования;
  • кто отвечает за ответы, в которых появляется близкий к оригиналу материал;
  • создают ли AI-сервисы замену для газет и уменьшают ли их лицензионный рынок;
  • должны ли разработчики получать разрешения на каждый текст или могут опираться на fair use.

Дело показательно из-за масштаба сторон и характера данных. The New York Times представляет издателей, для которых тексты служат коммерческим продуктом. OpenAI и Microsoft представляют модель бизнеса, где обучение на больших массивах информации предшествует созданию универсального AI-сервиса.

Что поставлено на карту для AI-индустрии

Если суд ограничит применение fair use к обучению, компаниям, вероятно, придётся активнее покупать лицензии, доказывать легальность источников и менять способы подготовки наборов данных. Стоимость доступа к контенту вырастет. Для небольших разработчиков такие расходы могут стать барьером.

Признание обучения добросовестным использованием даст индустрии более предсказуемую правовую основу. Компании смогут развивать модели без отдельной лицензии на каждую публикацию, а пользователи получат более широкий выбор сервисов. Правообладатели при этом могут столкнуться с сокращением доходов от лицензирования и усилить требования к фильтрации ответов.

Результат дела может повлиять на другие иски против OpenAI, Anthropic и Meta. Судебное решение не станет автоматическим ответом для каждого спора, однако его аргументация задаст ориентир для оценки обучения, вывода модели и влияния AI на рынок контента.

Американский процесс развивается на фоне других подходов. Высокий суд Дели отказал ANI во временном запрете OpenAI и связал допустимость обучения с частным использованием и законностью источника данных. Индийская позиция не обязывает американские суды следовать тому же пути, но показывает, что правовые системы уже ищут разные способы описать работу AI.

Расхождение с Бюро по авторскому праву США

Позиция Минюста расходится с более осторожными выводами Бюро по авторскому праву США. Бюро указывало, что fair use при обучении AI нельзя признавать автоматически. В центре его подхода находятся коммерческая цель разработчика, объём защищённого материала, возможность появления рынка лицензий и способность модели выдавать близкие копии.

Минюст смещает акцент на трансформативность обучения и общественную пользу развития AI. Ведомство связывает доступ к большим языковым моделям с научными разработками, творческими инструментами, национальной безопасностью и экономической конкуренцией США.

Разногласие между ведомствами не означает, что одно из них уже определило закон для всех компаний. Бюро выпускает аналитические материалы и рекомендации по авторскому праву. Минюст представляет позицию правительства в конкретном судебном процессе. Обязательное решение примет суд, а Конгресс США при необходимости может изменить правила отдельным законом.

Для рынка такая разница создаёт неопределённость. Разработчики получают политическую поддержку, но не получают иммунитет от исков. Правообладатели сохраняют возможность доказывать, что конкретная модель копирует материалы, использует незаконно полученные данные или наносит измеримый ущерб рынку.

Что это значит для будущего AI и авторского права

Судебные споры могут привести к одному из трёх сценариев.

  • Широкое признание fair use. Обучение моделей на защищённых текстах признают трансформативным при соблюдении условий. Проверка сместится к качеству источников и поведению модели после обучения.
  • Ограниченное признание. Суды разрешат обучение на части данных, но введут более строгие требования к коммерческим продуктам, пиратским копиям и ответам, которые заменяют оригинал.
  • Новые законодательные правила. Конгресс может закрепить лицензирование, компенсации авторам, реестры источников, режим отказа от использования данных или специальные исключения для AI.

Каждый вариант по-разному изменит рынок. Широкий fair use ускорит запуск новых моделей. Лицензирование повысит прозрачность и потенциально даст авторам новый источник дохода, но увеличит цену разработки. Жёсткие ограничения могут сократить доступ к данным и укрепить позиции крупнейших компаний, у которых больше ресурсов на юридические и лицензионные расходы.

Практические выводы для бизнеса и пользователей

  • Бизнесу, который использует AI, стоит проверять условия поставщика: откуда берутся данные для обучения, кто отвечает за претензии правообладателей и как компания обрабатывает спорные ответы.
  • Разработчикам продуктов полезно вести учёт источников, отделять легально полученные материалы от сомнительных архивов и тестировать модель на воспроизведение защищённых фрагментов.
  • Компаниям, работающим с контентом, следует оценить риск замены собственных материалов AI-сервисами и заранее определить правила использования генеративных инструментов сотрудниками.
  • Пользователям стоит помнить: позиция Минюста не означает, что любой ответ чат-бота свободен от авторских прав. Пересказ и новая генерация отличаются от публикации чужой статьи целиком.

Позиция Минюста усиливает аргументы OpenAI и других AI-компаний в борьбе за широкое толкование fair use. Она не отменяет судебную проверку и не снимает вопросов к пиратским источникам, запоминанию текстов и рыночному ущербу. Исход дела The New York Times покажет, станет ли обучение на защищённых материалах общим правилом для индустрии или суды установят более узкие границы.

Есть вопрос или заметили неточность? Напишите редакции Среды AI, чтобы мы могли уточнить разбор по мере развития дела.

Отправить тому, кому пригодится

Ссылка сохранит весь материал без сокращений.

По почте

Заметили неточность? Сообщить редакции