Microsoft и OpenAI в суде: что вскрыли внутренние признания о «краже» контента для обучения ИИ
Рассекреченные материалы иска The New York Times против OpenAI и Microsoft впервые показали, как топ-менеджеры называли сбор данных для обучения ИИ «крупнейшей кражей труда в истории человечества», а Copilot снизил переходы на сайт NYT почти на 93%. Разбираем факты, механику сбора данных и последствия для авторского права, издателей и пользователей ИИ.
Трёхлетний иск The New York Times против OpenAI и Microsoft впервые вывел на публику то, что раньше оставалось во внутренней переписке: массовый сбор данных для обучения ИИ топ-менеджеры обеих компаний называли «кражей» и «крупнейшей кражей труда в истории человечества». Рассекреченные материалы описывают обход платных стен, датасеты из миллионов статей и намеренное удаление уведомлений об авторских правах.
Отдельная деталь касается экономики издателей. Внутренние данные Microsoft показывают, что её «ответный движок» Copilot снизил переходы (click-through rate) на домен The New York Times почти на 93% по сравнению с обычным поиском Bing. Речь идёт и о копировании текстов, и о перераспределении трафика, от которого зависит выручка изданий.
Сразу оговорка: значительная часть новых сведений взята из брифа самой The New York Times, а не из оригинальных доказательств, которые остаются засекреченными. Цитаты приведены без полного контекста. Это позиция истца, а не установленный судом факт. Ниже по порядку: что именно стало известно, как это работает юридически и что меняется для всех, кто создаёт и читает контент.
Что случилось: суть иска и главные разоблачения
Кто участники и в чём суть претензий
The New York Times подала иск против OpenAI и Microsoft около трёх лет назад. Издание утверждает, что компании нарушили авторские права, обучая генеративные модели на его материалах. Претензии не сводятся к одному эпизоду: истец описывает систему, в которой журналистские тексты попадали в обучающие данные без разрешения, лицензий и оплаты.
Роли сторон различаются. OpenAI разработала модели, Microsoft вложилась в компанию, предоставила вычислительные мощности и встроила технологии в свои продукты, включая Copilot и поиск Bing. Для истца это означает, что ответственность распределяется между создателем модели и тем, кто вывел её на рынок и заработал на ней.
В рассекреченных материалах перечислены три группы действий: обход платных стен (paywalls), массовый сбор статей и удаление уведомлений об авторских правах из обучающих данных. Отдельно упоминаются миллионы материалов, попавших в датасеты, то есть в наборы данных, на которых учатся модели. Данное дело - часть более широкой волны судебных разбирательств против ИИ-компаний, которую ведут издатели, авторы и фотоагентства.
Почему рассекреченные документы стали поворотным моментом
Правовой спор об обучении ИИ до этого шёл в основном на языке абстракций: подпадает ли обучение модели под «добросовестное использование», можно ли считать копирование техническим этапом. Внутренние обсуждения компаний при этом были скрыты от публики.
Теперь на поверхности оказались прямые формулировки сотрудников и руководителей. Они не доказывают вину автоматически, но показывают, что внутри компаний проблему осознавали и обсуждали в жёстких терминах. Для суда и для общественного мнения это другой уровень аргументации: не «мы не знали», а «мы понимали масштаб».
Вторая причина внимания к материалам: цифры. Падение переходов на 93% превращает спор о копирайте в измеримый спор об экономическом ущербе.
Как компании собирали данные: обход платных стен, скрейпинг и удаление копирайта
Что такое скрейпинг и почему он стал проблемой
Скрейпинг - это автоматизированный сбор данных с сайтов. Программа-бот открывает страницы одну за другой и сохраняет текст: за ночь так можно выкачать тысячи статей. Технически это то же действие, что и обычное чтение, только в промышленных объёмах и без участия человека.
Сам по себе скрейпинг не всегда нарушает закон. Проблемы начинаются, когда он обходит технические ограничения, нарушает условия использования сайта или собирает закрытый контент. Платная стена (paywall) - механизм, при котором полный текст доступен только подписчику. Обход такой стены означает, что издатель не получил ни подписки, ни рекламного показа, ни данных о читателе.
В этом деле, по версии истца, компании собирали материалы именно из-за платных стен, незаметно для издателей, и формировали обучающие датасеты из миллионов статей. Это принципиально отличается от разового цитирования: речь о постоянно пополняемом массиве.
Удаление уведомлений об авторских правах: что это значит
Знак копирайта и строка с правообладателем указывают, кому принадлежит текст и на каких условиях его можно использовать. Если такие пометки убирают из обучающих данных, у модели исчезает встроенный сигнал о том, что материал кому-то принадлежит. По версии истца, в документах описан именно такой шаг: уведомления об авторских правах намеренно удаляли.
Аналогия: представить библиотеку, где кто-то копирует книги, стирает выходные данные и пускает текст в производство собственного продукта. Формально содержание сохранено, но связь с автором разорвана, а след происхождения потерян. Именно на системность, а не на случайные ошибки, указывает The New York Times в своих материалах. Суд эти утверждения пока не подтвердил.
Внутренние признания: что говорили топ-менеджеры Microsoft и OpenAI
«Крупнейшая кража труда в истории человечества»: кто и когда это сказал
Фраза принадлежит топ-менеджеру Microsoft. Имя в доступных материалах не раскрыто, известно только, что это руководитель высокого уровня. В частном порядке он назвал сбор данных для обучения ИИ «крупнейшей кражей труда в истории человечества». Официальной позицией компании эта формулировка не была и стала известна только сейчас.
Руководство OpenAI шло дальше в оценках риска: во внутренних документах модели компании названы «экзистенциальной угрозой» для издателей и журналистов, чьи работы их обучали. Такая формулировка описывает не техническую ошибку, а прямую угрозу источнику существования целой отрасли.
Отдельный эпизод касается Ника Тёрли, руководителя ChatGPT в OpenAI. Его заявления во внутренней переписке, по данным брифа, расходятся с отдельными критериями теста на добросовестное использование.
Показания Сатьи Наделлы: «всё, что за платной стеной, должно лицензироваться»
Генеральный директор Microsoft Сатья Наделла на допросе в этом году заявил: «Всё, что находится за платной стеной, должно лицензироваться любым, кто хочет использовать это для заземления или обучения». Заземление (grounding) здесь означает привязку ответов модели к конкретным источникам, чтобы снизить число выдумок.
Он также дал понять: если бы знал, что OpenAI собирала и обучалась на информации за платной стеной, то потребовал бы переобучить модели, ссылаясь на права Microsoft.
Позиция главы компании важна для иска. Она подтверждает логику лицензирования: контент за подпиской предполагает разрешение и оплату, а не свободный сбор.
Внутренний документ Microsoft формулирует проблему ещё прямее: «Весьма необычно, что конечный продукт угрожает экономическим основам своих ключевых поставщиков, но именно такую ситуацию мы создали для нашего бизнеса LLM в отношении его „цепочки поставок контента“». LLM - большая языковая модель, то есть тот тип ИИ, который отвечает текстом.
Оговорка остаётся: цитаты взяты из брифа The Times и приведены без полного контекста, оригинальные экспонаты дела закрыты.
Удар по издателям: как Copilot обрушил переходы на сайт The New York Times на 93%
Издательская экономика держится на трафике. Читатель приходит из поиска на статью, видит рекламу или оформляет подписку. Если ответ на запрос появляется прямо в чат-боте, переход не происходит, и вместе с ним исчезают показы и часть выручки.
Внутренние данные Microsoft показывают масштаб: «ответный движок» Copilot снизил click-through rate для домена The New York Times на целых 93% по сравнению с традиционным поиском Bing. Click-through rate (CTR) - доля показов, которые заканчиваются переходом на сайт. Падение такого показателя почти в десять раз означает, что аудитория читает не на сайте издания, а внутри ответа ИИ.
Что такое «петля гибели» и почему Microsoft её боялась
Внутренняя презентация Microsoft, которую в январе 2024 года подготовил директор по прикладной науке Брент Хехт, описывает падение переходов как «петлю гибели» (doom loop), способную «навредить производительности наших моделей и всей сети одновременно».
Логика замкнутого круга: издатели теряют доход, сокращают редакции, качественного и свежего контента становится меньше, а моделям нужно на чём учиться и чем подтверждать ответы. В том же документе ситуация описана как «весьма необычная»: конечный продукт подрывает экономические основы своих поставщиков контента.
Для издателя это не абстрактный риск. Падение CTR на 93% по одному крупному домену означает потерю миллионов визитов и части подписок. Юридический спор об обучении моделей превращается в спор о рынке, на котором продукт ИИ и продукт журналистики конкурируют напрямую.
Почему это ломает аргумент о «добросовестном использовании»
Что такое «добросовестное использование» и как оно работает
Добросовестное использование (fair use) - правовая доктрина в США, которая позволяет ограниченно использовать защищённый авторским правом материал без разрешения правообладателя. Суды оценивают четыре фактора.
| Фактор | Что оценивает суд | Вопрос в деле NYT |
|---|---|---|
| Цель и характер использования | Обучение и исследование или коммерческая выгода | Доступ к моделям продают по подписке |
| Природа произведения | Факты или результат творческого труда | Журналистика: чужой труд и затраты редакции |
| Объём использования | Небольшой фрагмент или произведение целиком | Обучающие датасеты из миллионов статей |
| Влияние на рынок | Заменяет ли новое использование оригинал | Падение переходов из Copilot на 93% |
Четвёртый фактор в этом деле самый чувствительный. Доктрина требует, чтобы использование не заменяло оригинальную работу и не подрывало рынок, на котором она продаётся. Цитирование в обзоре проходит этот тест, копирование целого произведения для продажи - нет.
Как признания топ-менеджеров подрывают защиту OpenAI
Внутренние признания работают против защиты по одной причине: они фиксируют осознание вреда. Если руководитель называет сбор данных кражей, а модели - «экзистенциальной угрозой» для издателей, защите сложнее утверждать, что использование нейтрально и не конкурирует с оригиналом.
Данные о падении переходов на 93% добавляют к этому измеримое замещение: читатель получает ответ в Copilot вместо визита на сайт. Для четвёртого фактора это прямой аргумент, а не оценочное суждение.
Позиции при этом расходятся. Суды в разных странах трактуют обучение по-разному, и единого ответа пока нет. Обзор того, как складывалась практика в США, есть в разборе позиции Минюста по обучению моделей на защищённых текстах. Пример из Индии показывает, что суд может признать обучение ИИ частным использованием и отказать изданию в запрете, о чём подробно рассказано в разборе решения Высокого суда Дели.
Добавляет контекст и политика. В этом месяце администрация США представила бриф в защиту нелицензированного использования защищённого материала для обучения моделей OpenAI. На стороне ответчиков выступает не только юридическая логика, но и государственный интерес в развитии ИИ.
Что это значит для будущего обучения ИИ на авторских текстах
Возможные сценарии: от лицензирования до ужесточения регулирования
Первый сценарий: суд признаёт, что рынку нанесён вред, и обязывает компании лицензировать контент. Тогда обучение моделей на журналистике станет платным по умолчанию, а выиграют издатели и владельцы крупных архивов.
Второй: компании сохраняют опору на fair use, но меняют практики. Часть лабораторий уже заключает лицензионные соглашения с медиа, платит за доступ к архивам и ограничивает дословное воспроизведение чужого текста в ответах.
Третий: появляются технические механизмы учёта. Это могут быть реестры разрешённых источников, стандарты маркировки данных и инструменты, которые фиксируют происхождение текста в датасете.
Финансовый ориентир уже есть: мировое соглашение Anthropic с авторами на $1,5 млрд показало, во сколько может обойтись спор о копирайте при обучении моделей. Суды рассматривают похожие иски в разных странах, и решение по делу The New York Times может задать рамку для остальных.
Что это значит для вас: практические выводы для создателей и пользователей контента
Если вы создаёте контент: фиксируйте авторство, сохраняйте историю публикаций, следите за практикой лицензирования и условиями площадок, где вы публикуетесь. Полезны и простые инструменты отслеживания, которые показывают, где ваш текст появляется без разрешения. То, что сегодня выглядит серой зоной, завтра может стать предметом иска.
Если вы пользуетесь ИИ-сервисами: держите в голове, что ответы могут опираться на чужие материалы, а источники указаны не всегда. Когда точность важна для решения или публикации, проверяйте ключевые утверждения по первоисточникам.
Если вы принимаете решения в компании: выясняйте, откуда взялись данные, на которых обучались или дообучались ваши модели и модели подрядчиков. Репутационный риск здесь идёт рядом с юридическим, а вопросы издателей к продуктам на базе ИИ уже становятся нормой.
Как оставаться в курсе и не потеряться в информационном шуме
Тема будет развиваться: засекреченные экспонаты дела могут раскрыть позже, решения по похожим искам появляются регулярно, позиции регуляторов меняются. Держать всё в голове не обязательно. Важнее видеть последовательность: кто что заявил, что решил суд, как это изменило правила.
Мы в Среда AI ведём хронологическую ленту по таким историям: без технического жаргона, с расшифровкой терминов и контекстом. Продолжение дела The New York Times разберём сразу после публикации новых материалов. Подпишитесь на обновления, чтобы не искать новости по десяткам источников вручную.
Есть вопрос или заметили неточность? Напишите нам, поправим.