Этика
Кризис согласия: почему обучение ИИ на данных людей требует новой правовой базы
Крупнейшие наборы данных для обучения ИИ были созданы путём скрапинга миллиардов изображений, статей и видео без явного согласия. По мере роста судебных исков и требования регуляторов к ответственности правовая база на основе согласия становится неизбежной.
Патрик Т ·

Крупнейшие обучающие наборы данных для ИИ — включая те, что используются в GPT-5, Claude Opus 4.7 и Gemini 2.0 — были созданы путём сбора миллиардов изображений, статей и видеоматериалов из интернета без явного согласия их авторов. По мере роста числа судебных исков и требований регуляторов к ответственности, вопрос больше не заключается в том, нарушили ли компании, работающие с ИИ, нормы согласия, а в том, могут ли существующие правовые рамки справиться с масштабом этого нарушения.
Масштаб проблемы
В 2024 году исследователи из Калифорнийского университета в Беркли оценили, что примерно 1,3 миллиарда защищённых авторским правом произведений были использованы для обучения крупных языковых моделей без разрешения. Это включает 400 миллионов книг, 200 миллионов научных статей и более 500 миллионов новостных материалов. Данные поступали из CommonCrawl, свободно доступного интернет-архива, который индексирует публичную сеть — но «публичный» не означает «бесплатно для использования в коммерческом обучении ИИ».
Это различие имеет значение. Фотография, опубликованная в Instagram, доступна всем, однако условия использования Instagram запрещают автоматизированный сбор данных. Новостная статья на сайте The New York Times также находится в открытом доступе, но издание прямо запрещает компаниям, занимающимся машинным обучением, использовать его материалы без лицензии. Тем не менее крупные лаборатории ИИ все равно обучали модели на таких наборах данных, полагаясь на правовую серую зону, которая теперь стала предметом судебных разбирательств.
К маю 2026 года против крупных компаний, занимающихся ИИ, было подано более 150 исков авторами, фотографами, журналистами и издателями. Дела делятся на две категории: нарушение авторских прав (с утверждением, что модели запоминают и воспроизводят данные обучения) и право на публичность (с утверждением, что использование персональных данных нарушает права на конфиденциальность). Ни одна из категорий не имеет четкого прецедента в законодательстве об ИИ.

Почему согласие важнее авторских прав
Закон об авторском праве был разработан для другой эпохи. Когда вы копируете книгу на ксероксе, вы создаёте одну копию. Когда вы сканируете книгу для учебного набора данных, вы создаёте цифровое представление, которое может быть индексировано, поисковано и потенциально восстановлено нейронной сетью. Юридический вопрос — «является ли это добросовестным использованием?» — не имеет окончательного ответа.
Но этический вопрос проще: согласился ли создатель? Согласие — это основа доверия. Когда фотограф загружает изображение на сайт портфолио, он соглашается с тем, что люди будут его просматривать. Он не соглашается с тем, чтобы его работа использовалась в системе машинного обучения, которая будет генерировать новые изображения в его стиле без указания авторства или вознаграждения. Когда журналист публикует статью, он соглашается с тем, что читатели будут её читать. Он не соглашается с тем, чтобы его уникальный голос и точка зрения были закодированы в модель, которая будет генерировать текст, звучащий как он.
Действующая правовая система рассматривает все способы использования опубликованных данных одинаково. Но обучение ИИ качественно отличается от чтения. Оно носит извлекающий характер. Оно масштабируемо. Оно предназначено для того, чтобы учиться и воспроизводить закономерности человеческого творчества.
Регуляторный ответ
Закон Европейского Союза об ИИ, вступивший в силу в январе 2026 года, требует, чтобы системы ИИ, обученные на материалах, защищённых авторским правом, были указаны в реестре. Компании должны документировать, какие данные использовались, откуда они поступили и дали ли создатели своё согласие. Нарушения влекут штрафы до 6% от мирового дохода.
Соединённые Штаты выбрали более медленный подход. Бюро по авторскому праву выпустило рекомендации в марте 2026 года, в которых говорится, что произведения, созданные ИИ, не могут быть защищены авторским правом, если человек-автор не сделал «значительных творческих выборов» в процессе создания. Но это не касается законности обучения на защищённых авторским правом данных с самого начала.
Япония и Южная Корея заняли противоположные позиции. Министерство экономики, торговли и промышленности Японии выпустило руководство, явно разрешающее обучение ИИ на материалах, защищённых авторским правом, без согласия, рассматривая это как необходимое для национальной конкурентоспособности. Подход Южной Кореи более строгий: требуется явное согласие на любое коммерческое использование персональных данных в системах ИИ.
Как может выглядеть новая структура
Юридическая база на основе согласия для обучения ИИ потребует три компонента: Раскрытие информации (компании, занимающиеся ИИ, должны раскрывать точно, какие данные были использованы для обучения модели, на детальном уровне), Права на отказ (Создатели должны иметь право требовать удаления своих работ из обучающих наборов данных), и Компенсация (когда коммерческие ИИ-системы обучаются на материалах, защищённых авторским правом, создатели должны получать компенсацию).
Эти механизмы уже существуют в других отраслях. Лицензирование музыки через ASCAP и BMI работает десятилетиями. Лицензирование стоковых фотографий является рынком на несколько миллиардов долларов. Существуют технологии для применения подобных моделей к обучению ИИ.
Путь вперёд
Кризис согласия будет разрешен одним из двух способов: через законодательство или через судебные разбирательства. Законодательство предпочтительнее, потому что оно создает определенность и позволяет достигать согласованных решений. Судебные разбирательства идут медленнее, но неизбежны, если законодательная инициатива не реализуется. Следующие 18 месяцев критически важны. Закон ЕС об ИИ станет первым настоящим испытанием регулирования на основе согласия. Если он сработает, другие юрисдикции последуют примеру. Если нет, по умолчанию будут идти судебные разбирательства, которые будут более дорогими и менее предсказуемыми для всех.