Политика

Утверждение урегулирования авторских прав Anthropic дает новым судебным искам по обучению ИИ новый ориентир

Одобрение федеральным судьёй урегулирования претензий по пиратству книг Anthropic на сумму 1,5 миллиарда долларов приносит авторам крупную выплату, оставляя при этом более широкий спор о добросовестном использовании для обучения ИИ нерешённым.

Майкл С ·

Утверждение урегулирования авторских прав Anthropic дает новым судебным искам по обучению ИИ новый ориентир
Wikimedia Commons / HaeB, CC BY-SA 4.0.

Федеральный судья одобрил Anthropicсоглашение на 1,5 миллиарда долларов с авторами и издателями, которые обвинили компанию в использовании пиратских книг для обучения Claude, что дало индустрии ИИ её самую конкретную юридическую ценность на данный момент в одном из ключевых споров эпохи генеративного ИИ. Урегулирование, о котором сообщили AP и The Verge 21 июля, охватывает более 482 000 произведений, и ожидается, что пострадавшие правообладатели получат примерно 3000 долларов за каждую книгу. Это крупное возмещение по меркам авторского права, но оно не даёт однозначного ответа на более широкий вопрос, нависающий над отраслью: когда обучение модели ИИ на материалах, защищённых авторским правом, становится добросовестным использованием, а когда способ получения этих материалов создаёт ответственность, которую не может перевесить никакой эталон модели?

Различие является сутью дела. Ранее судебное разбирательство дало Anthropic частичную победу на основании теории, что само обучение модели может квалифицироваться как добросовестное использование при некоторых обстоятельствах. Но претензии авторов в отношении пиратских копий развивались по другому пути. Фокус суда на якобы незаконном источнике сделал урегулирование предупреждением для каждой AI-компании, которая рассматривала большие текстовые корпуса как инженерный ресурс, не учитывая закупку, лицензирование и контроль цепочки владения. Даже если суд признает, что трансформативное использование для обучения может быть законным, источник учебного материала всё равно имеет значение.

Это урегулирование также изменяет условия ведения переговоров. Авторы и издатели наблюдали, как компании, занимающиеся ИИ, привлекали огромные суммы, продавали подписки, заключали корпоративные сделки и говорили о том, чтобы изменить экономику работы с знаниями. Выплата в размере 1,5 миллиарда долларов не делает всех copyright спор до отдыха, но он создает видимый ориентир для переговоров. Будущие истцы будут ссылаться на это, утверждая, что несанкционированное приобретение книг, архивов, кода, изображений, музыки или видео имеет измеримую ценность. Ответчики ИИ будут пытаться ограничить прецедент конкретными обвинениями в пиратстве и позицией по урегулированию в этом деле.

Дела по обучению ИИ на основе книг заставили суды отделить вопрос обучения модели от вопроса о том, как были получены защищенные авторским правом произведения. Изображение: Wikimedia Commons / Saeidpourbabak, CC BY-SA 4.0.
Дела по обучению ИИ на основе книг заставили суды отделить вопрос обучения модели от вопроса о том, как были получены защищенные авторским правом произведения. Изображение: Wikimedia Commons / Saeidpourbabak, CC BY-SA 4.0.

Для писателей это утверждение является одновременно победой и тревожным компромиссом. Примерно 3000 долларов за произведение значительны для многих авторов, особенно по сравнению с непрозрачной оценкой, которую большинству учебных наборов данных ранее присваивали книгам. Тем не менее некоторые правообладатели утверждали, что выплата слишком мала по сравнению с коммерческой выгодой, которую получили компании по разработке ИИ, и потенциальной будущей заменой труда писателей. Соглашение компенсирует предполагаемое прошлое использование; оно не создает действующий режим лицензирования для будущих моделей и не гарантирует, что авторы смогут осмысленно согласиться или отказаться от участия в каждом учебном процессе.

Для Anthropic одобрение снимает значительную правовую неопределённость, оставляя при этом вопросы репутационного характера. Компания строила большую часть своей публичной идентичности вокруг безопасности, ответственности и тщательного управления. Урегулирование по поводу пиратских книг противоречит этому имиджу, даже если компания не признаёт все обвинения и даже если её юридическая позиция по справедливому использованию частично сохраняется. На рынке ИИ доверие касается не только того, отказывается ли модель от опасных запросов. Речь также идёт о том, может ли компания показать, что данные, лицензии и происхождение её систем обрабатывались с дисциплиной.

Решение вынесено на фоне продолжающихся других судебных исков против компаний, занимающихся ИИ. Издатели, новостные организации, художники, музыкальные компании и разработчики программного обеспечения оспаривали способы сбора и использования учебных данных. Суд, вероятно, будет выносить разные решения в зависимости от носителя, источника, цели, характера вывода и предполагаемого ущерба на рынке. Набор книг, собранный с сайтов пиратства, не такой же, как лицензированный новостной контент, код общественного достояния, веб-страницы, находящиеся под управлением роботов, или документы предприятий, предоставленные пользователями. Такая сложность означает, что закон будет развиваться от случая к случаю, а не через единое универсальное правило обучения ИИ.

Соглашение Anthropic предоставляет правообладателям ориентир, но оно не решает все претензии к книгам, архивам, журналистике, коду, изображениям или музыке. Изображение: Wikimedia Commons / Roc0ast3r, CC0.
Соглашение Anthropic предоставляет правообладателям ориентир, но оно не решает все претензии к книгам, архивам, журналистике, коду, изображениям или музыке. Изображение: Wikimedia Commons / Roc0ast3r, CC0.

Операционный урок для лабораторий ИИ уже ясен. Управление данными должно стать полноценной инженерной функцией. Компаниям нужны записи о том, откуда взяты учебные материалы, какие права к ним принадлежат, какие наборы данных использовались для каких прогонов моделей, какие фильтры применялись и как обрабатываются запросы на удаление или исключение. Эта работа не является гламурной, но она может стать столь же важной для доверия к компании, как сертификация безопасности и время безотказной работы. Компания, которая не может объяснить цепочку поставок данных, столкнется с юридическими рисками, трудностями в закупках и общественным скептицизмом.

Выплата также может ускориться licensing рынки. Крупные издатели и платформы могут вести прямые переговоры с разработчиками моделей. Меньшие авторы, независимые издательства и коллективные правозащитные организации будут продвигать механизмы, которые не требуют от каждого создателя индивидуально участвовать в судебных разбирательствах. Риск заключается в том, что рынок лицензирования, построенный вокруг крупнейших каталогов, может еще больше концентрировать власть, предоставляя ключевым посредникам рычаги влияния, в то время как отдельные создатели будут получать стандартные выплаты и иметь мало контроля над последующим использованием. Вот почему политическая дискуссия не ограничится только компенсацией. Она будет смещаться в сторону согласия, прозрачности, авторства, возможности аудита и структуры рынка.

Для компаний, работающих с ИИ, урок заключается не просто в том, что юридические риски дороги. Суть в том, что управление данными больше нельзя рассматривать как вопрос второй линии поддержки. Пайплайны обучения требуют документации, показывающей, откуда взят материал, какие права к нему прилагались, какие исключения применялись и использовались ли или были отброшены материалы в последующих версиях моделей. Ведение такого рода записей сложно, потому что передовые наборы данных могут содержать триллионы токенов, собранных за годы. Но стоимость незнания может быть намного выше. Если компания не может объяснить происхождение своих данных, ей может понадобиться одновременно защищать как законность обучения, так и законность приобретения данных.

Это соглашение также создает давление на инвесторов и корпоративных клиентов. Юридическая ответственность крупного поставщика моделей является проблемой не только для юристов; она может стать проблемой непрерывности продукта. Клиенты, создающие важные рабочие процессы на основе модели, хотят знать, может ли судебное разбирательство вынудить изменить модель, удалить набор данных, изменить результаты или повысить цены. Инвесторы хотят знать, отражает ли оценка лаборатории нерешенные обязательства. Соглашение Anthropic дает советам директоров и закупочным командам конкретную причину задавать более детальные вопросы о авторских правах, лицензиях, гарантиях и проверках обучающих данных перед тем, как использовать поставщика.

Авторы сталкиваются с более сложным исходом. Выплата примерно в 3 000 долларов за книгу, если распределяется так, как сообщается, имеет значение для многих писателей и издателей. Но урегулирование не гарантирует, что авторы будут контролировать будущие использования своих произведений, и не создаёт универсальную систему оплаты за обучение. Оно компенсирует определённую группу по конкретным обвинениям. Многие писатели по-прежнему будут беспокоиться о том, что системы ИИ могут усваивать стиль, структуру и рыночную стоимость таким образом, который отдельные иски не могут легко измерить. Другие могут решить, что лицензирование лучше, чем бороться с каждым использованием задним числом. Отрасль движется в сторону рынка переговоров, но не обязательно равного.

Этот случай также иллюстрирует, почему общественные дебаты часто уходят в никуда. Разработчики ИИ подчеркивают трансформацию, статистическое обучение и социальную ценность систем, которые могут помогать людям писать, программировать, переводить и анализировать информацию. Создатели подчеркивают согласие, труд и тот факт, что коммерческие системы ИИ были созданы частично на рынках, которые уже существовали. Обе позиции содержат серьезные утверждения. Суд может прийти к выводу, что некоторые виды обучения являются законными, но при этом наказать за способ составления набора данных. Эта средняя позиция юридически возможна, но она оставляет обе стороны неудовлетворенными, так как не дает четкого морального ответа.

Издатели будут изучать урегулирование, чтобы получить рычаг давления в переговорах с другими лабораториями. Новостные организации уже заключают лицензионные сделки и подают иски. Теперь издатели книг могут настаивать на соглашениях, охватывающих весь каталог, которые включают вознаграждение, возможность выхода из соглашения, контроль за атрибуцией или ограничения на результаты моделей, которые напрямую конкурируют с оригинальными произведениями. Чем больше каталог, тем сильнее переговорная позиция. Такая динамика может сделать независимых авторов зависимыми от обществ по коллективному управлению правами, групповых исков или посредников платформ, если законодатели не создадут более ясные механизмы коллективного лицензирования для обучения ИИ.

Соглашение также может повлиять на техническое поведение. Если компании знают, что использование несанкционированных или плохо документированных обучающих данных может создать риск на миллиарды долларов, они могут больше инвестировать в устранение дубликатов, фильтрацию, маркировку источников и прослеживаемость наборов данных. Они могут также создавать модели таким образом, чтобы было проще удалять определенные корпуса или доказывать, что спорный набор данных не оказал существенного влияния на развернутую систему. Эти возможности трудны, потому что большие модели не хранят работы как традиционная база данных. Но правовое давление может изменить инженерные приоритеты, особенно когда клиенты начинают требовать доказательства.

Это урегулирование также имеет значение, потому что оно делает риск нарушения авторских прав понятным для финансовых рынков. До сих пор многие иски, связанные с обучением ИИ, казались масштабными, но абстрактными. Урегулирование на сумму более миллиарда долларов, одобренное судом, превращает риск в цифру, которую можно моделировать, резервировать, страховать, обсуждать или учитывать в лицензировании. Это не означает, что каждый случай будет урегулирован в таких же масштабах. Это означает, что руководители больше не могут воспринимать иски о нарушении авторских прав как далёкий шум, гонясь за созданием более крупных моделей. Стоимость неопределённости данных приблизилась к балансовому отчёту.

Для корпоративных клиентов практический вопрос заключается в возмещении убытков. Если компания использует Claude, ChatGPT, Gemini или другую модель для генерации текста, кода, маркетинговых материалов или анализа, кто несет риск, если данные для обучения модели или ее результаты станут основанием для иска? Поставщики начали предлагать различные формы защиты, но детали различаются. Дело Anthropic заставит закупочные команды внимательнее читать эти условия. Урегулирование вопросов с учебными материалами автоматически не делает клиентов ответственными, но напоминает им, что юридическая позиция поставщиков ИИ является частью риска продукта.

Сообщество авторов также может расколоться по вопросу стратегии. Некоторые будут рассматривать соглашение как доказательство того, что судебные разбирательства работают и их следует расширять. Другие могут опасаться, что коллективные соглашения приносят одноразовые выплаты, оставляя будущее рынка в основном в руках издателей, платформ и компаний, создающих модели. Независимые авторы, переводчики, иллюстраторы и небольшие издательства часто не имеют прямой переговорной силы. Они могут выступать за коллективное лицензирование, законодательные схемы или системы регистрации, которые позволяют создателям указывать свои предпочтения без необходимости вести индивидуальные переговоры с каждой лабораторией ИИ.

Мировое соглашение вряд ли остановит судебные разбирательства по справедливому использованию, потому что центральная доктрина остаётся неурегулированной в различных обстоятельствах. Суд может признать одно использование для обучения трансформационным, другое — нарушением из-за замещения результата, а третье — незаконным, поскольку исходный материал был получен ненадлежащим образом. Эта неопределённость будет побуждать обе стороны продолжать проверку границ. Компании, занимающиеся ИИ, хотят широкого юридического разрешения на обучение с использованием данных из Интернета и приобретённых или лицензированных корпусов. Правообладатели хотят компенсации и контроля. Мировое соглашение сокращает один спор, но не закрывает юридический фронт.

Давление на политику будет расти по мере того, как сгенерированные книги, обзоры, учебные пособия, аудиокниги и помощники по написанию конкурируют с теми же рынками, которые предоставляли данные для обучения. Если ИИ-системы только помогали пользователям находить и понимать книги, аргумент об экономическом ущербе был бы слабее. Если же они могут создавать заменители, имитировать авторские стили или заполнять платформы производным материалом, праводержатели будут утверждать, что обучение и результаты нельзя так просто разделить. Судам придётся рассматривать не только то, как обучаются модели, но и то, как разрабатываются и продвигаются продукты.

Позиция Anthropic по урегулированию споров может также влиять на то, как другие лаборатории подходят к раннему разрешению конфликтов. Оспаривание каждого дела до вынесения решения суда может создать благоприятные прецеденты, но это также может повредить процессу раскрытия информации, вызвать неопределенность для клиентов и повлиять на общественные представления о сборе данных. Урегулирование спора может устранить определенный риск, избегая при этом установления окончательного юридического правила, которое может обязать компанию в будущем. У этой стратегии есть ограничения, поскольку слишком большое количество урегулирований может выглядеть как признание того, что бизнес-модель зависит от последующей оплаты. Индустрия будет пытаться решить риски, не уступая в более широкой борьбе за право на добросовестное использование.

Одобрение суда дает издателям и авторам новую точку отсчета, но не формулу. Количество произведений, предполагаемые источники пиратства, процессуальное положение и масштаб бизнеса Anthropic — все это повлияло на результат. Иск по журналистике, музыке, изображениям или программному коду может включать различные ущербы и различные рыночные доказательства. Истцы будут цитировать это соглашение, потому что оно большое. Ответчики будут утверждать, что оно специфично для конкретного дела и добровольно. Обе позиции могут быть верны, поэтому соглашение имеет влияние, но не является обязательным.

Более глубокий вопрос управления заключается в том, смогут ли компании в сфере ИИ заслужить доверие до того, как суды вынудят их раскрыть информацию. Компания, которая публикует ясные правила использования обучающих данных, соблюдает отказы там, где она это обещала, лицензирует ценные корпуса и отслеживает происхождение данных, может столкнуться с судебными исками, но она будет выглядеть иначе, чем компания, которая не может объяснить свои источники. Доверие не придет от заявления о том, что модель продвинута или безопасна. Оно придет от демонстрации того, что промышленный процесс за моделью управляется как промышленный процесс, с ведением записей, контролями, аудитами и подотчетностью.

Вот почему урегулирование будет иметь последствия за пределами Anthropic. Оно дает каждому заинтересованному лицу более сильную переговорную позицию по разной причине: авторы могут ссылаться на компенсацию, лаборатории могут указывать на ограничения постановления, клиенты могут требовать документацию, а политики могут утверждать, что только добровольные соглашения не решат проблему системы. Этот случай превращает данные для обучения ИИ из невидимого инженерного ресурса в заметный управленческий актив.

Практическим следствием является то, что команды по разработке моделей будут вынуждены работать более тесно с юристами, библиотекарями, издателями и инженерами по работе с данными, чем они это делали во время первого бума генеративного ИИ. Ранее данные для обучения обсуждались в основном с точки зрения масштаба и качества. Теперь их будут обсуждать с точки зрения прав, происхождения, исключений и возможности аудита. Этот сдвиг может замедлить некоторые циклы разработки, но он также может сделать отрасль более устойчивой, уменьшая вероятность того, что будущие модели будут созданы на основе правовой неопределенности, которая становится видимой только после внедрения.

Международные последствия значительны. Доктрина добросовестного использования в США не совпадает с европейскими правилами текстового и дата-майнинга, японскими исключениями из авторских прав или возникающими правилами ИИ в других юрисдикциях. Глобальная компания по разработке ИИ может обучать модели в одной стране, обслуживать пользователей в другой и использовать данные, собранные или лицензированные из множества других стран. Дело Anthropic является урегулированием в США, а не глобальным законом. Тем не менее, оно будет изучаться во всем мире, поскольку наделяет спор крупной суммой и показывает, что суды готовы отделять теорию обучения от практического вопроса о том, как были получены данные.

Наиболее важный нерешённый вопрос заключается в том, сможет ли лицензирование масштабироваться без того, чтобы искусственный интеллект оказался закрыт для самых богатых игроков рынка. Крупные лаборатории могут позволить себе урегулирования и сделки по каталогам. Малые разработчики моделей, академические команды и проекты с открытым исходным кодом не могут нести такие же транзакционные издержки. Если правовой режим превратится в мозаику частных лицензий, компании с наибольшим капиталом могут получить ещё одно структурное преимущество. Политикам придётся решить, является ли целью исключительно компенсация, или же закон должен также сохранять пространство для исследований, конкуренции, библиотек, архивов и открытой технической разработки.

Одобренное соглашение, таким образом, является меньше концом, чем маркером. Оно говорит компаниям, работающим с ИИ, что правовые обходные пути при получении данных могут иметь последствия в миллиарды долларов. Оно говорит авторам, что суды могут различать трансформационное использование и незаконное получение материалов. И оно говорит законодателям, что существующая система авторского права вынуждена справляться с промышленным процессом обучения, для наблюдения за которым она не была предназначена. Следующий этап определит, станет ли обучение ИИ лицензируемой, проверяемой цепочкой поставок или останется серией дорогостоящих урегулирований после того, как модели уже созданы.

Темы: Anthropic, авторское право, авторы, Claude

Канонический адрес статьи