Политика

Google сталкивается с новым судебным иском со стороны издателя по поводу Gemini Training Data

Крупные издатели и авторы подали коллективный иск против Google, обвинив компанию в использовании защищённых авторским правом книг для обучения Gemini за пределами соглашений Google Books и Google Play. Иск расширяет судебный спор об обучении ИИ.

Майкл С ·

Google сталкивается с новым судебным иском со стороны издателя по поводу Gemini Training Data
Wikimedia Commons / Дэвид Нейгл, CC BY-SA 4.0.

Google стал свидетелем еще одного крупного судебного испытания по поводу данных, использованных для обучения Gemini. TechCrunch сообщил 14 июля, что издатели и авторы, включая Hachette, Cengage, Elsevier, Скотта Тьюроу и S.C.R.I.B.E., подали коллективный иск, обвиняя Google в использовании защищённых авторским правом произведений для обучения своей платформы ИИ без разрешения. В иске, поданном в Южном округе Нью-Йорка, также утверждается, что Google удаляла или изменяла информацию об авторских правах, чтобы скрыть обучение моделей Gemini на этих материалах. Google не сразу ответила на запрос TechCrunch о комментарии.

Дело важно, потому что это не просто ещё одна борьба за то, можно ли использовать общедоступные веб-данные для обучения. Истцы утверждают, что многие работы попали в Google через программы с ограниченными возможностями, такие как Google Книги и Google Play Books, где авторы и издатели соглашались на конкретное использование, а не на широкое обучение коммерческой модели. Это различие может иметь значение. Суды могут по-разному рассматривать сбор данных с открытых веб-ресурсов и использование компанией материалов, полученных в рамках более узких коммерческих или архивных соглашений.

Более широкий спор о авторских правах дал неоднозначные сигналы. TechCrunch отметил, что ранние решения в Калифорнии были на стороне компаний, работающих с ИИ, на основании добросовестного использования, в то время как отдельное судебное разбирательство Anthropic завершилось крупным урегулированием, связанным с пиратскими произведениями. Эти результаты не решают дело Google. Южный округ Нью-Йорка будет иметь свои собственные факты, своих собственных истцов и другого судью. Вопрос в том, будет ли добросовестное использование защищает обучение модели, когда исходный материал был введен в системы компании через отношения, которые якобы имели ограничения.

Дело издателя сосредоточено на вопросе о том, были ли книги, предоставленные для ознакомления или распространения, впоследствии использованы для обучения ИИ. Изображение: Wikimedia Commons / Roc0ast3r, CC0.
Дело издателя сосредоточено на вопросе о том, были ли книги, предоставленные для ознакомления или распространения, впоследствии использованы для обучения ИИ. Изображение: Wikimedia Commons / Roc0ast3r, CC0.

Издатели также оспаривают рычаг влияния. Генеративный ИИ может суммировать, переписывать, создавать черновики, переводить и отвечать на вопросы таким образом, который может заменять части рынка, занимаемые книгами, учебниками и справочными изданиями. Модель не должна воспроизводить всю книгу, чтобы создавать экономическое давление. Если она сможет усваивать и перепаковывать ценность многих защищённых авторским правом произведений, издатели будут утверждать, что компенсация и согласие должны быть частью системы.

Позиция Google, вероятно, будет опираться на ту же широкую защиту, которую используют другие компании в сфере ИИ, что обучение является преобразующим использованием и что модели не хранят книги в качестве простой замены копий. Истцы, скорее всего, будут подчеркивать предполагаемую внутреннюю обеспокоенность по поводу ответственности и удаления или изменения информации о авторских правах. Это делает метаданные ключевым вопросом. Если суд установит, что информация по управлению авторскими правами если это было сознательно удалено или изменено, дело могло бы выйти за рамки обычной дискуссии о тренировочных данных и перейти в более разрушительную область.

Институциональная история повышает ставки. Google Books начался как проект по поиску и оцифровке, который обещал открытие через фрагменты и библиографическую информацию. Обучение ИИ меняет обмен ценностями. Вместо того чтобы помогать читателям найти книгу, модель может использовать книги, чтобы ответить на вопрос до того, как читатель обратится к автору или издателю. Вот почему спор становится испытанием согласия, а не только испытанием копирования.

Вопросы авторских прав и контрактов в связи с обучением ИИ всё чаще переходят из обсуждений продуктов в залы судов. Изображение: Wikimedia Commons / Krzysztof Golik, CC BY-SA 4.0.
Вопросы авторских прав и контрактов в связи с обучением ИИ всё чаще переходят из обсуждений продуктов в залы судов. Изображение: Wikimedia Commons / Krzysztof Golik, CC BY-SA 4.0.

Для компаний, работающих в области ИИ, практическое следствие заключается в том, что происхождение данных становится риском продукта. Данные для обучения больше нельзя рассматривать как скрытый входной ресурс, юридические последствия которого будут решены после развертывания. Корпоративные клиенты, издатели, регуляторы и инвесторы спрашивают, какие наборы данных были использованы, на каких правах, и соблюдались ли отказы или лицензии. Это давление будет подталкивать разработчиков моделей к более чистым хранилищам данных, большему количеству лицензионных соглашений и более тщательной документации.

Для издателей судебные разбирательства — это только одна из стратегий. Лицензирование, коллективные переговоры, технический контроль и продуктовые партнерства будут формировать рынок быстрее, чем суды в некоторых случаях. Но иски устанавливают резервные правила. Дело Google задает вопрос о том, дает ли долгие отношения поискового гиганта с книгами право обучать Gemini или, наоборот, создают более высокое обязательство, потому что доверие было более узким. Этот ответ поможет определить экономику продуктов знаний для ИИ.

Темы: Google, Gemini, авторское право, данные для обучения ИИ

Канонический адрес статьи