Безопасность

Самая опасная модель ИИ компании Anthropic была утечена. Вот что это означает для безопасности ИИ.

Claude Mythos, модель Anthropic, признанная слишком опасной для публичного выпуска, была доступна неавторизованными пользователями всего через несколько часов после её анонса. Утечка выявляет фундаментальное напряжение в ответственной разработке ИИ.

Патрик Т ·

Самая опасная модель ИИ компании Anthropic была утечена. Вот что это означает для безопасности ИИ.

В тот же день Anthropic публично анонсировала Claude Mythos — модель, которую компания описывает как способную находить новые уязвимости в кибербезопасности на уровне, превышающем возможности экспертов-человеков — небольшая группа пользователей в частном сервере Discord уже получила к ней несанкционированный доступ. Нарушение, впервые о котором сообщило Bloomberg, не было результатом сложного взлома. Это было результатом действий подрядчика с легитимным доступом и группы, которая достаточно хорошо изучила внутреннюю инфраструктуру Anthropic, чтобы сделать обоснованное предположение о том, где размещена модель.

Инцидент одновременно обыденный и тревожный. Обыденный, потому что внутренние угрозы и уязвимости цепочки поставок являются одними из самых распространенных векторов утечек корпоративных данных. Тревожный, потому что объект, о котором идет речь, — это не база данных с записями клиентов или проприетарный исходный код, а система искусственного интеллекта, которую собственная команда безопасности Anthropic признала слишком опасной для выпуска в общий доступ.

Если какой-то случайный форум Discord получил к нему доступ, значит, он уже был взломан противниками. Настоящая проблема не в том, есть ли это у других — а в том, что они с этим делают.

Дэвид Линднер, CISO, Contrast Security

Mythos был разработан с конкретной и узкой целью: находить уязвимости в кибербезопасности быстрее и более комплексно, чем человеческие исследователи. Anthropic продемонстрировал его возможности, используя модель для выявления 27-летней уязвимости в OpenBSD, операционной системе, специально разработанной для безопасности. Впоследствии Mozilla использовала предварительную версию, чтобы найти и исправить 271 уязвимость в Firefox. Это не теоретические возможности — это продемонстрированные, воспроизводимые результаты.

Модель была намеренно ограничена проверенной группой из 40 компаний, включая Microsoft, Apple и Google, каждая из которых согласилась с строгими политиками использования и протоколами безопасности. Однако среди этих 40 компаний тысячи отдельных сотрудников имели определенный уровень доступа. Подрядчик, который предоставил первоначальную точку входа, был одним из этих тысяч. У специалистов по безопасности есть название этой проблеме: поверхность угроз со стороны инсайдеров масштабируется с количеством доверенных сторон, и доверие нельзя полностью проверить.

Особую значимость нарушения Mythos придает то, что оно раскрывает структурные проблемы ответственного внедрения ИИ. Стандартная модель выпуска опасных технологий — будь то патогены четвертого уровня биологической безопасности, ядерные материалы или засекреченная информация — включает физическую изоляцию, строгий контроль доступа и суровые юридические последствия за несанкционированное раскрытие. Ни один из этих механизмов не переносится напрямую на программное обеспечение.

Чем больше они добавляют в эту элитную группу, тем выше вероятность того, что информация попадет к кому-то, у кого не должно быть доступа. Это было неизбежно.

Дэвид Линднер, CISO, Contrast Security

Этот пролом также осложняет отношения Anthropic с его критиками. Сэм Альтман, генеральный директор OpenAI, публично охарактеризовал маркетинг Mythos компании Anthropic как основанный на страхе, предполагая, что компания преувеличивает опасность модели, чтобы привлечь внимание и оправдать свою ориентированную на безопасность позицию. Инцидент с несанкционированным доступом имеет двоякий эффект: с одной стороны, он указывает на то, что модель реальна и достаточно способна привлечь интерес специалистов, с другой стороны, он вызывает вопросы о том, соответствовала ли позиция безопасности Anthropic серьезности риска, который она утверждала, что управляет.

Для команд корпоративной безопасности утечка Mythos является предварительным знаком проблем, которые будут только усиливаться. По мере того как модели ИИ становятся более способными к автономным действиям — поиску уязвимостей, написанию эксплойтов, проведению атак — вопрос о том, кто имеет доступ к этим возможностям, становится вопросом существования. Существующая структура, при которой компании ИИ самостоятельно регулируют доступ через договорные соглашения, явно недостаточна.

Anthropic заявил, что расследует этот инцидент и работает с затронутыми сторонами. Неавторизованные пользователи, по данным Bloomberg, не использовали модель в злонамеренных целях — они просто постоянно использовали её с момента получения доступа. Это различие может иметь юридическое значение, но мало что меняет в отношении основной проблемы безопасности архитектуры, которую выявил этот взлом.

Канонический адрес статьи