Безопасность
Спор о дистилляции Anthropic-Alibaba — это предупреждение о извлечении моделей
Обвинения Anthropic в несанкционированном извлечении возможностей Claude показывают, почему безопасность моделей всё больше становится похожа на предотвращение мошенничества. Теперь лабораториям передового ИИ приходится защищать не только исходный код, но и поведение моделей.
Автор: Лео В ·

The Anthropic-Alibaba спор о дистилляции является предупреждением о том, что безопасность пограничной модели выходит за пределы джейлбрейков. Если соперник или несанкционированный оператор может массово запрашивать модель и обучать другую систему на её выходных данных, защищённым активом является не только код или веса. Это поведение.
Это превращает извлечение модели в другой вид проблемы безопасности. Злоумышленнику не нужно взламывать центр обработки данных. Им могут понадобиться только аккаунты, автоматизация, способы оплаты и достаточно трафика, который выглядит легитимным, пока закономерность не станет очевидной.
Дистилляция полезна и опасна
Дистилляция знаний является легитимным метод машинного обучения когда разрешено. Более маленькие модели могут обучаться на больших системах, делая их дешевле и проще в развертывании. Спор начинается, когда модель-учитель используется без разрешения или в нарушение условий использования.

Элементы управления будут знакомы всем, кто работал с платежами или злоупотреблением облачными сервисами. Лабораториям нужны ограничения по скорости, проверка клиентов, обнаружение аномалий, поведенческие отпечатки и пути юридической эскалации. Сложная часть заключается в том, чтобы отделить интенсивное законное использование от извлечения.
Проблема политики, замаскированная под злоупотребление
Геополитический аспект делает спор острее. Если политики будут полагать, что поведение продвинутой модели можно скопировать через доступ по API, они могут рассматривать управление учетными записями и доступ к облаку как инструменты контроля экспорта. Это бы напрямую привлекло безопасность модели к национальной промышленная стратегия.

Темы: Anthropic, Alibaba, дистилляция моделей, безопасность ИИ