Безопасность

Исследователи обнаружили, что передовые лаборатории ИИ не имеют четких публичных планов по сдерживанию неуправляемых моделей

Отчёт TechCrunch свидетельствует о том, что ведущие разработчики ИИ предоставляют мало публичной информации о том, как они будут сдерживать модель, которая ведёт себя опасно или выходит из-под предусмотренного контроля. Этот пробел вызывает вопросы о готовности к действиям в области предотвращения, обнаружения, остановки, аннулирования учётных данных, изоляции сети и восстановления.

Автор: Лео В ·

Исследователи обнаружили, что передовые лаборатории ИИ не имеют четких публичных планов по сдерживанию неуправляемых моделей
Редакционное изображение Mantis.

Лаборатории передового ИИ опубликовали мало конкретных сведений о том, как они собираются обнаруживать и сдерживать модель, которая ведет себя непредсказуемо или выходит за рамки предполагаемых операционных границ, согласно исследованию, освещенному в отчете TechCrunch. Это открытие выявляет разрыв между публичными обязательствами по безопасности и прозрачностью операций в отрасли, которая стремительно внедряет все более мощные системы. Исследователи, изучающие опубликованные материалы ведущих лабораторий, обнаружили скудное или отсутствующее раскрытие информации о конкретных технических мерах, протоколах принятия решений и процедурах восстановления, которые активировались бы, если бы развернутая модель проявила опасное поведение или обошла средства безопасности. Вопрос сдерживания делится на отдельные технические проблемы. Профилактика включает в себя ограничение того, к чему модель может получить доступ и что она может делать до развертывания: ограничение вычислений во время вывода, ограничение области API, ограничение прав доступа к файловой системе, контроль исходящего трафика в сети. Обнаружение требует систем, которые распознают, когда модель ведет себя вне допустимых параметров: мониторинг поведения, проверка результатов, обнаружение аномалий по сравнению с базовым уровнем производительности. Остановка требует возможности надежно прекращать выполнение: аварийные выключатели, отзыв ресурсов, завершение процессов. Отзыв учетных данных означает отзыв API-ключей, токенов аутентификации и учетных данных базы данных, чтобы скомпрометированная модель не могла получить доступ к другим системам. Сетевое изолирование предполагает физическое или логическое отделение модели от критической инфраструктуры. Восстановление включает восстановление службы из некоррумпированных контрольных точек и расследование того, что произошло.

Лаборатории, которые публиковали рамочные стратегии безопасности, предоставляют различные уровни конкретики. Рамочная стратегия готовности OpenAI описывает оценку и мониторинг на стратегическом уровне, но не детализирует техническую реализацию изоляции в рамках этих шести операционных областей. Политика ответственного масштабирования Anthropic рассматривает оценку рисков и меры безопасности при развертывании в общих чертах. Ни один из документов, например, не уточняет, какие учетные данные будут отозваны при каких условиях, как будет обеспечиваться изоляция сети или какие процедуры восстановления существуют для различных сценариев сбоев. В индустрии существует прецедент для такого рода раскрытия информации. В области программной безопасности регулярно публикуются модели угроз, поверхности атак и защитная архитектура. Облачные провайдеры документируют инструкции по реагированию на инциденты. Финансовые учреждения подают детализированные планы обеспечения непрерывности бизнеса регуляторам. Отсутствие подобных публичных документов у лабораторий ИИ предполагает либо то, что процедуры сдерживания остаются недоработанными, либо что лаборатории скрывают операционные детали по конкурентным или соображениям безопасности, либо и то, и другое. отчет TechCrunch документирует отчётность, лежащую в основе этой записи. Рамочная структура готовности OpenAI предоставляет полезные технические основы для оценки утверждения.

Операционные области для сдерживания модели охватывают все этапы от предотвращения до восстановления. Изображение: Mantis.
Операционные области для сдерживания модели охватывают все этапы от предотвращения до восстановления. Изображение: Mantis.

Сложность изоляции в больших масштабах

Сдерживание становится сложнее по мере того, как внедряемые модели становятся более способными и более интегрированными в производственные системы. Модель, работающая на изолированном оборудовании с ограниченными разрешениями, сталкивается с меньшим количеством путей для выхода, чем та, которая выполняет чувствительные задачи в распределённой инфраструктуре. Тем не менее, реальное развёртывание требует интеграции: доступ к API, чтение баз данных, взаимодействие с пользователями, ведение журналов, аналитика. Каждая точка интеграции является потенциальной поверхностью атаки. Исследователи, работающие над безопасностью LLM, зафиксировали, что модели могут использовать подсказки для извлечения данных обучения, манипулировать выводами, чтобы обмануть пользователей, или злоупотреблять разрешениями для доступа к ресурсам, к которым они не должны иметь доступ. OWASP Top 10 для приложений LLM каталогизирует уязвимости на уровне приложений, специфичные для развёртывания языковых моделей. Эти уязвимости сохраняются даже в лабораториях с высокими намерениями по обеспечению безопасности, потому что они вытекают из фундаментальных свойств того, как модели работают и как они взаимодействуют с системами. Операционная компромиссия также отражена в Политика ответственного масштабирования Anthropic.

Проблема сдерживания усугубляется, когда поведение модели само по себе неопределенно. Традиционное программное обеспечение выполняется детерминированно: можно проследить путь через код, проверить логику, надежно воспроизвести ошибки. Крупные языковые модели генерируют вероятностный результат. Модель, обученная отказываться от вредоносных запросов, всё же может случайно или намеренно выполнять враждебные команды. Её поведение при новых вводах не полностью предсказуемо даже для её создателей. Эта неопределённость усложняет обнаружение: лаборатории должны различать ожидаемые вариации и реальные сбои. Она усложняет решения о прекращении работы: лаборатории должны определить, насколько они должны быть уверены, прежде чем завершать работу системы, а ложные срабатывания имеют свои собственные издержки. Для более широкого контекста, CISA защищено по дизайну излагает соответствующий стандарт или учреждение.

Деревья решений для сдерживания модели требуют различения ожидаемой вариации и неисправности. Изображение: Mantis.
Деревья решений для сдерживания модели требуют различения ожидаемой вариации и неисправности. Изображение: Mantis.

Регуляторный и промышленный контекст

Процедуры сдерживания не являются исключительно лабораторной проблемой. CISA, Агентство кибербезопасности и защиты инфраструктуры США, подчеркнуло принципы безопасности на стадии проектирования для критически важного программного обеспечения. Рамки кибербезопасности NIST предоставляет словарь для управления рисками безопасности, который применяется к инфраструктуре ИИ. Ни одна из рамочных структур не предписывает конкретные процедуры сдерживания ИИ, потому что стандарты еще не сформировались. Лаборатории сохраняют свободу выбора подхода. Но по мере того как передовые модели переходят к реальному использованию, влияющему на настоящих пользователей и системы, разрыв между инженерной реальностью и публичным раскрытием информации становится проблемой.

Лаборатория, которая не может объяснить, как она обеспечит сдерживание сбоя модели, не может достоверно утверждать, что она предусмотрела этот сбой. Политики, оценивающие регулирование ИИ, не располагают техническими деталями, необходимыми для того, чтобы оценить, достаточно ли существующих практик лабораторий или требуется ли обязательное раскрытие информации или внешняя проверка. Отсутствие публичных планов сдерживания не означает, что у лабораторий нет внутренних процедур. Anthropic, OpenAI, Google, Meta и другие лаборатории нанимают специалистов по безопасности и ведут эксплуатационные инструкции. Эти процессы, вероятно, существуют, но остаются закрытыми. Вопрос в том, оправдана ли конфиденциальность. Сдерживание не является коммерческой тайной в том смысле, как веса модели или методы обучения. Это свойство безопасности: способность остановить систему от причинения вреда. Общественное понимание мер сдерживания позволило бы внешним исследователям проверять подход, выявлять пробелы и предлагать улучшения. Это придало бы пользователям и регуляторам уверенность в том, что лаборатории продумали возможные способы отказа. Это установило бы базовые ожидания в отрасли. На данный момент передовые лаборатории продолжают использовать модели с процедурами сдерживания, которые остаются в значительной степени непрозрачными. Результаты исследований не указывают на то, что какая-либо конкретная модель вышла за пределы своих назначенных рамок или причинила вред из-за сбоя в сдерживании. Но по мере того как используемые передовые модели становятся более мощными и широко применяемыми, ставки этой непрозрачности возрастают. Лаборатории сталкиваются с выбором: разрабатывать и документировать строгие возможности сдерживания или признать, что их заявления о безопасности основаны на хрупкой технической основе. Последний пункт можно проверить в сравнении с Топ-10 OWASP для приложений LLM.

Темы: безопасность ИИ, передовые модели, безопасность, сдерживание

Канонический адрес статьи