Безопасность
Безопасный найм Anthropic показывает, что предотвращение злоупотребления ИИ становится операционной функцией
Резкий рост числа позиций Anthropic, сосредоточенных на предотвращении опасного использования ИИ, иллюстрирует, как передовые лаборатории превращают безопасность моделей из исследовательской программы в постоянную функцию безопасности, политики и операций.
Автор: Лео В ·

AnthropicРастущий список ролей, посвящённых предотвращению опасного использования ИИ, является признаком того, что безопасность передовых моделей становится менее похожей на специализированный исследовательский проект и больше на постоянную операционную функцию.
Сдвиг важен, потому что способная модель создает риски на нескольких уровнях одновременно. Есть сама модель, способ её оценки, аккаунт, который к ней получает доступ, инструменты, к которым она может обратиться, приложения, построенные на её основе, и команды людей, которым приходится расследовать поведение, когда оно пересекает черту. Один документ с политикой не может регулировать весь этот стек.
Работа по предотвращению злоупотреблений находится на стыке безопасности инженерии и операционной работы с продуктом. Командам необходимо понимать, какие действия может предпринять злоумышленник, распознавать подозрительные шаблоны, не рассматривая каждого необычного пользователя как злонамеренного, и создавать пути эскалации, которые достаточно быстры, чтобы быть значимыми, но достаточно осторожны, чтобы не наказывать легитимные исследования.

Это отличается от ранних публичных обсуждений о защитных механизмах чат-ботов. Отказ в конце запроса — это лишь один метод контроля. Более продвинутые системы требуют многоуровневой защиты, включая проверку аккаунта, ограничения по частоте запросов, обнаружение злоупотреблений, ручную проверку и способы ограничения чувствительных функций без остановки обычной работы.
Операционная нагрузка будет расти по мере того, как модели станут более полезными в кибербезопасности, биологии, программировании и агентских рабочих процессах. Лаборатории могут знать, что определенная возможность ценна для защитников, исследователей и бизнеса, при этом также понимая, что она может сделать более эффективными небольшую группу злоумышленников. Задача заключается не просто в том, чтобы сказать «да» или «нет». Она заключается в том, чтобы определить, при каких условиях доступ может управляться.
Это делает найм стратегическим сигналом. Компании, которые создают команды безопасности только после инцидента, будут испытывать трудности с пониманием своих собственных систем вовремя. Компании, которые набирают их заранее, могут внедрять мышление о безопасности в проектирование продукта, правила доступа и реагирование на инциденты вместо того чтобы рассматривать это как внешний этап проверки.

Будут жесткие споры о прозрачности. Пользователи хотят знать, какие правила применяются. Исследователи хотят предсказуемого доступа. Правительства хотят уверенности в том, что наиболее способные системы не рассматриваются как обычное программное обеспечение. Поставщикам также нужно избегать публикации слишком подробной информации о своих защитах, чтобы не облегчать обход.
Следующий этап Безопасность ИИ будет оцениваться меньше по лабораторному манифесту, чем по тому, сможет ли компания управлять ежедневной деятельностью по предотвращению, расследованию и подотчетности с той скоростью, с которой улучшаются ее модели.
Темы: Anthropic, безопасность ИИ, предотвращение неправильного использования, кибербезопасность