Безопасность
Дорожная карта контроля ИИ DeepMind рассматривает агентов как внутренние угрозы
Google DeepMind опубликовала дорожную карту контроля ИИ для мониторинга и сдерживания все более автономных агентов. Важна рамка безопасности: по мере того как агенты получают доступ к инструментам, компаниям может потребоваться рассматривать их меньше как функции программного обеспечения и больше как субъекты с высокими привилегиями внутри системы.
Автор: Лео В ·

Google DeepMind опубликован Дорожная карта управления ИИ для мониторинга и сдерживания более способных агентов, Axios отчеты. Основная идея поразительно практична: по мере того как системы ИИ становятся более автономными, лабораториям следует заимствовать подход из кибербезопасности и рассматривать агентов не как пассивные программные инструменты, а как потенциальные внутренние угрозы с доступом к конфиденциальной информации.
Это значительный сдвиг в языке безопасности ИИ. Выравнивание по-прежнему остается первым уровнем, но DeepMind признает, что одного выравнивания может быть недостаточно для систем, которые могут программировать, просматривать, планировать, использовать инструменты, управлять учетными данными и работать в рамках длительных рабочих процессов. Как только агент может действовать, сдерживание становится частью безопасности.
Рамка угроз со стороны инсайдера
Корпоративная безопасность уже предполагает, что доверенные участники могут допускать ошибки, злоупотреблять доступом или быть скомпрометированы. Та же модель мышления начинает применяться к Агенты ИИПолезному агенту для кодирования может понадобиться доступ к репозиторию, права на развертывание и контекст системы отслеживания ошибок. Те же самые права создают радиус повреждений, если агент преследует неправильную цель или скрывает доказательства неудачи.

Исследователь DeepMind Рохин Шах сказал Axios, что согласование должно оставаться первой линией защиты, но что за него отвечают несколько уровней. Одним из предлагаемых уровней является использование других систем ИИ в качестве наблюдателей, которые проверяют рассуждения и поведение агента на признаки отклонений. Это превращает надзор в проблему активного мониторинга, а не в статический политический документ.
Руководители нуждаются в собственных гарантиях
Подход с надзором вызывает сложные вопросы. Если одна модель контролирует другую, что предотвращает сговор, слепые зоны, общие режимы отказа или руководителя, которого проще обмануть, чем человеческого проверяющего? Ответ вряд ли будет заключаться в одной модели-наблюдателе. Это будут многоуровневое логирование, песочницы, границы разрешений, обнаружение аномалий, red-team доказательства и эскалация со стороны человека.

Время имеет значение. Опасные полностью автономные агенты могут пока не существовать в том виде, в котором их изображает научная фантастика. Но полуавтономные агенты уже появляются в разработке программного обеспечения, исследованиях, кибербезопасности, обслуживании клиентов и финансах. Ждать до первой крупной ошибки было бы типичной ошибкой в области безопасности.
Безопасность агента становится инженерией безопасности
Темы: Google DeepMind, ИИ-агенты, безопасность ИИ, кибербезопасность