Этика

Лаборатории ИИ ослабляют обещания по безопасности в то время, как модели становятся сложнее для управления

Новый индекс безопасности ИИ показывает, что крупные лаборатории отказываются от предыдущих обязательств по приостановке, в то время как передовые системы становятся более способными. Этот вывод превращает добровольную безопасность в центр борьбы за управление летом.

Майкл С ·

Лаборатории ИИ ослабляют обещания по безопасности в то время, как модели становятся сложнее для управления
Mantis.

Самая важная история о безопасности ИИ на этой неделе заключается не только в том, что пограничные модели становятся более способными. Это было заметно уже несколько месяцев. Более резкое развитие заключается в том, что несколько компаний, создающих эти системы, похоже, ослабляют добровольные обязательства, которые должны были успокоить правительства, инвесторов и общественность, что гонка все еще имела тормоза.

Новый отчет, освещенный Axios, сообщает, что Институт Будущей Жизни обнаружил, что Anthropic, OpenAI, Google DeepMind и Meta ослабили или отказались от прежних обязательств приостановить разработку, если их системы приближаются к определенным порогам опасности. Anthropic заняла первое место в оценке, но получила только C+. OpenAI и Google DeepMind получили C, в то время как экзистенциальная безопасность была определена как самая слабая область в отрасли.

Оценки следует рассматривать в контексте. Институт Future of Life имеет определённую позицию по риску катастрофического ИИ, а некоторые сторонники открытого исходного кода утверждают, что такие оценки могут наказывать за прозрачность. Тем не менее, отчёт поднимает реальную проблему управления: добровольные рамки безопасности имеют значение только в том случае, если компании сохраняют их в силе при росте коммерческого давления.

Изначальное обещание, заложенное в политиках ответственного масштабирования, было легко для понимания политиками. Если модель приближалась к опасным порогам возможностей и меры безопасности не были готовы, компания должна была замедлиться, приостановить работу или отложить развертывание. Ни один глобальный регулятор не имел персонала, полномочий или доступа в реальном времени, чтобы заставить принять такое решение, но публичное обязательство создавало репутационные последствия. Лаборатория, которая нарушила собственное обещание по безопасности, должна была объяснить, почему.

Обязательства по безопасности ИИ становятся достоверными только тогда, когда внешние оценщики получают достаточно доступа для тестирования опасных возможностей до их развертывания. Изображение: Mantis.
Обязательства по безопасности ИИ становятся достоверными только тогда, когда внешние оценщики получают достаточно доступа для тестирования опасных возможностей до их развертывания. Изображение: Mantis.

Если порог для приостановки становится более условным, более дискреционным или более строго контролируемым руководителями, структура начинает выглядеть меньше как обязательное ограничение и больше как слой для общения. Это особенно чувствительно сейчас, потому что возможности моделей расширяются в сферы, где обычное тестирование продуктов слабо: кибербезопасность, биологическое рассуждение, автономные агенты, убеждение, долгосрочное планирование и использование инструментов.

Бенчмарк может показать, решает ли модель задачу. Он не может легко показать, будет ли развернутый агент действовать безопасно в тысячах корпоративных рабочих процессов, миллионах пользователей и при изменяющихся разрешениях инструментов. Эта неопределенность объясняет, почему рамки безопасности должны охватывать больше, чем таблицу лидеров до выпуска, и почему рынок создает структурное искушение: если одна лаборатория замедлится, в то время как другая выпускает продукт, осторожная лаборатория рискует потерять пользователей, разработчиков, корпоративные контракты и таланты.

В отчёте также указывается на растущее военное применение коммерческих систем ИИ, сдвиг, который ещё больше усложняет вопросы безопасности. Правительства хотят иметь возможности, надёжность и доступ. Компании стремятся к доходу и стратегической значимости. Старая граница между гражданским ИИ и оборонным ИИ размывается, поскольку модели, которые суммируют документы, пишут код или планируют рабочие процессы, также могут поддерживать разведывательный анализ, киберзащиту и логистику.

Обзоры передовых моделей теперь должны учитывать риски, связанные с кибербезопасностью, биобезопасностью, автономией, контролем доступа и развертыванием вблизи военных объектов. Изображение: Mantis.
Обзоры передовых моделей теперь должны учитывать риски, связанные с кибербезопасностью, биобезопасностью, автономией, контролем доступа и развертыванием вблизи военных объектов. Изображение: Mantis.

Практический ответ заключается не просто в том, чтобы требовать от компаний давать более жёсткие обещания. Следующий этап требует доступа к внешней оценке, отчётности о происшествиях, раскрытия возможностей моделей, ответственности на уровне совета директоров, защиты информаторов и чётких сигналов о том, когда внедрение должно замедлиться. Правительствам не нужно вмешиваться в каждый выпуск модели, чтобы сделать эту систему более надёжной, но они могут требовать документированных обоснований безопасности, независимого тестирования и публичных сводок остаточного риска.

Дискуссия о безопасности вступает в более зрелую и менее снисходительную фазу. Лаборатории больше не оцениваются по тому, публикуют ли они какую-либо структуру. Их оценивают по тому, сохраняет ли эта структура свою эффективность, когда появляются следующая модель, следующий клиент и следующая конкурентная угроза одновременно.

Темы: безопасность ИИ, передовые лаборатории, управление ИИ, Институт будущей жизни

Канонический адрес статьи