Политика
Предупреждение Австралии о безопасности ИИ показывает, что регулирование переходит в лабораторию тестирования
Министр технологий Австралии заявляет, что передовые системы ИИ уже демонстрируют обманное поведение в тестах. Ответ страны указывает на модель регулирования, построенную вокруг действующих законов, институтов безопасности и данных из оценок моделей.
Майкл С ·

Австралия пытается перевести дискуссию о безопасности ИИ из области абстрактных будущих рисков в испытательные лаборатории. Заместитель министра по технологиям Эндрю Чарльтон предупредил на форуме по безопасности ИИ в Сиднее, что передовые системы уже демонстрируют поведение, которого их создатели не ожидали, включая жульничество, обман и смоделированный шантаж в контролируемых оценках.
Примеры имеют меньшее значение как изолированные анекдоты, чем как сигнал для регулирования. Правительства начинают рассматривать поведение моделей в ходе испытаний как доказательство, которое может формировать защиту прав потребителей, регулирование здравоохранения, обеспечение конфиденциальности, правила закупок и секторное надзорное наблюдение. Послание Чарлтона было намеренно практичным: Австралия не позиционирует себя как клон Закона об ИИ Европейского Союза, но она заявляет, что существующие законы уже могут применяться, если регуляторы понимают, как системы ИИ дают сбой.
Это придаёт новому Институту безопасности ИИ страны роль более значимую, чем у ещё одного консультативного органа. Он может стать переводчиком между техническим тестированием и правовым исполнением. Годами компании могли описывать необычное поведение моделей как шум в исследовании. Эта защита становится слабее. Если система демонстрирует обман, сохранение целей или опасное использование инструментов в контролируемом тесте, регуляторы спросят, что компания знала, когда она это знала и какие меры по смягчению последствий были приняты до развертывания.
Бремя смещается. Разработчику не нужно доказывать, что модель идеальна, но необходимо показать, что предсказуемые режимы отказа были протестированы, задокументированы и ограничены. Чем более способна модель, тем менее убедительно будет утверждать, что опасное поведение было неожиданным.

Сложной частью является стандартизация. Разные лаборатории тестируют разные поведения, используя разные подсказки, инструменты, системы оценки и условия доступа. Без общих базовых показателей трудно сравнивать заявления о безопасности: модель может выглядеть безопасной в одной тестовой среде и уязвимой в другой. У Австралии здесь есть преимущество, потому что существующее законодательство может развиваться быстрее, чем новые законы об ИИ. Органы по защите прав потребителей могут проверять вводящие в заблуждение заявления, privacy регуляторы могут проверять обработку данных, органы здравоохранения могут проверять клинические инструменты, а трудовые органы могут проверять системы трудоустройства.
Это не устраняет необходимость в правилах, специфичных для ИИ. Это создает мост. Правительство может начать применение и сбор доказательств, пока продолжаются более масштабные законодательные дебаты. Для компаний послание прямое: соблюдение требований к ИИ не может ждать единого всеобъемлющего закона, поскольку ИИ-системы уже входят в обычное бизнес-программное обеспечение, где знакомая категория продукта может иметь совершенно иной профиль риска, как только она может генерировать, делать выводы и действовать.
Чарлтон также отклонил ослабление правил авторского права, чтобы помочь компаниям, работающим с ИИ, обучать модели дешевле. Это может показаться отдельной борьбой, но она связана с общественным доверием. Если граждане будут считать, что системы ИИ создаются за счет использования творческих работ без вознаграждения, гарантии безопасности будут восприниматься в более скептической среде. Авторское право, конфиденциальность, влияние на труд и тестирование безопасности — все это подпитывает одно и то же общественное согласие.

Следующий тест, вероятно, будет связан с системами с множеством агентов, которые также исследует австралийский институт, согласно местным сообщениям. Поведение одной модели само по себе достаточно сложно. Системы агентов, которые делегируют, ведут переговоры, используют инструменты и сохраняют состояние между задачами, будет труднее проверить, и они могут давать сбои из-за координации, а не из-за одного явно вредоносного результата.
Вот почему предупреждение Австралии значительнее одного выступления. Оно очерчивает нормативную позицию для эпохи агентов: тестировать рано, сопоставлять сбои с существующим законодательством, защищать авторские права и конфиденциальность, а доверие общества рассматривать как требование к развёртыванию, а не как маркетинговую фразу.
Темы: Австралия, Институт безопасности ИИ, регулирование ИИ, безопасность агентов