Политика

Тестирование передового ИИ становится проблемой доказательств, а не проблемой принципов

По мере того как правительства и компании-разработчики моделей обсуждают оценку перед выпуском, центральный вопрос смещается с того, существуют ли обязательства по безопасности, на то, могут ли внешние организации видеть достаточно доказательств, чтобы оценить их.

Майкл С ·

Тестирование передового ИИ становится проблемой доказательств, а не проблемой принципов
Mantis.

Дискуссия о тестировании передового ИИ выходит за рамки вопроса о том, должны ли компании давать обязательства. Более сложный вопрос заключается в том, какие доказательства нужны правительствам, клиентам и общественности, чтобы они могли решить, имеют ли эти обязательства какое-либо значение.

Добровольные принципы помогли сформировать общий словарь в области риска, красной команды и ответственного выпуска. Но принцип не является мерой. Он не может показать, насколько тщательно была протестирована система, что нашли оценщики, какие меры защиты не сработали или почему компания всё же решила, что развертывание допустимо.

Вот почему тестирование перед выпуском стало институциональной проблемой. Компания обладает наибольшим знанием о своей модели, но у неё также есть самый сильный стимул описывать её работу в благоприятных терминах. У правительств может быть власть, но не всегда существует техническая возможность проверять быстро меняющуюся систему.

Оценка моделей полезна только тогда, когда можно проверить их область применения, режимы сбоев и критерии принятия решений. Изображение: Mantis.
Оценка моделей полезна только тогда, когда можно проверить их область применения, режимы сбоев и критерии принятия решений. Изображение: Mantis.

Достоверная структура не потребует, чтобы каждая деталь модели была опубликована. Она потребует достаточного раскрытия информации, чтобы установить, что было протестировано, какие возможности вызвали повышенную озабоченность, насколько реалистичной была тестовая среда, какие меры смягчения были применены и кто имел полномочия отменить решение о выпуске.

Эталонная задача особенно важна. Модель может работать безопасно на узком тесте, но вести себя иначе при работе с инструментами, при длительном контексте, при подключении к рабочему процессу или при использовании решительным противником. Оценка должна отражать то, как системы действительно используются, а не только то, как они выглядят в лаборатории.

Совершенной публичной таблицы результатов для оценки рисков на переднем крае не существует. Некоторые результаты потребуют защиты, поскольку они раскрывают уязвимости или чувствительные возможности. Тем не менее конфиденциальность не должна становиться универсальным оправданием секретности. Независимые рецензенты, структурированные сообщение о происшествии и защищённые каналы раскрытия информации могут обеспечивать проверку без публикации руководства по неправильному использованию.

Подотчетность зависит от отслеживаемых решений о доступе, оценках, смягчении последствий и реагировании на инциденты. Изображение: Mantis.
Подотчетность зависит от отслеживаемых решений о доступе, оценках, смягчении последствий и реагировании на инциденты. Изображение: Mantis.

Для компаний, приобретающих ИИ, применима та же логика. Заявление поставщика о безопасности должно приводить к практическим вопросам: что было оценено, кто это проверял, как отслеживаются изменения и что происходит после вредного сбоя? Закупки становятся одним из важнейших механизмов подотчетности, поскольку они превращают абстрактные гарантии в договорные ожидания.

Эра моделей-пионеров не будет управляться одним лишь обещанием быть осторожными. Ею будет управлять то, оставляют ли мощные системы следы доказательств, достаточные для того, чтобы другие люди могли их проверить.

Темы: управление ИИ, оценка моделей, передовой ИИ, подотчетность

Канонический адрес статьи