Исследования

Google DeepMind запускает первую двойную слепую оценку передового ИИ

Google DeepMind тестирует Gemini Flash Lite на закрытых бенчмарках в криптографически защищённой среде. Цель пилотного проекта — не дать разработчикам моделей и оценщикам нарушить целостность критически важных тестов.

Майкл Г ·

Google DeepMind запускает первую двойную слепую оценку передового ИИ

Google DeepMind начал то, что он описывает как первое двойное слепое тестирование проприетарной модели ИИ передового уровня, используя криптографическую инфраструктуру, предназначенную для того, чтобы ни разработчик модели, ни внешние оценщики не видели информацию, которая могла бы скомпрометировать тест. Пилотный проект запустит модель Gemini Flash Lite против конфиденциальных эталонов, предоставленных через Singapore AI Safety Institute, OpenMined, AVERI и MLCommons. Цель проста и сложна одновременно: получить оценку, которую ни одна из сторон не могла бы тихо оптимизировать заранее.

Загрязнение эталонных данных стало центральной проблемой в оценке моделей. Публичные тестовые вопросы, решения и почти идентичные дубликаты могут попасть в тренировочные данные. Разработчики также могут настраивать системы в соответствии с известными эталонами, целенаправленно или нет, пока результат не будет отражать знакомство с экзаменом, а не общие способности. Сохранение эталона в приватном доступе защищает от некоторых утечек, но требует от оценщиков доверия к тому, что подсказки, результаты и доступ к модели обрабатываются точно так, как обещано. Пилотный проект DeepMind добавляет технические меры в контракты и обязательства по нулевому логированию.

Метод двойного слепого испытания является аналогией экспериментальной практики, а не утверждением о том, что все влияния были устранены. Оценщики не должны узнавать конфиденциальные детали модели, которые могут вызвать предвзятость или раскрыть систему. Разработчики моделей не должны видеть конфиденциальное содержимое теста, которое может повлиять на обучение. Защищённая среда выполнения посредничает в взаимодействии, позволяя эталонному тесту достигать модели, а результатам — оценщика, без того чтобы одна из сторон получала чувствительные данные другой стороны в обычной форме.

Это разделение особенно важно, когда тест охватывает опасные или коммерчески чувствительные возможности. Кибернетический бенчмарк может содержать пути эксплуатации, которые не должны быть в обращении. Оценка в области биологии может включать процедуры, требующие контролируемого доступа. Компания может отказаться от внешнего тестирования, если считает, что оценщики могут извлечь веса модели или системные подсказки. Конфиденциальные вычисления могут снизить эти опасения и сделать независимую оценку возможной там, где общая таблица или удаленный API были бы невозможны.

Криптография защищает границу теста

Пилот использует среду, сохраняющую конфиденциальность, поддерживаемую технологиями конфиденциальных вычислений Google. Общая модель заключается в защите данных во время их обработки, а не только при хранении или передаче. Аттестация с поддержкой аппаратного обеспечения может продемонстрировать, что одобренный код выполняется внутри определённой среды, прежде чем какая-либо из сторон передаст свои защищённые данные. Затем шифрование и контроль доступа ограничивают то, что администраторы или другие сервисы могут наблюдать. Бенчмарк и модель располагаются внутри контейнера, состояние которого можно проверить.

Конфиденциальная инфраструктура оценки защищает как контрольные подсказки, так и собственные активы модели во время выполнения.
Конфиденциальная инфраструктура оценки защищает как контрольные подсказки, так и собственные активы модели во время выполнения.

Это не делает коробку безошибочной. Аппаратное обеспечение и программное обеспечение для оркестрации могут содержать уязвимости. Побочные каналы могут раскрывать временные или ресурсные паттерны. Аттестация доказывает, что работает конкретная среда, а не то, что сам бенчмарк хорошо спроектирован. Система по-прежнему нуждается в моделировании угроз, обзоре кода, воспроизводимой конфигурации и плане реагирования в случае обнаружения проблемы с безопасностью. Криптография укрепляет целостность оценки; она не заменяет научное суждение.

OpenMined приносит опыт создания инфраструктуры, обеспечивающей конфиденциальность при внешнем доступе к моделям. AVERI и MLCommons вносят экспертизу в области оценки и бенчмаркинга, а сингапурский AISI добавляет независимый институт, ориентированный на общественные интересы. Партнёрство важно потому, что ни один участник не должен определять весь процесс целиком. Компания, разрабатывающая модель, может защищать свою систему, оценщик может разрабатывать тест, а общественный институт может устанавливать цели политики. Доверие улучшается, когда эти обязанности остаются различными и подлежащими проверке.

Первая модель — это система Gemini Flash Lite, а не самая мощная не выпущенная модель, которую могла бы выбрать DeepMind. Использование меньшего пилотного варианта разумно, потому что сам протокол требует тестирования. Команды могут проверить поток данных, оценку, доступ и восстановление после сбоев до того, как использовать метод для систем с более высоким уровнем риска. Успешный запуск покажет, что механизм работает при определённых условиях. Это не подтвердит, что все передовые оценки должны немедленно переноситься в ту же среду.

Достоверность оценки по-прежнему зависит от того, что измеряет эталонный показатель. Конфиденциальные вопросы могут быть узкими, культурно предвзятыми или не связанными с реальным использованием. Модель может успешно выполнить контролируемую киберзадачу и вести себя иначе, когда ей дают больше времени, дополнительных инструментов или обратную связь от пользователя. Двойное слепое тестирование снижает риск искажений и стратегической подготовки. Оно не устраняет разрыв между эталонным показателем и реальной системой, работающей в реальной организации.

Метод меняет стимулы для лабораторий и оценщиков

Разработчики моделей имеют коммерческий стимул демонстрировать сильные результаты и стимул безопасности ограничивать внешний доступ. У оценщиков есть стимул публиковать полезные результаты и защищать уникальность своих тестов. Эти цели могут вступать в конфликт. Безопасная двухслепая среда делает сотрудничество меньше зависимым от личного доверия. Она может позволить лаборатории продемонстрировать производительность, не получая экзамен, в то время как оценщик может протестировать проприетарную систему, не забирая модель на хранение.

Независимым оценщикам необходимо иметь достаточный доступ для тестирования модели без предоставления неограниченного контроля над проприетарными системами.
Независимым оценщикам необходимо иметь достаточный доступ для тестирования модели без предоставления неограниченного контроля над проприетарными системами.

Этот подход также может продлить полезный срок службы эталонов. Как только публичный тест становится популярным рейтингом, обучающие наборы данных и посттренировочные конвейеры начинают ориентироваться на него. Баллы растут, в то время как способность теста различать системы снижается. Конфиденциальные наборы могут менять вопросы и раскрывать агрегированные результаты без публикации каждого элемента. Это создаёт работу по обслуживанию и требует управления тем, кто может вносить вклад, проверять и выводить тесты из обращения. Всё же это предпочтительнее, чем притворяться, что широко собранный эталон остаётся нетронутым.

Гласная ответственность требует достаточного раскрытия информации, чтобы понять результат. Оценка из закрытой среды может стать новой формой власти, которую сторонние лица должны принимать, не видя теста. Оценщики должны публиковать область возможностей, методологию, выборку, правила оценивания, неопределённость и ограничения, при этом защищая конфиденциальные запросы. Независимое воспроизведение другой одобренной организацией может повысить уверенность в результатах. Конфиденциальность должна защищать целостность, а не препятствовать критике.

Политические агентства могут использовать этот метод для предварительной проверки перед развертыванием, особенно в случаях, когда правительства хотят иметь уверенность без требования предоставления весов модели. Национальный институт безопасности мог бы проводить стандартизированные тесты в защищенной среде и получать подписанные результаты. Поставщик мог бы проверять код и условия, не видя самих объектов. Такой процесс все равно потребует наличия юридической власти, правил обработки и соглашения о том, что происходит, когда модель превышает порог риска.

Надёжный рейтинг требует надёжного процесса принятия решений

Самый сложный вопрос возникает после оценки. Если модель демонстрирует неожиданно высокие результаты по опасной способности, кто может задержать выпуск, потребовать смягчающих мер или запросить еще один тест? Криптографическая целостность может показать, что результат не был подделан. Она не может решить, какой уровень производительности приемлем. Лаборатории и правительства должны установить пороговые политики до получения результатов, иначе неожиданный исход вызовет переговоры под коммерческим давлением.

Окружение должно сохранять журнал аудита, охватывающий версии программного обеспечения, идентификаторы моделей, версии тестов и код оценки. Эта запись позволяет исследователям воспроизвести спорный результат без широкого раскрытия защищенного содержания. Она также предотвращает возможность замены лабораторией модели безопаснее для оценки и использования другой. Идентичность модели и её конфигурация являются частью эксперимента. Небольшие изменения в инструментах, подсказках или слоях безопасности могут привести к существенно разному поведению.

Затраты определят, будет ли этот подход распространяться. Конфиденциальные среды с аппаратной поддержкой, независимые институты и поддержание эталонов требуют инженерных и управленческих усилий. Крупные передовые лаборатории могут это финансировать. Меньшие разработчики и академические команды могут нуждаться в совместной инфраструктуре или субсидированном доступе. Стандарт безопасности, который могут выполнить только самые богатые компании, может укрепить позиции действующих игроков, не улучшая оценку на более широком рынке. Открытые протоколы и совместимые инструменты могут снизить этот риск.

Пилотный проект DeepMind ценен тем, что рассматривает оценку как проблему безопасности и институциональную проблему, а не просто как набор подсказок. Эталонный тест должен оставаться конфиденциальным, модель должна оставаться защищенной, а результат должен оставаться достоверным для людей за пределами обеих организаций. Для достижения всех трех целей необходима архитектура, контракты и независимый надзор. Эксперимент будет оцениваться по тому, смогут ли другие оценщики воспроизвести протокол и объясняют ли опубликованные результаты достаточно, чтобы поддерживать проверку.

Соавторам бенчмарков понадобятся правила для конфликтов интересов. Организация, которая помогает писать тест, также может консультировать компанию, производящую модели, или получать от нее финансирование. Инфраструктура с двойным слепым контролем может скрывать подсказки, не устраняя институциональные стимулы. Руководящие органы должны раскрывать отношения, чередовать рецензентов и не допускать, чтобы один соавтор решал, как будут оцениваться его собственные задания. Технически безупречный тест все равно может потерять доверие, если люди, его интерпретирующие, не являются независимыми.

Статистический дизайн заслуживает такого же внимания. Конфиденциальные тесты часто содержат меньше заданий, потому что их дорого создавать и защищать. Малые выборки дают широкую неопределённость и делают результаты чувствительными к формулировке вопросов или случайным вариациям. В отчетах следует включать интервалы доверия, повторные измерения и анализ категорий ошибок, а не только общий балл. Политикам нужно знать, было ли пороговое значение явно превышено или результат находится в пределах измерительного шума.

Протокол также должен защищать от селективного раскрытия информации. Лаборатория может представить модель на несколько конфиденциальных оценок и опубликовать только благоприятный результат. Реестр завершенных испытаний, включая удержанные или неокончательные результаты, может уменьшить эту предвзятость, одновременно защищая чувствительные детали. Регулирующие органы могут требовать более полного отчета для выпусков с высоким риском. Добровольные участники должны объяснить, отражает ли опубликованный результат каждый согласованный тест или только подмножество, выбранное после того, как стали известны результаты.

Международная совместимость может предотвратить дублирование нагрузки. Национальные институты могут разрабатывать различные конфиденциальные эталоны для схожих рисков, что вынуждает лаборатории повторять дорогую оценку и делает сравнение результатов затруднительным. Общие форматы аттестации и единые поля отчетности позволили бы учреждениям признавать надежные процессы друг друга, одновременно сохраняя локальные пороговые значения политики. Участие Сингапура предоставляет пилотному проекту полезный трансграничный контекст, а не превращает его исключительно в внутреннее упражнение Google.

Мониторинг после развертывания должен быть связан с запечатанным эталоном. Если реальные пользователи обнаружат сбой, который тест пропустил, оценщики могут добавить защищённый элемент без публикации эксплойта. Будущие версии смогут измерять, работает ли устранение проблемы. Это создаёт постоянную оценку, а не одноразовый экзамен. Правила доступа должны предотвращать возможность у разработчика модели выводить новые элементы через повторное тестирование, что может потребовать ограничения скорости и контролируемого планирования повторных тестов.

Передовые модели всё чаще оцениваются в средах, где у каждого есть что-то важное, что нужно скрыть: собственные системы, опасные задачи, неопубликованные методы или чувствительные неудачи. Секретность может разрушить доверие, если она блокирует проверку. Она также может сохранять доверие, если предотвращает утечку результатов экзамена. Двойное слепое тестирование — это попытка определить эту границу с помощью технологий. Его успешность будет зависеть меньше от фразы «первый в своём роде», чем от того, приведёт ли закрытый тест к получению доказательств, которые учреждения смогут реально использовать.

Темы: Google DeepMind, оценки ИИ, бенчмарки, конфиденциальные вычисления, безопасность ИИ

Канонический адрес статьи