Исследования

Исследователи Anthropic показывают, что автоматизированные системы могут улучшить обучение согласованию на десяти тестовых наборах

Исследователи Anthropic сообщили, что автоматизированные исследовательские системы улучшили поведение модели по десяти контрольным показателям согласованности без снижения общей производительности. Эксперимент предполагает, что части исследований после обучения могут быть автоматизированы, при этом подчеркивая, что дизайн контрольных показателей по-прежнему определяет, чему система учится оптимизировать.

Майкл Г ·

Исследователи Anthropic показывают, что автоматизированные системы могут улучшить обучение согласованию на десяти тестовых наборах
Редакционное изображение Mantis.

Исследователи Anthropic сообщили, что автоматизированные исследовательские системы улучшили поведение модели по десяти бенчмаркам согласованности без снижения общей производительности в проведённых ими тестах. Этот результат предоставляет доказательства того, что части пост-тренировочных исследований могут быть организованы как агентная петля: изучать предыдущие работы, предлагать вмешательство, кратко обучать, оценивать результат и сохранять подходы, которые показывают наилучшие показатели. Это значимый результат автоматизации исследований. Это не доказательство того, что система ИИ может улучшать себя без цели, определённой человеком, экспериментальной среды или бенчмарка.

Проект, руководимый участником Anthropic Чэнь Юэ-Хан, описан в Anthropic бумага под названием «Автоматизированные исследователи могут надежно снижать сбои выравнивания». Каждый автоматизированный исследователь выравнивания изучал доступную литературу, выбирал метод и проводил приблизительно 30-минутный тренировочный эксперимент. Система повторяла этот цикл, сохраняя эффективные методы и отбрасывая слабые. Согласно статье, процесс улучшил все десять целевых поведений, при этом оставив общую производительность неизменной в проведенной оценке.

Подход имеет значение, потому что пост-тренировка включает множество задач, которые требуют больших затрат человеческого внимания, но относительно структурированы. Исследователи сравнивают методы, настраивают рецепты, проводят контролируемые задания и интерпретируют метрики. Агент, способный выполнять больше циклов этого процесса, может исследовать более обширное экспериментальное пространство, чем может позволить себе небольшая команда. Заявленное преимущество — не таинственный интеллект. Это параллельная, недорогая итерация в тщательно подготовленной среде, где эксперименты коротки и результаты могут быть оценены.

Эталон определяет работу

Основное ограничение такое же, как и для любой системы оптимизации, ориентированной на эталонные показатели: успех так же полон, как и измерение. Согласование ИИ в широком смысле относится к приведению поведения системы в соответствие с предполагаемыми целями и ограничениями. Набор из десяти эталонных тестов может показать, улучшились ли конкретные ошибки, но он не может отразить все возможные способы поведения модели в эксплуатации. Если важная ошибка отсутствует в оценке, у автоматизированного исследователя нет причин обнаруживать или исправлять её.

Автоматизированный процесс повторял обзор литературы, выбор методов, обучение и оценку по установленным эталонам. Изображение: Mantis
Автоматизированный процесс повторял обзор литературы, выбор методов, обучение и оценку по установленным эталонам. Изображение: Mantis

Это не делает результат тривиальным. А benchmark полезно, когда оно достаточно стабильно, чтобы сравнивать методы, и достаточно широкое, чтобы препятствовать узкой эксплуатации. Сообщалось, что система улучшила каждый целевой показатель без наблюдаемого снижения общей производительности, что предполагает, что она не просто меняла одно измеряемое поведение на другое в тестируемых условиях. Репликация потребует изучения того, как результаты изменяются в разных семьях моделей, при больших бюджетах на обучение и на контрольных тестах, которые менее напрямую связаны с проверяемыми вмешательствами.

Anthropic заявил, что его лучший автоматизированный метод в среднем превзошел идеи, предложенные опытными человеческими исследователями, в течение шести часов. Сравнение впечатляет, но его масштаб имеет значение. Человеческие исследователи разработали среду, предоставили научную литературу, выбрали цели и определили, как будет оцениваться успех. Автоматизированная система затем проводила поиск в этих границах. Она может быть лучше в быстрой эмпирической подборке, не будучи лучше в выборе, какая проблема безопасности заслуживает внимания, или в распознавании, когда само измерение может быть вводящим в заблуждение.

Сравнение стоимости уточняет операционный аргумент. В статье оценивалась примерно $4 в час на инференс API для автоматизированного исследователя по сравнению с $150 в час, которые платят человеческим исследователям. Эти цифры не включают все сопутствующие расходы, включая вычисления для обучающих запусков, разработку оценочной системы и экспертную проверку. Даже с учётом этих оговорок, дешёвые параллельные агенты могут изменить экономику пост-тренировки, позволяя командам опробовать больше кандидатных методов, прежде чем задействовать редкое человеческое время.

Автоматизация изменяет очередь исследований

Post-training уже включает обучение с подкреплением, контролируемую донастройку и рабочие процессы оптимизации предпочтений, которые зависят от повторной оценки. Инструменты, такие как открытая библиотека TRL, упростили воспроизведение отдельных частей этого стека. Автоматизированные исследователи добавляют еще один уровень, решая, какой метод попробовать следующим. Практическая выгода может заключаться в обработке рутинных поисков и абляций, оставляя людям возможность исследовать неоднозначные результаты, создавать более надежные оценки и решать, соответствует ли измеренное улучшение более безопасному поведению.

Та же самая автоматизация может создавать новые режимы сбоев. Агент может найти обходной путь в эталонном тесте, переобучиться на узком поведении или создать учебный рецепт, эффект которого трудно объяснить. Проведение множества экспериментов также увеличивает объем артефактов, которые необходимо отслеживать. Воспроизводимость требует полных записей о подсказках, коде, версиях моделей, наборах данных, случайных зернах и настройках оценки. Без этой информации дешевый поиск метода может дать результат, который выглядит эффективным, но его нельзя проверить или безопасно передать.

Автоматизация может быстро искать измеримую цель, но охват эталона по-прежнему определяет границы успеха. Изображение: Mantis
Автоматизация может быстро искать измеримую цель, но охват эталона по-прежнему определяет границы успеха. Изображение: Mantis

Некоторые наблюдатели описывают эту работу как шаг к рекурсивное самоулучшение, в которой системы ИИ способствуют тому, чтобы последующие системы становились более способными. Это разумная долгосрочная связь, но она может затмевать то, что произошло здесь. Исследователи автоматизировали ограниченный процесс согласования, а не весь процесс выбора архитектур, сбора данных, обеспечения вычислительных ресурсов, оценки социальных последствий и принятия решения о том, следует ли выпускать модель. Каждое из этих решений по-прежнему зависит от институтов и людей, находящихся за пределами экспериментального цикла.

Наиболее сильная интерпретация в краткосрочной перспективе более узкая и полезная. Автоматизированные исследовательские агенты могут стать силовыми усилителями для команд, которые имеют чёткие цели и надёжную оценку. Они могут тестировать больше гипотез, выявлять взаимодействия и сокращать время между идеей и доказательством. Их результаты следует рассматривать как работу быстрого младшего исследователя: ценную, когда процесс можно проверить, опасную, когда скорость принимается за суждение.

Следующий тест — обобщение

Независимая репликация должна проверить, сохраняются ли результаты, когда автоматизированные исследователи сталкиваются с незнакомыми моделями и скрытыми оценками. Система, которая улучшает только те показатели, которые она может неоднократно проверять, может оптимизировать тест, а не исходное поведение. Более убедительные доказательства появятся при вмешательствах, выбранных на одном наборе задач, которые улучшают отдельные оценки, разработанные другой командой. Это усложнит циклу исследований возможность добиться успеха за счет специфических для измерений обходных путей.

Авторы оценки могут усилить этот тест, удерживая часть процесса оценивания и меняя задачи после выбора методов. Они также могут искать поведенческие регрессии вне целевой группы, включая изменения, которые трудно суммировать в одном агрегированном балле. В опубликованном исследовании не было выявлено общего ухудшения по своим показателям, но более широкая работа в красной команде может выявить компромиссы, которые основной ориентир упустил. Автоматизированные эксперименты должны увеличить спрос на независимую оценку, а не снизить её.

Бюджеты вычислений могут изменять результат на большем масштабе. Тридцатиминутные тренировочные сессии позволяют быстро проводить итерации, в то время как полное обучение передового модели может требовать более дорогих заданий и более длинных циклов обратной связи. Автоматический исследователь, который хорошо работает в коротких экспериментах, может выбирать иначе, когда каждое решение несет гораздо более высокую стоимость. Будущие работы должны проверить, сможет ли система распределять фиксированный бюджет между дешевыми проверками и меньшим количеством высоконадежных запусков, не тратя вычислительные ресурсы на шумные сигналы.

Доступ к литературе создаёт ещё одну границу. Научный агент может повторно использовать только те методы, которые описаны в материалах, которые он может получить и интерпретировать. Новые сбои в безопасности могут требовать новых концепций, а не рекомбинации известных техник. Человеческие исследователи остаются ответственными за то, чтобы заметить, когда существующая литература некорректно формулирует проблему или упускает социальный контекст, который нельзя уловить с помощью функции потерь при обучении. Автоматизация наиболее эффективна там, где научный вопрос уже стал понятен системе.

Управление должно различать агента, предлагающего эксперимент, и агента, одобряющего развертывание результирующей модели. Первый может работать в изолированной среде, его действия могут логироваться и проверяться. Второй изменяет границы безопасности производственной системы и должен оставаться под независимым утверждением. Сохранение этого разделения предотвращает ситуацию, когда давление эффективности позволяет одному и тому же автоматизированному процессу создавать метод, оценивать его успех и выпускать его без внешней проверки.

Границы безопасности вокруг исследовательской среды будут иметь значение по мере того, как агенты становятся более способными. Поиск литературы, выполнение кода и обучение моделей создают пути к внешним системам и конфиденциальным артефактам. Командам следует изолировать эксперименты, ограничивать доступ по учетным данным и проверять сгенерированный код до того, как он будет использовать общую инфраструктуру. Автоматизация работы по согласованию была бы контрпродуктивной, если бы исследовательский агент создал риск нарушения цепочки поставок или утечки данных, который оценка никогда не измерила.

Нормы публикации могут помочь отрасли отличать воспроизводимый прогресс от сенсационных выводов. Выпуск определений бенчмарков, подсказок, следов выбора методов и неудачных запусков позволит другим группам изучить, где автоматизация принесла пользу. Некоторые детали могут потребовать сохранения в секрете, если они раскрывают опасные возможности, но результат, который нельзя проверить, должен иметь меньший вес при принятии решений по безопасности. Скорость автоматизированного рабочего процесса делает документацию особенно важной, так как больше решений принимается без постоянного наблюдения человека.

TechCrunch выдвинул проект как раннее представление самоулучшающегося ИИ, что отражает его стратегический интерес, но не весь диапазон возможностей. Работа показывает, что эксперименты с помощью моделей становятся практичными и недорогими как минимум в одной среде согласования. Нерешённым инженерным вопросом остаётся, смогут ли люди улучшать оценки и надзор так же быстро, как автоматизированные системы совершенствуются относительно них. Если измерения будут отставать от поиска, процесс исследований будет ускоряться без гарантии повышения безопасности.

Темы: Anthropic, согласование ИИ, автоматизированные исследования, пост-тренировка, эталоны

Канонический адрес статьи