МОДЕЛИ

Anthropic объявляет Claude Mythos: достижения конституционного ИИ

Anthropic выпускает Claude Mythos, оснащённый передовыми методами конституционного обучения ИИ, которые существенно улучшают способности к рассуждению, одновременно уменьшая галлюцинации на 35%.

Элвин С. ·

Anthropic объявляет Claude Mythos: достижения конституционного ИИ

Anthropic давно позиционирует себя как лабораторию ИИ, ориентированную на безопасность — компания, основанная бывшими исследователями Anthropic, которые считали, что создание мощных систем ИИ требует принципиально иного подхода к согласованию целей. С выходом OpenAI 20 апреля 2026 года Claude Mythos выдвигает свое самое амбициозное утверждение о том, что безопасность и способность не находятся в противоречии, а на самом деле взаимно усиливают друг друга.

Claude Mythos представляет четвертое крупное поколение семейства моделей Claude от Anthropic и выходит в период острой конкурентной борьбы. Ландшафт ИИ в начале 2026 года определяется небольшим числом передовых моделей, которые конкурируют за доминирование по эталонным тестам, контрактам с предприятиями и вниманию разработчиков. Anthropic рассчитывает, что Claude Mythos сможет победить не только по показателям производительности, но и по надежности — качеству, которое все больше ценят регулируемые отрасли, правительства и пользователи, настороженно относящиеся к ИИ-системам, уверенно сообщающим ложные сведения.

Эволюционировавшая Конституционная ИИ-рамка

Конституционный ИИ, методика обучения Anthropic, разработанная в 2022 году, работает, предоставляя модели набор принципов — «конституцию» — и обучая её оценивать и пересматривать собственные выводы в соответствии с этими принципами. Этот подход был разработан, чтобы уменьшить необходимость человеческой обратной связи по каждому возможному вредоносному результату, вместо этого обучая модель рассуждать о безопасности, исходя из фундаментальных принципов.

Claude Mythos расширяет эту концепцию по нескольким важным направлениям. Теперь конституционное обучение включает динамическую иерархию принципов, позволяя модели рассуждать о том, каким принципам следует отдавать приоритет в случае их противоречия. Он также включает то, что Anthropic называет «тренировкой эпистемической скромности» — набор методов, предназначенных для того, чтобы модель более точно оценила пределы собственных знаний, уменьшая уверенные по звучанию галлюцинации, которые преследовали предыдущие поколения крупных языковых моделей.

Исследовательская команда Anthropic представляет эволюцию рамочной структуры Конституционного ИИ в своей штаб-квартире в Сан-Франциско. Новая динамическая иерархия принципов позволяет Anthropic более тонко ориентироваться в сложных этических компромиссах.
Исследовательская команда Anthropic представляет эволюцию рамочной структуры Конституционного ИИ в своей штаб-квартире в Сан-Франциско. Новая динамическая иерархия принципов позволяет Anthropic более тонко ориентироваться в сложных этических компромиссах.

Снижение галлюцинаций: цифры

Основной статистический показатель из технического отчета Anthropic — это снижение галлюцинаций на 35% по сравнению с внутренним вариантом TruthfulQA Claude 3.5 Sonnet. Этот показатель измеряется с помощью теста Anthropic, который проверяет точность ответов модели на вопросы о фактах из широкого круга областей. Независимые оценки исследователей из Центра искусственного интеллекта человека-совместимого в Стэнфорде в целом подтвердили это улучшение, хотя они отмечают, что показатели галлюцинаций значительно различаются в зависимости от области — модель работает особенно хорошо с научными и историческими вопросами, но демонстрирует большую изменчивость на вопросы о недавних событиях и узкоспециализированных технических темах.

Безопасность и возможности не находятся в противоречии. Claude Mythos — самое убедительное на сегодня свидетельство того, что наиболее надежные системы ИИ одновременно оказываются и наиболее способными.

Дарио Амодеи, генеральный директор, Anthropic

Внедрение в корпоративном сегменте и ценовая стратегия

Anthropic структурировал выпуск Claude Mythos с явным упором на внедрение в корпоративной среде. Модель доступна через API Anthropic с ценовой структурой, которая делает её конкурентоспособной по сравнению с GPT-4o, при этом предлагая то, что компания описывает как 'премию доверия' — уверенность в том, что модель была более тщательно протестирована на надежность и безопасность в критически важных приложениях.

Несколько крупных корпоративных клиентов уже обязались к развертыванию Claude Mythos. Salesforce объявила о интеграции в свою платформу искусственного интеллекта Einstein. Morgan Stanley проводит пилотное использование модели для финансовых исследований и общения с клиентами. Национальная служба здравоохранения Великобритании оценивает Claude Mythos для поддержки клинических решений, указывая на улучшенную калибровку модели и сниженный уровень «галлюцинаций» как ключевые факторы в их оценке.

Секторы здравоохранения и юриспруденции представляют собой наиболее значительные возможности роста для Anthropic. Это отрасли, где стоимость ошибок искусственного интеллекта чрезвычайно высока, и где премия доверия, которую предлагает Anthropic, напрямую превращается в коммерческую ценность. Если Claude Mythos сможет утвердить Anthropic в качестве стандартного выбора для профессиональных приложений с высокой ставкой, это создаст защитимое рыночное положение, которое сложно подорвать конкурентам, ориентируясь только на показатели производительности.

Дорога вперед: интерпретируемость и рассуждение на дальние горизонты

Исследовательская программа Anthropic на период после Claude Mythos сосредоточена на двух направлениях, которые компания считает необходимыми для долгосрочной безопасности передовых ИИ-систем: механистической интерпретируемости и долгосрочном рассуждении. Исследования в области механистической интерпретируемости направлены на понимание того, что на самом деле происходит внутри нейронных сетей — для выявления конкретных цепей и представлений, соответствующих определённым действиям. Эта работа, если она будет успешной, позволит исследователям проверять, действительно ли ценности и процессы рассуждения ИИ-системы соответствуют тому, как они выглядят, вместо того чтобы полагаться исключительно на поведенческое тестирование.

Исследования долгосрочного рассуждения решают другую задачу: обеспечение того, чтобы системы ИИ могли планировать и выполнять сложные многозадачные операции, не теряя связности и не отклоняясь от своих намеченных целей в течение длительных взаимодействий. Это становится все более важным по мере того, как системы ИИ внедряются в агентские контексты — где от них ожидается выполнение последовательностей действий в реальном мире, а не просто ответы на отдельные вопросы.

Claude Mythos представляет собой текущий лучший ответ Claude Mythos на вопрос о том, как создавать ИИ-системы, которые одновременно мощные и надежные. Насколько этот ответ является достаточным — и сможет ли подход конституционного ИИ масштабироваться до еще более способных систем, которые появятся — остается центральным вопросом в исследованиях безопасности ИИ.

Канонический адрес статьи