МОДЕЛИ
Anthropic объявляет Claude Mythos: достижения конституционного ИИ
Anthropic выпускает Claude Mythos, оснащённый передовыми методами конституционного обучения ИИ, которые существенно улучшают способности к рассуждению, одновременно уменьшая галлюцинации на 35%.
Элвин С. ·

Anthropic давно позиционирует себя как лабораторию ИИ, ориентированную на безопасность — компания, основанная бывшими исследователями Anthropic, которые считали, что создание мощных систем ИИ требует принципиально иного подхода к согласованию целей. С выходом OpenAI 20 апреля 2026 года Claude Mythos выдвигает свое самое амбициозное утверждение о том, что безопасность и способность не находятся в противоречии, а на самом деле взаимно усиливают друг друга.
Claude Mythos представляет четвертое крупное поколение семейства моделей Claude от Anthropic и выходит в период острой конкурентной борьбы. Ландшафт ИИ в начале 2026 года определяется небольшим числом передовых моделей, которые конкурируют за доминирование по эталонным тестам, контрактам с предприятиями и вниманию разработчиков. Anthropic рассчитывает, что Claude Mythos сможет победить не только по показателям производительности, но и по надежности — качеству, которое все больше ценят регулируемые отрасли, правительства и пользователи, настороженно относящиеся к ИИ-системам, уверенно сообщающим ложные сведения.
Эволюционировавшая Конституционная ИИ-рамка
Конституционный ИИ, методика обучения Anthropic, разработанная в 2022 году, работает, предоставляя модели набор принципов — «конституцию» — и обучая её оценивать и пересматривать собственные выводы в соответствии с этими принципами. Этот подход был разработан, чтобы уменьшить необходимость человеческой обратной связи по каждому возможному вредоносному результату, вместо этого обучая модель рассуждать о безопасности, исходя из фундаментальных принципов.
Claude Mythos расширяет эту концепцию по нескольким важным направлениям. Теперь конституционное обучение включает динамическую иерархию принципов, позволяя модели рассуждать о том, каким принципам следует отдавать приоритет в случае их противоречия. Он также включает то, что Anthropic называет «тренировкой эпистемической скромности» — набор методов, предназначенных для того, чтобы модель более точно оценила пределы собственных знаний, уменьшая уверенные по звучанию галлюцинации, которые преследовали предыдущие поколения крупных языковых моделей.

Снижение галлюцинаций: цифры
Основной статистический показатель из технического отчета Anthropic — это снижение галлюцинаций на 35% по сравнению с внутренним вариантом TruthfulQA Claude 3.5 Sonnet. Этот показатель измеряется с помощью теста Anthropic, который проверяет точность ответов модели на вопросы о фактах из широкого круга областей. Независимые оценки исследователей из Центра искусственного интеллекта человека-совместимого в Стэнфорде в целом подтвердили это улучшение, хотя они отмечают, что показатели галлюцинаций значительно различаются в зависимости от области — модель работает особенно хорошо с научными и историческими вопросами, но демонстрирует большую изменчивость на вопросы о недавних событиях и узкоспециализированных технических темах.
Безопасность и возможности не находятся в противоречии. Claude Mythos — самое убедительное на сегодня свидетельство того, что наиболее надежные системы ИИ одновременно оказываются и наиболее способными.
Дарио Амодеи, генеральный директор, Anthropic
Внедрение в корпоративном сегменте и ценовая стратегия
Anthropic структурировал выпуск Claude Mythos с явным упором на внедрение в корпоративной среде. Модель доступна через API Anthropic с ценовой структурой, которая делает её конкурентоспособной по сравнению с GPT-4o, при этом предлагая то, что компания описывает как 'премию доверия' — уверенность в том, что модель была более тщательно протестирована на надежность и безопасность в критически важных приложениях.
Несколько крупных корпоративных клиентов уже обязались к развертыванию Claude Mythos. Salesforce объявила о интеграции в свою платформу искусственного интеллекта Einstein. Morgan Stanley проводит пилотное использование модели для финансовых исследований и общения с клиентами. Национальная служба здравоохранения Великобритании оценивает Claude Mythos для поддержки клинических решений, указывая на улучшенную калибровку модели и сниженный уровень «галлюцинаций» как ключевые факторы в их оценке.
Секторы здравоохранения и юриспруденции представляют собой наиболее значительные возможности роста для Anthropic. Это отрасли, где стоимость ошибок искусственного интеллекта чрезвычайно высока, и где премия доверия, которую предлагает Anthropic, напрямую превращается в коммерческую ценность. Если Claude Mythos сможет утвердить Anthropic в качестве стандартного выбора для профессиональных приложений с высокой ставкой, это создаст защитимое рыночное положение, которое сложно подорвать конкурентам, ориентируясь только на показатели производительности.
Дорога вперед: интерпретируемость и рассуждение на дальние горизонты
Исследовательская программа Anthropic на период после Claude Mythos сосредоточена на двух направлениях, которые компания считает необходимыми для долгосрочной безопасности передовых ИИ-систем: механистической интерпретируемости и долгосрочном рассуждении. Исследования в области механистической интерпретируемости направлены на понимание того, что на самом деле происходит внутри нейронных сетей — для выявления конкретных цепей и представлений, соответствующих определённым действиям. Эта работа, если она будет успешной, позволит исследователям проверять, действительно ли ценности и процессы рассуждения ИИ-системы соответствуют тому, как они выглядят, вместо того чтобы полагаться исключительно на поведенческое тестирование.
Исследования долгосрочного рассуждения решают другую задачу: обеспечение того, чтобы системы ИИ могли планировать и выполнять сложные многозадачные операции, не теряя связности и не отклоняясь от своих намеченных целей в течение длительных взаимодействий. Это становится все более важным по мере того, как системы ИИ внедряются в агентские контексты — где от них ожидается выполнение последовательностей действий в реальном мире, а не просто ответы на отдельные вопросы.
Claude Mythos представляет собой текущий лучший ответ Claude Mythos на вопрос о том, как создавать ИИ-системы, которые одновременно мощные и надежные. Насколько этот ответ является достаточным — и сможет ли подход конституционного ИИ масштабироваться до еще более способных систем, которые появятся — остается центральным вопросом в исследованиях безопасности ИИ.