Исследования
Выпускники DeepMind запускают Faraday Agent для автоматизации воспроизведения научных статей
Inherent, стартап, основанный бывшими исследователями Google DeepMind, разработал ИИ-агента под названием Faraday, который, по утверждению компании, превосходит системы Anthropic и OpenAI в воспроизведении экспериментальных результатов из опубликованных научных статей. Этот инструмент решает постоянную проблему в исследовательской деятельности: проверку того, могут ли опубликованные результаты быть независимо воспроизведены.
Майкл Г ·

Воспроизведение научных результатов по-прежнему остается одним из самых трудоемких узких мест в этой области. Когда исследователи публикуют свои выводы, проверка этих результатов часто требует месяцев работы: обратного проектирования экспериментальных установок, поиска наборов данных, которые могут быть конфиденциальными или утерянными со временем, восстановления программных сред из редкой документации и отладки кода, написанного авторами, которые могут больше за ним не следить. Компания Inherent, основанная бывшими исследователями Google DeepMind, утверждает, что ее агент Faraday может автоматизировать большую часть этой работы. Согласно отчету TechCrunch, компания заявляет, что Faraday превзошел сопоставимые системы от Anthropic и OpenAI в воспроизведении результатов научных статей в различных областях.
Фокус стартапа отражает настоящую кризисную ситуацию в академической публикации. Исследования за последнее десятилетие показали, что многие опубликованные результаты не могут быть воспроизведены независимыми командами. Некоторые неудачи связаны с неполной документацией. Другие происходят из-за тонких зависимостей между кодом, данными и вычислительными средами, которые авторы никогда не ожидали будут иметь значение. Еще другие выявляют негативные результаты: эксперименты, которые срабатывали при определенных условиях, но не удаются, когда параметры меняются. Faraday решает эту проблему, рассматривая воспроизведение статей как структурированную инженерную задачу. Агент читает опубликованные статьи, извлекает методологические детали, ищет связанный код и наборы данных, восстанавливает среды и пытается выполнить эксперименты до конца. Когда это удается, исследователи получают уверенность в том, что результаты подлинные. Когда оно дает сбой, конкретная точка отказа часто показывает, связана ли проблема с отсутствием данных, недокументированными зависимостями среды или с реальными проблемами в исходной работе. отчет TechCrunch документирует отчётность, лежащую в основе этой записи.
Здесь важно различать воспроизведение кода и научную проверку. Faraday может выполнять код и воспроизводить численные результаты. Это отличается от самостоятельной проверки научного заключения. Код из статьи может работать идентично на другой машине, но при этом делать выводы, которые не полностью поддерживаются данными, или не учитывать влияющие факторы, которые выявило бы независимое воспроизведение. Faraday решает инженерный аспект: практическую, трудоёмкую работу по запуску опубликованного кода в новом контексте. Этот аспект достаточно значителен, чтобы его автоматизация приносила реальную пользу исследовательским группам и издательским платформам.
Узкое место репликации
Скрытые данные представляют собой одно из самых сложных препятствий на пути к воспроизводимости. В статьях иногда используются проприетарные наборы данных, медицинские записи, ограниченные законом о конфиденциальности, или внутренние корпоративные данные, которые нельзя публиковать. Авторы могли обучаться на статьях из arXiv или других открытых источниках, но точные версии наборов данных со временем меняются, когда репозитории обновляются или удаляют файлы. В коде могут быть ссылки на локальные пути к файлам или захардкоженные учетные данные, удаленные до публикации. Faraday не может воссоздать отсутствующие данные, но может определить, чего не хватает, и явно это отметить. Один только этот диагностический шаг экономит исследователям недели безрезультатного отладки. Агент учится определять, какие пробелы критичны для воспроизводимости, а какие можно обойти. Он также различает случаи, когда авторы действительно предоставили недостаточно деталей, и случаи, когда необходимая информация существует в дополнительных материалах, репозиториях GitHub или блогах авторов, на которые сама статья не ссылается. Inherent предоставляет полезные технические основы для оценки утверждения.

Воссоздание среды также имеет большое значение. Статья, опубликованная пять лет назад, могла зависеть от конкретных версий библиотек машинного обучения, релизов Python, драйверов GPU или операционных систем. Эти версии часто больше не совместимы друг с другом. Деревья зависимостей изменились. Патчи безопасности нарушили работу старых API. Фарадей должен ориентироваться в этом археологическом слое, рассуждая о совместимости версий, определяя вероятные пути замены и проверяя, могут ли современные библиотеки воспроизвести исходные численные результаты. Некоторые эксперименты чувствительны к оборудованию: округление чисел с плавающей запятой, поведение кэша CPU, различия в архитектуре GPU или инициализация случайного семени. Фарадей должен учитывать эти физические ограничения и сообщать, когда результаты расходятся из-за оборудования, а не метода. Операционная компромиссность также отражается в Google DeepMind.
Заявления компании о показателях базируются на собственных тестах Inherent. Конкретные статьи, метрики и конкурирующие системы остаются конфиденциальными. Это не отменяет заявлений, но означает, что научное сообщество не может самостоятельно проверить эти показатели без доступа к тестовому набору и методологии Inherent. Оценка третьей стороной потребовала бы, чтобы исследователи запускали Faraday, других агентов из Anthropic и OpenAI, а также системы для сравнения на одном и том же наборе статей, измеряя успех по единым критериям. Эта работа не была опубликована по состоянию на август 2026 года. Inherent создала инструмент и продемонстрировала его ранним пользователям и прессе, что подтверждает достоверность базовой функциональности. Для проверки масштаба разрыва в производительности требуется внешняя репликация. Компания опубликовала веб-сайт с описанием продукта, но полная техническая документация по архитектуре Faraday, подходу к обучению и ограничениям остаётся ограниченной. Для более широкого контекста, arXiv излагает соответствующий стандарт или учреждение.
Последствия для издательской деятельности и исследований

Если Faraday будет надежно работать в масштабах, этот инструмент может изменить подход журналов к воспроизводимости. Некоторые издатели уже начали требовать от авторов предоставление кода и данных вместе со статьями. Другие проводят базовые проверки предоставленного кода перед его принятием. Автоматизированный агент, способный воспроизводить опубликованные результаты в момент публикации или вскоре после нее, предложил бы новый механизм контроля. Журналы могли бы использовать успешное воспроизведение как показатель при рецензировании или оценке после публикации. Исследователи, ссылающиеся на статью, могли бы проверить, удалось ли Faraday её воспроизвести. Финансирующие организации могли бы требовать от получателей грантов демонстрации воспроизводимости своих опубликованных результатов с помощью такого инструмента. Эти шаги ставят свои собственные вопросы: как журналы должны учитывать успех воспроизведения по сравнению с новизной? Следует ли публиковать отрицательные результаты репликации? Следует ли отзывать статьи, которые не удалось воспроизвести, или частичная репликация ценна сама по себе? Ответы зависят от области, рисков и причины неудачи. машинное обучение Статья, код которой не запускается из-за отсутствия набора данных, всё равно может содержать ценные идеи. Результаты клинических испытаний, которые невозможно воспроизвести, могут представлять прямые риски для безопасности. Фарадей может автоматизировать техническую работу, не решая эти вопросы по политике.
Более широкий контекст здесь заключается в растущей сложности самой исследовательской работы в области машинного обучения. Статьи в этой области теперь регулярно зависят от больших кодовых баз, закрытых наборов данных, распределенной вычислительной инфраструктуры и коммерческих API. Репликация результата глубокого обучения означает контроль не только за кодом и данными, но и за доступностью GPU, временем обучения и эффектами случайной инициализации, которые могут значительно смещать результаты. Faraday должен учитывать все эти факторы. Он также должен обрабатывать статьи, которые объединяют машинное обучение с другими областями: статьи по робототехнике, зависящие от спецификаций физического оборудования, статьи по нейронауке, зависящие от закрытых данных по визуализации мозга, или статьи по открытию лекарств, зависящие от библиотек вычислительной химии. Ни один агент не может идеально справиться со всеми случаями. Преимущество Фарадея, по мнению Inherent, заключается в том, что он превосходит существующие универсальные системы ИИ в этой конкретной задаче. Это может быть связано с целевой обучаемостью, лучшими стратегиями подталкивания или встроенным в агента специфическим для области рассуждением.
Независимое воспроизведение собственных результатов Фарадея в конечном итоге определит их влияние. Научное сообщество должно с должной осторожностью относиться к заявлениям компании о результативности по бенчмаркам, особенно когда эти бенчмарки еще не обнародованы. Важно, насколько успешно Фарадей работает, когда его используют настоящие исследователи для публикаций, которые им действительно важны, в достаточном количестве различных областей и публикаций, чтобы получить надежные данные. Ранняя группа пользователей будет здесь критически важна. По мере того как больше исследователей будет использовать Фарадея и сообщать о результатах, будут выявляться закономерности того, с какими типами статей инструмент справляется хорошо, а какие остаются неподвластными. Эта обратная связь от пользователей будет формировать как сам инструмент, так и обсуждение того, как ИИ может ускорить процесс. воспроизводимое исследование. На данный момент Faraday представляет собой значительный инженерный прогресс в автоматизации одной из самых раздражающих задач в исследовательской работе. Станет ли он стандартным уровнем в научной публикации, зависит от проверки, доступности и постоянного развития после первоначального запуска.
Темы: исследования ИИ, научная воспроизводимость, машинное обучение, DeepMind, автоматизация