Политика
Отставка директора CAISI оставляет офис стандартов ИИ в США без постоянного руководства
Отставка Криса Фолла из Центра стандартов и инноваций в области ИИ происходит на фоне того, как Вашингтон пытается определить правила тестирования, оценки и надзора за передовыми системами ИИ.
Майкл С ·

Федеральное ведомство, ответственное за развитие возможностей тестирования и оценки ИИ, теряет своего директора в чувствительный момент для политики США в области ИИ. Крис Фолл, который руководил департаментом торговли Центр стандартов и инноваций в области ИИ около трёх месяцев, увольняется, Axios сообщается после подтверждения от департамента. Директор NIST Арвинд Раман будет курировать CAISI и исполнять обязанности директора, пока офис ожидает постоянного замещения. Уход имеет значение в любом агентстве по стандартам. Сейчас это имеет еще большее значение, поскольку Вашингтон пытается решить, как должны оцениваться мощные системы ИИ, кто должен видеть результаты и что происходит, когда модель пересекает границы кибер-, биологического, индуцирования мнений или национальной безопасности.
CAISI является реорганизованным преемником Института безопасности ИИ США, и его миссия находится на стыке технических измерений и общественной подотчетности. Оно должно развивать возможности тестирования и оценки, поддерживать стандарты для передовых систем ИИ и помогать правительству понимать системы, которые частные компании создают быстрее, чем обычные процедуры регулирования могут двигаться. Уход Фолла не закрывает офис. Но это оставляет центр без постоянного руководства в то время, когда передовые лаборатории, поставщики облачных услуг, разработчики открытых моделей, группы гражданского общества и представители национальной безопасности все продвигают конкурирующие видения надзора.
Разрыв в руководстве возникает после недель необычного вмешательства правительства в доступ к моделям. Адмиnistрацион тщательно изучил релизы от OpenAI и Anthropic, взвесил вопросы экспортного контроля в отношении продвинутых моделей и столкнулся с давлением определить, когда модель достаточно безопасна для широкого общественного использования. Проблема заключается в том, что работа над стандартами по замыслу идет медленно, в то время как развертывание моделей необходимо ускорить по бизнес-при необходимости. Стабильный технический офис может превращать панику в процедуры. Временная структура руководства все еще может выполнять полезную работу, но она рискует стать реактивной именно в тот момент, когда отрасли нужны предсказуемые правила.

Существует техническая причина, по которой руководство имеет значение. Оценка не является одним единственным эталонным показателем. Серьезный офис по стандартам ИИ должен определить, как тестировать агентов с долгосрочными целями, кибервозможности, автономность моделей, устойчивость к взлому, риск обмана, утечки конфиденциальной информации, предвзятость, надежность и сопротивление неправильному использованию. Он также должен решить, как будут делиться результаты. Публичное раскрытие может повысить ответственность, но некоторые выводы о кибер- или биологических возможностях могут быть слишком чувствительными, чтобы публиковать их полностью. Промышленные компании будут требовать конфиденциальности. Группы общественных интересов будут требовать прозрачности. Офис нуждается в авторитете и доверии, чтобы сбалансировать оба этих требования.
Временная роль Рамана предоставляет CAISI опытного руководителя по стандартам, но это не устраняет неопределённость в политике. NIST может обеспечить техническую дисциплину, однако общая повестка в области ИИ формируется Белым домом, Министерством торговли, агентствами национальной безопасности, Конгрессом, штатами и судами. У каждого участника разные стимулы. Штаты хотят защиту потребителей и безопасность. Федеральные чиновники стремятся к национальному лидерству и безопасности. Лаборатории хотят предсказуемых путей одобрения. Сторонники открытого программного обеспечения обеспокоены тем, что строгие режимы закрепят положение устоявшихся участников. Директору приходится лавировать между всем этим, при этом делая измерения научно достоверными.
Риск для компаний заключается в вакууме, заполненном случайными решениями. Если доступ к модели формируется на основе индивидуальных решений, компании не могут планировать выпуск продуктов, клиенты не могут понять основу ограничений, а меньшие разработчики не могут знать, применяются ли к ним те же стандарты, что и к крупнейшим лабораториям. Президент Microsoft Брэд Смит и другие представители индустрии уже предупреждали, что непрозрачная политика в области ИИ затрудняет бизнес-планирование. CAISI должна была помочь создать более понятную техническую основу. Переход руководства затрудняет выполнение этой задачи, но не делает её невозможной.

Ставки выходят за пределы Соединенных Штатов. Другие правительства создают институты безопасности ИИ, организационные структуры для стандартов и регуляторные офисы. Европейский союз внедряет свой Закон об ИИ. Британский Институт безопасности ИИ стал ключевым игроком в оценках моделей. Китай продвигает собственное видение управления, одновременно расширяя распространение открытых моделей. Если США хотят установить глобальные нормы, им необходим федеральный офис, способный производить доверительную техническую работу и координироваться с союзниками. Ротация руководства ослабляет это сообщение, особенно когда технология развивается от чат-ботов к агентам, способным действовать через код, сети и научные рабочие процессы.
Постоянный директор унаследует проблему измерения, которая до сих пор не решена. Оценки передовых моделей должны охватывать обычную точность, но также использование инструментов, автономное планирование, киберповедение, биологические знания, убеждение, утечку конфиденциальной информации и устойчивость к отказам. Многие из этих возможностей не вписываются аккуратно в таблицу показателей. Они требуют разработки сценариев, операций красной команды, экспертной оценки и повторяемых протоколов, которые могут выдержать проверку со стороны компаний, ученых и государственных чиновников. Задача CAISI заключается в том, чтобы превратить спорные концепции безопасности в тесты, достаточно строгие, чтобы иметь значение, и достаточно практичные, чтобы их можно было провести до того, как решения о внедрении уже станут устаревшими.
Офис также должен определить, что считается доказательством. Модель может пройти публичный бенчмарк и при этом не справиться в реальном рабочем процессе агента. Она может отказать в ответе на небезопасный запрос в окне чата, но согласиться, когда контекст меняется с помощью обёртки инструмента или системного запроса. Она может вести себя иначе после дообучения, увеличения извлечения данных или интеграции в корпоративную среду. Поэтому работа со стандартами должна учитывать модели и их развертывание, а не только карточки моделей. Если CAISI оценивает базовую систему, в то время как компании выпускают агентные продукты на её основе, у публики останется лишь частичная картина.
Правила раскрытия информации станут одной из самых сложных проблем. Компании не хотят, чтобы чувствительные результаты оценок, нерелизованные возможности или данные о безопасности становились публичными таким образом, который может помочь злоумышленникам или конкурентам. Группы гражданского общества не хотят, чтобы тестирование безопасности уходило за рамки конфиденциальных соглашений. Авторитетный офис должен найти золотую середину: достаточный уровень публичной отчетности для формирования доверия, защищенные каналы для опасных находок и достаточную независимую проверку, чтобы процесс не сводился лишь к самопроверке с федеральной символикой. Лидерство важно, потому что эти нормы обсуждаются и устанавливаются до того, как станут рутинными.
CAISI также находится внутри более широкой федеральной системы, которая по своей природе не является быстрой. Правила закупок, ограничения на найм, межведомственные проверки, границы классификации и бюджетные циклы — всё это формирует то, что может делать офис. Оценка передовых ИИ требует редких талантов, доступа к вычислительным ресурсам, безопасной среды и связей с лабораториями, которые могут неохотно замедлять запуск продуктов. Директор должен развивать технический потенциал, одновременно управляя политическими ожиданиями. Это означает привлечение людей, которые могут глубоко понять передовые системы, чтобы бросать вызов поставщикам, а не только людей, которые могут координировать политические документы.
Вопрос открытой модели проверит офис на раннем этапе. Некоторые законодатели обеспокоены тем, что широко доступные мощные модели могут быть модифицированы для киберпреступности, биологического проектирования или дезинформации. Сторонники открытого исходного кода утверждают, что доступ способствует исследованиям, конкуренции, прозрачности и оборонному использованию. Стандарты не могут решить этот политический вопрос сами по себе, но они могут сделать его более конкретным. Вместо того чтобы обсуждать открытый доступ в абстрактной форме, CAISI могла бы определить пороговые показатели возможностей, методы оценки, практики смягчения и ожидания мониторинга, которые помогают различать обычные выпуски от систем с повышенным риском.
Офис также должен будет работать с отраслью, не становясь зависимым от нее. Передовые лаборатории хранят модели, логи, внутренние оценки и контекст развертывания. Государственным оценщикам необходим доступ к этой информации, чтобы понимать риски. Но если единственные тестовые среды контролируются поставщиками, публичные стандарты будут лишены независимости. Долгосрочная надежность CAISI будет зависеть от создания собственной безопасной тестовой инфраструктуры, сотрудничества с внешними исследователями и разработки процедур, позволяющих компаниям участвовать, не устанавливая правила для себя.
Финансирование и комплектование персоналом определят, сможет ли CAISI делать больше, чем просто созывать собрания. Оценка продвинутых систем требует участия исследователей машинного обучения, инженеров по безопасности, экспертов по био- и кибербезопасности, социальных ученых, статистиков, операторов инфраструктуры, юристов по политике и специалистов, понимающих, как модели фактически разворачиваются. Частный сектор часто может предложить более высокую оплату за тот же талант. Постоянный директор должен обладать полномочиями по найму, стипендиями, внешними партнерствами и достаточным бюджетом для создания безопасных тестовых сред. Без этих возможностей офис рискует превратиться в посредника информации, предоставляемой продавцами, вместо того чтобы быть независимым оценщиком.
Центру также необходимо определить свои отношения с чрезвычайными происшествиями. Если система ИИ вызывает реальное событие в области безопасности, распространяет опасные рекомендации или демонстрирует неожиданную опасную способность, кто получает отчет и что происходит дальше? В Соединенных Штатах существуют отлаженные каналы реагирования на киберинциденты, но инциденты с ИИ могут объединять вопросы безопасности продукции, национальной безопасности, защиты прав потребителей и гражданских прав. CAISI могла бы помочь создать шаблоны отчетов и пути эскалации, но ей потребуется четкий авторитет и координация с агентствами, которые уже занимаются частями этой проблемы.
Государственная политика усложнит ситуацию. Калифорния, Нью-Йорк и другие штаты уже приняли или рассматривали возможность принятия правил по ИИ, в то время как федеральная политика остаётся непостоянной. Компании предпочитают национальную рамочную систему, но штаты часто действуют, когда Вашингтон медлит. CAISI не может самостоятельно отменять законы штатов. Зато оно может предоставлять технические стандарты, к которым могут обращаться штаты, суды и федеральные агентства. Чем сильнее и надежнее эта работа, тем больше вероятность того, что она станет стабилизирующим фактором в разрозненной нормативной среде.
Офис также должен поддерживать доверие среди исследователей открытого исходного кода и небольших компаний. Если доступ к оценке и стандарты будут разрабатываться только для крупнейших передовых лабораторий, режим будет выглядеть как защита устоявшихся игроков. Небольшим разработчикам нужны четкие инструкции, соразмерные обязательства и публичные инструменты, которыми они могут пользоваться для тестирования своих собственных систем. Цель должна заключаться в повышении уровня безопасности во всей экосистеме, а не просто в создании привилегированного канала переговоров между правительством и крупнейшими поставщиками моделей.
Уход Фолла не решает ни один из этих вопросов, но время влияет на инерцию. Новое руководство создает авторитет через ранние привычки: что оно публикует, как справляется с разногласиями, кого нанимает, насколько быстро реагирует и доверяют ли его работе внешние эксперты. Переход к новому руководству может быть безвредным, если институт уже зрелый. CAISI еще не зрелый. Это делает следующее назначение более значимым, чем обычное кадровое решение внутри бюрократии по стандартам.
Компании будут наблюдать, станет ли CAISI предрелизным «сторожем», издателем стандартов, исследовательским партнером или какой-то комбинацией этих трёх ролей. Каждая роль несёт разные последствия. Сторож может замедлить запуск продуктов, но может предоставить более ясные публичные гарантии. Издатель стандартов может влиять на рынок, не одобряя отдельные продукты. Исследовательский партнёр может улучшить качество оценки, но может не иметь полномочий для принуждения. Публичная миссия офиса оставляет место для всех трёх ролей, но директору придётся уточнить, как они сочетаются между собой.
Группы гражданского общества будут настаивать на ответственности в вопросах предвзятости, гражданских прав, влияния на работников и развертывания в государственном секторе, а не только в случае катастрофических или рисков национальной безопасности. Это может превысить технические возможности CAISI, если офис попытается взять на себя ответственность за все вопросы, связанные с ИИ. Надежному учреждению нужны границы. Оно может предоставлять научные методы измерений и оценки, одновременно координируя работу с другими агентствами, ответственными за дискриминацию, защиту прав потребителей, труд, образование и здравоохранение. Четкие границы — это не отступление; это способ для технического офиса избежать превращения в перегруженный орган, решающий все политические вопросы.
Переход в руководстве также происходит в то время, когда системы ИИ становятся всё сложнее для определения. Продукт может сочетать в себе несколько моделей, системы поиска, соединители инструментов, память, права доступа пользователей и автономное планирование. Оценивать один снимок модели проще, чем оценивать всю систему целиком. Стандарты CAISI придется развивать от тестирования, ориентированного на модели, к обеспечению, учитывающему развертывание. В противном случае компания может пройти оценку модели и при этом выпустить рискованную агентную рабочую систему вокруг неё. Следующему директору придётся явно осуществить этот переход.
Немедленной угрозой является не то, что вся работа по стандартам остановится. Постоянные сотрудники, руководство NIST и партнерские агентства могут поддерживать проекты в движении. Риск заключается в том, что офис потеряет способность принимать трудные решения о приоритетах, пока формируется политическая среда. Каждый метод оценки, шаблон отчета и соглашение о сотрудничестве, создаваемое сейчас, может стать прецедентом. Постоянный директор может решить, какие прецеденты устанавливать намеренно. И.о. структура может избежать противоречий, но избегание само по себе может стать политикой, когда передовые лаборатории продолжают выпускать модели, агенты и специализированные системы быстрее, чем правительство может реагировать.
Следующий директор, таким образом, должен быть больше, чем символическое назначение. Эта роль требует человека, который сможет вызвать уважение у технических исследователей, руководителей отрасли, должностных лиц по национальной безопасности, критиков из гражданского общества и международных партнеров. Это редкий профиль. Директор, слишком близкий к промышленности, может испытывать трудности с общественным доверием. Директор, которому не хватает технической компетентности, может не суметь бросить вызов лабораториям. Директор, который рассматривает эту работу как обычное управление стандартами, может недооценить, как быстро меняются базовые системы.
Вот почему вакансия имеет значение, даже если департамент быстро назначит замену. Ранние институциональные решения определят, станет ли CAISI надежным органом измерений или еще одним спорным политическим офисом. Следующие несколько месяцев сформируют его репутацию и его практическое влияние на лаборатории, которые он должен оценивать.
Международная координация добавляет еще один уровень. Если Соединенные Штаты, Великобритания, Европейский союз, Япония и другие союзники будут использовать несовместимые методы оценки, компании столкнутся с фрагментированным соблюдением требований, а правительства будут испытывать трудности с сравнением результатов. Если координация будет слишком слабой, слабейший режим может установить практический стандарт. CAISI может помочь создать общий технический язык для оценки возможностей моделей, отчетности о инцидентах, снижения рисков и обеспечения надежности развертывания. Это сделает лидерство США более устойчивым, чем речи о доминировании в области ИИ, потому что предоставит союзникам что-то практическое для внедрения.
Существует также проблема общественного доверия. Многие избиратели слышат о безопасности ИИ и думают о возможном ущербе в будущем, в то время как компании воспринимают это как потенциальное препятствие для циклов разработки продуктов. Офис стандартов должен показать, что его работа основана на реальных системах и реальных сценариях сбоев: ненадежное использование инструментов, плохие медицинские рекомендации, ненадежная гражданская информация, вредная автоматизация, утечки конфиденциальной информации и модели, которые могут помогать злонамеренным актерам. Если CAISI сможет связать стандарты с видимым ущербом и практическими мерами по его снижению, будет сложнее отвергать его как бюрократию или паникерство.
Министерство торговли заявило, что ожидает назначения нового директора в ближайшие недели, и чиновник ведомства сообщил Axios, что роль Фолла всегда была рассчитана как временная. Это может быть правдой, но рынок будет судить о переходе по тому, что будет дальше. Сильный заместитель должен разъяснить, как CAISI будет оценивать передовые возможности, как оно будет работать с лабораториями до и после выпусков, как будет обрабатывать чувствительные результаты и как будет избегать превращения либо в отраслевой прорезиненный штамп, либо в политический узкий горлышко.
Стандарты ИИ часто обсуждаются так, как если бы это была просто бумажная работа. Они становятся инфраструктурой. Они определяют, смогут ли правительства сравнивать модели, смогут ли компании доказать наличие мер безопасности, смогут ли клиенты доверять внедрениям и будут ли рискованные возможности управляться с помощью повторяемых контролей, а не импровизации. Пробел в руководстве CAISI поэтому не является просто кадровой ремаркой. Это проверка того, сможет ли Вашингтон построить долгосрочную Управление ИИ институты, в то время как системы, которыми они управляют, продолжают становиться быстрее, дешевле и более автономными.
Темы: CAISI, NIST, стандарты ИИ, Министерство торговли