МОДЕЛИ

Google выпускает более дешевую модель Gemini Models As Agent Costs Become A Front с проблемами ИИ

Выпуски Gemini 3.6 Flash, 3.5 Flash-Lite и 3.5 Flash Cyber от Google показывают, что гонка ИИ-моделей движется в направлении эффективности, специализированной работы по безопасности и экономики производственных агентов.

Патрик Т ·

Google выпускает более дешевую модель Gemini Models As Agent Costs Become A Front с проблемами ИИ
Wikimedia Commons / Остин МакКинли, CC BY 3.0.

Google выпустил три новых Gemini модели, построенные вокруг рыночной реальности, которую становится труднее игнорировать поставщикам ИИ: разработчикам и предприятиям нужны не только более мощные модели, но и более дешёвые модели, способные многократно выполнять агентные рабочие процессы, не превращая каждую задачу в бюджетную борьбу. Компания представила Gemini 3.6 Flash, Gemini 3.6 Flash-Lite и Gemini 3.5 Flash Cyber 21 июля, позиционируя релизы вокруг эффективности, задержки, надёжности и специализации задач, а не вокруг единственного утверждения о превосходстве на переднем крае. Сообщение прямое. По мере того как агенты переходят от демонстраций к производству, стоимость за выполненный рабочий процесс имеет такое же значение, как и место в рейтинге.

Флагманом группы является Gemini 3.6 Flash, который Google описывает как рабочую модель для программирования, интеллектуальной работы и мультимодальных задач. Google утверждает, что модель использует на 17% меньше выходных токенов, чем Gemini 3.5 Flash, согласно Artificial Analysis Index, а в некоторых бенчмарках по программированию способна еще сильнее сократить расход токенов. Компания установила цену на уровне $1,50 за миллион входных токенов и $7,50 за миллион выходных токенов, напрямую связав ценность модели со стоимостью выполнения агентной задачи. Такая формулировка важна, потому что ИИ-агенты часто тратят деньги через повторные попытки, вызовы инструментов, промежуточное рассуждение и контекстно-емкие циклы, а не через один ответ.

Gemini 3.5 Flash-Lite продвигает тот же аргумент дальше. Google утверждает, что это самая быстрая и экономически эффективная модель в серии 3.5, работающая со скоростью 350 выходных токенов в секунду согласно Искусственный анализ и стоит $0,30 за миллион входных токенов и $2,50 за миллион выходных токенов. Это делает его кандидатом для высокопроизводительных задач, таких как поиск, обработка документов, перевод квитанций и менее рискованные задачи подагентов. Стратегический момент заключается в том, что не каждый шаг в конвейере агента требует использования премиум-модели. Производственная система может распределять задачи по портфелю, используя более дешевые модели для большого объема и более мощные модели, когда сложность оправдывает стоимость.

Экономика агентов всё больше зависит от того, как часто модели используют инструменты, сканируют данные и повторно проходят по кодовым путям внутри производственной инфраструктуры. Изображение: Wikimedia Commons / Федеральное бюро расследований, общественное достояние.
Экономика агентов всё больше зависит от того, как часто модели используют инструменты, сканируют данные и повторно проходят по кодовым путям внутри производственной инфраструктуры. Изображение: Wikimedia Commons / Федеральное бюро расследований, общественное достояние.

Наиболее специализированный выпуск — Gemini 3.5 Flash, модель, созданная на основе 3.5 Flash и дообученная для поиска, проверки и исправления уязвимостей с помощью Google CodeMender агент безопасности. Google DeepMind сообщает, что модель изначально будет доступна через пилотный проект с ограниченным доступом для правительств и доверенных партнеров, выбор развертывания, который отражает двойственное назначение автоматизированного обнаружения уязвимостей. В тестах на движке JavaScript V8 от Google компания заявила, что Flash Cyber обнаружил 55 уникальных подтверждённых проблем против 47 у основной версии Gemini 3.5 Flash и 36 у Claude Opus 4.6, включая 10 проблем, которые не смогли выявить другие протестированные модели.

Модель безопасности показывает, как Google хочет конкурировать. Вместо того чтобы утверждать, что одна большая модель должна решать все проблемы кибербезопасности, Google утверждает, что более легкую модель можно вызвать много раз по большому коду, позволяя агенту исследовать больше путей перед созданием окончательного отчета. Это практическое утверждение о работе по обеспечению безопасности программного обеспечения. Обнаружение уязвимостей — это не только вопрос гениальности в одном ответе. Часто это вопрос охвата, настойчивости, проверки и экономики поиска в очень большом пространстве без застревания на первой правдоподобной уязвимости.

Эти релизы также оставляют заметный разрыв. Gemini 3.5 Pro, модель, которой многие разработчики ожидали как следующий крупный шаг Google, все еще тестируется с партнерами. Google заявляет, что планирует сделать её доступной в широком масштабе, когда она будет готова, и уже начала амбициозный предварительный этап обучения для Gemini 4. Эта деталь смягчает разочарование, но не устраняет его. Конкурентный рынок быстро меняется: OpenAI, Anthropic, xAI, Meta и китайские лаборатории открытых моделей стремятся формировать ожидания разработчиков. Google сообщает рынку, что хотя работа над более крупными моделями продолжается, её краткосрочным ответом является более широкий и дешёвый Gemini portfolio.

Google использует линию Flash, чтобы сделать Gemini более практичным для повторяющихся производственных задач, в то время как продолжается работа над более крупными моделями. Изображение: Wikimedia Commons / Runner1928, CC BY-SA 3.0.
Google использует линию Flash, чтобы сделать Gemini более практичным для повторяющихся производственных задач, в то время как продолжается работа над более крупными моделями. Изображение: Wikimedia Commons / Runner1928, CC BY-SA 3.0.

Для корпоративных покупателей это, возможно, более полезный выпуск. Компании, которые вышли за пределы пилотных проектов, всё чаще спрашивают, как работает ИИ-воркфлоу в течение месяца использования: сколько токенов он потребляет, как часто повторяет попытки, может ли безопасно использовать инструменты, чрезмерно ли редактирует код и может ли более дешёвая модель справляться с большинством рутинной работы. Gemini 3.6 Flash and Flash-Lite предназначены для этих обсуждений закупок. Это не только продукты; это доказательство того, что стек ИИ превращается в рынок операций, где маршрутизация, политика, наблюдаемость и экономика единицы определяют, выживут ли агенты после развертывания.

Релиз также предполагает, что наименование модели становится менее важным, чем размещение модели. Разработчик, создающий агента, может использовать более продвинутую модель для разбиения задачи, более дешевую модель для классификации документов, специализированную модель для программирования, чтобы написать исправление, модель зрения для проверки скриншотов и кибермодель для проверки изменения безопасности. Такой рабочий процесс сложнее продвигать на рынке, чем один флагманский релиз, но он ближе к тому, как строятся производственные системы. Ценность заключается в выборе правильной способности в нужный момент цепочки, а затем в измерении того, завершилась ли общая задача точно и экономично.

Заявления Google о стоимости следует рассматривать в контексте этого производства. Более низкая цена за токен полезна только в том случае, если модель не создаёт дополнительных повторных попыток, ручной очистки или последующих ошибок. Предприятия будут проверять эти системы с точки зрения общей стоимости, а не только заявленных тарифов. Они будут спрашивать, может ли Flash-Lite надёжно извлекать структурированные данные, может ли 3.6 Flash ограничивать изменения кода, создаёт ли Cyber результаты, которым доверяют инженеры по безопасности, и предотвращает ли логика маршрутизации использование низкозатратных моделей для задач, требующих более глубокого рассуждения. Таким образом, экономическая картина неразрывно связана с оценкой и наблюдаемостью.

Задержка важна по той же причине. Ассистент, с которым взаимодействует пользователь, который ждет слишком долго между шагами, кажется сломанным, даже если конечный ответ правильный. Внутренний агент, который тратит минуты на обработку обычного рабочего процесса, может оказаться дороже, чем сэкономленное время сотрудников. Более быстрые модели позволяют разработчикам создавать более отзывчивые интерфейсы, но скорость также может стимулировать больше вызовов, больше подагентов и больше скрытой промежуточной работы. Следующее поколение инфраструктуры ИИ потребует панелей управления, которые показывают не только расход токенов, но и количество шагов, количество вызовов инструментов, уровень ошибок и уровень вмешательства человека.

Возможности Gemini 3.5 Flash Cyber по управлению рисками — наиболее политически чувствительная часть объявления, поскольку они указывают на мир, в котором поставщики продают узкоспециализированные высокопроизводительные решения в рамках контролируемых программ. Решение Google DeepMind опробовать модель совместно с правительствами и доверенными партнёрами признаёт, что автоматическое обнаружение уязвимостей — это не просто ещё одно удобство для разработчиков. Инструмент, который находит уязвимости в безопасности, может укреплять программное обеспечение при использовании защитниками, но он также может снижать стоимость разведки и разработки эксплойтов, если доступ не контролируется. Та же логика двойного использования со временем может применяться к моделям, настроенным для биологического проектирования, тестирования убеждения или других чувствительных областей.

Сравнение с тестом V8 от Claude Opus 4.6 in Google имеет коммерчески значимый подтекст, но его не следует воспринимать как полную картину. Бенчмарки, проводимые поставщиками, часто отражают конкретные условия, настройки инструментов, подсказки и методы оценки. Важный сигнал заключается в том, что модель, оптимизированная для узкого рабочего процесса в области безопасности, может превзойти более крупную универсальную модель в этом рабочем процессе. Это не удивительно, но стратегически важно. Это означает, что конкуренция на переднем крае больше не зависит только от того, у кого самый способный универсальный помощник. Речь также идет о том, кто может упаковать экспертизу в конкретной области в модели, которым предприятия могут доверять для повторяемой работы.

Выпуск Flash-Lite может оказать наибольшее повседневное влияние, поскольку многие рабочие нагрузки ИИ являются рутинными. Обработка служебных запросов, извлечение метаданных, расширение поиска, классификация политик, перевод, составление кратких отчетов встреч и очистка документов не всегда требуют использования самой мощной доступной модели. Им необходимы последовательность, скорость и стоимость, достаточно низкая, чтобы компании могли использовать их в масштабах. Если Google сможет сделать Gemini практичным вариантом по умолчанию для этих уровней, компания добьётся широкого использования, даже если другая компания привлечёт внимание более крупной передовой системой.

Новые модели появляются также в то время, когда разработчики становятся все более скептичными по отношению к маркетингу, основанному исключительно на длине контекстного окна и бенчмарках. Большое контекстное окно полезно только если модель может находить соответствующий материал и следовать инструкциям на протяжении долгой сессии. Оценка по кодированию полезна только если сгенерированные изменения компилируются, проходят тесты и избегают масштабного переписывания. Низкая цена за токен полезна только если модель не требует повторной коррекции. Google старается удовлетворить более зрелого покупателя выпуском, ориентированным на экономику рабочей лошадки, а не на эффектное шоу.

Это не означает, что передовая производительность больше не имеет значения. Самые сильные универсальные модели по-прежнему формируют ожидания разработчиков, привлекают внимание предприятий и справляются с самыми сложными задачами в рабочем процессе. Но портфолио моделей позволяет поставщику превращать передовую работу в практические уровни. Флагманская модель может решать сложные задачи планирования и рассуждений. Молниеносные модели могут выполнять повторяющуюся среднюю работу. Специализированные варианты могут справляться с областями, где важно специализированное обучение. Если маршрутизация работает, клиент сталкивается с одной системой. Внутри поставщик оптимизирует затраты, задержку и риски на нескольких движках.

Google также реагирует на конкурентное давление со стороны открытых и китайских поставщиков моделей, которые сделали способные модели с низкой стоимостью ключевым пунктом продажи. Разработчики, которые могут размещать модели самостоятельно или использовать более дешевые API, имеют больше рычагов влияния, чем в период раннего бума чат-ботов. Поставщик премиум-класса должен оправдывать свою цену надежностью, инструментами, гарантией, безопасностью и интеграцией. Gemini 3.6 Flash and Flash-Lite является признаком того, что Google не хочет уступать конкурирующим компаниям производственный уровень с низкой стоимостью, пока она готовится представить более крупные системы.

Для команд безопасности Flash Cyber может стать проверкой того, можно ли доверять специализированному защитному ИИ в реальных программах управления уязвимостями. Модель, которая находит больше проблем в бенчмарке, полезна, но для команд безопасности также важны ложные срабатывания, качество исправлений, рейтинг эксплуатируемости, воспроизводимость и интеграция с существующими системами управления задачами и обзора кода. Если система ИИ засоряет инженеров правдоподобными, но малоценными находками, она может тратить дефицитное человеческое внимание, которое должна была сэкономить. Поэтому пилотная программа должна оцениваться по операционным результатам, а не только по количеству обнаружений.

Более широкий рынок моделей движется в сторону того, чтобы оркестрация стала продуктом. Клиентам понадобятся средства управления, которые определяют, какая модель обрабатывает какую подзадачу, сколько бюджет может потратить каждый рабочий процесс, когда следует перейти к более сильной модели, когда требуется одобрение человека и как аудиторить результат. Анонс Google предоставил разработчикам больше компонентов. Следующий вопрос заключается в том, смогут ли Google Cloud и API Gemini упростить управление этими компонентами в масштабе. Выбор модели становится решением времени выполнения, а не одноразовым решением о закупке.

Релизы также отражают более тихое разочарование разработчиков: изменения моделей могут нарушить тщательно настроенные рабочие процессы. Когда поставщики вводят новые системы, клиентам приходится повторно тестировать подсказки, схемы инструментов, поведение системы безопасности, форматы вывода и предположения о задержках. Более широкое семейство моделей дает Google больше гибкости, но также увеличивает нагрузку на обеспечение совместимости. Предприятия будут ожидать стабильных версий, четких сроков устаревания, инструментов для оценки и руководства по миграции. Клиенты, использующие ИИ в производстве, менее снисходительны, чем ранние пользователи, потому что обновление модели теперь может повлиять на очереди поддержки, кодовые конвейеры, проверки соответствия и функции, ориентированные на клиентов.

Прозрачность ценообразования будет иметь такое же значение, как и качество модели. Агентные системы могут скрывать затраты на промежуточных этапах, которые пользователи никогда не видят. Рабочий процесс может извлекать сотни страниц, вызывать модель планирования, запускать несколько субагентов, просить кибер-модель проверить патч, а затем суммировать результат. Если трудно прогнозировать цены, владельцы бизнеса будут ограничивать использование или замедлять внедрение. Более дешёвые уровни Google являются ответом на эти сомнения, но клиентам всё равно потребуются средства контроля бюджета и отчётность, связывающая расходы с достигнутыми бизнес-результатами.

Отсутствие широко выпущенной модели Gemini 3.5 Pro также поддерживает конкурентное давление на Google. Разработчики могут оценить более дешевые модели Flash, при этом задаваясь вопросом, обладает ли Google самой сильной системой для самых сложных задач. Похоже, компания разделяет гонку по символическому рубежу и гонку по экономике производства. Это может быть разумным, но создает проблему в коммуникации. Google необходимо убедить клиентов, что портфолио не является утешительным призом, пока более крупные модели остаются в стадии тестирования.

Таким образом, выпуск функционирует как рыночный сигнал так же, как обновление продукта. Google сообщает разработчикам, что она хочет, чтобы Gemini использовалась в повседневной работе, а не только в демонстрационных примерах. Это означает, что модели должны быть достаточно дешевыми для многократного использования, достаточно специализированными для чувствительных рабочих процессов и достаточно стабильными для команд закупок, которые больше не рассматривают ИИ как эксперимент. Если эти условия будут выполнены, модели Flash могут стать слоем, который пользователи редко замечают, но к которому компании обращаются постоянно.

Под стратегией модели существует стратегия платформы. Google может связать Gemini to Android, Workspace, Cloud, Chrome, Search, продукты безопасности и инструменты для разработчиков. Более дешевые модели Flash дают этой платформе больше возможностей внедрять ИИ, не делая каждую функцию экономически болезненной. Рабочий процесс Gmail, помощник BigQuery, инструмент проверки кода и сканер безопасности могут в фоновом режиме обращаться к разным моделям Gemini. Клиенту может быть всё равно, какая модель ответила, но для Google это важно, поскольку такие вызовы усиливают зависимость от её ИИ-стека.

Открытым вопросом остаётся, примут ли разработчики большее фрагментирование моделей. Портфель даёт инженерам гибкость, но также увеличивает операционную нагрузку. Командам нужны правила маршрутизации, стратегии резервного использования, наборы для оценки, оценки стоимости и политики безопасности для каждого класса моделей. Если Google хочет Flash, Flash-Lite, Cyber, Pro и будущий Gemini 4 systems to coexist, им понадобятся инструменты, которые делают выбор и мониторинг простыми. Компаниями, которые выиграют в производственном ИИ, могут оказаться те, кто снижает когнитивную нагрузку при выборе между моделями, а не только те, кто выпускает их больше.

Кибер-пилот поднимает отдельный вопрос управления. Google ограничивает Flash Cyber, потому что та же система, которая помогает защитникам находить ошибки, может помочь злоумышленникам при широком неправильном использовании. Такой контроль доступа, вероятно, станет более распространённым для специализированных моделей. Общий помощник может быть широко доступен, тогда как кибер-, био- или другие чувствительные варианты проходят через доверенные программы, контролируемые развертывания и обязательства клиентов. Таким образом, гонка моделей разделяется на два соревнования одновременно: соревнование по затратам для повседневных задач агентов и соревнование с контролируемым доступом для высокорискованных специализированных возможностей.

Выпуск Google не снимает сомнений относительно того, сможет ли компания вновь занять символическое лидерство в области передового ИИ. Он показывает, что компания серьёзно относится к производственному рынку. Если агенты будут работать внутри кодовых баз, браузеров, корпоративных документов и систем безопасности, они должны быть достаточно доступными для частого использования и достаточно надёжными, чтобы оставлять меньше беспорядка. Самое важное: анонс Gemini на этой неделе может относиться не к одной конкретной модели. Возможно, это признание того, что следующая битва в сфере ИИ будет измеряться количеством завершённых рабочих процессов, а не только скриншотами результатов тестов.

Темы: Google, Gemini, агенты ИИ, кибербезопасность

Канонический адрес статьи