ТЕХНОЛОГИИ

Gemini — самая мощная мультимодальная модель Google на сегодняшний день

Google представила Gemini Omni, новую флагманскую мультимодальную модель, способную создавать и редактировать видео, аудио и изображения через разговор на естественном языке. Анонсированная на Google I/O 2026, эта модель представляет собой самый значительный скачок в возможностях ИИ Google с момента появления оригинальной Gemini launch.

Патрик Т ·

Gemini — самая мощная мультимодальная модель Google на сегодняшний день

Объявление прозвучало в середине второго дня конференции Google I/O 2026 и произвело эффект компании, которая провела почти два года, наблюдая, как конкуренты определяют правила гонки за мультимодальный ИИ. Сундар Пичаи представил Gemini Omni не как очередное обновление, а как фундаментальное переосмысление того, на что должна быть способна универсальная модель ИИ. Послание было ясным: Google перестал догонять.

Gemini Omni может принимать любую комбинацию текста, изображений, аудио и видео в качестве входа и создавать любую комбинацию этих же модальностей в качестве вывода. Звучит как спецификация, но демонстрации на I/O выявили кое-что более важное: модель не просто обрабатывает эти входные данные параллельно — она рассуждает по ним одновременно, формируя единое понимание сцены, разговора или творческого задания перед тем, как сгенерировать ответ.

В одной демонстрации дизайнер продукта загрузила грубый эскиз, справочную фотографию и голосовую заметку, описывающую её видение нового потребительского продукта. Gemini Omni синтезировал все три входные данных, задал два уточняющих вопроса на естественном языке и создал фотореалистичное изображение продукта вместе с коротким видео, показывающим его в использовании. Вся интеракция заняла менее четырех минут. Та же рабочая схема, с использованием традиционных инструментов, потребовала бы команду дизайнеров, конвейер 3D-визуализации и большую часть рабочего дня.

Новая архитектура для мультимодального рассуждения

Техническая основа Gemini Omni отличается от подхода, который Google применяла в предыдущих версиях Gemini. Предыдущие версии обрабатывали разные модальности через отдельные тракты кодировщиков, а затем объединяли представления на позднем этапе. Omni, напротив, была обучена с нуля на перемежающихся мультимодальных данных — последовательностях, где текст, изображения, аудио и видео появляются вместе в их естественном контексте, а не как отдельные потоки, которые затем выравниваются.

Практическим следствием этого архитектурного выбора является то, что Gemini Omni проявляет то, что исследователи Google называют «кросс-модальной привязкой» — способность закреплять абстрактные концепции через разные сенсорные представления. Когда модель просят описать эмоциональный тон музыкального произведения, а затем сгенерировать изображение, отражающее этот тон, она не рассматривает это как две отдельные задачи. Она строит единое внутреннее представление концепции и выражает его через ту модальность, которая наиболее подходит.

Рабочая станция для медиапроизводства, работающая с интерфейсом видеомонтажа Gemini Omni во время демонстрации Google I/O 2026.
Рабочая станция для медиапроизводства, работающая с интерфейсом видеомонтажа Gemini Omni во время демонстрации Google I/O 2026.

Эта возможность имеет значительные последствия для творческих профессионалов. Видеоредакторы, музыканты, архитекторы и дизайнеры игр давно работают с несколькими инструментами, которые не взаимодействуют друг с другом. Gemini Omni — первая убедительная попытка создать единый уровень рассуждений над всеми этими инструментами, способный изначально понимать результаты их работы.

Генерация видео в масштабах

Возможно, самым впечатляющим демонстрационным примером на I/O стала генерация видео. Google показала Gemini Omni, создающую 90-секундный короткометражный фильм по двухабзацному описанию, с согласованным дизайном персонажей, логичными переходами между сценами и синхронизированной аудиодорожкой. Результат не был телевещательным качеством — модель всё ещё испытывает трудности с тонкими выражениями лица и сложными физическими взаимодействиями — но он был последовательным так, как предыдущие системы генерации видео не могли.

Что более важно, Gemini Omni может редактировать существующее видео с помощью инструкций на естественном языке. Журналист, тестировавший модель на I/O, описал процесс, когда он загрузил необработанную запись интервью и попросил модель «убрать паузы, ускорить темп и добавить ненавязчивую фоновую музыку, соответствующую настроению разговора». Модель вернула отредактированную версию через несколько минут. Редактирование было несовершенным — фоновая музыка иногда конфликтовала с ритмом речи — но показанный рабочий процесс действительно был новым.

Google осторожно позиционирует эту возможность как инструмент для профессиональных создателей, а не как замену им. Сообщения компании на I/O постоянно подчеркивали усиление возможностей вместо автоматизации, что отражает как искреннее убеждение, так и коммерческую необходимость. Креативные индустрии представляют собой значительное и активное сообщество, и Google не может позволить себе их оттолкнуть в тот момент, когда просит их использовать свои инструменты.

Конкурентная среда

Gemini Omni выходит в момент, когда конкуренция на рынке мультимодального ИИ действительно становится плотной. OpenAI GPT-4o доступен более года и завоевал значительную базу пользователей среди разработчиков и креативных профессионалов. Claude 3.7 Sonnet от Anthropic занял прочные позиции в корпоративных воркфлоу, где требуется глубокий анализ документов и изображений. Meta Llama 4 Scout показала конкурентоспособные результаты в мультимодальных бенчмарках при значительно меньшей стоимости по сравнению с проприетарными решениями.

Преимущество Google, по мнению компании, заключается в распространении. В ближайшие месяцы Gemini Omni будет интегрирована в Google Workspace, YouTube Studio, Google Photos и Google Meet. Это означает, что модель будет доступна более чем трём миллиардам людей, использующих инструменты продуктивности Google, без необходимости посещать отдельный интерфейс ИИ или осваивать новый рабочий процесс.

Инфраструктура производства и редактирования медиа Google, которая будет служить основной платформой для развертывания творческих инструментов Gemini Omni.
Инфраструктура производства и редактирования медиа Google, которая будет служить основной платформой для развертывания творческих инструментов Gemini Omni.

Интеграция с YouTube особенно важна. Google объявила, что Gemini Omni станет доступна авторам YouTube через YouTube Studio, позволяя им создавать дополнительные видеоматериалы, варианты миниатюр и переведённые версии своих видео на нескольких языках. Учитывая, что каждую минуту на YouTube загружается более 800 часов нового видеоконтента, масштаб этого внедрения сделает Gemini Omni одним из самых широко используемых в мире инструментов ИИ для работы с видео практически сразу после запуска.

Внедрение и ценообразование для предприятий

Google объявила о многоуровневой структуре ценообразования, отражающей позиционирование Gemini Omni как премиального предложения. Индивидуальные пользователи плана Google One AI Premium будут иметь доступ к ограниченной версии возможностей модели, а более высокие лимиты использования будут доступны через новый уровень подписки 'Gemini Advanced' по цене 29,99 долларов США в месяц. Корпоративные клиенты будут получать доступ к модели через платформу Vertex AI от Google Cloud, при этом ценообразование будет основано на потреблении токенов и модальности вывода.

Корпоративное ценообразование вызвало критику со стороны разработчиков, которые утверждают, что стоимость видеогенерации Google за токен значительно выше, чем у конкурирующих сервисов. Google возразила, что интегрированная природа Gemini Omni — его способность рассуждать на разных модальностях без необходимости отдельных API-запросов для каждого — снижает общую стоимость сложных рабочих процессов ниже, чем кажется при сравнении ставок за токен в отдельности.

Что будет дальше

Google разработала дорожную карту функций генерации видео в реальном времени для Gemini Omni, включающую несколько возможностей, которые ещё не будут доступны на момент запуска. Real — способность создавать видеовыход по мере развития разговора, а не в виде пакетного процесса, — описывается как «приоритет на ближайшее время». Интеграция с исследованиями Google в области робототехники, которые изучают, как большие мультимодальные модели могут управлять физическими системами, описывается как долгосрочная цель.

Более насущный вопрос заключается в том, сможет ли Gemini Omni изменить восприятие Google как компании, которая вечно догоняет лидеров в гонке ИИ. Технические демонстрации на I/O впечатляют, но они всегда были сильной стороной Google. Более трудное испытание наступит в ближайшие месяцы, когда модель окажется в руках миллионов пользователей, и разрыв между демонстрацией и повседневной реальностью станет очевидным. Пока что у индустрии ИИ появился новый эталон.

Канонический адрес статьи