ТЕХНОЛОГИИ
Nvidia расширяет преимущество своей ИИ-инфраструктуры за пределы GPU до полноразмерных стоечных систем
Конкурентная позиция Nvidia расширяется с отдельных ускорителей до плотно интегрированных систем вычислений, памяти, сетей и хранения данных. По мере того как AI-кампусы достигают гигаваттного масштаба, координация перемещения данных и энергоэффективности может быть важна так же, как и сам GPU.
Патрик Т ·

Nvidia расширяет своё преимущество в области ИИ-инфраструктуры от ускорителя в центре сервера до полной системы, которая обеспечивает работу тысяч ускорителей вместе. Платформа Vera Rubin сочетает в себе GPU с CPU, сетевые компоненты, хранилища и специализированные элементы, разработанные как согласованная архитектура стоек. Это изменение важно, потому что самая сложная проблема на крупнейших ИИ-кампусах уже не заключается в том, чтобы получить быстрый чип в одиночку. Сложность заключается в перемещении состояния модели и тренировочных данных через огромную систему, не заставляя дорогостоящие процессоры простаивать или тратить энергию впустую.
Эта стратегия появляется в тот момент, когда Amazon, Google и другие гипермасштабируемые компании увеличивают инвестиции в собственные ускорители. Специальный кремний предоставляет облачным операторам рычаги влияния на стоимость и снабжение, ослабляя предположение о том, что каждая передовая рабочая нагрузка должна выполняться на стандартном GPU Nvidia. TechCrunchАнализ утверждает, что конкурентная реакция видна вокруг чипа: Nvidia продает больше памяти, межсоединений, сетевых и оркестрационных слоев, необходимых для превращения производительности компонентов в используемую производительность кластера.
Вера Рубин делает аргумент системы явным. Архитектура объединяет графические процессоры Rubin с центральными процессорами Vera и интегрированную инфраструктуру уровня стойки. Модель, параметры которой, активации и кэш не помещаются на одном устройстве, должна постоянно обмениваться данными между процессорами и узлами. Каждая передача вводит задержку и потребляет энергию. Задача разработчика системы — обеспечивать дорогие вычислительные блоки необходимыми данными, минимизируя при этом перемещения, которые создают затраты, не продвигая рабочую нагрузку.
Узкое место перемещается вне GPU
На меньшем масштабе покупатели могут сравнивать ускорители, используя привычные показатели, и настраивать вокруг них серверы. На мегамасштабе локальные сравнения компонентов становятся менее решающими. Топология сети, восстановление после сбоев, пропускная способность хранилища, планирование и размещение памяти определяют, сколько теоретической производительности достигает приложение. Кластер может обладать отличными GPU, но при этом обеспечивать плохую экономику, если коммуникации их задерживают или если программное обеспечение не может эффективно распределять рабочие нагрузки. Вот почему токены на ватт и полезная работа на стойку становятся важнее, чем одно максимальное число.

Память иллюстрирует сдвиг. По мере роста моделей и контекстных окон системам требуется больше памяти с высокой пропускной способностью рядом с вычислительными узлами и большие массивы данных, доступные во всем кластере. Поставщики, такие как Micron выгод получено потому, что спрос на акселераторы тянет за собой спрос на память. Операционная задача заключается в доставке правильных данных в нужное время. Роль CPU Веры частично заключается в оркестрации, координируя работу тогда, когда ни один сервер не может удерживать полное состояние, необходимое для большой задачи.
Нетворкинг так же важен. NVLink и связанные с ними технологии коммутационной ткани позволяют акселераторам обмениваться данными с пропускной способностью и уровнем задержки, которые обычные сети центров обработки данных не могут обеспечить. Плотная интеграция может обеспечить более предсказуемую производительность, потому что аппаратное и программное обеспечение разрабатываются вместе. Это также создаёт зависимость. Клиент, который строит систему вокруг стойки, коммутационной ткани и программного обеспечения управления одного поставщика, не может заменить акселератор так же легко, как в более модульном сервере.
Эта зависимость не является автоматически плохим решением. Предприятия регулярно выбирают интегрированные платформы, потому что стоимость проектирования каждого интерфейса превышает экономию от гибкости компонентов. Развертывания Frontier AI имеют сжатые сроки и ограниченный специализированный персонал. Проверенная стойка может снизить риски интеграции и быстрее вывести систему в производство. Компромисс проявляется позже в ходе переговоров о цене, циклах обновлений и способности принять конкурирующий чип без перестройки программного обеспечения и операций вокруг него.
Программное обеспечение превращает интеграцию в рвы
CUDA Остается большой частью преимущества Nvidia, потому что разработчики и команды инфраструктуры проводили годы, создавая код, библиотеки и операционные практики вокруг него. Платформа поддерживает не только выполнение ядра. Она связывает профилировщики, коммуникационные библиотеки, фреймворки моделей и инструменты развертывания. Аппаратные конкуренты могут создать способные ускорители, но клиенты также оценивают инженерную работу, необходимую для переноса и проверки рабочих нагрузок. Эти затраты на миграцию дают Nvidia возможность расширяться от чипов до полных систем.
Кастомные чипы гиперскейлеров продолжают оказывать значительное давление. Программа TPU от Google демонстрирует, что облачный провайдер может создать зрелую службу ускорителей, оптимизированную под собственную инфраструктуру и выбранные рабочие нагрузки. Amazon пошла по похожему пути. Эти системы не нужно повсеместно заменять Nvidia, чтобы изменить рынок. Они могут захватить внутренние задачи с высоким объемом, создать альтернативные программные экосистемы и предоставить крупным покупателям ориентировочную цену при переговорах о внешних GPU.

Ответ Nvidia заключается в увеличении единицы конкуренции. Если покупатели сравнивают только производительность ускорителя, альтернативы могут атаковать один компонент. Если сравнение включает пропускную способность стоек, время развертывания, поведение сети, интеграцию хранения и поддержку программного обеспечения, претендент должен соответствовать всей экосистеме. Эта стратегия напоминает бизнес-платформы для крупных предприятий, которые защищают основной продукт, владея смежными слоями. Она может поддерживать маржу при росте спроса, но также поднимает вопросы антимонопольного регулирования и концентрации клиентов, если слишком большая часть стека зависит от одного поставщика.
Операции решат, сдерживает ли платформа своё обещание. Плотные стойки создают высокие требования к охлаждению и электропитанию. Отказ сетевого коммутатора, кабеля или компонента управления может повлиять на гораздо больше вычислительных ресурсов, чем отказ карты в небольшом сервере. Операторам нужны телеметрические данные, которые выявляют ухудшение работы до сбоев задач, резервная мощность для обслуживания и системы планирования, которые могут перемещать работу без потери дорогостоящего прогресса обучения. Интеграция должна улучшать эти задачи, а не просто упрощать закупки.
Тестирование клиентов — полезная работа за каждый доллар
Покупатели должны оценивать полную стоимость рабочей нагрузки, включая приобретение, электроэнергию, сеть, время инженеров, простой и срок службы платформы. Nvidia может оправдать премию, если система достигает сервиса быстрее и держит ускорители занятыми дольше. Конкуренты могут выиграть, если их более низкая стоимость компонентов выдерживает расходы на перенос и эксплуатацию в масштабе. Ни один из результатов нельзя определить по спецификации запуска. Для этого требуется измерение производительности приложения в собственной среде клиента.
Планирование ёмкости также становится программной задачей. Обучающие задания, интерактивный вывод и пакетные рабочие нагрузки предъявляют разные требования к памяти и сетевым ресурсам. Платформа, которая умно их планирует, может повысить использование без добавления чипов. Операторам следует проверить, предоставляют ли инструменты управления достаточно информации для настройки этих решений или скрывают её за слоем, контролируемым поставщиком. Простота ценна до тех пор, пока система не начинает вести себя непредсказуемо, и инженеры не могут понять, почему.
Открытые стандарты могли бы смягчить привязку к конкретной платформе, если они сделают форматы моделей, интерфейсы управления и сетевой контроль более переносимыми. Оптимизация, специфичная для аппаратного обеспечения, все равно будет иметь значение, поскольку самые крупные рабочие нагрузки чувствительны к небольшим приростам эффективности. Реалистичная цель — не идеальная взаимозаменяемость. Цель заключается в сохранении достаточной переносимости, чтобы клиент мог размещать новые рабочие нагрузки на другой платформе без перестройки всей своей системы данных и развертывания.
Устойчивость поставок — еще одна причина, по которой покупатели могут избегать единой архитектуры, даже если она показывает лучшие результаты. Полностьёе шасси Nvidia зависит от более широкого перечня материалов и специализированных производственных мощностей. Концентрация может упростить поддержку, но делает сбои более значительными. Крупные клиенты, вероятно, будут поддерживать альтернативные программы ускорителей частично в качестве страховки, принимая некоторое дублирование программного обеспечения, чтобы сохранить переговорное влияние и непрерывность работы.
Системный подход также может сдвинуть конкуренцию в сторону сервисных организаций. Развертывание плотных стоек требует опыта в охлаждении, электропитании, проектировании конструкции и надежности. Nvidia и его партнеры могут упаковывать эталонные разработки, но каждый объект имеет свои ограничения. Поставщики, которые помогают клиентам быстро достичь стабильной работы, могут получать выгоду, выходящую за пределы продаж компонентов. Этот уровень обслуживания обеспечивает обратную связь для следующего поколения оборудования и делает платформенные отношения более трудными для разрыва.
Команды по закупкам должны требовать доказательства на уровне рабочей нагрузки, прежде чем расширять выбор платформы на весь парк. Обучение, извлечение, кодирование агентов и высокообъемное прогнозирование могут требовать разных характеристик памяти и задержки. Стойка, которая превосходна в одной задаче, может быть ненужно дорогой для другой. Смешанная инфраструктура увеличивает операционную работу, но может предотвратить превращение премиальной архитектуры в стандарт для задач, которые не выигрывают от её основных сильных сторон.
Финансовым планировщикам следует также моделировать стоимость следующего обновления. Интегрированные системы могут повысить текущую эффективность использования, в то время как частичное обновление будет затруднено, если процессоры, архитектура и ускорители развиваются в разном темпе. Ожидаемый срок службы программного обеспечения и сетевых решений может быть длиннее, чем цикл жизни GPU. Условия контрактов, варианты перепродажи и обратная совместимость определят, смогут ли клиенты сохранить эти уровни или им придется заменить большую часть стойки для установки нового ускорителя.
Следующая фаза конкуренции в области инфраструктуры ИИ, следовательно, будет выглядеть меньше как тест производительности чипов и больше как конкурс промышленных систем. Nvidia делает ставку на то, что его накопленный опыт в области программного обеспечения, сетей и проектирования стоек останется ценным, даже когда у клиентов появится больше вариантов ускорителей, включая Google Cloud TPU платформа. Нерешённый вопрос заключается в том, продолжает ли интеграция снижать общие операционные расходы или превращается в форму зависимости, цена которой растёт быстрее, чем её выгода. Клиенты будут отвечать на этот вопрос по одному развернутому кластеру за раз.
Темы: Nvidia, Вера Рубин, инфраструктура ИИ, дата-центры, сети