Исследования

Искусственный интеллект в сетевых технологиях становится новым ускорителем

По мере того как тренировочные кластеры масштабируются до сотен тысяч ускорителей, сети становятся таким же стратегическим элементом, как и сами чипы. Гонка за передовыми моделями теперь зависит от инфраструктуры, которая обеспечивает питание, синхронизацию и эффективность работы GPU.

Майкл Г ·

Искусственный интеллект в сетевых технологиях становится новым ускорителем
Mantis.

The аппаратное обеспечение ИИ История обычно рассказывается через ускорители. GPUs, TPU, специализированные ASIC и модули памяти попадают в заголовки, потому что они являются наглядными символами вычислительной мощности. Но по мере масштабирования передовых кластеров для обучения, сеть, соединяющая эти чипы, становится не менее важной.

Современная тренировочная задача — это не мысли одного чипа в одиночку. Это тысячи, десятки тысяч или в конечном итоге сотни тысяч ускорителей, обменивающихся данными в условиях жестких временных ограничений. Если сеть дает сбои, задержки или не успевает распределять трафик, дорогие чипы простаивают. На передовом уровне простаивающие чипы — это не просто неудобство. Это сожженный капитал.

Кластер — это компьютер

Фраза "фабрика ИИ' полезен, потому что он смещает внимание с отдельных серверов на скоординированные производственные системы. Кластер должен обрабатывать данные, перемещать градиенты, синхронизировать задачи, справляться с отказами, изолировать пользователей и поддерживать предсказуемую производительность при рабочих нагрузках, которые могут выполняться неделями.

Вот почему недавние исследования высокоскоростных сетей для гига-масштабных AI-фабрик имеют значение. Технические детали могут казаться узкими: балансировка нагрузки, пропускная способность при бисекции, низкая джиттерность, сбои соединений, многопутевая маршрутизация. Но именно эти детали определяют, завершится ли выполнение модели эффективно или превратится в вскрытие инфраструктуры.

На граничном уровне структура сети определяет, какая часть вычислительных ресурсов ускорителей может быть действительно использована. Изображение: Mantis.
На граничном уровне структура сети определяет, какая часть вычислительных ресурсов ускорителей может быть действительно использована. Изображение: Mantis.

Нетворкинг становится стратегическим рвом

Nvidia's Spectrum-X Работа показывает, почему сетевая инфраструктура переходит на стратегический уровень. Компания продает не только ускорители. Она продает больше системы, необходимой для того, чтобы ускорители были полезны в масштабе: NICs, коммутаторы, программное обеспечение, эталонные архитектуры и эксплуатационные знания.

Это имеет конкурентные последствия. Если сетевой стек максимально оптимизирован для платформы чипа, покупателям может быть сложнее сочетать различные компоненты. Ров не ограничивается только CUDA или модельным программным обеспечением. Это обещание полной технологической цепочки, что фабрика будет работать.

Коммутаторы Ethernet становятся стратегической частью инфраструктуры вычислений ИИ, а не просто второстепенным товаром. Изображение: Mantis.
Коммутаторы Ethernet становятся стратегической частью инфраструктуры вычислений ИИ, а не просто второстепенным товаром. Изображение: Mantis.

Неудача — это работа первого класса

Крупные кластеры постоянно терпят неудачи в мелочах. Ссылки сбрасываются, хосты ведут себя неправильно, компоненты деградируют, арендаторы сталкиваются друг с другом, а задания создают шаблоны трафика, которые стандартные data-center Предположения не предусматривали. Сеть ИИ должна реагировать достаточно быстро, чтобы эти сбои не привели к серьезным нарушениям обучения.

Исследовательский урок прозрачен: предсказуемая производительность важна так же, как и максимальная пропускная способность. Быстрая сеть, которая становится нестабильной в реальных условиях обучения, может быть хуже слегка более медленной сети с надежной изоляцией и восстановлением. Передовые ИИ ценят последовательность.

Это также изменяет то, как инвесторам следует читать объявления о инфраструктуре. Компания, которая заявляет, что приобрела крупный кластер GPU, не завершила рассказ. Настоящий вопрос заключается в том, есть ли у неё сеть, хранилище, охлаждение, электропитание и операции, чтобы поддерживать продуктивность этого кластера.

Скрытая архитектура возможностей

Способности модели часто обсуждаются так, как будто они возникают только из алгоритмов и масштаба. На практике способности возникают из скрытой архитектуры, которая позволяет масштабу работать: память, сети, программное обеспечение, энергия, охлаждение и люди, которые умеют устранять неполадки во всем этом в 3 часа утра.

Гоночная модель на переднем крае все больше зависит от физических систем, стоящих за API. Изображение: Mantis.
Гоночная модель на переднем крае все больше зависит от физических систем, стоящих за API. Изображение: Mantis.

Темы: сетевые технологии ИИ, Spectrum-X, инфраструктура ИИ, передовые модели

Канонический адрес статьи