AWS и NVIDIA объявили 26 августа о планах установить два миллиона дополнительных GPU в 2027–2028 годах. В заказ входят Blackwell Ultra, Rubin и Rubin Ultra. Это прибавка к ранее объявленному миллиону ускорителей, развёртывание которых начинается в 2026 году.

GPU выполняет множество вычислений параллельно: такие процессоры используют для обучения моделей, генерации текста и обработки изображений. Amazon устанавливает их в своих центрах обработки данных, а клиент получает удалённый доступ к вычислениям. Покупать и обслуживать оборудование ему не требуется.

Два миллиона ускорителей — не два миллиона одинаковых серверов

В одном сервере может быть несколько GPU, а для обучения крупной модели серверы объединяют в группу с быстрой сетью. Часть покупателей арендует такие группы целиком. Другим нужен отдельный сервер для уже обученной модели. Общее число ускорителей ничего не говорит о том, сколько машин каждого типа будет доступно конкретному клиенту.

AWS пока не опубликовала для этой партии распределение по регионам, подробный график ввода и тарифы. Объявлены общий объём и период установки — 2027–2028 годы.

Новое оборудование будет работать и за готовыми сервисами

В том же соглашении AWS и NVIDIA речь идёт о моделях Nemotron в Bedrock и SageMaker, ускорении обработки данных и поиска, а также робототехнике. Расширение затрагивает несколько услуг AWS, а не только аренду GPU.

Разница заметна на примере поиска по архиву. Можно арендовать сервер и самостоятельно установить модель. Можно обращаться к готовой модели через API — программный интерфейс, которому приложение отправляет запрос и от которого получает ответ. Во втором случае клиент тоже использует чужие серверы, но их выбор и обслуживание выполняет поставщик услуги.

Ещё до ответа модели архив нужно подготовить для поиска: извлечь текст из файлов и построить индекс, по которому программа находит подходящие фрагменты. Это отдельная вычислительная работа. Ускорение такого этапа полезно при частом обновлении большого архива, даже если сама модель осталась прежней.

NVIDIA будет участвовать и в развитии чипов Amazon

Отдельная часть соглашения касается Trainium — собственных ускорителей AWS для моделей. Amazon и NVIDIA работают над их интеграцией с NVLink Fusion, технологией быстрого обмена данными между чипами, и над доступом к новой памяти NVIDIA NVHBM.

Память хранит данные, с которыми работает ускоритель, а соединения передают их между вычислительными узлами. Поэтому производительность зависит не только от отдельного чипа. Слишком медленная передача данных заставляет его ждать, даже когда вычислительной мощности хватает.

Компании описывают будущую архитектуру, в которой Trainium и GPU можно будет объединять на уровне стойки. Сотрудничество с NVIDIA распространяется и на оборудование Amazon с собственными ускорителями: в нём планируют использовать технологии памяти и соединений NVIDIA.