NVIDIA опубликовала в блоге и в техническом документе по архитектуре Blackwell (PDF) новые детали о поколении ускорителей ИИ Blackwell Ultra. Теперь стало ясно, что изменения на уровне аппаратного обеспечения оказались значительно глубже, чем предполагалось ранее.
Главное новшество — двухкристальный дизайн (dual-reticle). Blackwell Ultra состоит из двух кристаллов, объединённых интерфейсом NV-HBI с пропускной способностью 10 ТБ/с. Всего чип насчитывает 208 млрд транзисторов, что в 2,6 раза больше, чем у Hopper, и остаётся полностью совместимым с экосистемой CUDA.
Если чипы первого поколения Blackwell включали 144 потоковых мультипроцессора (SM), то у Blackwell Ultra их уже 160. То есть NVIDIA сделала архитектуру ещё более сложной, но при этом не раскрывает данных о площади кристалла. Можно лишь предположить, что она составляет около 800 мм² или чуть больше, что вплотную приближает чип к пределу современных технологий производства.
Кроме того, на каждую SM-партицию теперь выделяется 256 КБ Tensor Memory (TMEM), которая снижает нагрузку на внешнюю память HBM3E. В Blackwell Ultra увеличена пропускная способность SFU по ключевым инструкциям внимания (например, exp) — до ~2× против Blackwell, что ускоряет производительность операций softmax/attention.
Ещё одно заметное изменение в Blackwell Ultra — переход на память 12-Hi HBM3E общим объёмом 288 ГБ вместо прежних 186 ГБ. Пропускная способность остаётся на уровне 8 ТБ/с, но благодаря увеличенной ёмкости даже один ускоритель способен вместить гораздо более крупные датасеты ИИ-моделей. А в конфигурациях NVL72 общий объём HBM3E достигает 20,7 ТБ.
| GB300 Grace Blackwell Ultra | GB200 Grace Blackwell | |
| GPU | Blackwell Ultra | Blackwell |
| CPU | Grace Superchip (72 ARM-ядра) | Grace Superchip (72 ARM-ядра) |
| Память CPU | 480 ГБ LPDDR5X, 512 ГБ/с | 480 ГБ LPDDR5X, 512 ГБ/с |
| FP4 Tensor Core (Dense/Sparse) | 15 / 20 PFLOPS | 10 / 20 PFLOPS |
| FP8/FP6 Tensor Core (Dense/Sparse) | 5 / 10 PFLOPS | 5 / 10 PFLOPS |
| INT8 Tensor Core (Dense/Sparse) | 157,5 / 315 TFLOPS |
105/210 TFLOPS |
| FP16/BF16 Tensor Core (Dense/Sparse) | 2,5 / 5 PFLOPS | 2,5 / 5 PFLOPS |
| TF32 Tensor Core (Dense/Sparse) | 1,25 / 2,5 PFLOPS | 1,25 / 2,5 PFLOPS |
| FP32 | 80 TFLOPS | 80 TFLOPS |
| FP64 Tensor Core (Dense) | 1,3 TFLOPS | 40 TFLOPS |
| FP64 | 1,3 TFLOPS | 40 TFLOPS |
| HBM | 288 GB (HBM3E) | 186 GB (HBM3E) |
| Пропускная способность памяти | 8 Тбайт/с | 8 Тбайт/с |
| NVLink-Interface | 1,8 Тбайт/с | 1,8 Тбайт/с |
| Интерфейс PCIe | PCIe 6.0 | PCIe 5.0 |
| TDP | 1.400 Вт | 1.200 Вт |
| Server-Option | GB300 NVL72 | GB200 NVL72 |
| Общая емкость HBM | 20,7 TB (HBM3E) | 13,5 TB (HBM3E) |
| HBM-Gesamtbandbreite | 576 Тбайт/с | 576 Тбайт/с |
Blackwell Ultra показывает значительно более высокую производительность при вычислениях в формате FP4 — и связано это с введением нового формата данных NVFP4. Однако вычисления в INT8 у Blackwell Ultra, наоборот, заметно ниже — примерно в 32 раза, а производительность в FP64, и без того урезанная по сравнению с Hopper, снижена ещё сильнее.
Мы уже говорили о различии в объёме памяти HBM3E. К этому добавляется рост TDP — с 1200 до 1400 Вт. Соединение GPU и CPU теперь осуществляется по 16 линиям PCIe 6.0 (256 ГБ/с), тогда как у Blackwell использовался PCIe 5.0 с пропускной способностью вдвое меньше.
Новый формат данных NVFP4
NVFP4 — это 4-битный формат с базовой структурой E2M1 (1 бит знак, 2 — экспонента, 1 — мантисса). Чтобы компенсировать крайне низкую разрядность, используется двухуровневое масштабирование:
- FP8 (E4M3) масштаб применяется к каждому блоку из 16 значений;
- FP32 масштаб — ко всему тензору.
Такой подход позволяет выполнять аппаратное ускорение квантования с гораздо меньшей погрешностью, чем у стандартного FP4 или MXFP4. NVFP4 сохраняет точность, близкую к FP8 (среднее отклонение обычно менее 1%), при этом снижает потребление памяти примерно в 1,8 раза по сравнению с FP8 и до 3,5 раз по сравнению с FP16.
В тестах на моделях (например, DeepSeek-R1-0528) NVFP4 показал почти ту же точность, что FP8: разница составила не более 1%, а в отдельных случаях (AIME 2024) точность NVFP4 оказалась даже на 2% выше, чем у FP8.
Производительность и энергоэффективность
Производительность Blackwell Ultra в NVFP4 выросла с 10 до 15 PFLOPS (в плотных вычислениях), что даёт значительный прирост относительно базового Blackwell.
Не менее важный фактор — энергопотребление. Переход на FP4 снижает нагрузку на память и ускоряет операции. В результате Blackwell Ultra обеспечивает до 50× более высокую энергоэффективность на токен, чем Hopper, и до 200 000× по сравнению с поколением Kepler десятилетней давности.
Подробности о работе NVFP4 и его преимуществах NVIDIA раскрыла в отдельной публикации.
Сокращение FP64-производительности объясняется тем, что Blackwell Ultra оптимизирован в первую очередь под инференс, а также под обучение в форматах с низкой точностью. FP64 в этом сегменте не требуется.
Системы на Blackwell Ultra уже запущены в массовое производство и начинают поставляться первым клиентам. А преемник под кодовым названием Rubin уже прошёл стадию tape-out.
Подписывайтесь на группу Hardwareluxx ВКонтакте и на наш канал в Telegram (@hardwareluxxrussia).
