> > > > NVIDIA Blackwell Ultra: новые сведения об архитектуре и формат данных NVFP4

NVIDIA Blackwell Ultra: новые сведения об архитектуре и формат данных NVFP4

Опубликовано:

hardwareluxx news newNVIDIA опубликовала в блоге и в техническом документе по архитектуре Blackwell (PDF) новые детали о поколении ускорителей ИИ Blackwell Ultra. Теперь стало ясно, что изменения на уровне аппаратного обеспечения оказались значительно глубже, чем предполагалось ранее.

Главное новшество — двухкристальный дизайн (dual-reticle). Blackwell Ultra состоит из двух кристаллов, объединённых интерфейсом NV-HBI с пропускной способностью 10 ТБ/с. Всего чип насчитывает 208 млрд транзисторов, что в 2,6 раза больше, чем у Hopper, и остаётся полностью совместимым с экосистемой CUDA.

Если чипы первого поколения Blackwell включали 144 потоковых мультипроцессора (SM), то у Blackwell Ultra их уже 160. То есть NVIDIA сделала архитектуру ещё более сложной, но при этом не раскрывает данных о площади кристалла. Можно лишь предположить, что она составляет около 800 мм² или чуть больше, что вплотную приближает чип к пределу современных технологий производства.

Кроме того, на каждую SM-партицию теперь выделяется 256 КБ Tensor Memory (TMEM), которая снижает нагрузку на внешнюю память HBM3E. В Blackwell Ultra увеличена пропускная способность SFU по ключевым инструкциям внимания (например, exp) — до ~2× против Blackwell, что ускоряет производительность операций softmax/attention.

Ещё одно заметное изменение в Blackwell Ultra — переход на память 12-Hi HBM3E общим объёмом 288 ГБ вместо прежних 186 ГБ. Пропускная способность остаётся на уровне 8 ТБ/с, но благодаря увеличенной ёмкости даже один ускоритель способен вместить гораздо более крупные датасеты ИИ-моделей. А в конфигурациях NVL72 общий объём HBM3E достигает 20,7 ТБ.

Сравнение систем Blackwell
  GB300 Grace Blackwell Ultra GB200 Grace Blackwell
GPU Blackwell Ultra Blackwell
CPU Grace Superchip (72 ARM-ядра) Grace Superchip (72 ARM-ядра)
Память CPU 480 ГБ LPDDR5X, 512 ГБ/с 480 ГБ LPDDR5X, 512 ГБ/с
FP4 Tensor Core (Dense/Sparse) 15 / 20 PFLOPS 10 / 20 PFLOPS
FP8/FP6 Tensor Core (Dense/Sparse) 5 / 10 PFLOPS 5 / 10 PFLOPS
INT8 Tensor Core (Dense/Sparse) 157,5 / 315 TFLOPS

105/210 TFLOPS

FP16/BF16 Tensor Core (Dense/Sparse) 2,5 / 5 PFLOPS 2,5 / 5 PFLOPS
TF32 Tensor Core (Dense/Sparse) 1,25 / 2,5 PFLOPS 1,25 / 2,5 PFLOPS
FP32 80 TFLOPS 80 TFLOPS
FP64 Tensor Core (Dense) 1,3 TFLOPS 40 TFLOPS
FP64 1,3 TFLOPS 40 TFLOPS
HBM 288 GB (HBM3E) 186 GB (HBM3E)
Пропускная способность памяти 8 Тбайт/с 8 Тбайт/с
NVLink-Interface 1,8 Тбайт/с 1,8 Тбайт/с
Интерфейс PCIe PCIe 6.0 PCIe 5.0
TDP 1.400 Вт 1.200 Вт
Server-Option GB300 NVL72 GB200 NVL72
Общая емкость HBM 20,7 TB (HBM3E) 13,5 TB (HBM3E)
HBM-Gesamtbandbreite 576 Тбайт/с 576 Тбайт/с

Blackwell Ultra показывает значительно более высокую производительность при вычислениях в формате FP4 — и связано это с введением нового формата данных NVFP4. Однако вычисления в INT8 у Blackwell Ultra, наоборот, заметно ниже — примерно в 32 раза, а производительность в FP64, и без того урезанная по сравнению с Hopper, снижена ещё сильнее.

Мы уже говорили о различии в объёме памяти HBM3E. К этому добавляется рост TDP — с 1200 до 1400 Вт. Соединение GPU и CPU теперь осуществляется по 16 линиям PCIe 6.0 (256 ГБ/с), тогда как у Blackwell использовался PCIe 5.0 с пропускной способностью вдвое меньше.

Новый формат данных NVFP4

NVFP4 — это 4-битный формат с базовой структурой E2M1 (1 бит знак, 2 — экспонента, 1 — мантисса). Чтобы компенсировать крайне низкую разрядность, используется двухуровневое масштабирование:

  • FP8 (E4M3) масштаб применяется к каждому блоку из 16 значений;
  • FP32 масштаб — ко всему тензору.

Такой подход позволяет выполнять аппаратное ускорение квантования с гораздо меньшей погрешностью, чем у стандартного FP4 или MXFP4. NVFP4 сохраняет точность, близкую к FP8 (среднее отклонение обычно менее 1%), при этом снижает потребление памяти примерно в 1,8 раза по сравнению с FP8 и до 3,5 раз по сравнению с FP16.

В тестах на моделях (например, DeepSeek-R1-0528) NVFP4 показал почти ту же точность, что FP8: разница составила не более 1%, а в отдельных случаях (AIME 2024) точность NVFP4 оказалась даже на 2% выше, чем у FP8.

Производительность и энергоэффективность

Производительность Blackwell Ultra в NVFP4 выросла с 10 до 15 PFLOPS (в плотных вычислениях), что даёт значительный прирост относительно базового Blackwell.

Не менее важный фактор — энергопотребление. Переход на FP4 снижает нагрузку на память и ускоряет операции. В результате Blackwell Ultra обеспечивает до 50× более высокую энергоэффективность на токен, чем Hopper, и до 200 000× по сравнению с поколением Kepler десятилетней давности.

Подробности о работе NVFP4 и его преимуществах NVIDIA раскрыла в отдельной публикации.

Сокращение FP64-производительности объясняется тем, что Blackwell Ultra оптимизирован в первую очередь под инференс, а также под обучение в форматах с низкой точностью. FP64 в этом сегменте не требуется.

Системы на Blackwell Ultra уже запущены в массовое производство и начинают поставляться первым клиентам. А преемник под кодовым названием Rubin уже прошёл стадию tape-out.

Подписывайтесь на группу Hardwareluxx ВКонтакте и на наш канал в Telegram (@hardwareluxxrussia).