Консультативная группа по экосистеме x86 (x86 Ecosystem Advisory Group) опубликовала спецификацию AI Compute Extensions (ACE) — нового набора команд для ускорения ИИ-вычислений в будущих процессорах x86. ACE предусматривает использование специализированных блоков для матричных операций. Аналогичный подход ARM уже реализовала в расширениях Scalable Matrix Extensions 2 (SME2), которые работают совместно с Scalable Vector Extensions 2 (SVE2).
Основная задача ACE — ускорить выполнение матричных вычислений и повысить эффективность работы с форматами данных пониженной точности, включая FP8, FP6, FP4, BF16 и INT8. Такие возможности особенно востребованы при обучении и инференсе ИИ-моделей, где важны высокая вычислительная плотность и экономное использование памяти.
Одним из ключевых элементов ACE стала вычислительная модель на основе тайлов (tiles). Данные загружаются в специальные тайловые регистры, где выполняются матричные умножения и операции внешнего произведения. Тайловая архитектура тесно интегрирована с существующими расширениями AVX и AMX, что позволяет сочетать высокопараллельную векторную обработку со специализированными матричными блоками. Дополнительно предусмотрены регистры масштабирования блоков (block-scale registers), которые обеспечивают гибкое масштабирование числовых значений в ходе матричных вычислений.
Значительное внимание в ACE уделили преобразованию форматов данных. Набор команд поддерживает аппаратно ускоренную конвертацию из традиционных форматов вроде FP32 в форматы пониженной точности FP8, FP6 и FP4, а также преобразования между форматами микромасштабирования MX FP8 и MX INT8, разработанными в рамках инициативы OCP. При этом поддерживаются различные режимы округления, включая round-to-even, round-to-odd и стохастическое округление, что помогает повысить численную точность и стабильность обучения нейросетей.
Кроме того, ACE определяет набор инструкций для управления тайловыми регистрами и перемещения данных. Они отвечают за инициализацию, настройку, загрузку и освобождение тайлового состояния, а также за обмен данными между регистрами AVX и тайловыми регистрами. Дополняют их специализированные инструкции для операций внешнего произведения и матричного умножения, рассчитанные на высокую производительность при выполнении ключевых ИИ-задач.
Спецификацию ACE версии 1.15 уже можно загрузить в формате PDF на сайте x86 Ecosystem Advisory Group.
Судя по имеющейся информации, первые x86-процессоры с поддержкой ACE появятся не раньше 2028 года. Ранее AMD уже упоминала новые матричные блоки в числе особенностей архитектуры Zen 7. Вероятно, именно они обеспечат поддержку набора команд ACE.
Подписывайтесь на группу Hardwareluxx ВКонтакте и на наш канал в Telegram (@hardwareluxxrussia).
