Приятная новость! Techpowerup начал публиковать Matrix Performance в dense (TOPS, TFLOPS).

Видеокарты, графические процессоры, драйверы
Відповісти
Автор
Повідомлення
Alekss
Member

Повідомлення

TechPowerUp — ресурс, стоящий за GPU-Z, начал указывать Matrix Performance в dense-режиме, без учёта Sparse Matrix и низко точных форматов вроде NVFP4/NVFP8.

Зачем это полезно? Nvidia уже 4 года рассказывает покупателям и журналистам о 500-1000 Ai Tops, публикуя раздутые показатели в (2 - 4 раза) Matrix Performance своих GPU. Мелким шрифтом при этом (редко) указывается, что цифры получены в режиме NVFP8/NVFP4 + Sparse Matrix.

AMD и intel всегда четко указывают режим dense (dense = полный расчёт, без пропуска нулевых весов, как в Sparse Matrix) производительность своих GPU. В итоге GPU Nvidia в 99% случаев своей работы показывают исключительно dense производительность, что и публикует Techpowerup.

Режимы эти реальны (NVFP8/NVFP4), но для 99% задач бесполезны - как и Sparse Matrix в целом. В итоге: в реальной работе GPU Nvidia почти всегда выдают только dense-производительность, а именно её теперь и публикует TechPowerUp. Если сравнивать честные dense-показатели Matrix Performance, картина куда прозрачнее: у всех GPU после RTX 3000 и RX 7000 они стандартны и предсказуемы.

Отдельный момент - RX 6000 (RDNA2): формально Matrix-инструкции там тоже есть, но реализованы через эмуляцию dp4a, и точный расчёт официально сложен (AMD его не публикует). Можно лишь сказать, что int8 Matrix (TOPS) для RDNA2 не отличается от обычного int8: если RX 6900 XT показывает 46 TFLOPS FP16, то Matrix Performance (int8 TOPS) через dp4a-эмуляцию будет ≈92 AI TOPS.

Matrix Performance: что означают режимы?
GPU считает Matrix-операции в разной точности. Чем ниже точность (меньше бит на число), тем выше показатель TFLOPS/TOPS — это не "ускорение" в чистом виде, а просто более грубые числа, которые быстрее умножаются.

GeForce RTX 5070 Ti и Radeon RX 9070 XT (данные TechPowerUp, dense-режим)
unknown_2026.08.14-12.49.png
Наиболее полезные для пользователя: INT8 (TOPS), FP8 (TFLOPS), FP16 (TFLOPS) — именно эти режимы реально используются при локальном запуске LLM, квантизации моделей (Q8,Q6,Q4)(GGUF, GPTQ, AWQ) и большинстве современных inference-движков (llama.cpp, vLLM, TensorRT-LLM).
Вкладення
unknown_2026.08.14-12.08.png
unknown_2026.08.14-12.06.png
Відповісти