vsx: ↑
30.05.2025 10:36
Alekss: ↑
29.05.2025 23:35
К сожалению это не так. Вам нужно смотреть на показатели int8, а не int4. Показатели Ai TOPS по стандарту считаются в int8. AMD указывает 2 показателя Ai tops int8 и Int4, которые в 2 раза больше. Nvidia публикует показатели Ai Tops в Int8. Ai Tops RTX 5070 равен 988, RX 9070 равен 583 Ai TOPS, что на 40% меньше.
Что по отставанию на 1 поколение в матричных вычислениях то это так и есть (это еще мягко сказано).
Вот таблица int4 и int8 для nvidia и amd. Где там разница в 40% и отставание на 1 поколение?
Screenshot_7.png
Screenshot_9.png
Я не знаю, что там публикует videocardz в своей таблице. В архитектуре GPU RDNA AMD есть некая особенность, а именно достижении пиковых значений FLOPS, TOPS в очень ограниченных сценариях, в которых они практически никогда не используются. Я не буду сейчас описывать почему это происходит, это потребует отдельной большой статьи. Если сравнивать не показатели Ai TOPS,а возможности архитектуры, то AMD даже в RDNA4 ничего особо нового не добилась в тензорных вычислениях, кроме точности FP8, которое представила как достижение. Даже Intel B580 будет намного производительней.
Это значит, что для того чтобы достичь этих показателей игра например, или приложение должны специально быть оптимизированы под это (выполнять (упаковывать) 2 инструкции вместо 1 например, но никто этого делать из разработчиков не будет под AMD). Поэтому, я бы с большой долей иронии рассматривал публикуемые AMD показатели Ai TOPS и TFLOPS с удвоенными значениями. В таблице videocardz есть примечание для AMD w/ sparsity (с разреженностью). Возможно это как раз то, что я отметил выше.
Вот например есть другая таблица с описанием, где упоминается, что исключается разреженность в показателях:
Наши рейтинги фокусируются на пиковой производительности для точности INT8, которая является наиболее распространенной метрикой для оценки возможностей вывода ИИ. Мы исключаем разреженность, чтобы обеспечить более точное отражение производительности ИИ в плотных вычислительных сценариях, где оптимизации разреженности могут быть неприменимы. Для SoC результаты отражают пиковую производительность интегрированного NPU.
https://laptopmedia.com/ai-hardware-per ... op/#page/1
Я уже более года столкнулся с такой темой под названием - не существует общепризнанного бенчмарка, типа 3dmark, в котором можно измерить показатели Ai Tops. Поэтому, Nvidia и AMD публикуют какие-то цифры Ai tops, которые никто проверить, или опровергнуть не может. Также, возможности RDNA4 вполне сопоставимы с Blakwell а именно чистая (бесполезная) производительность int8, FP8. Для AMD Это достижение (FSR4), а для Nvidia ничего особенного.
Вам нужно не увлекаться цифрами Aitops (FP8, int8) а понять очень важную тему. Все программное обеспечение для матричных и тензорных вычислений (98%) в мире пишется под и на api Nvidia Cuda. Поэтому, любые сценарии где используются матричные (тензорные) вычисления развалятся, когда Nvidia покажет 100% производительности, а AMD 50% или 30%. Даже при одинаковых показателях Ai Tops int8, AMD придется использовать API Vulcan или фремйворк RocM, чтобы не то, что достигнуть каких-то показателей, а даже запустить такое приложение.
Нужно понимать, что int8, и даже int4 Ai Tops можно посчитать и в RDNA2 (RX 6950XT). Эти инструкции могут использовать даже процессоры для смартфонов, например Qualcomm Snapdragon 7 gen 3 (int4+INT8), или ранее выпущенный среднего сегмента Snapdragon 6 Gen 1 (INT8+INT16).
vsx: ↑
30.05.2025 10:36
Alekss: ↑
29.05.2025 23:35
К сожалению это не так. Вам нужно смотреть на показатели int8, а не int4. Показатели Ai TOPS по стандарту считаются в int8. AMD указывает 2 показателя Ai tops int8 и Int4, которые в 2 раза больше. Nvidia публикует показатели Ai Tops в Int8. Ai Tops RTX 5070 равен 988, RX 9070 равен 583 Ai TOPS, что на 40% меньше.
Что по отставанию на 1 поколение в матричных вычислениях то это так и есть (это еще мягко сказано).
Вот таблица int4 и int8 для nvidia и amd. Где там разница в 40% и отставание на 1 поколение?
Что до оставания на 1 поколение Tensor core Amd от Nvidia имеется ввиду, что Tensor core Nvidia могут работать c точностью FP4, а AMD с FP8 (как прошлое поколение RTX 4000 Ada lovelace). Я об этом упомянул в своем предыдущем посте.
Alekss: ↑
29.05.2025 23:35
vsx: ↑
29.05.2025 14:03
Какое еще отставание на 1 поколение? У RX 9070 топсов больше чем у 5070, 578 против 494. У 5060Ti и того меньше
Что по отставанию на 1 поколение в матричных вычислениях то это так и есть (это еще мягко сказано).
0 поколение: Nvidia тензорные вычисления ввела в 2017 году в архитектуре Volta (Tesla V100).
1 поколение: В десктопных GPU появились в 2018 (Turing RTX 2000)
2 поколение: в 2020 году RTX 3000 Ampere
3 поколение: в 2022 году RTX 4000 Ada Lovelace появилась точность (FP8)
4 поколение: в 2025 году RTX 5000 Blackwell точность (FP4)
1 поколение: условно матричных (тензорных) BF16 (практически бесполезных), появилось у AMD в 2022 году в архитектуре RDNA3 (сразу после покупки Хilinx). Nvidia к этому времени выпустила 3 поколение матричных (тензорных) в своих GPU, архитектуре RTX 4000 Ada Lovelace появилась точность (FP8).
2 поколение: матричных (тензорных) вычислений AMD представила только в 2025 году в архитектуре RDNA 4 (точность FP8). И они по производительности сразу сравнялись с 3 поколением RTX 4000 Ada Lovelace.
Поэтому AMD отстает на 1 поколение от NVidia в матричных (тензорных) вычислениях.