Ентузіасти знайшли спосіб активувати масштабування AMD FSR 4 на відеоадаптерах Radeon RX 7000

Обсуждение статей и новостей сайта
Автор
Повідомлення
Enjthesilence
Member
Аватар користувача

Повідомлення

l-m: 19.06.2025 12:12 Enjthesilence
я - так, ти - ні
будь ласка розбирись в питані і не вкидуй цей свій брєдік. рей реконстракшан і длсс абсолютно різні технології і втрата продуктивності з рей реконстракшном, задача якого прибирати шуми і артефакти про використані ретерйсингу і апскейлер - це фундаментально різні речі. я розумію твоє бажання виправдати оптіскейлер, але якщо коротко втрати продуктивності у 2080 на порядок менші ніж у 7000 радеонів з оптіскейлером фср4, це просто факт, не засмучуйся.
Melofon
Member
Аватар користувача
Звідки: Николаев

Повідомлення

Ortyomko: 19.06.2025 11:37
чуть не поняв. типу моделей малувато?
Да он почему-то думал что их уже вообще нет, то есть не продают уже, а так моделей достаточно, вроде не особо меньше чем было после старта продаж.
l-m
Member

Повідомлення

Enjthesilence
навіщо ти цю маячню пишеш? З DLSS3 - 57 фпс, з DLSS4 - 38, і там, і там однаково увімкнений рей реконстракшн.
Enjthesilence
Member
Аватар користувача

Повідомлення

l-m: 19.06.2025 12:23 Enjthesilence
навіщо ти цю маячню пишеш? З DLSS3 - 57 фпс, з DLSS4 - 38, і там, і там однаково увімкнений рей реконстракшн.
це тест РЕЙРЕКОНСТРАКШН технології, це не АПСКЕЙЛЕР як фср4. Щоб побачити різницю в продуктивності трансформера і снн саме в апскейлері, треба ВИМКНУТИ рейрейконстракшн і залишити лише АПСКЕЙЛЕР. Наприклад фреймген - також входить в пакет ДЛСС і не повіріш втрата продуктивності там не відповідає втраті продуктивності чисто з апскейлером, тому що це різні технології. Тобі важко зрозуміти, що сама по собі технологія рейреконстракшену різних моделей має різний вплив на продуктивність? підказую тобі, знайди тест саме апскейлера. рейреконстракшн - це більш важка до тензорів технолгія за апскейлер.
Востаннє редагувалось 19.06.2025 12:38 користувачем Enjthesilence, всього редагувалось 1 раз.
Ortyomko
Member
Аватар користувача
Звідки: Дніпро

Повідомлення

з таким падінням ФПС, може є сенс порівняти як буде працювати взагалі без оцього апскейлера?
Бо щось якась цікава тенденція пішла, вже змагаються у кого апскейлер краще, і це важливіше за рідний фпс у рідній роздільній здатності.
l-m
Member

Повідомлення

Enjthesilence: 19.06.2025 12:27Наприклад фреймген - також входить в пакет ДЛСС і не повіріш втрата продуктивності там не відповідає втраті продуктивності чисто з апскейлером
Логічно, адже більше навантаження від кращої моделі = більший ботлнек = більша посадка продуктивності. Визнаю, з рейреконстракшеном як раз є упор у тензори, якого так не хотів попередній дописувач.
Enjthesilence: 19.06.2025 12:27знайди тест саме апскейлера
ну 20% у кіберпанку
kairo
Member
Аватар користувача
Звідки: Україна

Повідомлення

l-m: 19.06.2025 02:32Ну на RTX 2000 провал продуктивності з DLSS4 приблизно такий самий як на RX 7000 з FSR4, але абсолютно всім байдуже
І тензори на RTX 2000 є, але щось не допомогли
Провал на цілих 1-2% відсотка, жесть. Із такими втратами на RTX20 просто неможливо грати...
спойлер
erkins007
Member
Аватар користувача

Повідомлення

l-m: 19.06.2025 11:50Єсли да каби...
На 2080 повільніше 4 версія на 20-30%, інколи буває й більше, ось, наприклад 2080Ti на 35%
Вы RR и обычный DLSS различаете?
Реконструкция лучей требует огромной тензорной мощи и будет влиять на фпс на всех картах слабее 4090.
Обычный же dlls апскейлер прекрасно работает и на 30 и на 20 серии.

Отправлено спустя 2 минуты 23 секунды:
kairo: 19.06.2025 12:41
l-m: 19.06.2025 02:32Ну на RTX 2000 провал продуктивності з DLSS4 приблизно такий самий як на RX 7000 з FSR4, але абсолютно всім байдуже
І тензори на RTX 2000 є, але щось не допомогли
Провал на цілих 1-2% відсотка, жесть. Із такими втратами на RTX20 просто неможливо грати...
спойлер
Во, спасибо. Потому что этот кадр без иначе бы не успокоился.
Enjthesilence
Member
Аватар користувача

Повідомлення

l-m: 19.06.2025 12:37
Enjthesilence: 19.06.2025 12:27Наприклад фреймген - також входить в пакет ДЛСС і не повіріш втрата продуктивності там не відповідає втраті продуктивності чисто з апскейлером
Логічно, адже більше навантаження від кращої моделі = більший ботлнек = більша посадка продуктивності. Визнаю, з рейреконстракшеном як раз є упор у тензори, якого так не хотів попередній дописувач.
Enjthesilence: 19.06.2025 12:27знайди тест саме апскейлера
ну 20% у кіберпанку
я знайшов на 17%, але там реддіт і резолюшн в людині дуже високий. так от навіть якщо і 20% при тому що це карта 2018 року і 7900хтх 2022 року, яка втрачає від 30 до 50% з оптіскейлером, яка має сенс лише в 4к. особисто тестив лише на 3080 і там взагалі мізер був від 2 до 10% максимум.
я відверто хотів би щоб всі мали змогу грати з новими апскейлерами, але ж люди досі вірять що те мильне одоробало ТАА в сучасних іграх - краще тільки тому що це "натив".
Alekss
Member

Повідомлення

l-m: 19.06.2025 11:50
Alekss: 19.06.2025 10:47Что нужно сделать, чтобы заработал FSR4 на RDNA3 (RX 7000)?

Нужно всего-то взять инструкцию fp8 c 8 битной точностью, которая предназначена для (Wave MMA) ai accelerator RDNA4 (RX 9000), и путем пере писания логики (заменить все вызовы FP8 ядер, на FP16 эмулируемые версии), отдать ее на исполнение alu fp16. Например: вместо обработки обычных задач по вычислению графики, или добавить их дополнительно загрузив GPU.

Почему все удивляются потере -30% или -50% производительности при этом, я не понимаю. Это как умножать 16 битное число в столбик, вместо 8 битного на калькуляторе.
Невірно, у RDNA3 теж є WMMA - https://gpuopen.com/learn/wmma_on_rdna3/
Емулювати FP8 через FP16 потрібно, перекладати на "alu fp16" - ні.
Але продуктивність у RDNA3 з FP8 буде значно гірше ніж у RDNA4, тому й падіння.

В ідеалі, AMD має навчити окрему модель FP16 з меншими параметрами для RDNA3, вища точність може компенсувати деяку втрату якості зображення через малий розмір моделі. Але їм це не цікаво, тож маємо що маємо.

erkins007: 19.06.2025 11:02 Если нет упора в тензоры, то разница 10%. Учитывая разницу в качестве она оправдана.
Єсли да каби...
На 2080 повільніше 4 версія на 20-30%, інколи буває й більше, ось, наприклад 2080Ti на 35%
Насколько я помню WMMA-блоки fp16 (bf16) на rdna3 довольно примитивные (1 поколения FP16 (E5M10) и BF16) и вряд ли эмулятор перепишет их так, чтобы fp8 (эмулированная RDNA4 (E4M3/E5M2) инструкция обрабатывалась именно на WMMA-блоках Fp16 Ai accelerator RDNA3 (смотри слайд - падение производительности ровно в 2 или 4 раза). В блоке RDNA3 WMMA-ai accelerator присутствует только 1 блок для расчета fp16 (смотри 2 слайд), второй используется для расчетов in4.
fp8 support instruction rdna_4_2 — копия.png
rdna3 ai core matrix_1.png
Я даже не представляю, что это будет за такой эмулятор! AMD сразу же купит его для себя. Также я не уверен, что в поколении RDNA3 можно было в отличии от RDNA4 исполнять fp16 инструкции на WMMA-блоках Ai accelerator параллльно за 1 такт (1 отдавать на SIMD-ALU fp32 + 1 на WMMA-блоки fp16 (bf16). Это все равно займет тот же цикл производительности. Не зря ведь, для использования FSR 3.1 в RDNA3 расчеты производятся на уровне драйвера SIMD-ALU fp32, а не на матричных WMMA-блоки fp16 (bf16).

Поэтому я и сделал вывод, что эмулировав WMMA матричные инструкции FP8 RDNA4 на FP16 RDNA3 будет использоваться обычные шейдерные SIMD-ALU fp32 для расcчета, с потерей производительности в -30% и -50%, что и наблюдается.
To4kaU
Member

Повідомлення

Enjthesilence: 19.06.2025 12:27
l-m: 19.06.2025 12:23 Enjthesilence
навіщо ти цю маячню пишеш? З DLSS3 - 57 фпс, з DLSS4 - 38, і там, і там однаково увімкнений рей реконстракшн.
це тест РЕЙРЕКОНСТРАКШН технології, це не АПСКЕЙЛЕР як фср4. Щоб побачити різницю в продуктивності трансформера і снн саме в апскейлері, треба ВИМКНУТИ рейрейконстракшн і залишити лише АПСКЕЙЛЕР. Наприклад фреймген - також входить в пакет ДЛСС і не повіріш втрата продуктивності там не відповідає втраті продуктивності чисто з апскейлером, тому що це різні технології. Тобі важко зрозуміти, що сама по собі технологія рейреконстракшену різних моделей має різний вплив на продуктивність? підказую тобі, знайди тест саме апскейлера. рейреконстракшн - це більш важка до тензорів технолгія за апскейлер.
Немає сенсу взагалі йому щось доводити, в його фантазіях, 7600х по продуктивності, як core 265k.
Alekss
Member

Повідомлення

Ortyomko: 19.06.2025 12:33 з таким падінням ФПС, може є сенс порівняти як буде працювати взагалі без оцього апскейлера?
Бо щось якась цікава тенденція пішла, вже змагаються у кого апскейлер краще, і це важливіше за рідний фпс у рідній роздільній здатності.
В данной технологии использования FSR4 на RDNA3 рассматривается исключительно в native, без использования upscaler. Смысл включения FSR4 на картах RX 7900 и возможно RX 6900 - получить качество сглаживания FSR4 в тех играх, которые FSR4 доступно. Не хватает видимо владельцам RX 7900 XTX качества сглаживания FSR 3.1 и они решили, что использовав FSR4 улучшат визуально картинку даже в -50% производительности. Есть много примеров и тестов на youtube, когда включая сглаживание fsr 3.1 появляются артефакты в виде мерцания текстур, гостинга (шлейфа) итд.

Это видно очень хорошо тут. На примере RX 9070 и Oblivion Remastered + FSR 3.1 vs FSR 4.



Это исключительно мое мнение - возможно я ошибаюсь и владельцы очень производительных GPU уровня RX 7900 XT (XTX) играют с upscaler.
HaruMamberu
Member
Аватар користувача
Звідки: Київ

Повідомлення

Tiufin: 18.06.2025 22:28
Misanthrop: 18.06.2025 19:35

Ще подивимось, бо це поки перші спроби. Не треба недооцінювати комьюніті.
Колись і про емулятор пс3 казали неможливо, а зараз вже транслятор інструкцій чувак запілив, що воно ще трохи і краще нативу буде працювати.
А з ФСР4 набагато менше гемору
ну от що за люди :D якщо на платі фізично немає блоків, які мають робити ті обчислення, то як софт із цим допоможе?
Я не дуже в курсі деталей щодо емулятора пс3. Але пс3 в якому році вийшла? І через скільки років комп'ютерне залізо змогло нормально той емулятор потягнути, і наскільки більш потужним, ніж пс3, воно мало бути?
Чого це з фср4 менше гемору, якщо воно вимагає окремих фізичних блоків на чіпі?
дайте, будь ласка, деталі стосовно вимог fsr 4 до специфічних блоків
Святой
Member
Звідки: Украина

Повідомлення

vmsolver: 18.06.2025 19:56
starik_0: 18.06.2025 17:30 я может чего то не понимаю то у меня на фарминг симулятор 22 с fsr 1 на качестве фпс меньше чем вообще без него. карта 1063
У Паскалей поддержка даже FP16 чисто номинальная и она точно не быстрее FP32, поэтому нет, эти новые нейроплюшки не для Паскалей, увы, Паскали устарели аппаратно.
У меня сейчас на Titan Xp при активации FSR вырастает количество кадров в секунду. Какая версия работает то тогда? Разница в FPS с нативом есть же...
vmsolver
Member
Аватар користувача

Повідомлення

Святой: 20.06.2025 07:28 У меня сейчас на Titan Xp при активации FSR вырастает количество кадров в секунду. Какая версия работает то тогда? Разница в FPS с нативом есть же...
В моём сообщение речь была о другом, о том что новые апскейлеры использующие матричные ускорители, а также более мелкие типы данных, не могут быть задействованы на старом железе. Это значит FSR, который вы запустили старой версии, он работает на обычных АЛУ, но качество до нейросетевых апскейлеров не дотягивает и этот разрыв будет только увеличиваться. Паскали уже устарели в этом плане.
Tiufin
Member

Повідомлення

HaruMamberu: 20.06.2025 00:09
Tiufin: 18.06.2025 22:28
ну от що за люди :D якщо на платі фізично немає блоків, які мають робити ті обчислення, то як софт із цим допоможе?
Я не дуже в курсі деталей щодо емулятора пс3. Але пс3 в якому році вийшла? І через скільки років комп'ютерне залізо змогло нормально той емулятор потягнути, і наскільки більш потужним, ніж пс3, воно мало бути?
Чого це з фср4 менше гемору, якщо воно вимагає окремих фізичних блоків на чіпі?
дайте, будь ласка, деталі стосовно вимог fsr 4 до специфічних блоків
Та ті, амд просто так додало тензорні ядра у новому поколінні, від нічого робити (а до того це просто так зробила нвідіа). Добре, продовжуйте шукати теорії змови, мені все одно впринципі :D
HaruMamberu
Member
Аватар користувача
Звідки: Київ

Повідомлення

Tiufin: 20.06.2025 20:20
HaruMamberu: 20.06.2025 00:09 дайте, будь ласка, деталі стосовно вимог fsr 4 до специфічних блоків
Та ті, амд просто так додало тензорні ядра у новому поколінні, від нічого робити (а до того це просто так зробила нвідіа). Добре, продовжуйте шукати теорії змови, мені все одно впринципі :D
та я наче лише деталі попросив :spy:
Tiufin
Member

Повідомлення

HaruMamberu: 06.07.2025 00:58
Tiufin: 20.06.2025 20:20
Та ті, амд просто так додало тензорні ядра у новому поколінні, від нічого робити (а до того це просто так зробила нвідіа). Добре, продовжуйте шукати теорії змови, мені все одно впринципі :D
та я наче лише деталі попросив :spy:
На, читай:
спойлер
Ось детальний огляд вимог FidelityFX Super Resolution 4 (FSR 4) від AMD до специфічних апаратних блоків відеокарт, які необхідні для ефективної роботи цієї технології. FSR 4 використовує передові алгоритми, зокрема машинне навчання, для покращення якості зображення та продуктивності в іграх, тому потребує певних апаратних компонентів. Розглянемо їх по черзі:

1. AI-акселератори (AI Accelerators)Функція: Прискорюють обчислення, пов’язані з машинним навчанням, яке лежить в основі алгоритмів FSR 4.
Вимоги: Підтримка операцій з низькою точністю, таких як INT8 (8-бітні цілі числа) та FP16 (16-бітні числа з плаваючою комою).

Можливість швидко обробляти великі обсяги даних для нейронних мереж, що покращують зображення.

Чому це важливо: AI-акселератори забезпечують високу продуктивність при виконанні задач машинного навчання, дозволяючи FSR 4 досягати якісного масштабування зображень без значного падіння частоти кадрів.

2. Блоки WMMA (Wave Matrix Multiply Accumulate)Функція: Виконують матричні обчислення, які є ключовими для алгоритмів машинного навчання в FSR 4.
Вимоги: Підтримка операцій з 8-бітними числами з плаваючою комою (FP8) для ефективного виконання матричних множень і накопичень.
Оптимізація для прискорення обчислень у нейронних мережах.
Чому це важливо: Блоки WMMA дозволяють відеокартам швидко обробляти складні обчислення, що сприяє як підвищенню продуктивності, так і якості зображення в іграх.

3. Прискорювачі для нейронної візуалізаціїФункція: Оптимізують задачі нейронної візуалізації, що є частиною технології FSR 4.
Вимоги: Підтримка складних обчислень для генерації та покращення зображень у реальному часі.
Забезпечення високої якості зображення при збереженні стабільної частоти кадрів.

Чому це важливо: Ці прискорювачі критично необхідні для роботи нейронних мереж, які покращують візуальну складову ігор, зберігаючи баланс між якістю та продуктивністю.



4. Покращені обчислювальні блоки (Compute Units, CU)Функція: Виконують загальні обчислення для графічних задач і задач машинного навчання.
Вимоги: Підтримка нових інструкцій і операцій, специфічних для FSR 4.
Наявність подвійних векторних блоків SIMD32 з двома арифметично-логічними пристроями (ALU) та одним блоком для обробки трансцендентних чисел (TLU).
Чому це важливо: Покращені CU забезпечують додаткову обчислювальну потужність, що дозволяє відеокартам справлятися зі складними задачами FSR 4 без значного впливу на продуктивність.

5. Блоки для прискорення генерації кадрівФункція: Підтримують технологію AMD Fluid Motion Frames (FMG) 2, інтегровану в FSR 4.
Вимоги: Генерація додаткових кадрів у реальному часі для підвищення плавності ігрового процесу.
Забезпечення високої частоти кадрів у динамічних сценах.

Чому це важливо: Ці блоки покращують ігровий досвід, генеруючи додаткові кадри, що робить геймплей більш плавним, особливо у вимогливих іграх



Висновок:
Для роботи FSR 4 відеокарта повинна мати AI-акселератори, блоки WMMA, прискорювачі для нейронної візуалізації, покращені обчислювальні блоки та блоки для прискорення генерації кадрів. Ці апаратні компоненти разом забезпечують необхідну обчислювальну потужність і оптимізацію, щоб технологія могла ефективно покращувати якість зображення та продуктивність у сучасних іграх.
І що це змінило? Таким як ти все одно нічого не докажеш
Відповісти