Intel розкрила подробиці про серверні CPU Clearwater Forest: до 288 E‑ядер Darkmont

Обсуждение статей и новостей сайта
Автор
Повідомлення
1234waltz
Member

Повідомлення

Пропоную обговорити Intel розкрила подробиці про серверні CPU Clearwater Forest: до 288 E‑ядер Darkmont
12 плиток по 24 ядра. Цікаво, в плитці 24 ядра, чи якась частина площі деактивована через брак і ядер в майбутньому може стати 28-32.
Scoffer
Member
Аватар користувача

Повідомлення

Е-ядра мікроархітектурно ідентичні тим що в Core Ultra 200, але на новому техпроцесі і з кешем L3 по 8 метрів на плитку. Цікаво що це змінить в плані продуктивності.

Відправлено через 4 хвилини 15 секунд:
L3 звичайний сегментний, а не кластерний як в амд, одна плитка - один сегмент, що дає величезний доступний для кожного ядра кеш в 576 метрів. Але, скоріш за все, буде повільним.
Alligator
Member
Аватар користувача
Звідки: Миколаїв

Повідомлення

Scoffer: 26.08.2025 10:14Але, скоріш за все, буде повільним.
враховуючи
У процесорах Intel Clearwater Forest буде використовуватися багаточипове компонування з технологією 3D-упаковки Foveros разом із міжкристальними з’єднаннями EMIB.
це буде ще "експериментальним" та задушеним по частоті та TDP.
waryag
Member
Аватар користувача
Звідки: Суми

Повідомлення

18А - це 2nm TSMC? :popcorn:
Scoffer
Member
Аватар користувача

Повідомлення

Alligator: 26.08.2025 10:49це буде ще "експериментальним" та задушеним по частоті та TDP.
Тут і до гадалки ходити не треба щоб з'ясувати що коли сегменти в різних чиплетах, то швидко не буде в будь-якому випадку. Втім, якщо це будуть біля 2ггц е-ядра, то їм швидко в наносекундах і не треба насправді. А пропускна спроможність кешу буде страшна, 72 сегменти це тобі не це. Коротше черговий типовий рендерний проц.
Yalg
Member
Аватар користувача

Повідомлення

Очень странная штука, да, ядер много, но кеша крохи, и для чего оно?
Веб серверам на ARM оно по цене не конкурент.
Scoffer
Member
Аватар користувача

Повідомлення

Yalg: 26.08.2025 11:18Веб серверам на ARM оно по цене не конкурент.
Це тільки в хмарах. А на землі дешевих варіантів на арм небагато. Власне, вони відсутні. :rotate:
AssayMAS
Member
Звідки: ][аркiв

Повідомлення

waryag: 26.08.2025 11:0218А - це 2nm TSMC?
пока не выйдет и поломанный кристалл не засунут под электронный микроскоп не узнаем какой размер у рабочей области при транзисторе 40+нМ на 40+нМ да и какой вид транзистора тоже интересно. Так что "тайна" сия не скоро будет проверенна.
vmsolver
Member
Аватар користувача

Повідомлення

Кто хотел чиплетов, вот оно будущее, чиплеты чиплетами погоняет. Изменения вроде бы не плохие, посмотрим на выход годных у нового техпроцесса.
Scoffer: 26.08.2025 10:14що дає величезний доступний для кожного ядра кеш в 576 метрів. Але, скоріш за все, буде повільним.
Это зависит от частоты меш, сами кеши обычные, не медленные и не быстрые. Слово медленные тут не уместно, если частоту меша поставят низкую, то да, задержки вырастут, но ты представь какая суммарная пропускная способность всех сегментов? Огромная. Вот для этого кеш и делают распределённым, потому что он работает не на одно ядро, а сразу на все, и данные размазаны по всему кешу. Как и у кольца - у каждого ядра нет "своего" сегмента кеша, они все общие и только адрес кеш-линии определяет, в каком сегменте эти данные будут находиться. В этом смысле, кольцо и сетка у такой архитектуры это почти одно и тоже, просто сетка это "расширенное" кольцо, в котором решена главная проблема кольца - плохая масштабируемость по полосе на ядро.
Scoffer
Member
Аватар користувача

Повідомлення

vmsolver: 26.08.2025 11:42Это зависит от частоты меш, сами кеши обычные, не медленные и не быстрые.
Частота меша до частоти кеша не має ніякого стосунку. Частота меша це про пропускну спроможність, частота кеша про затримки в наносекундах. Ніхто не сумнівається в величезній ПСП. Питання чи не трапиться так що доступ в цей кеш в наносекундах буде одного порядку з оперативою.
vmsolver
Member
Аватар користувача

Повідомлення

Scoffer: 26.08.2025 11:48
vmsolver: 26.08.2025 11:42Это зависит от частоты меш, сами кеши обычные, не медленные и не быстрые.
Частота меша до частоти кеша не має ніякого стосунку. Частота меша це про пропускну спроможність, частота кеша про затримки в наносекундах. Ніхто не сумнівається в величезній ПСП. Питання чи не трапиться так що доступ в цей кеш в наносекундах буде одного порядку з оперативою.
Вот эти частоты как раз и делают одинаковыми, по крайней мере раньше в HEDT так делали, если разгонять сетку, разгоняются и кеши. Не известно как они сейчас сделали, если их разделили то там вообще все проблемы решены, будет и низкая латентность и большая полоса.
Scoffer
Member
Аватар користувача

Повідомлення

Раніше і трава зеленіше була) Все давно відв'язане. Більшість останніх здобутків в енергоефективності засновані в асинхронізації всього і вся оптимізації частоти кожного окремого елементу. Бо синхр це звісно прикольно, але ніяких ватів ні на що не вистачить.
mrigi
Member
Аватар користувача

Повідомлення

колись їх спишуть і будуть продаватися на аліекспресі по 199 разом з китайською материнкою
vmsolver
Member
Аватар користувача

Повідомлення

Scoffer: 26.08.2025 12:36 Раніше і трава зеленіше була) Все давно відв'язане. Більшість останніх здобутків в енергоефективності засновані в асинхронізації всього і вся оптимізації частоти кожного окремого елементу. Бо синхр це звісно прикольно, але ніяких ватів ні на що не вистачить.
Не знаю о какой траве ты сейчас говоришь и причем тут она, но причины улучшения энергоэффективности в первую очередь это техпроцесс, разделенные домены меша и кешей мало влияют на энергоэффективность. Асинхронность не всегда хорошо, так как данные между такими системами приходится пропускать через синхронизаторы, а это дополнительная задержка в виде суммы времени тактов обоих доменов. В общем - не сочиняй.

Итого, нет в подобном решении какой-то медленности как ты говоришь, они сделали хорошу масштабируемую систему, так как все сегменты кеша потенциально доступны для всех ядер.

Интересно какую линейку чипов они сделают и цены на них, тесты AVX10.2 и тому подобное.
Scoffer
Member
Аватар користувача

Повідомлення

vmsolver: 26.08.2025 14:11а это дополнительная задержка в виде суммы времени тактов обоих доменов.
Рекомендую звернути увагу на затримку кешів в тактах. Вже далеко не перший рік вона дробна і плаваюча, особливо в районі L3.
спойлер
Зображення
Враховуючи що L3 складається зі слайсів, і до кожного з них різні наносекунди, немає ніякого сенсу городити синхронізацію.
vmsolver
Member
Аватар користувача

Повідомлення

Scoffer: 26.08.2025 15:01Рекомендую звернути увагу на затримку кешів в тактах. Вже далеко не перший рік вона дробна і плаваюча, особливо в районі L3.
Ой, божечки, рекомендует он, ты сначала подумай, как та дробная задержка получается, и она не плавает, когда тестовый объем перекрывает объем одного уровня кеша, данные периодически подтягиваются из более медленного верхнего уровня, при усреднении времени доступа получается плавный график.
Задержка коммуникации меньше задержки кешей, это всё что надо знать на этом уровне.

Вот выйдут тесты новой платформы - посмотрим конкретные числа.
Shuginubi
Member
Аватар користувача
Звідки: Махачкала

Повідомлення

Любопытно.. С какими P ядрами прошлых поколений можно сравнить Е ядра Darkmoon? Если там уровень 11 поколения, то это очень хорошо.
dext
Member
Звідки: Dnipro

Повідомлення

Scoffer: 26.08.2025 15:01 Рекомендую звернути увагу на затримку кешів в тактах. Вже далеко не перший рік вона дробна і плаваюча, особливо в районі L3.
Це тому, що через різні частоти занальна затримка L3 це [X тактів CPU + Y тактів Ring Bus], тому на наведених графіках вже давно маячня, як мінімум для інтеловських ЦП
За інтеловськими даташитами частота L3 = Ring Bus, більше того ця шина фізично розташована над слайсами L3, тобто тактувати Ring/L3 по різному технічно неможливо
Scoffer
Member
Аватар користувача

Повідомлення

Не знаю шо там з рінг, не вивчав, зато знаю шо там з меш
https://builders.intel.com/docs/network ... 785299.pdf
сторінка 11
Description of Mesh/Fabric Frequency Policy -

Default
<10% Mesh = 1.2 GHz/0.8GHz,
10-95% Mesh = Uncore Frequency Scaling (UFS)
>95% Mesh = maximize mesh freq under TDP constraint UFS tuning will vary depending on SKU


Latency optimized (Traditional Perf mode)
Mesh freq = maximize mesh freq under TDP constraint
Тобто меш повністю відв'язаний від анкора, на частоті котрого працює ласт левел кеш, і живе своїм власним життям, що і треба було довести. В залежності від навантаження на шину може працювати як повільніше анкора, так і швидше.
Підозрюю шо з рінгами приблизно те ж саме відбувається.
Немає ніякого сенсу молотити шину на всіх парах якщо вона не юзається. Це енергонеефективно. Там якщо покопатись, то може вийде шо і кеш не такий вже й прив'язаний до того анкора і можуть бути варіації :rotate:
dext
Member
Звідки: Dnipro

Повідомлення

Scoffer: 27.08.2025 17:55 Тобто меш повністю відв'язаний від анкора, на частоті котрого працює ласт левел кеш
Читаємо уважніше:
A major performance-per-power tradeoff is the uncore frequency. Uncore in
this this technical article refers to the coherent fabrics and L3 caches in the
compute chiplets
Ну і що каже офіційний даташит на "Intel® Xeon® Processor Scalable Family":
Uncore - The portion of the processor comprising the shared LLC cache, CHA,
IMC, PCU, Utility Box (UBOC), IIO and Intel® UPI modules
Uncore це узагальнена назва всього поза ядрами, LLC - L3, CHA - це агенти і т.п.

Тож не потрібно довільних інтерпретацій, посилайтеся на даташити
Відповісти