Новости
Последние статьи и обзоры
Intel розкрила подробиці про серверні CPU Clearwater Forest: до 288 E‑ядер Darkmont
-
1234waltz
Member
Пропоную обговорити Intel розкрила подробиці про серверні CPU Clearwater Forest: до 288 E‑ядер Darkmont
12 плиток по 24 ядра. Цікаво, в плитці 24 ядра, чи якась частина площі деактивована через брак і ядер в майбутньому може стати 28-32.
12 плиток по 24 ядра. Цікаво, в плитці 24 ядра, чи якась частина площі деактивована через брак і ядер в майбутньому може стати 28-32.
-
Scoffer
Member
Е-ядра мікроархітектурно ідентичні тим що в Core Ultra 200, але на новому техпроцесі і з кешем L3 по 8 метрів на плитку. Цікаво що це змінить в плані продуктивності.
Відправлено через 4 хвилини 15 секунд:
L3 звичайний сегментний, а не кластерний як в амд, одна плитка - один сегмент, що дає величезний доступний для кожного ядра кеш в 576 метрів. Але, скоріш за все, буде повільним.
Відправлено через 4 хвилини 15 секунд:
L3 звичайний сегментний, а не кластерний як в амд, одна плитка - один сегмент, що дає величезний доступний для кожного ядра кеш в 576 метрів. Але, скоріш за все, буде повільним.
-
Alligator
Member
- Откуда: Миколаїв
враховуючиScoffer: ↑ 26.08.2025 10:14Але, скоріш за все, буде повільним.
це буде ще "експериментальним" та задушеним по частоті та TDP.У процесорах Intel Clearwater Forest буде використовуватися багаточипове компонування з технологією 3D-упаковки Foveros разом із міжкристальними з’єднаннями EMIB.
-
waryag
Member
- Откуда: Суми
18А - це 2nm TSMC? 
-
Scoffer
Member
Тут і до гадалки ходити не треба щоб з'ясувати що коли сегменти в різних чиплетах, то швидко не буде в будь-якому випадку. Втім, якщо це будуть біля 2ггц е-ядра, то їм швидко в наносекундах і не треба насправді. А пропускна спроможність кешу буде страшна, 72 сегменти це тобі не це. Коротше черговий типовий рендерний проц.Alligator: ↑ 26.08.2025 10:49це буде ще "експериментальним" та задушеним по частоті та TDP.
-
Yalg
Member
Очень странная штука, да, ядер много, но кеша крохи, и для чего оно?
Веб серверам на ARM оно по цене не конкурент.
Веб серверам на ARM оно по цене не конкурент.
-
Scoffer
Member
Це тільки в хмарах. А на землі дешевих варіантів на арм небагато. Власне, вони відсутні.Yalg: ↑ 26.08.2025 11:18Веб серверам на ARM оно по цене не конкурент.
-
AssayMAS
Member
- Откуда: ][аркiв
пока не выйдет и поломанный кристалл не засунут под электронный микроскоп не узнаем какой размер у рабочей области при транзисторе 40+нМ на 40+нМ да и какой вид транзистора тоже интересно. Так что "тайна" сия не скоро будет проверенна.waryag: ↑ 26.08.2025 11:0218А - це 2nm TSMC?
-
vmsolver
Member
Кто хотел чиплетов, вот оно будущее, чиплеты чиплетами погоняет. Изменения вроде бы не плохие, посмотрим на выход годных у нового техпроцесса.
Это зависит от частоты меш, сами кеши обычные, не медленные и не быстрые. Слово медленные тут не уместно, если частоту меша поставят низкую, то да, задержки вырастут, но ты представь какая суммарная пропускная способность всех сегментов? Огромная. Вот для этого кеш и делают распределённым, потому что он работает не на одно ядро, а сразу на все, и данные размазаны по всему кешу. Как и у кольца - у каждого ядра нет "своего" сегмента кеша, они все общие и только адрес кеш-линии определяет, в каком сегменте эти данные будут находиться. В этом смысле, кольцо и сетка у такой архитектуры это почти одно и тоже, просто сетка это "расширенное" кольцо, в котором решена главная проблема кольца - плохая масштабируемость по полосе на ядро.Scoffer: ↑ 26.08.2025 10:14що дає величезний доступний для кожного ядра кеш в 576 метрів. Але, скоріш за все, буде повільним.
-
Scoffer
Member
Частота меша до частоти кеша не має ніякого стосунку. Частота меша це про пропускну спроможність, частота кеша про затримки в наносекундах. Ніхто не сумнівається в величезній ПСП. Питання чи не трапиться так що доступ в цей кеш в наносекундах буде одного порядку з оперативою.vmsolver: ↑ 26.08.2025 11:42Это зависит от частоты меш, сами кеши обычные, не медленные и не быстрые.
-
vmsolver
Member
Вот эти частоты как раз и делают одинаковыми, по крайней мере раньше в HEDT так делали, если разгонять сетку, разгоняются и кеши. Не известно как они сейчас сделали, если их разделили то там вообще все проблемы решены, будет и низкая латентность и большая полоса.Scoffer: ↑ 26.08.2025 11:48Частота меша до частоти кеша не має ніякого стосунку. Частота меша це про пропускну спроможність, частота кеша про затримки в наносекундах. Ніхто не сумнівається в величезній ПСП. Питання чи не трапиться так що доступ в цей кеш в наносекундах буде одного порядку з оперативою.vmsolver: ↑ 26.08.2025 11:42Это зависит от частоты меш, сами кеши обычные, не медленные и не быстрые.
-
Scoffer
Member
Раніше і трава зеленіше була) Все давно відв'язане. Більшість останніх здобутків в енергоефективності засновані в асинхронізації всього і вся оптимізації частоти кожного окремого елементу. Бо синхр це звісно прикольно, але ніяких ватів ні на що не вистачить.vmsolver: ↑ 26.08.2025 12:01раньше
-
mrigi
Member
колись їх спишуть і будуть продаватися на аліекспресі по 199 разом з китайською материнкою
-
vmsolver
Member
Не знаю о какой траве ты сейчас говоришь и причем тут она, но причины улучшения энергоэффективности в первую очередь это техпроцесс, разделенные домены меша и кешей мало влияют на энергоэффективность. Асинхронность не всегда хорошо, так как данные между такими системами приходится пропускать через синхронизаторы, а это дополнительная задержка в виде суммы времени тактов обоих доменов. В общем - не сочиняй.Scoffer: ↑ 26.08.2025 12:36 Раніше і трава зеленіше була) Все давно відв'язане. Більшість останніх здобутків в енергоефективності засновані в асинхронізації всього і вся оптимізації частоти кожного окремого елементу. Бо синхр це звісно прикольно, але ніяких ватів ні на що не вистачить.
Итого, нет в подобном решении какой-то медленности как ты говоришь, они сделали хорошу масштабируемую систему, так как все сегменты кеша потенциально доступны для всех ядер.
Интересно какую линейку чипов они сделают и цены на них, тесты AVX10.2 и тому подобное.
-
Scoffer
Member
Рекомендую звернути увагу на затримку кешів в тактах. Вже далеко не перший рік вона дробна і плаваюча, особливо в районі L3.vmsolver: ↑ 26.08.2025 14:11а это дополнительная задержка в виде суммы времени тактов обоих доменов.
- спойлер

-
vmsolver
Member
Ой, божечки, рекомендует он, ты сначала подумай, как та дробная задержка получается, и она не плавает, когда тестовый объем перекрывает объем одного уровня кеша, данные периодически подтягиваются из более медленного верхнего уровня, при усреднении времени доступа получается плавный график.Scoffer: ↑ 26.08.2025 15:01Рекомендую звернути увагу на затримку кешів в тактах. Вже далеко не перший рік вона дробна і плаваюча, особливо в районі L3.
Задержка коммуникации меньше задержки кешей, это всё что надо знать на этом уровне.
Вот выйдут тесты новой платформы - посмотрим конкретные числа.
-
Shuginubi
Member
- Откуда: Махачкала
Любопытно.. С какими P ядрами прошлых поколений можно сравнить Е ядра Darkmoon? Если там уровень 11 поколения, то это очень хорошо.
-
dext
Member
- Откуда: Dnipro
Це тому, що через різні частоти занальна затримка L3 це [X тактів CPU + Y тактів Ring Bus], тому на наведених графіках вже давно маячня, як мінімум для інтеловських ЦПScoffer: ↑ 26.08.2025 15:01 Рекомендую звернути увагу на затримку кешів в тактах. Вже далеко не перший рік вона дробна і плаваюча, особливо в районі L3.
За інтеловськими даташитами частота L3 = Ring Bus, більше того ця шина фізично розташована над слайсами L3, тобто тактувати Ring/L3 по різному технічно неможливо
-
Scoffer
Member
Не знаю шо там з рінг, не вивчав, зато знаю шо там з мешdext: ↑ 27.08.2025 15:46L3 = Ring Bus
https://builders.intel.com/docs/network ... 785299.pdf
сторінка 11
Тобто меш повністю відв'язаний від анкора, на частоті котрого працює ласт левел кеш, і живе своїм власним життям, що і треба було довести. В залежності від навантаження на шину може працювати як повільніше анкора, так і швидше.Description of Mesh/Fabric Frequency Policy -
Default
<10% Mesh = 1.2 GHz/0.8GHz,
10-95% Mesh = Uncore Frequency Scaling (UFS)
>95% Mesh = maximize mesh freq under TDP constraint UFS tuning will vary depending on SKU
Latency optimized (Traditional Perf mode)
Mesh freq = maximize mesh freq under TDP constraint
Підозрюю шо з рінгами приблизно те ж саме відбувається.
Немає ніякого сенсу молотити шину на всіх парах якщо вона не юзається. Це енергонеефективно. Там якщо покопатись, то може вийде шо і кеш не такий вже й прив'язаний до того анкора і можуть бути варіації
-
dext
Member
- Откуда: Dnipro
Читаємо уважніше:Scoffer: ↑ 27.08.2025 17:55 Тобто меш повністю відв'язаний від анкора, на частоті котрого працює ласт левел кеш
Ну і що каже офіційний даташит на "Intel® Xeon® Processor Scalable Family":A major performance-per-power tradeoff is the uncore frequency. Uncore in
this this technical article refers to the coherent fabrics and L3 caches in the
compute chiplets
Uncore це узагальнена назва всього поза ядрами, LLC - L3, CHA - це агенти і т.п.Uncore - The portion of the processor comprising the shared LLC cache, CHA,
IMC, PCU, Utility Box (UBOC), IIO and Intel® UPI modules
Тож не потрібно довільних інтерпретацій, посилайтеся на даташити