PCIe 5.0 передає удвічі більше даних, ніж PCIe 4.0, але не робить відеокарту удвічі швидшою. Якщо модель, сцена або пакет даних повністю вміщується у VRAM, графічний процесор виконує більшість роботи у власній пам’яті. Інтерфейс у такому сценарії використовується переважно на початку й наприкінці обчислення.

Купити GPU сервер

Реальна різниця PCIe 4.0 і PCIe 5.0 проявляється в інших умовах: при встановленні кількох GPU, скороченні підключення до x8 або x4, вивантаженні даних у системну пам’ять та постійному обміні між накопичувачами, CPU і відеокартами. Тому правильний підхід — вибирати версію інтерфейсу саме за архітектурою сервера. 

Далі — про порівняння швидкості PCIe 4.0 проти PCIe 5.0 в теорії і на практиці, реальні сценарії використання нового інтерфейсу та практичні поради з вибору. 

PCIe 4.0 vs PCIe 5.0: швидкість і кількість ліній

Оновлення до PCIe 5.0 у GPU-серверах підвищує швидкість передачі даних на одній лінії вдвічі: з 16 до 32 мільярдів трансакцій на секунду (GT/s). У розрахунку повної пропускної здатності PCIe 4.0 і PCIe 5.0 також варто враховувати кількість ліній — x16, x8 і x4 тощо. Розрахунки реальної швидкості, важливі для серверів — у таблиці:

Режим підключення Теоретична максимальна швидкість в одному напрямку Сумарно в обох напрямках Еквівалент за пропускною здатністю
4.0 x16 31,5 ГБ/с 63 ГБ/с PCIe 5.0 x8
4.0 x8 15,8 ГБ/с 31,5 ГБ/с PCIe 5.0 x4
4.0 x4 7,9 ГБ/с 15,8 ГБ/с PCIe 5.0 x2
5.0 x16 63 ГБ/с 126 ГБ/с -
5.0 x8 31,5 ГБ/с 63 ГБ/с PCIe 4.0 x16
5.0 x4 15,8 ГБ/с 31,5 ГБ/с PCIe 4.0 x8

Нагадуємо, що в таблиці наведені теоретичні розрахункові показники, яких неможливо досягти в реальності. Службові операції протоколу, топологія плати, PCIe Switch і контролер пам’яті зменшують фактичну швидкість. Наприклад, у дослідженні спеціалістів Хунанського університету виміряна пропускна здатність PCIe 4.0 x16 у multi-GPU сервері становила 24–26 ГБ/с, а PCIe 5.0 x16 — 52–60 ГБ/с.

Також важливо пам’ятати, що стандарти мають зворотну сумісність. Відеокарта PCIe 5.0 працює у слоті PCIe 4.0, але використовує швидкість четвертого покоління. Аналогічно GPU Gen4 можна встановити у материнську плату Gen5 без підвищення швидкості самої карти.

Коли PCIe дійсно впливає на швидкість GPU

Вплив PCIe на продуктивність GPU визначається кількістю даних, які потрібно переміщувати за межі відеопам’яті (VRAM). Поки обчислення виконуються всередині графічного процесора, ширина зовнішнього інтерфейсу майже не має значення.

У GPU-сервері дані рухаються за трьома основними напрямками:

  • із системної RAM або накопичувача до VRAM;
  • з GPU назад до процесора, RAM чи сховища;
  • між кількома графічними прискорювачами.

Наприклад, у машинному навчанні версія PCIe стає важливою при підготовці великих батчів, завантаженні датасетів, збереженні контрольних точок і синхронізації кількох прискорювачів. Якщо дані подаються повільніше, ніж GPU здатна їх обробляти, обчислювальні блоки простоюють.

Докладніше про сценарії, в яких актуально протиставлення PCIe 4.0 проти PCIe 5.0 — у таблиці:

Робочий сценарій Інтенсивність обміну даними Потреба у Gen5
Інференс моделі, яка повністю вміщується у VRAM Низька після завантаження Мінімальна
GPU-рендеринг сцени всередині VRAM Низька під час рендеру Мінімальна
Пакетний інференс із великим потоком запитів Середня або висока Залежить від розміру пакетів
Навчання нейромереж із постійною подачею датасету Висока Помітна
Вивантаження даних на CPU через нестачу VRAM Дуже висока Критична
Завантаження моделей і перемикання між ними Дуже висока Критична
Сервер із 4–8 GPU без NVLink Висока Рекомендовано
GPUDirect Storage та масив швидких NVMe Висока Рекомендовано

Вузьке місце (PCIe bottleneck) особливо помітне при вивантаженні даних через нестачу VRAM. Коли ваги моделі або KV-кеш не вміщуються у відеопам’ять, вони постійно передаються між RAM і GPU. В описаному вище прикладі завантаження 32-мільярдної моделі на сервер з 8 NVIDIA H20 відновлення або перемикання 32-мільярдної моделі займало близько 2,5 секунди. Завантаження KV-кешу на 64 тисячі токенів для Qwen-7B-Chat формувало до 70% часу видачі першого токена.

Зберігання даних також може створювати обмеження. За даними NVIDIA, у системі з PCIe Switch пряме передавання даних від віддаленого сховища до GPU через GPUDirect Storage може підтримувати близько 50 ГБ/с. Без GDS потік проходить через процесор і обмежується приблизно 25 ГБ/с.

PCIe 4.0 проти PCIe 5.0 у реальних тестах

Раніше ми співставляли PCI Express 4.0 проти PCI Express 5.0, порівнюючи різні версії інтерфейсу при роботі з відеокартою Nvidia GeForce RTX 5090. Наші тести показували такий результат:

Тестове середовище Продуктивність PCIe 4.0 vs PCIe 5.0
5.0 x16 / 5.0 x8 / 4.0 x16 5.0 x4 / 4.0 x8 4.0 x4
DaVinci Resolve 100% 90% 75%
After Effects 100% 95–98% 92–96%
Unreal Engine 100% 96% 93%
Blender + Octane Різниця в межах 2–5%
Llama.cpp Різниця до 6%

Отже, повний інтерфейс Gen4 x16 не є вузьким місцем навіть для флагманської відеокарти. Реальне вузьке місце створює скоріше зменшення кількості ліній, ніж зниження версії інтерфейсу. 

Але результати суттєво змінюються, коли GPU регулярно отримує великі масиви із системної пам’яті. Це характерно для завантаження моделей, CPU offload, відновлення KV-кешу та перемикання між кількома LLM. У згаданому раніше дослідженні Хунанського університету перехід на PCIe 5.0 у GPU-сервері дав такі результати:

  • час видачі першого токена при завантаженні KV-кешу скоротився у 1,14–2,38 раза;
  • перемикання та повторне завантаження моделей прискорилося у 1,12–2,48 раза.

Тобто вища пропускна здатність прискорює GPU-сервер тоді, коли відеокарта не може почати або продовжити обчислення без даних із RAM. У рендерингу чи інференсі всередині VRAM PCIe 4.0 x16 майже не обмежує продуктивність. При CPU offload, довгому контексті та частому перемиканні моделей інтерфейс уже визначає час виконання операції.

Наприклад, якщо обмін через PCIe займає 70% часу операції, подвоєння пропускної здатності теоретично скорочує загальну затримку приблизно на 35%. Коли частка передавання досягає 95%, виграш може наближатися до 48%. Це розрахункова оцінка за умови, що інші етапи виконуються з незмінною швидкістю.

Скільки ліній PCIe потрібно відеокартам у сервері

Лінії PCIe у GPU-сервері розподіляються не лише між графічними прискорювачами. Частину використовують NVMe, мережеві карти, RAID-контролери, плати захоплення та інші пристрої. Тому наявність чотирьох фізичних слотів x16 не гарантує, що всі вони працюватимуть у режимі x16.

Практичні конфігурації PCIe для відеокарт у сервері виглядають так:

Кількість GPU Для рендеру та інференсу Для навчання LLM, HPC і CPU offload
1 GPU 4.0 x16 5.0 x16 із запасом
2 GPU 2 × 4.0 x16 або 2 × 5.0 x8 2 × 5.0 x16
4 GPU 4 × 4.0 x8 4 × 5.0 x8 або x16
8 GPU Серверна топологія з PCIe Switch PCIe 5.0, NVLink або NVSwitch

Також платформа повинна мати достатньо ліній ще до встановлення перемикачів. Наприклад, AMD EPYC 9005 підтримує до 160 ліній PCIe 5.0 залежно від процесора та конфігурації сервера. Такий запас дозволяє під’єднувати кілька прискорювачів, NVMe-масив і швидку мережеву карту без примусового переведення основних GPU у режим x4.

У двопроцесорному сервері важлива й топологія NUMA. Відеокарта повинна отримувати дані від RAM, підключеної до того самого процесора. Перехід через міжпроцесорний інтерфейс додає затримку та може зменшити фактичну пропускну здатність незалежно від покоління PCIe.

GPU-сервер PCIe 4.0 чи PCIe 5.0: що вибрати

GPU-сервер PCIe 4.0 залишається практичним рішенням для однієї або двох відеокарт, якщо кожна отримує повноцінне підключення x16. Така платформа підходить для GPU-рендерингу, локального інференсу, генерації зображень, відеообробки та обчислень, які повністю вміщуються у VRAM.
PCIe 5.0 у GPU-серверах потрібен для щільніших конфігурацій. Новий стандарт дозволяє підключати карти через x8 без зменшення швидкості відносно Gen4 x16, залишаючи більше ліній для NVMe, мережі й контролерів.

GPU-сервер PCIe 5.0 варто вибрати у таких випадках:

  • встановлюються чотири або вісім графічних прискорювачів;
  • моделі чи датасети регулярно вивантажуються у системну RAM;
  • використовується KV cache offload або швидке перемикання моделей;
  • дані надходять із масиву NVMe через GPUDirect Storage;
  • сервер працює з мережею 100/200/400GbE;
  • планується майбутній апгрейд на серверні GPU Gen5.

Переходити з готової платформи PCIe 4.0 у GPU-сервері на Gen5 тільки заради новішої версії інтерфейсу недоцільно. Якщо відеокарта працює у режимі x16, а задача вміщується у VRAM, більший обсяг пам’яті або потужніший GPU дадуть помітніший результат.

Для нового багатокарткового сервера PCIe 5.0 уже є раціональним вибором. Він не подвоює швидкість обчислень, але забезпечує нормальний розподіл ліній між кількома відеокартами та зменшує ризик вузького місця при обміні даними. Саме в цьому полягає реальна перевага Gen5 для AI, HPC і професійних GPU-систем.