PCIe 5.0 передає удвічі більше даних, ніж PCIe 4.0, але не робить відеокарту удвічі швидшою. Якщо модель, сцена або пакет даних повністю вміщується у VRAM, графічний процесор виконує більшість роботи у власній пам’яті. Інтерфейс у такому сценарії використовується переважно на початку й наприкінці обчислення.
Реальна різниця PCIe 4.0 і PCIe 5.0 проявляється в інших умовах: при встановленні кількох GPU, скороченні підключення до x8 або x4, вивантаженні даних у системну пам’ять та постійному обміні між накопичувачами, CPU і відеокартами. Тому правильний підхід — вибирати версію інтерфейсу саме за архітектурою сервера.
Далі — про порівняння швидкості PCIe 4.0 проти PCIe 5.0 в теорії і на практиці, реальні сценарії використання нового інтерфейсу та практичні поради з вибору.
PCIe 4.0 vs PCIe 5.0: швидкість і кількість ліній
Оновлення до PCIe 5.0 у GPU-серверах підвищує швидкість передачі даних на одній лінії вдвічі: з 16 до 32 мільярдів трансакцій на секунду (GT/s). У розрахунку повної пропускної здатності PCIe 4.0 і PCIe 5.0 також варто враховувати кількість ліній — x16, x8 і x4 тощо. Розрахунки реальної швидкості, важливі для серверів — у таблиці:
| Режим підключення | Теоретична максимальна швидкість в одному напрямку | Сумарно в обох напрямках | Еквівалент за пропускною здатністю |
| 4.0 x16 | 31,5 ГБ/с | 63 ГБ/с | PCIe 5.0 x8 |
| 4.0 x8 | 15,8 ГБ/с | 31,5 ГБ/с | PCIe 5.0 x4 |
| 4.0 x4 | 7,9 ГБ/с | 15,8 ГБ/с | PCIe 5.0 x2 |
| 5.0 x16 | 63 ГБ/с | 126 ГБ/с | - |
| 5.0 x8 | 31,5 ГБ/с | 63 ГБ/с | PCIe 4.0 x16 |
| 5.0 x4 | 15,8 ГБ/с | 31,5 ГБ/с | PCIe 4.0 x8 |
Нагадуємо, що в таблиці наведені теоретичні розрахункові показники, яких неможливо досягти в реальності. Службові операції протоколу, топологія плати, PCIe Switch і контролер пам’яті зменшують фактичну швидкість. Наприклад, у дослідженні спеціалістів Хунанського університету виміряна пропускна здатність PCIe 4.0 x16 у multi-GPU сервері становила 24–26 ГБ/с, а PCIe 5.0 x16 — 52–60 ГБ/с.
Також важливо пам’ятати, що стандарти мають зворотну сумісність. Відеокарта PCIe 5.0 працює у слоті PCIe 4.0, але використовує швидкість четвертого покоління. Аналогічно GPU Gen4 можна встановити у материнську плату Gen5 без підвищення швидкості самої карти.
Коли PCIe дійсно впливає на швидкість GPU
Вплив PCIe на продуктивність GPU визначається кількістю даних, які потрібно переміщувати за межі відеопам’яті (VRAM). Поки обчислення виконуються всередині графічного процесора, ширина зовнішнього інтерфейсу майже не має значення.
У GPU-сервері дані рухаються за трьома основними напрямками:
- із системної RAM або накопичувача до VRAM;
- з GPU назад до процесора, RAM чи сховища;
- між кількома графічними прискорювачами.
Наприклад, у машинному навчанні версія PCIe стає важливою при підготовці великих батчів, завантаженні датасетів, збереженні контрольних точок і синхронізації кількох прискорювачів. Якщо дані подаються повільніше, ніж GPU здатна їх обробляти, обчислювальні блоки простоюють.
Докладніше про сценарії, в яких актуально протиставлення PCIe 4.0 проти PCIe 5.0 — у таблиці:
| Робочий сценарій | Інтенсивність обміну даними | Потреба у Gen5 |
| Інференс моделі, яка повністю вміщується у VRAM | Низька після завантаження | Мінімальна |
| GPU-рендеринг сцени всередині VRAM | Низька під час рендеру | Мінімальна |
| Пакетний інференс із великим потоком запитів | Середня або висока | Залежить від розміру пакетів |
| Навчання нейромереж із постійною подачею датасету | Висока | Помітна |
| Вивантаження даних на CPU через нестачу VRAM | Дуже висока | Критична |
| Завантаження моделей і перемикання між ними | Дуже висока | Критична |
| Сервер із 4–8 GPU без NVLink | Висока | Рекомендовано |
| GPUDirect Storage та масив швидких NVMe | Висока | Рекомендовано |
Вузьке місце (PCIe bottleneck) особливо помітне при вивантаженні даних через нестачу VRAM. Коли ваги моделі або KV-кеш не вміщуються у відеопам’ять, вони постійно передаються між RAM і GPU. В описаному вище прикладі завантаження 32-мільярдної моделі на сервер з 8 NVIDIA H20 відновлення або перемикання 32-мільярдної моделі займало близько 2,5 секунди. Завантаження KV-кешу на 64 тисячі токенів для Qwen-7B-Chat формувало до 70% часу видачі першого токена.
Зберігання даних також може створювати обмеження. За даними NVIDIA, у системі з PCIe Switch пряме передавання даних від віддаленого сховища до GPU через GPUDirect Storage може підтримувати близько 50 ГБ/с. Без GDS потік проходить через процесор і обмежується приблизно 25 ГБ/с.
PCIe 4.0 проти PCIe 5.0 у реальних тестах
Раніше ми співставляли PCI Express 4.0 проти PCI Express 5.0, порівнюючи різні версії інтерфейсу при роботі з відеокартою Nvidia GeForce RTX 5090. Наші тести показували такий результат:
| Тестове середовище | Продуктивність PCIe 4.0 vs PCIe 5.0 | ||
| 5.0 x16 / 5.0 x8 / 4.0 x16 | 5.0 x4 / 4.0 x8 | 4.0 x4 | |
| DaVinci Resolve | 100% | 90% | 75% |
| After Effects | 100% | 95–98% | 92–96% |
| Unreal Engine | 100% | 96% | 93% |
| Blender + Octane | Різниця в межах 2–5% | ||
| Llama.cpp | Різниця до 6% | ||
Отже, повний інтерфейс Gen4 x16 не є вузьким місцем навіть для флагманської відеокарти. Реальне вузьке місце створює скоріше зменшення кількості ліній, ніж зниження версії інтерфейсу.
Але результати суттєво змінюються, коли GPU регулярно отримує великі масиви із системної пам’яті. Це характерно для завантаження моделей, CPU offload, відновлення KV-кешу та перемикання між кількома LLM. У згаданому раніше дослідженні Хунанського університету перехід на PCIe 5.0 у GPU-сервері дав такі результати:
- час видачі першого токена при завантаженні KV-кешу скоротився у 1,14–2,38 раза;
- перемикання та повторне завантаження моделей прискорилося у 1,12–2,48 раза.
Тобто вища пропускна здатність прискорює GPU-сервер тоді, коли відеокарта не може почати або продовжити обчислення без даних із RAM. У рендерингу чи інференсі всередині VRAM PCIe 4.0 x16 майже не обмежує продуктивність. При CPU offload, довгому контексті та частому перемиканні моделей інтерфейс уже визначає час виконання операції.
Наприклад, якщо обмін через PCIe займає 70% часу операції, подвоєння пропускної здатності теоретично скорочує загальну затримку приблизно на 35%. Коли частка передавання досягає 95%, виграш може наближатися до 48%. Це розрахункова оцінка за умови, що інші етапи виконуються з незмінною швидкістю.
Скільки ліній PCIe потрібно відеокартам у сервері
Лінії PCIe у GPU-сервері розподіляються не лише між графічними прискорювачами. Частину використовують NVMe, мережеві карти, RAID-контролери, плати захоплення та інші пристрої. Тому наявність чотирьох фізичних слотів x16 не гарантує, що всі вони працюватимуть у режимі x16.
Практичні конфігурації PCIe для відеокарт у сервері виглядають так:
| Кількість GPU | Для рендеру та інференсу | Для навчання LLM, HPC і CPU offload |
| 1 GPU | 4.0 x16 | 5.0 x16 із запасом |
| 2 GPU | 2 × 4.0 x16 або 2 × 5.0 x8 | 2 × 5.0 x16 |
| 4 GPU | 4 × 4.0 x8 | 4 × 5.0 x8 або x16 |
| 8 GPU | Серверна топологія з PCIe Switch | PCIe 5.0, NVLink або NVSwitch |
Також платформа повинна мати достатньо ліній ще до встановлення перемикачів. Наприклад, AMD EPYC 9005 підтримує до 160 ліній PCIe 5.0 залежно від процесора та конфігурації сервера. Такий запас дозволяє під’єднувати кілька прискорювачів, NVMe-масив і швидку мережеву карту без примусового переведення основних GPU у режим x4.
У двопроцесорному сервері важлива й топологія NUMA. Відеокарта повинна отримувати дані від RAM, підключеної до того самого процесора. Перехід через міжпроцесорний інтерфейс додає затримку та може зменшити фактичну пропускну здатність незалежно від покоління PCIe.
GPU-сервер PCIe 4.0 чи PCIe 5.0: що вибрати
GPU-сервер PCIe 4.0 залишається практичним рішенням для однієї або двох відеокарт, якщо кожна отримує повноцінне підключення x16. Така платформа підходить для GPU-рендерингу, локального інференсу, генерації зображень, відеообробки та обчислень, які повністю вміщуються у VRAM.
PCIe 5.0 у GPU-серверах потрібен для щільніших конфігурацій. Новий стандарт дозволяє підключати карти через x8 без зменшення швидкості відносно Gen4 x16, залишаючи більше ліній для NVMe, мережі й контролерів.
GPU-сервер PCIe 5.0 варто вибрати у таких випадках:
- встановлюються чотири або вісім графічних прискорювачів;
- моделі чи датасети регулярно вивантажуються у системну RAM;
- використовується KV cache offload або швидке перемикання моделей;
- дані надходять із масиву NVMe через GPUDirect Storage;
- сервер працює з мережею 100/200/400GbE;
- планується майбутній апгрейд на серверні GPU Gen5.
Переходити з готової платформи PCIe 4.0 у GPU-сервері на Gen5 тільки заради новішої версії інтерфейсу недоцільно. Якщо відеокарта працює у режимі x16, а задача вміщується у VRAM, більший обсяг пам’яті або потужніший GPU дадуть помітніший результат.
Для нового багатокарткового сервера PCIe 5.0 уже є раціональним вибором. Він не подвоює швидкість обчислень, але забезпечує нормальний розподіл ліній між кількома відеокартами та зменшує ризик вузького місця при обміні даними. Саме в цьому полягає реальна перевага Gen5 для AI, HPC і професійних GPU-систем.