PCIe 5.0 передаёт вдвое больше данных, чем PCIe 4.0, но не делает видеокарту вдвое быстрее. Если модель, сцена или пакет данных полностью помещается в VRAM, графический процессор выполняет большую часть работы в собственной памяти. Интерфейс в таком сценарии используется преимущественно в начале и в конце вычисления.
Реальная разница PCIe 4.0 и PCIe 5.0 проявляется в других условиях: при установке нескольких GPU, сокращении подключения до x8 или x4, выгрузке данных в системную память и постоянном обмене между накопителями, CPU и видеокартами. Поэтому правильный подход — выбирать версию интерфейса именно с учётом архитектуры сервера.
Далее — о сравнении скорости PCIe 4.0 и PCIe 5.0 в теории и на практике, реальных сценариях использования нового интерфейса и практических рекомендациях по выбору.
PCIe 4.0 vs PCIe 5.0: скорость и количество линий
Переход на PCIe 5.0 в GPU-серверах повышает скорость передачи данных по одной линии вдвое: с 16 до 32 миллиардов транзакций в секунду (GT/s). При расчёте полной пропускной способности PCIe 4.0 и PCIe 5.0 также следует учитывать количество линий — x16, x8, x4 и т. д. Расчёты реальной скорости, важные для серверов, приведены в таблице:
| Режим подключения | Теоретическая максимальная скорость в одном направлении | Суммарно в обоих направлениях | Эквивалент по пропускной способности |
| 4.0 x16 | 31,5 ГБ/с | 63 ГБ/с | PCIe 5.0 x8 |
| 4.0 x8 | 15,8 ГБ/с | 31,5 ГБ/с | PCIe 5.0 x4 |
| 4.0 x4 | 7,9 ГБ/с | 15,8 ГБ/с | PCIe 5.0 x2 |
| 5.0 x16 | 63 ГБ/с | 126 ГБ/с | - |
| 5.0 x8 | 31,5 ГБ/с | 63 ГБ/с | PCIe 4.0 x16 |
| 5.0 x4 | 15,8 ГБ/с | 31,5 ГБ/с | PCIe 4.0 x8 |
Напоминаем, что в таблице приведены теоретические расчётные показатели, которых невозможно достичь в реальных условиях. Служебные операции протокола, топология платы, PCIe Switch и контроллер памяти снижают фактическую скорость. Например, в исследовании специалистов Хунаньского университета измеренная пропускная способность PCIe 4.0 x16 в multi-GPU сервере составила 24–26 ГБ/с, а PCIe 5.0 x16 — 52–60 ГБ/с.
Также важно помнить, что стандарты имеют обратную совместимость. Видеокарта PCIe 5.0 работает в слоте PCIe 4.0, но использует скорость четвёртого поколения. Аналогично GPU Gen4 можно установить в материнскую плату Gen5 без повышения скорости самой карты.
Когда PCIe действительно влияет на скорость GPU
Влияние PCIe на производительность GPU определяется количеством данных, которые необходимо перемещать за пределы видеопамяти (VRAM). Пока вычисления выполняются внутри графического процессора, ширина внешнего интерфейса почти не имеет значения.
В GPU-сервере данные перемещаются по трём основным направлениям:
- из системной RAM или накопителя в VRAM;
- из GPU обратно в процессор, RAM или хранилище;
- между несколькими графическими ускорителями.
Например, в машинном обучении версия PCIe становится важной при подготовке крупных батчей, загрузке датасетов, сохранении контрольных точек и синхронизации нескольких ускорителей. Если данные поступают медленнее, чем GPU способен их обрабатывать, вычислительные блоки простаивают.
Подробнее о сценариях, в которых актуально сравнение PCIe 4.0 и PCIe 5.0, — в таблице:
| Рабочий сценарий | Интенсивность обмена данными | Потребность в Gen5 |
| Инференс модели, которая полностью помещается в VRAM | Низкая после загрузки | Минимальная |
| GPU-рендеринг сцены внутри VRAM | Низкая во время рендеринга | Минимальная |
| Пакетный инференс с большим потоком запросов | Средняя или высокая | Зависит от размера пакетов |
| Обучение нейросетей с постоянной подачей датасета | Высокая | Заметная |
| Выгрузка данных на CPU из-за нехватки VRAM | Очень высокая | Критическая |
| Загрузка моделей и переключение между ними | Очень высокая | Критическая |
| Сервер с 4–8 GPU без NVLink | Высокая | Рекомендуется |
| GPUDirect Storage и массив быстрых NVMe | Высокая | Рекомендуется |
Узкое место (PCIe bottleneck) особенно заметно при выгрузке данных из-за нехватки VRAM. Когда веса модели или KV-кеш не помещаются в видеопамять, они постоянно передаются между RAM и GPU. В описанном выше примере загрузки 32-миллиардной модели на сервер с 8 NVIDIA H20 восстановление или переключение 32-миллиардной модели занимало около 2,5 секунды. Загрузка KV-кеша на 64 тысячи токенов для Qwen-7B-Chat формировала до 70% времени выдачи первого токена.
Хранение данных также может создавать ограничения. По данным NVIDIA, в системе с PCIe Switch прямая передача данных из удалённого хранилища в GPU через GPUDirect Storage может поддерживать около 50 ГБ/с. Без GDS поток проходит через процессор и ограничивается приблизительно 25 ГБ/с.
PCIe 4.0 против PCIe 5.0 в реальных тестах
Ранее мы сопоставляли PCI Express 4.0 и PCI Express 5.0, сравнивая разные версии интерфейса при работе с видеокартой Nvidia GeForce RTX 5090. Наши тесты показали следующий результат:
| Тестовая среда | Производительность PCIe 4.0 vs PCIe 5.0 | ||
| 5.0 x16 / 5.0 x8 / 4.0 x16 | 5.0 x4 / 4.0 x8 | 4.0 x4 | |
| DaVinci Resolve | 100% | 90% | 75% |
| After Effects | 100% | 95–98% | 92–96% |
| Unreal Engine | 100% | 96% | 93% |
| Blender + Octane | Разница в пределах 2–5% | ||
| Llama.cpp | Разница до 6% | ||
Таким образом, полноценный интерфейс Gen4 x16 не является узким местом даже для флагманской видеокарты. Реальное узкое место чаще создаёт уменьшение количества линий, а не снижение версии интерфейса.
Однако результаты существенно меняются, когда GPU регулярно получает большие массивы данных из системной памяти. Это характерно для загрузки моделей, CPU offload, восстановления KV-кеша и переключения между несколькими LLM. В упомянутом ранее исследовании Хунаньского университета переход на PCIe 5.0 в GPU-сервере дал следующие результаты:
- время выдачи первого токена при загрузке KV-кеша сократилось в 1,14–2,38 раза;
- переключение и повторная загрузка моделей ускорились в 1,12–2,48 раза.
То есть более высокая пропускная способность ускоряет GPU-сервер тогда, когда видеокарта не может начать или продолжить вычисления без данных из RAM. В рендеринге или инференсе внутри VRAM PCIe 4.0 x16 почти не ограничивает производительность. При CPU offload, длинном контексте и частом переключении моделей интерфейс уже определяет время выполнения операции.
Например, если обмен через PCIe занимает 70% времени операции, удвоение пропускной способности теоретически сокращает общую задержку приблизительно на 35%. Когда доля передачи достигает 95%, выигрыш может приближаться к 48%. Это расчётная оценка при условии, что остальные этапы выполняются с неизменной скоростью.
Сколько линий PCIe требуется видеокартам в сервере
Линии PCIe в GPU-сервере распределяются не только между графическими ускорителями. Часть используют NVMe, сетевые карты, RAID-контроллеры, платы захвата и другие устройства. Поэтому наличие четырёх физических слотов x16 не гарантирует, что все они будут работать в режиме x16.
Практические конфигурации PCIe для видеокарт в сервере выглядят следующим образом:
| Количество GPU | Для рендеринга и инференса | Для обучения LLM, HPC и CPU offload |
| 1 GPU | 4.0 x16 | 5.0 x16 с запасом |
| 2 GPU | 2 × 4.0 x16 или 2 × 5.0 x8 | 2 × 5.0 x16 |
| 4 GPU | 4 × 4.0 x8 | 4 × 5.0 x8 или x16 |
| 8 GPU | Серверная топология с PCIe Switch | PCIe 5.0, NVLink или NVSwitch |
Кроме того, платформа должна иметь достаточное количество линий ещё до установки коммутаторов. Например, AMD EPYC 9005 поддерживает до 160 линий PCIe 5.0 в зависимости от процессора и конфигурации сервера. Такой запас позволяет подключать несколько ускорителей, массив NVMe и высокоскоростную сетевую карту без принудительного перевода основных GPU в режим x4.
В двухпроцессорном сервере также важна топология NUMA. Видеокарта должна получать данные из RAM, подключённой к тому же процессору. Переход через межпроцессорный интерфейс добавляет задержку и может снизить фактическую пропускную способность независимо от поколения PCIe.
GPU-сервер PCIe 4.0 или PCIe 5.0: что выбрать
GPU-сервер PCIe 4.0 остаётся практичным решением для одной или двух видеокарт, если каждая получает полноценное подключение x16. Такая платформа подходит для GPU-рендеринга, локального инференса, генерации изображений, обработки видео и вычислений, которые полностью помещаются в VRAM.
PCIe 5.0 в GPU-серверах необходим для более плотных конфигураций. Новый стандарт позволяет подключать карты через x8 без снижения скорости по сравнению с Gen4 x16, оставляя больше линий для NVMe, сети и контроллеров.
GPU-сервер PCIe 5.0 следует выбирать в следующих случаях:
- устанавливаются четыре или восемь графических ускорителей;
- модели или датасеты регулярно выгружаются в системную RAM;
- используется KV cache offload или быстрое переключение моделей;
- данные поступают из массива NVMe через GPUDirect Storage;
- сервер работает с сетью 100/200/400GbE;
- планируется будущий апгрейд на серверные GPU Gen5.
Переходить с готовой платформы PCIe 4.0 в GPU-сервере на Gen5 только ради более новой версии интерфейса нецелесообразно. Если видеокарта работает в режиме x16, а задача помещается в VRAM, больший объём памяти или более мощный GPU дадут более заметный результат.
Для нового многокарточного сервера PCIe 5.0 уже является рациональным выбором. Он не удваивает скорость вычислений, но обеспечивает нормальное распределение линий между несколькими видеокартами и снижает риск возникновения узкого места при обмене данными. Именно в этом заключается реальное преимущество Gen5 для AI, HPC и профессиональных GPU-систем.