6 oktober 2026
PCIe 5.0 verdubbelt de beschikbare bandbreedte ten opzichte van PCIe 4.0, van 64 GB/s naar 128 GB/s per x16-slot. Voor AI-servers betekent dit concreet dat GPU’s, NVMe-opslag en netwerkkaarten aanzienlijk minder wachten op data, wat directe doorlooptijdwinst oplevert bij intensieve trainings- en inferentiewerklasten. In dit artikel beantwoorden we de meest gestelde vragen over PCIe 5.0 en wat het in de praktijk betekent voor jouw AI-infrastructuur.
PCIe 5.0 biedt per lane een overdrachtssnelheid van 32 GT/s, tegenover 16 GT/s bij PCIe 4.0. In een x16-configuratie resulteert dat in een bidirectionele bandbreedte van 128 GB/s, precies het dubbele van de 64 GB/s die PCIe 4.0 levert. Die verdubbeling klinkt eenvoudig, maar de praktische impact voor AI-werklasten is aanzienlijk.
Bij grootschalige AI-training worden enorme hoeveelheden modelgewichten, activaties en gradiënten continu tussen GPU-geheugen, systeemgeheugen en opslag heen en weer geschoven. Als de interconnect een bottleneck vormt, wacht de GPU op data in plaats van te rekenen. PCIe 5.0 vermindert dat wachten structureel, zeker bij multi-GPU-configuraties waarbij meerdere kaarten tegelijkertijd data uitwisselen via de CPU of via NVMe-opslag.
Belangrijk om te beseffen: de snelheidswinst is niet uniform zichtbaar in alle scenario’s. Werklasten die al CPU-gebonden zijn, of waarbij de GPU zelf de beperkende factor is, profiteren minder. Maar zodra de interconnect de flessenhals is, wat bij moderne AI-accelerators steeds vaker het geval is, maakt PCIe 5.0 een meetbaar verschil.
De drie componenten die het meest profiteren van PCIe 5.0 zijn high-end GPU-accelerators, NVMe-SSD’s en snelle netwerkadapters. Deze onderdelen genereren de hoogste bandbreedtevraag en worden bij PCIe 4.0 het snelst beperkt door de interconnect.
Moderne AI-accelerators zoals de Nvidia H100 en de nieuwere B200- en B300-generatie zijn ontworpen met PCIe 5.0 als verwachte interconnect. De theoretische geheugenbandbreedte van deze kaarten overtreft ruimschoots wat PCIe 4.0 kan leveren als host-interface. Bij inferentie op grote taalmodellen, waarbij het laden van modelgewichten een kritische stap is, zorgt de hogere PCIe-bandbreedte voor kortere laadtijden en hogere doorvoer per tijdseenheid.
PCIe 5.0 NVMe-SSD’s bereiken sequentiële leessnelheden van 12 tot 14 GB/s, meer dan het dubbele van de snelste PCIe 4.0-drives. Voor AI-toepassingen waarbij datasets groter zijn dan het beschikbare GPU-geheugen, en data dus voortdurend van opslag geladen moet worden, is dit een directe prestatieverbetering. Bekijk onze opslagoplossingen als je wilt weten welke NVMe-configuraties beschikbaar zijn voor AI-werklasten.
PCIe 5.0 is een fysieke interconnectstandaard die de snelheid van gegevensoverdracht tussen componenten bepaalt. CXL (Compute Express Link) is een protocol dat boven op PCIe 5.0 draait en een fundamenteel andere functie vervult: het maakt het mogelijk om geheugen, versnellers en andere apparaten te koppelen alsof ze onderdeel zijn van dezelfde geheugenpool.
Concreet gezegd: PCIe 5.0 bepaalt hoe snel bits reizen, CXL bepaalt hoe slim die bits gedeeld worden. Voor AI-servers is dat onderscheid belangrijk. CXL maakt het mogelijk om geheugen van meerdere apparaten samen te voegen tot één logische pool, wat bij LLM-inferentie met grote modellen de beschikbare geheugencapaciteit drastisch kan uitbreiden zonder extra GPU’s toe te voegen.
In de praktijk zijn PCIe 5.0 en CXL complementair. CXL 2.0 en 3.0 vereisen PCIe 5.0 als onderliggende laag om hun volledige potentieel te benutten. Wie in 2026 een toekomstbestendige AI-server wil bouwen, doet er verstandig aan beide specificaties mee te nemen in de evaluatie, niet als alternatieven maar als samenhangende vereisten.
PCIe 5.0 maakt een meetbaar verschil in AI-training zodra de interconnect de beperkende factor is. Dat is met name het geval bij grote batch sizes, hoge modelcomplexiteit, multi-GPU-setups zonder dedicated NVLink, en werklasten waarbij data continu van NVMe-opslag geladen wordt omdat het niet volledig in GPU-geheugen past.
Bij kleinere modellen of werklasten waarbij de GPU zelf de bottleneck vormt, is het verschil tussen PCIe 4.0 en PCIe 5.0 minimaal. De winst wordt pas zichtbaar als de GPU sneller kan verwerken dan de interconnect data kan aanleveren. Dat punt wordt steeds eerder bereikt naarmate GPU-accelerators krachtiger worden.
Een praktische vuistregel: als je GPU-utilization hoog is maar de throughput tegenvalt, is de interconnect waarschijnlijk de oorzaak. PCIe 5.0 lost dat op door de maximale overdrachtssnelheid te verdubbelen. Bij distributed training over meerdere nodes speelt ook de netwerkinterface een rol, en ook daarvoor geldt dat PCIe 5.0 hogere bandbreedtes mogelijk maakt voor 400G en 800G Ethernet- of InfiniBand-adapters.
Supermicro biedt al een breed portfolio van servers met native PCIe 5.0-ondersteuning, gebaseerd op Intel Xeon Scalable (Sapphire Rapids en Emerald Rapids) en AMD EPYC (Genoa en Bergamo)-platforms. Deze systemen zijn beschikbaar in configuraties die specifiek zijn afgestemd op AI-training, inferentie en HPC-werklasten.
Wat Supermicro onderscheidt, is de snelheid waarmee nieuwe GPU-generaties worden ondersteund. Waar merken als HP en Dell vaak maanden wachten voordat nieuwe Nvidia-kaarten in hun systemen beschikbaar zijn, brengt Supermicro servers met ondersteuning voor de nieuwste generatie GPU’s, zoals de B200 en B300, als eerste op de markt. Dat is voor organisaties die nu investeren in AI-infrastructuur een concreet voordeel: je hoeft niet te wachten op een fabrikant die zijn productlijn bijwerkt.
Wij leveren als grootste en oudste Supermicro-distributeur van Nederland het volledige portfolio, volledig geconfigureerd op maat. Van enkelvoudige GPU-servers tot multi-rack AI-clusters, elk systeem wordt afgestemd op jouw specifieke werklast, schaalvereisten en toekomstige groei. Bekijk onze AI-oplossingen voor een overzicht van beschikbare Supermicro-platforms met PCIe 5.0-ondersteuning, of neem contact op voor een configuratiegesprek op maat.
Ja, PCIe is neerwaarts compatibel, wat betekent dat PCIe 4.0-kaarten gewoon werken in een PCIe 5.0-slot en vice versa. De kaart communiceert dan op de snelheid van de langzaamste generatie, dus een PCIe 4.0 GPU in een PCIe 5.0-slot draait op PCIe 4.0-snelheid. Voor een migratie naar PCIe 5.0 hoef je dus niet alles tegelijk te vervangen, maar alleen de componenten waarbij de bandbreedtewinst daadwerkelijk impact heeft op jouw werklast.
De meest betrouwbare methode is het monitoren van GPU-utilization in combinatie met de werkelijke doorvoer. Als je GPU-utilization structureel hoog is (boven de 90%) maar de tokens per seconde of trainingstijd tegenvalt, is de interconnect een waarschijnlijke oorzaak. Tools zoals Nvidia Nsight Systems, nvidia-smi en PyTorch Profiler geven inzicht in PCIe-overdrachtstijden en geheugenkopieeroperaties, waarmee je de bottleneck concreet kunt lokaliseren voordat je investeert in een nieuw platform.
Een veelgemaakte fout is het upgraden van het moederbord naar PCIe 5.0 zonder ook de NVMe-opslag en netwerkadapters mee te upgraden, waardoor de systeembrede bottleneck simpelweg verschuift. Een andere valkuil is het onderschatten van de koelingsuitdagingen: PCIe 5.0-componenten, met name NVMe-SSD’s, genereren aanzienlijk meer warmte dan hun PCIe 4.0-voorgangers en vereisen actieve koeling of specifieke serverontwerpen. Zorg dus voor een integrale evaluatie van het volledige systeem, niet alleen de interconnectstandaard.
PCIe 5.0 is zeker relevant voor inferentie, met name bij grote taalmodellen waarbij modelgewichten bij elke aanvraag of sessie van opslag of systeemgeheugen naar het GPU-geheugen geladen worden. Hogere PCIe-bandbreedte verlaagt de laadtijd van modellen en verhoogt de maximale doorvoer bij hoge concurrency. Bij kleinere modellen die volledig in GPU-geheugen passen, is het voordeel beperkter, maar zodra je werkt met modellen groter dan het beschikbare VRAM, maakt de interconnectsnelheid direct verschil in responstijd en capaciteit.
CXL-geheugenuitbreiding wordt interessant zodra de modelomvang de gecombineerde VRAM van je GPU’s overstijgt en je geen extra GPU’s wilt of kunt toevoegen. Dit is typisch het geval bij LLM-inferentie met modellen van 70 miljard parameters of groter, waarbij geheugen eerder een bottleneck is dan rekenkracht. Omdat CXL 2.0 en 3.0 PCIe 5.0 vereisen als onderliggende laag, is investeren in een PCIe 5.0-platform nu tegelijkertijd een investering in CXL-compatibiliteit voor de toekomst.
Op basis van de historische PCIe-generatiecyclus van vier tot vijf jaar per generatie, en het feit dat PCIe 6.0 nog in een vroeg adoptiestadium verkeert, is een PCIe 5.0-platform realistisch gezien drie tot vijf jaar relevant voor productie-AI-werklasten. Bovendien zijn de meeste GPU-generaties die tot 2027 verwacht worden, waaronder de Nvidia B200- en B300-serie, ontworpen met PCIe 5.0 als primaire host-interface. Een server die nu wordt geconfigureerd met PCIe 5.0 kan dus meerdere GPU-generaties ondersteunen zonder platformwissel.
Breng in ieder geval inzicht mee in de omvang van je modellen (aantal parameters en precisie), de grootte van je trainingsdatasets, het verwachte aantal gelijktijdige inferentieverzoeken en je groeiverwachting voor de komende twee jaar. Aanvullend is het nuttig te weten of je werklast CPU-gebonden, geheugengebonden of interconnect-gebonden is, zodat de configuratie daar op afgestemd kan worden. Op basis van die informatie kan een gespecialiseerde partner zoals NCS een systeem samenstellen waarbij PCIe 5.0-bandbreedte, GPU-keuze, NVMe-capaciteit en netwerkconfiguratie als samenhangend geheel worden geoptimaliseerd.
Den Sliem 89
7141 JG Groenlo
The Netherlands
+31 544 470 000
info@ncs.nl
GPU-servers verwerken duizenden berekeningen parallel — ontdek wanneer ze onmisbaar zijn voor jouw organisatie.
Wat is een AI-server en wanneer heb je er een nodig? Ontdek de techniek, hardware en toepassingen.