In een AI-server speelt de CPU een ondersteunende maar onmisbare rol naast de GPU. De GPU verwerkt de zware rekenlasten, maar de CPU beheert alles eromheen: datavoorbereiding, geheugencoördinatie, systeemlogica en communicatie tussen componenten. Zonder een capabele processor loopt zelfs de krachtigste GPU-server vast op taken die buiten het bereik van de GPU vallen.

De verhouding tussen CPU en GPU bepaalt in grote mate hoe efficiënt een AI-server presteert onder realistische werklasten. In de secties hieronder beantwoorden we de meest gestelde vragen over de rol van de CPU in een GPU-gedomineerde AI-server, van de basisfuncties tot de keuze voor de juiste architectuur.

Waarom heeft een GPU-server überhaupt een krachtige CPU nodig?

Een GPU-server heeft een krachtige CPU nodig omdat de GPU zelf niet zelfstandig kan opereren. De CPU fungeert als de dirigent van het systeem: hij initieert taken, beheert het geheugen, verwerkt I/O-verzoeken en coördineert de communicatie tussen GPU’s, opslag en netwerk. Zonder voldoende CPU-capaciteit kan de GPU zijn volledige rekenpotentieel niet benutten.

Veel mensen gaan ervan uit dat je bij een AI-server simpelweg de krachtigste GPU’s installeert en klaar bent. In de praktijk is de CPU de schakel die alles bij elkaar houdt. Hij laadt data vanuit de opslag, verdeelt taken over de GPU’s, verwerkt systeeminterrupties en zorgt ervoor dat de GPU’s continu van werk worden voorzien. Een trage of onderbezette CPU laat de GPU’s letterlijk wachten.

Bij AI-workloads zoals inferentie of datapreprocessing is de CPU bovendien actief betrokken bij de uitvoering zelf. Taken die niet goed te parallelliseren zijn, zoals het parseren van invoerdata of het aansturen van API-verzoeken, worden volledig door de CPU afgehandeld. De CPU in een AI-server is daarmee geen bijzaak, maar een essentiële bouwsteen van de totale verwerkingscapaciteit.

Wat zijn de concrete taken van de CPU in een AI-workload?

De CPU in een AI-workload vervult meerdere concrete taken: datavoorbereiding en -preprocessing, geheugen- en cachebeheer, taakplanning voor de GPU’s, netwerkcommunicatie en het uitvoeren van seriële of minder parallelle berekeningsstappen. Deze taken zijn niet glamoureus, maar zonder ze komt de GPU niet tot zijn recht.

Concreet betekent dit dat de CPU bij AI-training verantwoordelijk is voor het laden en transformeren van trainingsdata voordat die naar de GPU-geheugens worden gestuurd. Bij inferentie verwerkt de CPU inkomende verzoeken, formatteert de invoer en stuurt de resultaten terug naar de aanroepende applicatie. Bij gedistribueerde AI-workloads over meerdere nodes coördineert de CPU ook de communicatie via het netwerk.

Daarnaast beheert de CPU de PCIe-bandbreedte, die bepaalt hoe snel data tussen CPU-geheugen en GPU-geheugen kan worden uitgewisseld. In moderne AI-servers zoals die van Supermicro wordt dit aangevuld met directe GPU-to-GPU-communicatie via NVLink, maar de CPU blijft de centrale verkeersleider in de datastroom.

Wat gebeurt er als de CPU een bottleneck wordt in een AI-server?

Als de CPU een bottleneck wordt in een AI-server, dalen de GPU-benuttingspercentages drastisch. De GPU’s wachten op data of instructies die de CPU niet snel genoeg kan aanleveren. Dit uit zich in lage GPU-utilization, langere trainingstijden en hogere kosten per verwerkte batch, terwijl de dure GPU-hardware grotendeels stilstaat.

In de praktijk zie je dit probleem het vaakst in twee situaties. Ten eerste bij servers met te weinig CPU-cores ten opzichte van het aantal GPU’s, waardoor de processor overbelast raakt door systeemtaken en geen ruimte meer heeft voor datavoorbereiding. Ten tweede bij configuraties met trage of verouderde opslag, waarbij de CPU wacht op data die niet snel genoeg beschikbaar is, en daarmee de hele pipeline vertraagt.

Een CPU-bottleneck is ook lastig te diagnosticeren, omdat de GPU-monitoring dan lage utilization toont terwijl de CPU op 100% draait. Veel organisaties interpreteren dit foutief als een GPU-probleem en overwegen extra GPU’s aan te schaffen, terwijl de oplossing in de CPU- of opslaglaag ligt. Een goed ontworpen AI-serverarchitectuur voorkomt dit door CPU, geheugen, opslag en GPU’s in balans te dimensioneren.

Hoeveel CPU-cores heeft een AI-server nodig per GPU?

Als vuistregel geldt dat een AI-server minimaal vier tot acht CPU-cores per GPU nodig heeft voor gangbare AI-workloads. Bij zware datapreprocessing of hoge inferentie-throughput kan dit oplopen tot twaalf of meer cores per GPU. Het exacte aantal hangt af van de workload, de geheugenbandbreedte en de complexiteit van de datapipeline.

Bij een server met vier high-end GPU’s heb je dus al snel behoefte aan een processor met zestien tot tweeëndertig cores, alleen al om de GPU’s van voldoende werk te voorzien. Moderne server-CPU’s zoals de AMD EPYC-serie of Intel Xeon Scalable bieden dit comfortabel, maar de keuze moet altijd worden afgestemd op de specifieke workload.

Houd ook rekening met de taken die buiten de AI-pipeline vallen: systeembeheer, monitoring, logging en netwerkcommunicatie vergen ook CPU-capaciteit. Een te krap gedimensioneerde processor leidt in de praktijk tot onverwachte pieken in CPU-belasting op momenten dat je dat het minst kunt gebruiken, zoals midden in een trainingsjob.

Welke CPU-architecturen zijn het meest geschikt voor AI-servers?

Voor AI-servers zijn AMD EPYC en Intel Xeon Scalable de dominante CPU-architecturen. AMD EPYC blinkt uit in geheugenbandbreedte en coredichtheid, wat voordelig is bij zware datapreprocessing. Intel Xeon Scalable biedt sterke I/O-prestaties en brede ecosysteemcompatibiliteit. De keuze hangt af van de specifieke workload en het gewenste platform.

AMD EPYC voor geheugenintensieve AI-workloads

AMD EPYC-processors bieden een hoog aantal geheugenkanalen en grote L3-caches, wat ze bijzonder geschikt maakt voor workloads waarbij grote datasets snel beschikbaar moeten zijn. In AI-trainingsscenario’s met omvangrijke batches en complexe datapipelines presteert EPYC sterk doordat de geheugenbandbreedte de GPU-datastroom goed kan bijhouden.

Intel Xeon Scalable voor brede platformintegratie

Intel Xeon Scalable-processors hebben een breed ecosysteem van ondersteunde software, drivers en beheertools, wat ze aantrekkelijk maakt in omgevingen waar compatibiliteit en beheerbaarheid prioriteit hebben. Intels AMX-instructieset biedt bovendien native acceleratie voor bepaalde AI-inferentietaken direct op de CPU, wat in hybride workloads een voordeel kan zijn.

Supermicro biedt platforms voor beide architecturen, met moederborden en behuizingen die specifiek zijn geoptimaliseerd voor AI-workloads. Wij helpen klanten bij het selecteren van de architectuur die het beste past bij hun workloadprofiel en toekomstige schaalbaarheid.

Wanneer is het zinvol om te investeren in een dualsocket CPU-configuratie?

Een dualsocket CPU-configuratie is zinvol wanneer een AI-server meer dan vier GPU’s bevat, wanneer de workload intensieve datapreprocessing vereist, of wanneer de server ook andere taken uitvoert naast AI-inferentie of training. Twee processors verdubbelen de beschikbare cores, geheugenkanalen en PCIe-lanes, wat de balans met meerdere GPU’s herstelt.

In de praktijk is een dualsocket configuratie het meest relevant voor servers met zes, acht of meer GPU’s. Met één processor en acht GPU’s ontstaat er vrijwel zeker een CPU-bottleneck, tenzij de workload bijzonder GPU-gebonden is met minimale datavoorbereiding. Met twee processors heb je voldoende rekencapaciteit om alle GPU’s continu van werk te voorzien.

Er zijn ook situaties waarin een krachtige single-socketprocessor de betere keuze is. Bij kleinere configuraties met twee of vier GPU’s, of bij workloads die minder CPU-intensief zijn, voegt een tweede socket onnodige kosten en energieverbruik toe. De afweging is altijd specifiek voor de workload, het aantal GPU’s en het budget. Wij configureren AI-servers op maat, zodat CPU en GPU in de juiste verhouding staan voor de beoogde toepassing, of het nu gaat om een compacte inferentieserver of een multi-rack trainingscluster.

Voor organisaties die ook nadenken over de opslaglaag in hun AI-infrastructuur: de keuze voor de juiste opslagoplossing heeft direct invloed op de CPU-belasting en daarmee op de totale AI-serverprestaties.

Veelgestelde vragen

Hoe weet ik of mijn huidige CPU een bottleneck vormt in mijn AI-server?

De meest betrouwbare manier is om gelijktijdig de GPU-utilization en CPU-belasting te monitoren tijdens een actieve workload. Als je ziet dat de GPU-utilization structureel onder de 80% blijft terwijl de CPU op of nabij 100% draait, is een CPU-bottleneck de meest waarschijnlijke oorzaak. Tools zoals nvidia-smi (voor GPU-monitoring) en htop of Prometheus in combinatie met Grafana (voor CPU-monitoring) geven je dit inzicht in real time. Op basis van die data kun je gericht beslissen of een CPU-upgrade, extra cores of een betere datapipeline de oplossing is.

Wat is het verschil tussen CPU-geheugen en GPU-geheugen, en waarom is die balans belangrijk?

CPU-geheugen (RAM) is de werkruimte van de processor en wordt gebruikt voor datavoorbereiding, systeemprocessen en het tijdelijk opslaan van datasets voordat ze naar de GPU worden gestuurd. GPU-geheugen (VRAM) is het snelle, gespecialiseerde geheugen op de grafische kaart dat direct door de GPU wordt gebruikt voor modelparameters en activaties. Als het CPU-geheugen te beperkt is, ontstaan er knelpunten in de datapipeline omdat de processor data niet snel genoeg kan klaarzetten voor de GPU. Een goede vuistregel is om minimaal twee keer zoveel CPU-RAM beschikbaar te hebben als de totale VRAM-capaciteit van alle GPU’s in de server.

Kan ik een bestaande server upgraden met extra GPU's zonder de CPU te vervangen?

Dat hangt volledig af van de huidige CPU-capaciteit en het aantal PCIe-lanes dat beschikbaar is. Als je server al op of nabij de CPU-limiet draait, zal het toevoegen van extra GPU’s de bottleneck verergeren in plaats van de prestaties te verbeteren. Controleer eerst of het moederbord voldoende PCIe-slots en bandbreedte ondersteunt, en of de huidige processor genoeg cores en geheugenkanalen heeft om de extra GPU’s van werk te voorzien. In veel gevallen is het verstandiger om een volledig nieuw, gebalanceerd platform te configureren dan een bestaande server stapsgewijs uit te breiden.

Maakt het uit welke PCIe-generatie de CPU ondersteunt voor AI-workloads?

Ja, de PCIe-generatie heeft directe invloed op de bandbreedte tussen CPU-geheugen en GPU-geheugen, en daarmee op hoe snel data naar de GPU’s kan worden getransporteerd. PCIe 5.0, ondersteund door de nieuwste AMD EPYC- en Intel Xeon-generaties, biedt dubbele bandbreedte ten opzichte van PCIe 4.0, wat met name voordelig is bij workloads met grote databatches of bij servers met meerdere hoge-resolutie GPU’s. Voor inferentie-workloads met relatief kleine invoerdata is het verschil minder groot, maar bij AI-training met omvangrijke datasets kan een hogere PCIe-generatie merkbaar bijdragen aan kortere trainingstijden. Het is een van de redenen waarom het loont om CPU en GPU altijd als een geïntegreerd platform te selecteren.

Is een ARM-gebaseerde CPU zoals Ampere Altra een serieuze optie voor AI-servers?

ARM-gebaseerde server-CPU’s zoals de Ampere Altra winnen terrein in AI-inferentiescenario’s, met name vanwege hun hoge coreaantallen (tot 192 cores per socket) en gunstige energie-efficiëntie. Ze zijn minder geschikt voor zware AI-trainingsworkloads waarbij brede softwarecompatibiliteit en volwassen ecosysteemondersteuning cruciaal zijn, maar voor inferentie op schaal zijn ze een serieuze kandidaat. De afweging ten opzichte van AMD EPYC of Intel Xeon hangt af van je workloadprofiel, de softwarestack die je gebruikt en de mate waarin je afhankelijk bent van x86-specifieke tools en drivers. Voor de meeste organisaties blijft x86 de veiligste keuze, maar ARM verdient zeker een plek in de evaluatie bij grootschalige inferentie-deployments.

Hoe beïnvloedt de keuze voor NVMe-opslag de CPU-belasting in een AI-server?

Snelle NVMe-opslag vermindert de tijd die de CPU kwijt is aan het wachten op data, wat direct de beschikbare capaciteit voor andere taken vergroot. Als de opslag traag is, raakt de CPU geblokkeerd op I/O-wachttijden en kan hij de GPU’s niet tijdig van nieuwe data voorzien, wat resulteert in een gecombineerde opslag- én CPU-bottleneck. Moderne NVMe-oplossingen met hoge sequentiële leessnelheden en lage latency houden de datapipeline vlot en verlagen daarmee de effectieve CPU-belasting. De combinatie van snelle opslag, voldoende CPU-cores en de juiste geheugenbandbreedte vormt de basis van een goed gebalanceerde AI-serverarchitectuur.

Wat is een praktisch startpunt als ik een nieuwe AI-server wil configureren en niet zeker weet hoeveel CPU-capaciteit ik nodig heb?

Begin met het in kaart brengen van je workloadprofiel: gaat het om AI-training, inferentie, of een combinatie van beide, en hoe data-intensief is de preprocessing? Gebruik vervolgens de vuistregel van vier tot acht CPU-cores per GPU als startpunt, en pas dit aan op basis van de complexiteit van je datapipeline en eventuele nevenfuncties van de server. Als je workload nog onzeker is of naar verwachting groeit, is het verstandig om te kiezen voor een platform met uitbreidingsruimte, zoals een dualsocket moederbord dat je initieel met één processor kunt uitrusten. Een gespecialiseerde partner kan op basis van jouw specifieke use case een configuratie samenstellen die CPU, GPU, geheugen en opslag in de juiste verhouding combineert, zodat je niet achteraf tegen onnodige bottlenecks aanloopt.

Gerelateerde artikelen

NCS International

Den Sliem 89
7141 JG Groenlo
The Netherlands
+31 544 470 000
info@ncs.nl

Meer berichten

Wat is een GPU-server?

GPU-servers verwerken duizenden berekeningen parallel — ontdek wanneer ze onmisbaar zijn voor jouw organisatie.


read more

Wat is een AI-server?

Wat is een AI-server en wanneer heb je er een nodig? Ontdek de techniek, hardware en toepassingen.


read more