Voor de meeste AI-workloads geldt: meer P-cores leveren betere prestaties, maar E-cores zijn zeker niet overbodig. P-cores (performance cores) zijn geoptimaliseerd voor zware, latentiegevoelige berekeningen, terwijl E-cores (efficiency cores) achtergrondtaken efficiënt afhandelen zonder de P-cores te belasten. De ideale verhouding hangt volledig af van het type AI-workload dat je draait. In dit artikel beantwoorden we de meest gestelde vragen over CPU-cores in AI-systemen, van de basisprincipes tot de keuze voor de juiste architectuur.

Wat doen P-cores en E-cores precies in een moderne CPU?

P-cores (performance cores) zijn de krachtigste kernen in een hybride CPU-architectuur. Ze draaien op hogere kloksnelheden, hebben toegang tot grotere caches en zijn ontworpen voor taken die snelle, complexe verwerking vereisen. E-cores (efficiency cores) zijn kleiner, verbruiken minder energie en zijn bedoeld voor lichtere taken die parallel kunnen worden uitgevoerd zonder hoge latentie-eisen.

Intel introduceerde deze hybride architectuur met de twaalfde generatie Core-processors (Alder Lake) en heeft het concept sindsdien verder uitgebouwd in de generaties Raptor Lake en Meteor Lake. Het idee is afkomstig uit de wereld van mobiele chips, waar energiebeheer altijd een prioriteit was. In een server- of AI-context werkt het principe anders: hier gaat het niet primair om batterijduur, maar om de efficiënte verdeling van computerlast over een groot aantal parallelle processen.

In de praktijk werkt het besturingssysteem samen met de CPU-scheduler om te bepalen welke taak op welk type kern terechtkomt. Zware threads worden naar P-cores gestuurd, terwijl E-cores I/O-afhandeling, monitoring en ondersteunende processen voor hun rekening nemen. Voor AI-systemen betekent dit dat de keuze voor de juiste kernverhouding direct invloed heeft op de algehele systeemprestaties.

Welk type AI-workload profiteert het meest van P-cores?

AI-workloads die het meest profiteren van P-cores zijn taken waarbij lage latentie en hoge single-thread prestaties cruciaal zijn. Denk aan real-time inferentie, het laden en preprocessen van grote datasets, en het aansturen van GPU-acceleratoren. Bij deze taken maken de hogere kloksnelheid en grotere cache van P-cores een meetbaar verschil in doorvoersnelheid.

Concreet zijn dit de scenario’s waarbij P-cores de voorkeur verdienen:

  • LLM-inferentie op CPU: Wanneer grote taalmodellen deels of volledig op de CPU worden uitgevoerd, is hoge single-thread snelheid bepalend voor de responsietijd.
  • Data preprocessing voor AI-training: Het transformeren, normaliseren en batchen van trainingsdata vereist snelle seriële verwerking voordat de data naar de GPU gaat.
  • Real-time AI-toepassingen: Denk aan fraudedetectie, beeldherkenning in beveiligingssystemen of medische diagnostiek waarbij milliseconden tellen.
  • Modelladen en checkpointing: Het inladen van grote modelbestanden uit geheugen of opslag profiteert van de hogere geheugenbandbreedte die P-cores kunnen benutten.

Voor organisaties die werken met AI-infrastructuuroplossingen op basis van GPU-servers is de CPU vaak de bottleneck bij het voeden van de GPU met data. In die context zijn krachtige P-cores geen luxe, maar een noodzaak.

Wanneer leveren E-cores meer waarde in een AI-infrastructuur?

E-cores leveren de meeste waarde in AI-infrastructuren waar veel parallelle, lichte taken tegelijkertijd moeten worden uitgevoerd. Denk aan het beheren van netwerkcommunicatie, het draaien van monitoringprocessen, containerorkestratie (zoals Kubernetes-agents) en het verwerken van I/O-verzoeken van meerdere gebruikers tegelijk.

In grootschalige AI-omgevingen draaien servers zelden alleen het AI-model zelf. Er zijn altijd ondersteunende processen actief: logging, health checks, load balancing, datastreamverwerking. E-cores nemen deze taken over zonder de P-cores te onderbreken, wat de algehele systeemefficiëntie verhoogt.

Een ander scenario waar E-cores in uitblinken, is batch-inferentie met lage urgentie. Als je ’s nachts grote hoeveelheden data verwerkt zonder strikte latentievereisten, kunnen E-cores die werklast efficiënter en energiezuiniger afhandelen dan P-cores op vol vermogen. Dit is relevant voor organisaties die hun energiekosten en warmteproductie willen beperken in een druk datacenter.

Hoe verhoudt het aantal cores zich tot GPU-prestaties in AI-servers?

In een AI-server met GPU-acceleratie is de CPU primair verantwoordelijk voor het aansturen van de GPU, niet voor het zware rekenwerk zelf. Het aantal CPU-cores bepaalt hoeveel parallelle GPU-taken en data-pipelines tegelijkertijd kunnen worden beheerd. Een te zwakke CPU met te weinig cores wordt de bottleneck die de GPU-prestaties beperkt.

De vuistregel in de industrie is dat je per GPU minimaal vier tot acht krachtige CPU-cores nodig hebt om de datatoevoer op peil te houden. Bij systemen met meerdere GPU’s, zoals servers met vier of acht Nvidia-kaarten, loopt de benodigde CPU-capaciteit snel op. Een dual-socket configuratie met hoge core counts is dan geen overkill, maar een architecturale noodzaak.

Tegelijkertijd geldt: meer cores helpen niet als de geheugenbandbreedte of PCIe-bandbreedte de beperkende factor is. De CPU-keuze moet altijd in samenhang worden bekeken met het moederbord, de geheugenarchitectuur en de manier waarop GPU’s zijn aangesloten. Dit is precies waarom maatwerk serverontwerp zo belangrijk is bij AI-infrastructuur.

Welke CPU-architecturen worden het meest gebruikt in AI-servers?

In AI-servers domineren twee CPU-architecturen de markt: Intel Xeon Scalable (gebaseerd op de P-core-architectuur zonder hybride E-core-opzet) en AMD EPYC. Beide zijn ontworpen voor server-workloads met hoge core counts, grote caches en brede geheugenondersteuning. Voor edge AI en workstations wordt ook Intel Core Ultra ingezet, die wel de hybride P/E-core-architectuur gebruikt.

Intel Xeon Scalable

Intel Xeon-processors zijn traditioneel gebouwd op pure performance cores zonder de hybride P/E-verdeling die je in consumentenprocessors ziet. Ze bieden hoge core counts, ondersteuning voor grote hoeveelheden ECC-geheugen en zijn geoptimaliseerd voor datacenterworkloads. De nieuwste generaties ondersteunen ook AI-specifieke instructiesets zoals AVX-512 en AMX (Advanced Matrix Extensions), die matrixberekeningen voor AI-modellen direct versnellen.

AMD EPYC

AMD EPYC-processors staan bekend om hun hoge core counts en uitstekende geheugenbandbreedte dankzij de chiplet-architectuur. Ze zijn populair in HPC en AI-omgevingen waar veel parallelle threads nodig zijn. EPYC-systemen bieden ook sterke PCIe-bandbreedte, wat essentieel is voor het aansluiten van meerdere GPU’s in een AI-server.

Supermicro biedt serverplatforms voor beide architecturen en is vaak als eerste in staat nieuwe processorgeneraties te ondersteunen, ruim voordat andere merken die mogelijkheid bieden. Wij leveren deze systemen volledig geconfigureerd aan organisaties in de Benelux.

Moet je bij een AI-server kiezen voor meer cores of hogere kloksnelheid?

Voor de meeste AI-serverworkloads gaat de voorkeur uit naar meer cores boven hogere kloksnelheid, maar de optimale keuze hangt af van het workloadprofiel. Taken die sterk paralleliseerbaar zijn, zoals batch-inferentie en gedistribueerde training, schalen beter met meer cores. Latentiegevoelige taken waarbij snelle seriële verwerking centraal staat, profiteren meer van hogere kloksnelheden per core.

In de praktijk betekent dit het volgende:

  • Kies voor meer cores als je meerdere AI-modellen tegelijk draait, veel parallelle inferentieverzoeken verwerkt, of een groot aantal GPU’s aanstuurt.
  • Kies voor hogere kloksnelheid als je primair werkt met real-time inferentie op één model, of als je CPU-gebonden preprocessing doet waarbij latentie kritisch is.
  • Overweeg een balans bij gemengde workloads: een processor met een hoog aantal cores op een solide basiskloksnelheid is voor de meeste AI-omgevingen de meest flexibele keuze.

Daarnaast speelt de opslagarchitectuur een belangrijke rol: een snelle NVMe-opslag-setup zorgt ervoor dat de CPU niet wacht op data, waardoor zowel kloksnelheid als core count optimaal benut worden. De juiste CPU-keuze is altijd onderdeel van een breder systeemontwerp, niet een geïsoleerde beslissing.

Twijfel je over de beste CPU-configuratie voor jouw specifieke AI-workload? Wij helpen je graag bij het samenstellen van een Supermicro AI-server die precies aansluit op jouw behoeften, nu én in de toekomst.

Veelgestelde vragen

Kan een CPU zonder GPU ook AI-workloads aan, en welke cores zijn dan het belangrijkst?

Ja, CPU-only AI-inferentie is zeker mogelijk, vooral voor kleinere modellen of edge-toepassingen. In dat geval zijn P-cores dominant: zij dragen de volledige rekenlast van modelinferentie, en hoge single-thread prestaties gecombineerd met grote L3-cache bepalen dan rechtstreeks de responsietijd. Optimalisaties zoals Intel AMX of AMD’s BLAS-bibliotheken kunnen de CPU-prestaties voor AI verder verbeteren zonder dat een GPU nodig is.

Hoe weet ik of mijn huidige CPU een bottleneck is voor mijn AI-workload?

Een veelzeggende indicator is een hoge CPU-bezetting (boven de 90%) terwijl je GPU-utilization juist laag blijft (onder de 70%). Dit betekent dat de CPU de GPU niet snel genoeg van data kan voorzien. Tools zoals nvidia-smi, htop en perf geven je inzicht in dit patroon. Als je dit herkent, is upgraden naar een CPU met meer P-cores of hogere geheugenbandbreedte de meest directe oplossing.

Wat is een veelgemaakte fout bij het kiezen van een CPU voor een AI-server?

De meest voorkomende fout is het overinvesteren in GPU-capaciteit terwijl de CPU ondergepland blijft. Een krachtige GPU die wacht op data van een trage CPU levert aanzienlijk minder rendement dan verwacht. Een tweede veelgemaakte fout is het negeren van geheugenbandbreedte: een CPU met veel cores maar smalle geheugenkanalen kan alsnog een knelpunt vormen bij het laden van grote AI-modellen of datasets.

Hoe beïnvloedt NUMA-architectuur de prestaties in AI-servers met meerdere CPU-sockets?

Bij dual-socket servers werken de twee CPU’s elk met hun eigen geheugendomein, wat NUMA (Non-Uniform Memory Access) wordt genoemd. Als een AI-proces geheugen opvraagt dat fysiek aan de andere socket is gekoppeld, leidt dit tot hogere latentie en lagere bandbreedte. Het is daarom belangrijk om AI-workloads NUMA-bewust te configureren, bijvoorbeeld via numactl in Linux, zodat processen en hun geheugen op dezelfde socket worden gehouden.

Is het zinvol om te investeren in een nieuwere CPU-generatie voor bestaande AI-workloads?

Dat hangt sterk af van de specifieke instructiesetondersteuning van de nieuwe generatie. Intel’s AMX-instructies (beschikbaar vanaf Sapphire Rapids) kunnen matrixberekeningen voor LLM-inferentie op CPU tot vier keer versnellen ten opzichte van oudere generaties met alleen AVX-512. Als je workload intensief gebruikmaakt van matrix- of tensoroperaties, kan een generatiewissel een significante prestatieverbetering opleveren zonder dat je extra GPU’s hoeft toe te voegen.

Hoe schaal ik mijn CPU-capaciteit mee als mijn AI-omgeving groeit?

De meest flexibele aanpak is beginnen met een schaalbaar serverplatform dat dual-socket ondersteuning biedt, zodat je later een tweede CPU kunt toevoegen zonder de server te vervangen. Daarnaast is het verstandig om te kiezen voor een platform met voldoende PCIe-lanes en geheugensloten voor toekomstige uitbreiding. Voor organisaties met snel groeiende AI-workloads is een modulaire infrastructuurstrategie, eventueel in combinatie met clusterbeheer via Kubernetes, de meest toekomstbestendige keuze.

Welke rol spelen E-cores bij het draaien van meerdere AI-modellen tegelijkertijd op één server?

Bij multi-model deployments, waarbij meerdere AI-modellen tegelijkertijd actief zijn op één server, nemen E-cores de orkestratie- en communicatietaken over: denk aan het beheren van API-verzoeken, load balancing tussen modellen en logging. Dit ontlast de P-cores zodat die volledig beschikbaar blijven voor de inferentietaken zelf. In containeromgevingen zoals Docker of Kubernetes is het zelfs mogelijk om via CPU-affiniteit expliciet te sturen welke cores voor welke containers worden ingezet.

Gerelateerde artikelen

NCS International

Den Sliem 89
7141 JG Groenlo
The Netherlands
+31 544 470 000
info@ncs.nl

Meer berichten

Wat is een GPU-server?

GPU-servers verwerken duizenden berekeningen parallel — ontdek wanneer ze onmisbaar zijn voor jouw organisatie.


read more

Wat is een AI-server?

Wat is een AI-server en wanneer heb je er een nodig? Ontdek de techniek, hardware en toepassingen.


read more