Een Supermicro AI-server uitbreiden naarmate je workload groeit doe je door stapsgewijs extra GPU’s, geheugen, opslag of netwerkbandbreedte toe te voegen aan een bestaand systeem, of door meerdere servers samen te koppelen in een cluster. Supermicro-platforms zijn van nature ontworpen met schaalbaarheid als uitgangspunt, waardoor je niet bij elke groeistap hoeft te investeren in een volledig nieuw systeem. In dit artikel beantwoorden we de meest gestelde vragen over het schalen van je AI-infrastructuur, van componentkeuze tot clusteropbouw en support.

Welke componenten bepalen de schaalbaarheid van een Supermicro AI-server?

De schaalbaarheid van een Supermicro AI-server wordt bepaald door vier kerncomponenten: het moederbord (het aantal beschikbare PCIe-slots en CPU-sockets), de voeding (of die voldoende wattage heeft voor extra GPU’s), de koeling (of het chassis uitgebreide thermische belasting aankan) en de opslagarchitectuur. Samen bepalen deze factoren hoeveel ruimte er is om te groeien zonder het hele systeem te vervangen.

Het moederbord is het meest bepalende onderdeel. Supermicro biedt moederborden met vier tot acht of meer PCIe 5.0-slots, wat directe invloed heeft op hoeveel GPU’s je kunt toevoegen. Kies je bij de initiële configuratie voor een platform met meer slots dan je op dat moment nodig hebt, dan betaal je nu iets meer maar bespaar je later aanzienlijk op vervangingskosten.

Naast het moederbord speelt de voedingseenheid een kritieke rol. Moderne AI-GPU’s zoals de Nvidia H100 of B300 verbruiken elk honderden watt. Een server die nu twee GPU’s draait maar later zes moet ondersteunen, heeft een redundante voeding nodig die dat vermogen ook daadwerkelijk kan leveren. Wij adviseren bij elke configuratie al rekening te houden met de maximale thermische belasting van de beoogde eindconfiguratie, zodat je later niet tegen een onverwacht plafond aanloopt.

Wanneer is het beter om een bestaande server uit te breiden dan een nieuwe te kopen?

Het uitbreiden van een bestaande Supermicro AI-server is beter dan een nieuwe aanschaffen wanneer het huidige platform nog vrije PCIe-slots, geheugenkanalen en voldoende voedingscapaciteit heeft. Is dat het geval, dan levert een upgrade een hogere return on investment dan een volledige vervanging, omdat je de bestaande investering in chassis, moederbord en koeling behoudt.

Er zijn echter situaties waarin een nieuwe server de betere keuze is. Dat geldt wanneer het bestaande platform een oudere PCIe-generatie heeft die de bandbreedte van nieuwe GPU’s niet volledig benut, wanneer de CPU-architectuur niet meer aansluit op moderne AI-workloads, of wanneer de totale eigendomskosten van een upgrade dicht in de buurt komen van een nieuw systeem. In de huidige markt, waar GPU-prijzen sterk fluctueren door schaarste en grootschalige inkoop door hyperscalers, is de timing van een aankoop bovendien relevant: soms is het financieel aantrekkelijker om nu een volledig nieuw en toekomstbestendig platform neer te zetten dan later in stappen bij te kopen tegen hogere prijzen.

Een goede vuistregel: als een uitbreiding meer dan 70 procent van de nieuwwaarde van een vergelijkbaar nieuw systeem kost, is vervanging doorgaans de slimmere investering op de lange termijn.

Hoe voeg je extra GPU’s toe aan een bestaande Supermicro AI-server?

Extra GPU’s toevoegen aan een bestaande Supermicro AI-server vereist drie stappen: controleer of het moederbord voldoende vrije PCIe-slots heeft met de juiste generatie en bandbreedte, verifieer dat de voedingseenheid het extra vermogen aankan, en zorg dat het koelsysteem de hogere thermische output verwerkt. Daarna installeer je de GPU’s fysiek, update je de drivers en pas je de workload-configuratie aan.

Voorbereiding: compatibiliteit controleren

Voordat je een GPU plaatst, controleer je het technische datasheet van het moederbord op het maximale aantal ondersteunde GPU’s, de PCIe-generatie (5.0 geeft aanzienlijk meer bandbreedte dan 4.0) en de vereiste stroomconnectoren. Supermicro publiceert gevalideerde GPU-compatibiliteitslijsten per platform, wat de kans op onverwachte problemen na installatie sterk verkleint.

Installatie en configuratie

Na de fysieke plaatsing van de GPU’s installeer je de bijbehorende drivers en, indien van toepassing, de CUDA-toolkit of andere AI-frameworks. Vervolgens test je de server onder volledige belasting om te bevestigen dat thermische limieten niet worden overschreden en dat de voeding stabiel blijft. Wij begeleiden klanten ook in deze fase, zodat de uitbreiding direct productierijp is.

Wat is het verschil tussen verticaal en horizontaal schalen bij AI-workloads?

Verticaal schalen betekent dat je meer rekenkracht toevoegt aan één bestaande server, bijvoorbeeld door extra GPU’s, meer RAM of snellere opslag te installeren. Horizontaal schalen betekent dat je meerdere servers aan elkaar koppelt om als één systeem samen te werken. Voor AI-workloads geldt: verticaal schalen is eenvoudiger en heeft lagere latency, horizontaal schalen biedt vrijwel onbeperkte capaciteit maar vereist meer netwerk- en softwarearchitectuur.

Bij AI-training op grote modellen bereik je al snel de grenzen van wat één server aankan, zelfs met acht high-end GPU’s. Horizontaal schalen via een GPU-cluster maakt het mogelijk om trainingstaken te verdelen over tientallen of honderden GPU’s. Dit vereist wel een hoogwaardige interconnect zoals InfiniBand of een 400GbE-netwerk, anders wordt de netwerkverbinding zelf het knelpunt.

Voor inferentie-workloads, waarbij een getraind model voorspellingen doet op basis van inkomende data, volstaat verticaal schalen vaak langer. De rekenintensiteit per verzoek is lager dan bij training, waardoor één krachtig systeem een hoge doorvoer kan verwerken. Pas wanneer het aantal gelijktijdige verzoeken sterk toeneemt, is horizontale uitbreiding de logische volgende stap. Meer over hoe wij AI-infrastructuur inrichten lees je op onze oplossingenpagina.

Hoe schakel je meerdere Supermicro AI-servers samen in een cluster?

Meerdere Supermicro AI-servers samenvoegen tot een cluster doe je door ze te verbinden via een hoogwaardig netwerk (InfiniBand of 100GbE of hoger), clusterbeheersoftware te configureren zoals Kubernetes of Slurm, en de workloads te verdelen via een job scheduler. Supermicro-platforms zijn ontworpen om naadloos in dergelijke clusterarchitecturen te functioneren.

De netwerkkeuze is bepalend voor de clusterprestaties. InfiniBand biedt de laagste latency en de hoogste bandbreedte voor GPU-to-GPU-communicatie, wat essentieel is bij gedistribueerde AI-training waarbij GPU’s voortdurend gradiënten uitwisselen. Ethernet-oplossingen op basis van 100GbE of 400GbE zijn een kostenefficiënter alternatief voor inferentie-clusters of minder latencygevoelige workloads.

Naast het netwerk is opslag een aandachtspunt in een clusteromgeving. Gedeelde, snelle opslag, zoals een parallel bestandssysteem of een NVMe-over-Fabrics-oplossing, zorgt ervoor dat alle nodes in het cluster toegang hebben tot dezelfde trainingsdata zonder dat opslag het knelpunt wordt. Onze opslagoplossingen zijn specifiek afgestemd op deze eisen.

Welke garantie- en supportopties gelden bij het uitbreiden van een Supermicro AI-server?

Bij het uitbreiden van een Supermicro AI-server gelden de garantievoorwaarden van de nieuw toegevoegde componenten naast de bestaande garantie op het systeem. Wij zijn de enige Supermicro-distributeur in Nederland die 24/7 on-site garantieservice biedt, wat betekent dat bij een storing een technicus ter plaatse komt, ook buiten kantooruren.

Het is belangrijk te weten dat het toevoegen van componenten die niet door Supermicro zijn gevalideerd voor het betreffende platform de bestaande garantie kan beïnvloeden. Wij adviseren daarom altijd om uitbreidingen te laten uitvoeren met gecertificeerde en compatibele hardware, en om vooraf te overleggen welke componenten officieel ondersteund worden. Zo blijft de garantie op het gehele systeem intact.

Voor organisaties waarbij uptime bedrijfskritisch is, bieden wij ook uitgebreide servicecontracten aan die proactief beheer, snelle vervangingsonderdelen en directe toegang tot onze engineers omvatten. Omdat wij vaste contactpersonen hanteren en geen wisselende helpdesks, weten onze klanten altijd met wie ze spreken en kunnen ze rekenen op snelle, deskundige afhandeling bij elke uitbreiding of storing.

Veelgestelde vragen

Hoeveel GPU's kan ik maximaal toevoegen aan een Supermicro AI-server?

Dit hangt volledig af van het moederbordplatform dat je gebruikt. Supermicro biedt systemen aan die twee tot acht of zelfs meer GPU’s ondersteunen, afhankelijk van het aantal beschikbare PCIe 5.0-slots en de voedingscapaciteit van het chassis. Het is daarom verstandig om bij de initiële aanschaf al een platform te kiezen dat aansluit op je verwachte maximale GPU-behoefte, zodat je later zonder infrastructurele beperkingen kunt uitbreiden.

Wat zijn de meest gemaakte fouten bij het uitbreiden van een AI-server?

De meest voorkomende fout is het onderschatten van de voedings- en koelcapaciteit: veel beheerders voegen GPU’s toe zonder te verifiëren of de PSU het extra vermogen daadwerkelijk aankan onder volledige belasting. Een tweede veelgemaakte fout is het installeren van niet-gevalideerde hardware, wat zowel prestatieproblemen als garantieverlies kan veroorzaken. Controleer daarom altijd de Supermicro-compatibiliteitslijst voor je platform en raadpleeg een specialist voordat je begint.

Hoe weet ik of mijn huidige netwerkinfrastructuur geschikt is voor een GPU-cluster?

Voor een GPU-cluster heb je minimaal een 100GbE-netwerk nodig, maar voor gedistribueerde AI-training waarbij GPU’s continu gradiënten uitwisselen is InfiniBand de aanbevolen keuze vanwege de extreem lage latency en hoge bandbreedte. Controleer of je huidige switches en netwerkaansluitingen deze snelheden ondersteunen en of je topologie geschikt is voor de all-to-all communicatiepatronen die AI-trainingstaken vereisen. Als je netwerk het knelpunt wordt, verlies je het grootste deel van de prestatievoordelen van extra GPU’s.

Kan ik Supermicro AI-servers uit verschillende generaties combineren in één cluster?

Technisch gezien is het mogelijk om servers van verschillende generaties in één cluster te combineren, maar dit brengt uitdagingen met zich mee op het gebied van prestatie-uniformiteit: de langzaamste node bepaalt vaak het tempo van gedistribueerde trainingstaken. Bovendien kunnen verschillen in PCIe-generatie, GPU-architectuur en driverversies de configuratie en het beheer compliceren. Wij adviseren om bij clusteruitbreiding zoveel mogelijk te kiezen voor homogene hardware, of in ieder geval per node-groep een consistente configuratie aan te houden.

Hoe lang duurt het gemiddeld om een Supermicro AI-server uit te breiden, en moet de server daarvoor offline?

Een uitbreiding met extra GPU’s duurt doorgaans een halve tot een hele werkdag, inclusief de fysieke installatie, driverupdates en validatietests onder belasting. De server moet tijdens de fysieke installatie offline zijn, maar met goede planning kan de downtime beperkt worden tot een kort onderhoudsvenster. Als uptime bedrijfskritisch is, adviseren wij om de uitbreiding te combineren met een gepland onderhoudsmoment of om een redundante node in te zetten die de workload tijdelijk overneemt.

Welke software heb ik nodig om mijn uitgebreide AI-infrastructuur optimaal te benutten?

Na een hardware-uitbreiding heb je minimaal bijgewerkte GPU-drivers en, afhankelijk van je workload, de CUDA-toolkit, cuDNN en een AI-framework zoals PyTorch of TensorFlow nodig. Voor clusteromgevingen voeg je daar clusterbeheersoftware aan toe zoals Kubernetes met GPU-operators of een job scheduler zoals Slurm voor het verdelen van trainingstaken. Het correct configureren van deze softwarelaag is minstens zo belangrijk als de hardware zelf: een verkeerde instelling van NUMA-topologie of GPU-affiniteit kan de prestaties met tientallen procenten verlagen.

Wat moet ik regelen op het gebied van stroomvoorziening en koeling in het datacenter bij een grote uitbreiding?

Bij het uitbreiden van je AI-infrastructuur met meerdere GPU-servers stijgt het stroomverbruik en de warmteproductie aanzienlijk: een volledig bezette AI-server met acht H100-GPU’s kan al snel 10 tot 12 kilowatt verbruiken. Controleer vooraf of je datacenterpowerfeeds, PDU’s en koelcapaciteit (in kW per rack) deze belasting aankunnen, en stem dit af met je facilitaire afdeling of datacenteroperator. Wij adviseren bij grotere uitbreidingen altijd een gezamenlijke review van de datacenterinfrastructuur, zodat je geen verrassingen tegenkomt op het moment van ingebruikname.

Gerelateerde artikelen

NCS International

Den Sliem 89
7141 JG Groenlo
The Netherlands
+31 544 470 000
info@ncs.nl

Meer berichten

Wat is een GPU-server?

GPU-servers verwerken duizenden berekeningen parallel — ontdek wanneer ze onmisbaar zijn voor jouw organisatie.


read more

Wat is een AI-server?

Wat is een AI-server en wanneer heb je er een nodig? Ontdek de techniek, hardware en toepassingen.


read more