Een UPS (Uninterruptible Power Supply) en stroomredundantie zijn in een AI-datacenteromgeving geen luxe, maar een absolute vereiste. AI-workloads draaien op GPU-servers die enorme hoeveelheden stroom verbruiken en bij een stroomonderbreking direct data, modelstatus en rekentijd verliezen. Stroombeveiliging voorkomt dat een korte stroomstoring een langlopende AI-trainingstaak volledig om zeep helpt. In dit artikel beantwoorden we de meest gestelde vragen over UPS, stroomredundantie en de specifieke eisen van een moderne AI-infrastructuur.

Wat gebeurt er met AI-workloads als de stroom uitvalt?

Bij een stroomuitval zonder adequate beveiliging stoppen AI-workloads onmiddellijk en gaat alle niet-opgeslagen voortgang verloren. GPU-servers slaan tussentijdse modelstatus en trainingsdata op in vluchtig geheugen (RAM en VRAM), dat bij stroomverlies direct wordt gewist. Een AI-trainingsrun van meerdere uren of dagen moet dan volledig opnieuw worden gestart, wat zowel rekentijd als energie kost.

De gevolgen gaan verder dan verloren rekentijd. Abrupte stroomuitval kan schade veroorzaken aan opslagmedia, met name aan NVMe-drives die nog actief schrijven op het moment van uitval. Ook het besturingssysteem en geïnstalleerde software kunnen corrupte bestanden achterlaten, waardoor een server pas na tijdrovend herstel weer inzetbaar is.

Voor organisaties die GPU-servers inzetten voor inferentie, dus het realtime uitvoeren van AI-modellen voor eindgebruikers, heeft een stroomstoring directe operationele gevolgen. Diensten vallen weg, API-calls mislukken en SLA-verplichtingen komen in gevaar. Juist omdat AI-infrastructuur zowel kostbaar als bedrijfskritisch is, is een robuuste stroombeveiliging voor het datacenter geen optionele aanvulling.

Hoe werkt een UPS in een moderne serveromgeving?

Een UPS (Uninterruptible Power Supply) is een apparaat dat tussen het stroomnet en de servers staat en bij uitval onmiddellijk overschakelt op een interne batterij, zodat de stroomtoevoer zonder onderbreking doorgaat. In een moderne serveromgeving zorgt een UPS voor een naadloze overgang die servers niet eens registreren als een stroomgebeurtenis.

Er zijn drie gangbare UPS-topologieën relevant voor datacenteromgevingen:

  • Offline (standby) UPS: Schakelt pas over op batterij na detectie van een storing. De overschakeltijd (enkele milliseconden) is voor de meeste servers acceptabel, maar voor kritische AI-workloads onvoldoende.
  • Line-interactive UPS: Regelt spanningsvariaties actief bij zonder batterij te gebruiken, en schakelt bij volledige uitval over op batterij. Goede middenweg voor middelgrote serveromgevingen.
  • Online dubbelconversie-UPS: Converteert netspanning continu naar gelijkstroom en terug naar wisselstroom. Servers draaien altijd op de batterijomvormer, waardoor er bij netuitval nul milliseconden overschakeltijd is. Dit is de standaard voor serieuze datacenteromgevingen en AI-infrastructuur.

Naast de directe stroombeveiliging biedt een UPS ook bescherming tegen spanningspieken, netfrequentieafwijkingen en ruis op de stroomtoevoer. Voor GPU-servers, die gevoelig zijn voor stroomkwaliteit, is dit een onderschat voordeel van een UPS-serveropstelling.

Wat is het verschil tussen N+1, 2N en 2N+1 redundantie?

Stroomredundantie beschrijft hoeveel reservecapaciteit een stroominfrastructuur heeft bovenop de minimaal benodigde capaciteit. N staat voor de benodigde capaciteit om de volledige belasting te dragen. N+1 voegt één extra eenheid toe, 2N verdubbelt de volledige capaciteit en 2N+1 is een volledig dubbele infrastructuur met een extra reserve.

N+1 redundantie

Bij N+1 is er één extra UPS-module of stroomvoeding aanwezig bovenop het minimum. Als er drie modules nodig zijn om de volledige belasting te dragen, zijn er vier aanwezig. Dit is een kostenefficiënte aanpak die bescherming biedt bij uitval van één component. Voor veel organisaties met een AI-infrastructuur die niet volledig continu-kritisch is, biedt N+1 een goede balans tussen kosten en beschikbaarheid.

2N en 2N+1 redundantie

Bij 2N is de volledige stroominfrastructuur volledig verdubbeld: twee onafhankelijke stroomcircuits, twee UPS-systemen, twee voedingspaden naar elke server. Uitval van een volledig circuit heeft geen impact op de operatie. 2N+1 voegt daar bovenop nog een extra module aan toe voor maximale bescherming. Dit niveau van redundante stroomvoorziening is de standaard in Tier III- en Tier IV-datacenters, en is vereist voor omgevingen waar downtime simpelweg geen optie is, zoals bij payment providers, ziekenhuissystemen of grote AI-platforms.

Supermicro-servers ondersteunen standaard dual redundante voedingen (PSU’s), wat aansluit op een 2N-stroomarchitectuur. Dit is een van de redenen waarom organisaties die serieus investeren in AI-infrastructuur voor stroomvoorziening kiezen voor Supermicro-hardware.

Welke stroomcapaciteit heeft een AI-server daadwerkelijk nodig?

Een moderne AI-server met meerdere high-end GPU’s verbruikt aanzienlijk meer stroom dan een traditionele server. Afhankelijk van het aantal GPU’s, het type processor en de opslagconfiguratie kan een volledig geladen AI-server tussen de 3.000 en 10.000 watt of meer verbruiken. Dit heeft directe gevolgen voor de dimensionering van UPS-systemen en stroomcircuits.

Ter vergelijking: een standaard 1U-server voor algemene workloads verbruikt doorgaans tussen de 200 en 500 watt. Een server met vier of acht recente Nvidia-GPU’s kan dit veelvoudig overstijgen. Bij het dimensioneren van een UPS voor een AI-datacenter moet rekening worden gehouden met:

  • Piekbelasting vs. gemiddeld verbruik: GPU’s verbruiken bij volledige belasting (training) significant meer dan in rust of bij inferentie. Dimensioneer op piekverbruik, niet op gemiddeld verbruik.
  • Power Usage Effectiveness (PUE): Naast de servers verbruiken ook koeling, netwerkapparatuur en overige infrastructuur stroom. Reken dit mee in de totale UPS-capaciteit.
  • Groeiruimte: Een AI-omgeving groeit doorgaans snel. Dimensioneer de UPS-capaciteit met voldoende marge voor uitbreiding, zodat de stroominfrastructuur niet direct opnieuw hoeft te worden aangepast bij de eerste serveruitbreiding.

Bij het samenstellen van AI-serveroplossingen helpen wij klanten ook nadenken over de stroomvereisten van de gekozen configuratie, zodat de stroominfrastructuur en de hardware op elkaar zijn afgestemd.

Wanneer is een generator noodzakelijk naast een UPS?

Een generator is noodzakelijk naast een UPS wanneer de verwachte duur van een stroomstoring de batterijcapaciteit van de UPS overstijgt. Een UPS biedt doorgaans een autonomietijd van enkele minuten tot maximaal een uur, afhankelijk van de batterijcapaciteit en de belasting. Voor langere storingen is een dieselgenerator of gasgenerator noodzakelijk om de stroomvoorziening te continueren.

In de praktijk werken UPS en generator als een tandem. De UPS vangt de eerste seconden of minuten op, terwijl de generator opstart. Moderne generatoren zijn doorgaans binnen 10 tot 30 seconden operationeel. Zonder UPS zou die opstartperiode voor servers al fataal zijn; met UPS is de overgang naadloos.

Een generator is in de volgende situaties vrijwel altijd noodzakelijk:

  • Omgevingen waar 24/7-beschikbaarheid vereist is, zoals productiedatacenters, ziekenhuissystemen of financiële platforms.
  • Locaties met een minder stabiel stroomnet of een verhoogd risico op langdurige stroomonderbrekingen.
  • AI-trainingsclusters waar een onderbreking van meerdere uren betekent dat dagen aan rekentijd verloren gaan.
  • Datacenters die voldoen aan Tier III- of Tier IV-specificaties, waarbij aaneengesloten beschikbaarheid contractueel is vastgelegd.

Hoe beïnvloedt stroomredundantie de keuze van serverhardware?

Stroomredundantie stelt specifieke eisen aan serverhardware: servers moeten beschikken over duale of meervoudige redundante voedingen die elk op een apart stroomcircuit zijn aangesloten. Een server met slechts één voeding is per definitie een single point of failure, ongeacht hoe goed de externe stroominfrastructuur is ingericht.

Supermicro-servers zijn standaard beschikbaar met redundante PSU-configuraties, waarbij elke voeding onafhankelijk op een apart stroompad kan worden aangesloten. Dit maakt ze bij uitstek geschikt voor gebruik in een 2N-stroomarchitectuur. Bovendien ondersteunt Supermicro geavanceerde power-managementfuncties waarmee het stroomverbruik per component nauwkeurig kan worden gemonitord en beheerd.

Bij de keuze van serverhardware voor een omgeving met stroomredundantie zijn de volgende aspecten relevant:

  • Aantal en vermogen van PSU’s: Zorg dat elke voeding afzonderlijk de volledige belasting kan dragen bij uitval van de andere.
  • Hot-swap-PSU’s: Voedingen die zonder uitschakeling kunnen worden vervangen, zijn essentieel voor onderhoud zonder downtime.
  • IPMI en remote power management: Voor het op afstand monitoren van stroomverbruik en het beheren van stroomgebeurtenissen per server.
  • Compatibiliteit met PDU’s: De server moet aansluiten op de gebruikte Power Distribution Units in het rack, inclusief de juiste stekkertypen en voltages.

De keuze voor de juiste opslagconfiguratie speelt ook een rol: bij stroomuitval zijn opslagoplossingen met schrijfbeveiliging minder kwetsbaar voor datacorruptie. Wij adviseren klanten hierover als onderdeel van een volledig geïntegreerde serveroplossing, van stroomarchitectuur tot opslagconfiguratie, zodat de gehele infrastructuur als één geheel functioneert.

Veelgestelde vragen

Hoe bepaal ik de juiste UPS-capaciteit voor mijn specifieke AI-serveropstelling?

Begin met het optellen van het maximale piekverbruik van alle aangesloten apparatuur, inclusief GPU-servers, netwerkapparatuur en koeling. Voeg daar een veiligheidsmarge van 20–25% aan toe om overbelasting te voorkomen en ruimte te laten voor uitbreiding. Vergeet ook de PUE-factor niet: in een typische serverruimte verbruikt de ondersteunende infrastructuur (koeling, verlichting, netwerk) al snel 30–50% bovenop het serververbruik zelf. Een gespecialiseerde leverancier kan u helpen een nauwkeurige vermogensberekening te maken op basis van uw specifieke hardwareconfiguratie.

Wat is de ideale autonomietijd van een UPS voor een AI-datacenteromgeving?

De ideale autonomietijd hangt af van uw herstelstrategie: als u een generator heeft die binnen 30 seconden opstart, volstaat een autonomietijd van 5–10 minuten ruimschoots voor de overbrugging. Zonder generator moet de UPS lang genoeg meegaan om een gecontroleerde shutdown van alle systemen te voltooien, wat bij grote AI-clusters al snel 10–20 minuten kan vergen. Houd er rekening mee dat de autonomietijd sterk afneemt naarmate de belasting hoger is; test de werkelijke autonomietijd altijd onder realistische piekbelasting en niet alleen op papier.

Hoe implementeer ik checkpointing om verlies van AI-trainingsvoortgang bij stroomuitval te minimaliseren?

Checkpointing is een softwarematige strategie waarbij de modelstatus, gewichten en optimalisatiestatus periodiek worden opgeslagen naar persistente opslag, zodat een training na een onderbreking kan worden hervat vanaf het laatste checkpoint. Frameworks zoals PyTorch en TensorFlow bieden ingebouwde checkpointing-functionaliteit; stel de checkpointfrequentie in op basis van de acceptabele hoeveelheid verloren rekentijd, bijvoorbeeld elke 15–30 minuten bij langlopende trainingstaken. Combineer dit altijd met een robuuste UPS-oplossing: checkpointing vervangt stroombeveiliging niet, maar beperkt de schade als een storing toch doordringt.

Welke veelgemaakte fouten worden er gemaakt bij het inrichten van stroomredundantie voor AI-servers?

Een van de meest voorkomende fouten is het aansluiten van beide PSU’s van een server op hetzelfde stroomcircuit of dezelfde UPS, waardoor er in de praktijk geen echte redundantie bestaat ondanks de aanwezige hardware. Een andere veelgemaakte fout is het dimensioneren op gemiddeld verbruik in plaats van piekverbruik, waardoor de UPS overbelast raakt op het moment dat het er echt toe doet. Tot slot wordt de batterijcapaciteit van UPS-systemen regelmatig niet getest of onderhouden, terwijl batterijen na 3–5 jaar significant aan capaciteit verliezen en periodieke vervanging vereisen.

Hoe monitor ik het stroomverbruik en de UPS-status van mijn AI-servers op afstand?

De meeste zakelijke UPS-systemen bieden een netwerkbeheerkaart (Network Management Card) waarmee u de UPS-status, batterijgezondheid, belasting en autonomietijd op afstand kunt monitoren via een webinterface of integreren in een bredere monitoringoplossing zoals Nagios, Zabbix of Prometheus. Op serverniveau biedt IPMI (Intelligent Platform Management Interface), standaard aanwezig op Supermicro-servers, inzicht in het stroomverbruik per component en maakt het geautomatiseerde acties mogelijk bij stroomgebeurtenissen. Stel altijd drempelwaarden en alerts in zodat u proactief wordt gewaarschuwd bij afwijkingen, zoals een batterij die onder 80% capaciteit zakt of een onverwachte belastingspiek.

Is een colocatiedatacenter een goed alternatief als ik zelf geen stroomredundantie wil inrichten?

Ja, colocatie in een gecertificeerd Tier III- of Tier IV-datacenter is een uitstekende optie voor organisaties die niet zelf willen investeren in UPS-systemen, generators en redundante stroominfrastructuur. Deze datacenters bieden standaard 2N of 2N+1 stroomredundantie, professioneel onderhoud en contractueel vastgelegde uptime-garanties van 99,982% (Tier III) of 99,995% (Tier IV). U bent dan wel nog steeds verantwoordelijk voor de stroomredundantie op serverniveau, dus kies ook in een colocatieomgeving altijd voor servers met redundante PSU’s die op de twee beschikbare stroomcircuits worden aangesloten.

Hoe vaak moet ik mijn UPS-systeem testen en onderhouden om betrouwbaarheid te garanderen?

Een UPS-systeem vereist regelmatig onderhoud om te garanderen dat het daadwerkelijk functioneert op het moment dat het nodig is. Voer minimaal twee keer per jaar een belastingstest uit waarbij u simuleert dat de netspanning wegvalt en controleert of de UPS correct en tijdig overneemt. Controleer de batterijgezondheid jaarlijks via de beheerinterface of een gespecialiseerde technicus, en vervang batterijen proactief na 3–5 jaar, afhankelijk van het gebruikte batterijtype en de omgevingstemperatuur. Documenteer alle testresultaten en onderhoudsmomenten zodat u trends in batterijdegradatie tijdig kunt signaleren.

Gerelateerde artikelen

NCS International

Den Sliem 89
7141 JG Groenlo
The Netherlands
+31 544 470 000
info@ncs.nl

Meer berichten

Wat is een GPU-server?

GPU-servers verwerken duizenden berekeningen parallel — ontdek wanneer ze onmisbaar zijn voor jouw organisatie.


read more

Wat is een AI-server?

Wat is een AI-server en wanneer heb je er een nodig? Ontdek de techniek, hardware en toepassingen.


read more