NVIDIA Mellanox 920-9B210-00FN-0D0 in de praktijk: Het bouwen van een NDR Low-Latency Fabric voor AI-clusters met biljoenen parameters
August 26, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 in de praktijk: Het bouwen van een NDR Low-Latency Fabric voor AI-clusters met biljoenen parameters
Achtergrond & De Uitdaging: Wanneer HDR Trillion-Parameter Modellen Ontmoet
Een toonaangevende AI-onderzoeksorganisatie schaalde onlangs haar cluster voor het trainen van grote taalmodellen van 1.024 naar 4.096 NVIDIA H100 GPU's, met als doel de trainingsduur voor een 1,8 biljoen parameter sparse MoE (Mixture of Experts) model te comprimeren van maanden naar minder dan twee weken. Echter, tijdens de initiële validatie, observeerde het team ernstige congestie in de all-to-all communicatiefase op hun bestaande 200Gb/s HDR fabric, waardoor de GPU-benutting kelderde van een verwachte 85% naar slechts 52%—ver onder de drempel die nodig is om hun ambitieuze trainingsdeadline te halen.
De netwerkanalyse onthulde dat de all-to-all collectieve operaties, die inherent zijn aan MoE-architecturen, de HDR-links verzadigden en congestiecontrolemechanismen activeerden die de latentie verder versterkten. De organisatie had een fabric nodig die deterministische, sub-microseconden latentie kon leveren over duizenden eindpunten, terwijl het de bandbreedte-ruimte bood om verkeerspieken op te vangen zonder prestatieverlies. Dit is precies de uitdaging die de NVIDIA Mellanox 920-9B210-00FN-0D0 is ontworpen om aan te pakken.
Oplossing & Implementatie: Een 400Gb/s NDR Fabric voor Exascale AI
De organisatie implementeerde de 920-9B210-00FN-0D0 InfiniBand switch OPN (Ordering Part Number) als de basis van een nieuwe two-tier leaf-spine fabric. Op leaf-niveau ontving elke rack twee 920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR switches, die 128 poorten van 400Gb/s connectiviteit boden aan 64 dual-port H100 servers per rack via OSFP-naar-OSFP actieve optische kabels. Op spine-niveau verbonden 16 extra 920-9B210-00FN-0D0 switches alle leaf switches met elkaar, waardoor een non-blocking fat-tree met een volledige bisectiebandbreedte van 51,2 Tb/s per spine-tier werd gecreëerd.
Wat deze oplossing bijzonder overtuigend maakte, was de geïntegreerde SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) technologie van de switch. Voor de MoE-workload werd de all-to-all communicatie direct afgehandeld op de switch fabric, waarbij de switches in-network data-reductie en herverdeling uitvoerden. Dit elimineerde de noodzaak van meerdere host-side passes, waardoor de communicatie-overhead die de vorige HDR-implementatie plaagde drastisch werd verminderd.
Volgens het 920-9B210-00FN-0D0 datasheet, levert de switch een cut-through latentie van minder dan 100 ns, wat werd gevalideerd tijdens de proof-of-concept fase. Het engineeringteam bevestigde ook dat het 920-9B210-00FN-0D0 compatibele ecosysteem alle OSFP-optics en kabels bevatte die ze al hadden gekwalificeerd, waardoor inkoopproblemen werden geëlimineerd. De 920-9B210-00FN-0D0 specificaties—inclusief dubbele redundante voedingen en hot-swappable ventilatoren—gaven het team vertrouwen in het behalen van hun 99,999% beschikbaarheidsdoelstelling voor het productiecluster.
Resultaten & Meetbare Winsten: Van Bottleneck naar Mogelijkmaker
Nadat de volledige NDR fabric was geïmplementeerd en de MoE-trainingstaak was hervat, mat de organisatie transformerende verbeteringen op meerdere fronten:
- Herstel van GPU-benutting: De gemiddelde GPU-benutting steeg van 52% naar 89%, met een piekbenutting van 94% tijdens rekenintensieve fasen—een direct gevolg van het elimineren van netwerk-geïnduceerde vertragingen.
- Vermindering van all-to-all latentie: De tijd die nodig was voor een volledige all-to-all uitwisseling over 4.096 GPU's daalde van 180 ms naar minder dan 45 ms, een verbetering van 75% die direct vertaalde naar snellere trainingsiteraties.
- Voltooiingstijd van de taak: De verwachte trainingstijd voor het 1,8T MoE-model werd teruggebracht van 14 dagen naar slechts 9 dagen—een versnelling van 36% die zowel de time-to-market als de cloud-compute kosten aanzienlijk verlaagde.
- Operationele efficiëntie: Met 64 poorten per switch werd het aantal benodigde spine switches met 37% verminderd in vergelijking met een 40-poorts HDR-ontwerp, wat de bekabeling vereenvoudigde en het stroomverbruik per rack met 28% verminderde.
Vanuit een totaal eigendomskostenperspectief merkte het financiële team van de organisatie op dat hoewel de 920-9B210-00FN-0D0 prijs per eenheid hoger was dan het HDR-alternatief, de netwerkkosten per GPU daadwerkelijk daalden vanwege de hogere radix en het verminderde aantal switch-lagen. Dit economische voordeel, gecombineerd met de dramatische prestatieverbeteringen, maakte de NDR-upgrade een duidelijke zakelijke winst. De 920-9B210-00FN-0D0 InfiniBand switch OPN-oplossing integreerde ook naadloos met hun bestaande NVIDIA UFM-implementatie, wat centrale zichtbaarheid en geautomatiseerde waarschuwingen bood die de operationele overhead met 40% verminderden.
Samenvatting & Vooruitzichten: De NDR Basis voor Next-Gen AI
De NVIDIA Mellanox 920-9B210-00FN-0D0 bleek de transformerende oplossing die deze AI-onderzoeksorganisatie nodig had om het volledige potentieel van haar 4.096-GPU H100 cluster te ontsluiten. Door 400Gb/s NDR-bandbreedte, 64-poorts dichtheid en SHARPv3 in-network computing te leveren, stelde de switch hen in staat om op te schalen van 1.024 naar 4.096 GPU's zonder prestaties of beheersbaarheid te compromitteren—een prestatie die onmogelijk zou zijn geweest met hun vorige HDR-infrastructuur.
Vooruitkijkend is de organisatie van plan om binnen de komende 18 maanden uit te breiden naar 8.192 GPU's, waarbij de 920-9B210-00FN-0D0 te koop via de channel partners van NVIDIA wordt gebruikt om een nog grotere three-tier folded-Clos fabric te bouwen. Voor organisaties die hun investeringen in next-generation AI en HPC-netwerken evalueren, biedt de 920-9B210-00FN-0D0 een bewezen, productieklaar oplossing die de belofte van low-latency RDMA interconnect-optimalisatie op exascale-niveau waarmaakt.

