NVIDIA Mellanox 920-9B210-00FN-0D0 in de praktijk: het bouwen van een NDR Low-Latency Fabric voor Trillion-Parameter MoE-modellen

August 27, 2026

Laatste bedrijfsnieuws over NVIDIA Mellanox 920-9B210-00FN-0D0 in de praktijk: het bouwen van een NDR Low-Latency Fabric voor Trillion-Parameter MoE-modellen

NVIDIA Mellanox 920-9B210-00FN-0D0 in de praktijk: het bouwen van een NDR Low-Latency Fabric voor Trillion-Parameter MoE-modellen

Achtergrond en de uitdaging: Wanneer alles voor iedereen een knelpunt wordt in de opleiding

Een toonaangevende AI-onderzoeksorganisatie heeft onlangs haar grote taalmodeltrainingscluster van 1.024 naar 4.096 NVIDIA H100 GPU's vergroot, met als ambitieus doel de trainingstijd voor een 1.8-biljoen-parameter schaars MoE-model (Mix of Experts) van maanden tot minder dan twee wekenTijdens de eerste validatie, the team discovered that their existing 200Gb/s HDR network was experiencing severe congestion during the all-to-all communication phase—a characteristic pattern of MoE architectures—causing GPU utilization to plummet from an expected 85% to just 52%, ver onder de drempel die nodig is om aan de trainingstermijn te voldoen.

Netwerkanalyse toonde aan dat collectieve communicatie voor meer dan 40% van de communicatievoetafdruk van het MoE-model bestond.Het verkeerspatroon werd steeds meer gefragmenteerd en gebarsten.Het bestaande HDR-netwerk, na het activeren van congestiebeheersmechanismen, onderging dramatische latentieverhogingen, waardoor een aanzienlijk deel van de GPU's inactief en wachtend bleef.De organisatie had dringend behoefte aan een netwerkstuk dat in staat was om deterministische sub-microseconde latentie te leveren., verliesloos transport, en enorme niet-blokkerende schaalbaarheidNVIDIA Mellanox 920-9B210-00FN-0D0is speciaal voor deze uitdaging gebouwd.

Oplossing en implementatie: een door het MoE geoptimaliseerde NDR Leaf-Spine Architectuur

De organisatie heeft een tweelaagse blad-ruggengraatfabriek ingezet die is gebouwd rond de920-9B210-00FN-0D0 InfiniBand-schakelaar OPNIn elke rekenruimte, twee920-9B210-00FN-0D0 MQM9790-NS2FIn de bladerenlaag werden switches geïnstalleerd die 400 Gb/s connectiviteit leverden aan 64 H100-servers met twee poorten via OSFP-naar-OSFP-actieve optische kabels.16 extra 920-9B210-00FN-0D0 schakelaars met elkaar verbonden alle bladschakelaars, waardoor een volledig niet-blokkerende fat-tree stof wordt gecreëerd met een totale bisectiebandbreedte van 51,2 Tb/s.

Het middelpunt van deze oplossing is de geïntegreerde SHARPv3-technologie van de schakelaar (Scalable Hierarchical Aggregation and Reduction Protocol).Alle communicatie werd rechtstreeks naar de schakelaar getransporteerd., waarbij de switches de gegevens in het netwerk verminderen en herverdelen.het drastisch verminderen van de communicatie overhead die de vorige HDR implementatie had geplaagd. de920-9B210-00FN-0D0 gegevensbladde doorlooplatentie van minder dan 100 ns, die tijdens de proof-of-conceptfase werd gevalideerd en van cruciaal belang bleek voor de strenge latentievereisten van de MoE-werklast.

De920-9B210-00FN-0D0 specificaties¥inclusief dubbele redundante stroomvoorzieningen en warmwisselbare ventilatoren ¥ gaf het team het vertrouwen om hun 99,999% beschikbaarheid doel te bereiken.920-9B210-00FN-0D0 compatibelHet ecosysteem omvatte alle OSFP-optica en -kabels die zij al hadden gekwalificeerd, waardoor vertragingen bij de aanbesteding werden geëlimineerd en de implementatietijdlijn werd vereenvoudigd.

Resultaten en meetbare voordelen: van een knelpunt naar een stimulant

Na de volledige inzet van de NDR-structuur en de hervatting van de opleidingsactiviteit van het MOE, heeft de organisatie transformatieve verbeteringen in meerdere dimensies gemeten:

  • Recuperatie van GPU-gebruik:De gemiddelde GPU-uitbuiting steeg van 52% naar 89%, met een piekuitbuiting van 94% in computingintensieve fasen, een direct gevolg van het elimineren van door het netwerk veroorzaakte stallingen.
  • Vermindering van de latentie van alles naar alles:De tijd die nodig is voor een volledige all-to-all-uitwisseling over 4.096 GPU's daalde van 180 ms naar minder dan 45 ms, een verbetering van 75% die rechtstreeks werd vertaald in snellere trainingsiteraties.
  • Tijd voor voltooiing van de opdracht:De geplande trainingstijd voor het 1,8T MoE-model werd verlaagd van 14 dagen naar slechts 9 dagen, met een versnelling van 36%, waardoor zowel de time-to-market- als de cloudcomputingkosten aanzienlijk werden verlaagd.
  • Operationeel rendement:Met 64 poorten per schakelaar werd het aantal benodigde spine-schakelaars met 37% verminderd in vergelijking met een 40-poort HDR-ontwerp, waardoor de bekabeling werd vereenvoudigd en het stroomverbruik per rack met 28% werd verminderd.

Het financieel team van de organisatie merkte op dat de totale eigendomskosten920-9B210-00FN-0D0 prijsIn de eerste plaats is de kosten van de netwerkoplossingen voor de GPU's in vergelijking met de HDR-alternatieven hoger.in combinatie met de dramatische prestatiewinst, maakte de NDR-upgrade een duidelijke zakelijke overwinning.920-9B210-00FN-0D0 InfiniBand switch OPN oplossingHet systeem is ook naadloos geïntegreerd met hun bestaande NVIDIA UFM-implementatie, waardoor ze gecentraliseerde zichtbaarheid en geautomatiseerde waarschuwingen bieden die de operationele overhead met 40% verminderen.

Samenvatting en vooruitzichten: De NDR Foundation for Next-Gen MoE Workloads

DeNVIDIA Mellanox 920-9B210-00FN-0D0Het bleek de transformatieve oplossing te zijn die deze AI-onderzoeksorganisatie nodig had om het volledige potentieel van haar H100-cluster van 4096 GPU's te ontsluiten.en SHARPv3 in-network computing, de switch stelde hen in staat om te schalen van 1.024 naar 4.096 GPU's zonder afbreuk te doen aan de prestaties of beheersbaarheid, een prestatie die onmogelijk zou zijn geweest met hun vorige HDR-infrastructuur.

De organisatie is van plan om binnen de komende 18 maanden uit te breiden tot 8.192 GPU's.920-9B210-00FN-0D0 te koopVoor organisaties die hun volgende generatie AI- en HPC-netwerkinvesteringen evalueren, is het de bedoeling om de volgende generatie AI- en HPC-netwerken te ontwikkelen.De 920-9B210-00FN-0D0 biedt een bewezen, een productie-klaar oplossing die voldoet aan de belofte van lage latentie RDMA-interconnectoptimalisatie op exaschaal.