NVIDIA Mellanox MCX653106A-HDAT in actie: RDMA/RoCE Low-Latency Transport en Server Throughput Optimalisatie
July 30, 2026
A major hyperscale cloud provider operating a 256-node cluster for distributed AI training and real-time analytics began experiencing severe network performance degradation as their infrastructure scaledDe bestaande 25GbE TCP/IP-gebaseerde stof vertoonde All-Reduce-latenties van meer dan 6 milliseconden over 128 knooppunten.Terwijl de CPU-benutting voor netwerkverwerking meer dan 40% van de rekenkapaciteit van elke server verbruiktDeze knelpunt beperkte de GPU-uitbuiting tot slechts 55%, waardoor de trainingscycli drastisch werden verlengd en de inkomstenopwekkende capaciteit werd verminderd.Het team had een oplossing nodig die zowel microseconde latency als enorme bandbreedte kon leveren en tegelijkertijd de programmeerbaarheid kon bieden die nodig was voor werkladingspecifieke verkeersoptimalisatie.
Na een uitgebreide technische evaluatie heeft de aanbieder deNVIDIA Mellanox MCX653106A-HDATHet is de basis voor de transformatie van het netwerk.MCX653106A-HDAT ConnectX adapter PCIe-netwerkkaart, geconfigureerd met dual-port 100GbE-connectiviteit om 200 Gb/s totale bandbreedte per knooppunt te leveren.
- Fase 1 Pilotproject (8 knooppunten):Het team installeerde deMCX653106A-HDAT Ethernet-adapterkaartDe adapters werden gekoppeld aan NVIDIA Spectrum-4 switches voor end-to-end congestie management.
- Fase 2 - Validering en afstemming:Met behulp van de telemetrische gegevens die in deMCX653106A-HDAT-gegevensbladHet team heeft de configuratie gevalideerd, de DCB-parameters verfijnd en de instellingen voor collectieve communicatie van NCCL geoptimaliseerd.De geavanceerde programmabiliteitsfuncties van de adapter stelden een aangepaste verkeersstuur mogelijk voor de specifieke all-reductiepatronen van de werkdruk.
- Fase 3: volledige productie (256 knooppunten):Na een succesvolle validatie werd de gehele cluster naar de nieuwe adapter gemigreerd.MCX653106A-HDAT-compatibelde aard van de oplossing zorgde voor naadloze integratie met bestaande servers en Linux-distributies.
- Fase 4 Continu optimalisatie:Het team maakte gebruik van de in-line telemetrie en programmeerbare datapath van de adapter om routingsbeleid te implementeren dat rekening houdt met de werkdruk, waardoor de prestaties voor de AI-trainingswerkzaamheden verder werden geoptimaliseerd.
Het team merkte op dat deMCX653106A-HDAT Ethernet adapter kaart oplossingDe QSFP56-poorten ondersteunden zowel 100GbE- als 25GbE-optica, waardoor een soepele overgang mogelijk was zonder de bestaande connectiviteit te verstoren.
| Metrische | Pre-upgrade (25GbE TCP/IP) | Na-upgrade (MCX653106A-HDAT met RoCE) | Verbetering |
|---|---|---|---|
| All-Reduce Latency (256 knooppunten) | 6.8 ms | 0.22 ms | 30.9* vermindering |
| Netwerk-CPU-gebruik (per knooppunt) | 43% | 5% | 38 pp hergebruikt |
| GPU-gebruik (opleidingsfase) | 55% | 93% | +38% toename |
| Clusteropleiding doorvoer | 2.1x baseline | 6.4x basiswaarde | 3.0* stijging |
Naast deze kwantitatieve winst heeft de aanbieder aanzienlijke operationele voordelen waargenomen.het drastisch versnellen van de time-to-market voor nieuwe AI-dienstenHet programmeerbare datapad van de adapter maakte het mogelijk om het verkeer op maat te vormen voor prioriteitsstromen, zodat het kritieke collectieve communicatieverkeer nooit in twijfel raakte.Voor organisaties die het rendement van hun investeringen beoordelen, deMCX653106A-HDAT prijsHet team merkte ook op dat de aankoop van een nieuwe server, die in de eerste helft van het jaar werd uitgevoerd, volledig gerechtvaardigd was door de 3* doorvoerwinst en de mogelijkheid om extra serververwervingen met meer dan 18 maanden uit te stellen.MCX653106A-HDAT te koopbundels met NVIDIA Spectrum-4-switches boden de meest gunstige economie voor grootschalige implementaties.
De aanbieder maakte ook gebruik van de uitgebreide telemetrie-mogelijkheden die in deMCX653106A-HDAT-specificatieshet ontwikkelen van voorspellende prestatiemodellen en geautomatiseerde congestiebeperkende strategieën, waardoor de operationele efficiëntie verder wordt verbeterd.
Deze inzet op productieschaal toont aan dat deNVIDIA Mellanox MCX653106A-HDATDe combinatie van 200 Gb/s totale bandbreedte, sub-0,3 milliseconde collectieve communicatie latentie,en uitgebreide hardware offloads maakt bijna lineaire schaalbaarheid voor GPU-versnelde werklasten mogelijkAls een eind-tot-eindMCX653106A-HDAT Ethernet adapter kaart oplossing, verwijdert het de netwerkflesskloof die de efficiëntie van gedistribueerde opleiding en de levering van clouddiensten historisch heeft beperkt.
Ik kijk vooruit.de cloudprovider onderzoekt uitgebreide integratie met NVIDIA DOCA om extra gegevenspadprogrammabiliteit te implementeren voor werklastspecifieke optimalisatie in meerdere huurderomgevingenZij maken ook gebruik van de in-line telemetrie van de adapter, die uitgebreid is gedocumenteerdMCX653106A-HDAT-gegevensblad de ontwikkeling van de volgende generatie geautomatiseerde prestatiemanagementsystemen.NVIDIA Mellanox MCX653106A-HDATis de basis geworden van hun AI-infrastructuurroutekaart, die een robuust, schaalbaar platform biedt voor de volgende generatie basismodelopleidingen en real-time analytics-diensten.

