NVIDIA Mellanox MCX653105A-HDAT in Actie: RDMA/RoCE Low-Latency Transport en Server Throughput Optimalisatie

July 29, 2026

Laatste bedrijfsnieuws over NVIDIA Mellanox MCX653105A-HDAT in Actie: RDMA/RoCE Low-Latency Transport en Server Throughput Optimalisatie

NVIDIA Mellanox MCX653105A-HDAT in actie: RDMA/RoCE Low-Latency Transport en Server Throughput Optimalisatie

Achtergrond en uitdagingen: de knelpunt van het netwerk in een AI/HPC-cluster

Een groot technologiebedrijf heeft onlangs een 128-knoop GPU-versnelde cluster ingezet voor training van grote taalmodellen (LLM),met elk knooppunt uitgerust met acht NVIDIA H100 GPU's en high-performance NVMe-opslagMaar toen de cluster verder ging dan 32 knooppunten, was de prestaties dramatisch slechter.Terwijl de TCP/IP-netwerkstapel meer dan 45% van de CPU-bronnen per knooppunt verbruiktHet netwerk dat op meerdere 25GbE-links was gebouwd, was de belangrijkste knelpunt geworden, waardoor het gebruik van de GPU sterk werd beperkt en de trainingscycli ver buiten de aanvaardbare tijdlijnen werden verlengd.Het team had dringend behoefte aan een oplossing die zowel ultra-lage latentie als enorme bandbreedte kon leveren, terwijl de CPU-intensieve netwerkverwerking werd afgeladen.

Oplossing en implementatie: Transformatie van de stof met de MCX653105A-HDAT

Na een uitgebreide technische evaluatie heeft het team deNVIDIA Mellanox MCX653105A-HDATElke GPU-knooppunt was uitgerust met eenMCX653105A-HDAT ConnectX adapter PCIe-netwerkkaart, geconfigureerd met dual-port 100GbE-connectiviteit om 200 Gb/s totale bandbreedte per server te bieden.

De inzet werd uitgevoerd in vier gestructureerde fasen:

  • Fase 1 Hardwareinstallatie (128 knooppunten):Elke server ontving deMCX653105A-HDAT Ethernet-adapterkaartDe adapters werden geïnstalleerd met de nieuwste firmware en de NVIDIA OFED driver stack.
  • Fase 2 RoCEv2-configuratie:Het team stelde RoCEv2 in staat in het gehele weefsel, waarbij de parameters Priority Flow Control (PFC) en Explicit Congestion Notification (ECN) zorgvuldig werden afgestemd om een verliesloze Ethernet-omgeving te creëren.De geavanceerde congestiebeheersingsfuncties worden in hetMCX653105A-HDAT-gegevensbladDe Commissie heeft de Commissie verzocht om een verslag uit te brengen over de resultaten van de evaluatie.
  • Fase 3: NCCL-optimalisatie:De NVIDIA Collective Communications Library (NCCL) werd opnieuw geconfigureerd om de RDMA-mogelijkheden van de adapter te benutten,met aangepaste verkeersstuurregels geprogrammeerd in de ingebedde verwerkingsmotoren van de adapter om te optimaliseren voor de specifieke all-reduce- en all-gather-patronen van de LLM-werklast.
  • Fase 4 - Validering en fine-tuning:Met behulp van de telemetrische gegevens die via deMCX653105A-HDAT-specificaties, heeft het team de configuratie gevalideerd, de instellingen voor onderbrekingsmoderatie verfijnd en baseline prestatiemetingen vastgesteld voor voortdurende monitoring.

Het is opmerkelijk dat de adapterMCX653105A-HDAT-compatibelmet de bestaande bekabelingsinfrastructuur, aangezien de QSFP28-poorten zowel 100GbE- als 25GbE-optica ondersteunen, waardoor een sierlijke migratie mogelijk is zonder storende kabelvervanging.Het team maakte ook gebruik van de multi-host mogelijkheden van de adapter om zowel computing als opslagfuncties op dezelfde fysieke poort te ondersteunen.

Resultaten en voordelen: meetbare winst in de prestaties van de opleiding

De prestatieverbeteringen die door deNVIDIA Mellanox MCX653105A-HDATDe belangrijkste prestatiemetingen voor en na de upgrade worden hieronder samengevat:

Metrische Pre-upgrade (25GbE TCP/IP) Na-upgrade (MCX653105A-HDAT met RoCE) Verbetering
All-Reduce latency (128 knooppunten) 9.2 ms 0.28 ms 32.8x vermindering
Netwerk-CPU-gebruik (per knooppunt) 47% 6% 41 pp hergebruikt
GPU-gebruik (opleidingsfase) 58% 94% +36% toename
Clusteropleiding doorvoer 1.9x basiswaarde 5.7x basiswaarde 3x toename

Naast deze kwantitatieve prestaties, heeft het team aanzienlijke operationele voordelen waargenomen.het drastisch versnellen van modellen-iteratiecycliHet programmeerbare datapad van de adapter maakte het mogelijk om het verkeer op maat te vormen voor prioriteitsstromen, zodat het kritieke collectieve communicatieverkeer nooit in twijfel raakte.Voor organisaties die het rendement van hun investeringen beoordelen, deMCX653105A-HDAT prijsHet team merkte op dat de 3x doorvoerwinst en de mogelijkheid om extra GPU-serververwervingen met ten minste 12 maanden uit te stellen, volledig gerechtvaardigd bleek te zijn.MCX653105A-HDAT te koopbundels met NVIDIA Spectrum-4-switches boden de meest gunstige economie voor volledige clusterimplementatie.

Samenvatting en vooruitzichten: een basis voor de volgende generatie AI-infrastructuur

Deze inzet op productieschaal bevestigt dat deNVIDIA Mellanox MCX653105A-HDATDe combinatie van 200 Gb/s totale bandbreedte, sub-0,3 millisecond collectieve communicatie latentie,Het is de bedoeling dat de programma's in de eerste plaats worden ontwikkeld om de mogelijkheid te bieden om de hardware te vergroten en de hardware te vergroten.Als een eind-tot-eindMCX653105A-HDAT Ethernet adapter kaart oplossing, wordt de netwerkflesskloor die de efficiëntie van gedistribueerde opleiding in het verleden beperkt heeft, weggenomen.

Het bedrijf onderzoekt de integratie met NVIDIA DOCA om extra gegevenspadprogrammabiliteit te implementeren voor werkladingspecifieke optimalisatie.Zij maken ook gebruik van de geavanceerde telemetrie van de adapter, die uitgebreid in deMCX653105A-HDAT-gegevensblad het ontwikkelen van voorspellende prestatiemodellen en geautomatiseerde congestieminderingsstrategieën.NVIDIA Mellanox MCX653105A-HDATHet is de hoeksteen geworden van hun AI-infrastructuurroutekaart, die een robuuste, schaalbare basis biedt voor de volgende generatie basismodelontwikkeling en -implementatie.