NVIDIA Mellanox MCX631432AN-ADAB in Actie: RDMA/RoCE Low-Latency Transport en Server Throughput Optimalisatie

July 28, 2026

Laatste bedrijfsnieuws over NVIDIA Mellanox MCX631432AN-ADAB in Actie: RDMA/RoCE Low-Latency Transport en Server Throughput Optimalisatie

NVIDIA Mellanox MCX631432AN-ADAB in actie: RDMA/RoCE Low-Latency Transport en Server Throughput Optimalisatie

Achtergrond en uitdagingen: de knelpunt van het netwerk in een AI-opleidingscluster

Een vooraanstaand fintechbedrijf heeft onlangs een op 64-nodes gebaseerde AI-cluster ontworpen voor high-frequency trading-strategie-training, waarbij elke server is uitgerust met high-performance NVMe-opslag.,Na de inwerkingtreding daalde de daadwerkelijke opleidingsdoorvoer aanzienlijk onder de verwachtingen.Een analyse na de inzet heeft aangetoond dat de 10GbE TCP/IP-gebaseerde communicatie tussen knooppunten het belangrijkste knelpunt was geworden.All-Reduce collectieve communicatie-operaties vertoonden latentie tot 4 ̊5 milliseconden.Terwijl de CPU overhead voor netwerkprotocol verwerking overschreden 40% severely hungry GPU data preprocessing pipelinesHet team had dringend behoefte aan een netwerkoplossing die zowel de communicatie-latentie drastisch kon verminderen als de CPU-berekeningscapaciteit kon terugwinnen.

Oplossing en implementatie: bouwen aan een RoCE-verliesloos netwerk met de MCX631432AN-ADAB

Na een uitgebreide technische evaluatie heeft het team deNVIDIA Mellanox MCX631432AN-ADABElke server was uitgerust metMCX631432AN-ADAB ConnectX-6 Lx met twee poorten 25GbE SFP28Adapter, met beide SFP28-poorten verbonden met redundante NVIDIA Spectrum-3-switches om een zeer beschikbare architectuur te creëren.

De inzet werd uitgevoerd in drie verschillende fasen:

  • Fase 1 Pilotproject (8 knooppunten):Het team installeerde deMCX631432AN-ADAB Ethernet-adapterkaartop een subset van GPU-servers, waarbij RoCEv2 wordt geconfigureerd met Priority Flow Control (PFC) en Explicit Congestion Notification (ECN) om een verliesloze Ethernet-fabriek te creëren.NCCL (NVIDIA Collective Communications Library) werd opnieuw gecompileerd met RDMA-ondersteuning.
  • Fase 2 - Tuning en validatie:Met behulp van de telemetrische gegevens die in deMCX631432AN-ADAB-gegevensbladHet team heeft de DCB-parameters en bufferdrempels verfijnd om PFC-pauze stormen te elimineren en tegelijkertijd bijna nul pakketverlies te behouden.MCX631432AN-ADAB-specificatiesHet is de opdracht van de organisatie om de onderbrekingsmoderatie en de wachtrijdiepte te optimaliseren voor het specifieke werklastprofiel.
  • Fase 3: volledige productie (64 knooppunten):Na een succesvolle validatie werden de resterende knooppunten naar de nieuwe adapter gemigreerd.MCX631432AN-ADAB-compatibelstuurprogramma's die naadloos geïntegreerd zijn met de bestaande Ubuntu-omgeving en Mellanox OFED-stack.

Het team merkte op dat deMCX631432AN-ADAB Ethernet adapter kaart oplossingde adapters waren volledig compatibel met hun bestaande SFP28-kabel- en schakelaarinfrastructuur, waardoor kostbare aanvullende upgrades niet meer nodig waren.

Resultaten en voordelen: meetbare transformatie van latentie en doorvoer

De prestatieverbeteringen die door deNVIDIA Mellanox MCX631432AN-ADABDe volgende tabel geeft een samenvatting van de belangrijkste indicatoren voor en na de upgrade:

Metrische Pre-upgrade (10GbE TCP/IP) Na-upgrade (MCX631432AN-ADAB met RoCE) Verbetering
All-Reduce latency (gemiddeld) 4.7 ms 0.32 ms 14.7x vermindering
Netwerk-CPU-gebruik (per knooppunt) 42% 9% 33 pp vrijgesteld
GPU-gebruik (dateloadingsfase) 61% 89% +28%
Clusteropleiding doorvoer 1.8x basiswaarde 4.3x basiswaarde 2.4x toename

Naast deze kwantitatieve winst, zag het team operationele verbeteringen die rechtstreeks van invloed waren op de productiviteit van de ontwikkelaar.Voorbeelden van trainingen die voorheen 36 uur in beslag namen, in slechts 15 uur afgerondDe op hardware gebaseerde NVMe-oF-offload verminderde ook de opslagtoegangslatentie met 35%, waardoor data-intensieve checkpoint-operaties verder versneld werden.Voor organisaties die de business case evalueren, deMCX631432AN-ADAB prijsHet team merkte ook op dat de nieuwe GPU-server met de nieuwe GPU-server in de VS, de nieuwe GPU-server met de nieuwe GPU-server, de nieuwe GPU-server met de nieuwe GPU-server, de nieuwe GPU-server met de nieuwe GPU-server met de nieuwe GPU-server met de nieuwe GPU-server, de nieuwe GPU-server met de nieuwe GPU-server met de nieuwe GPU-server, de nieuwe GPU-server met de nieuwe GPU-server met de nieuwe GPU-server met de nieuwe GPU-server, de nieuwe GPU-server met de nieuwe GPU-server met de nieuwe GPU-server, de nieuwe GPU-server met de nieuwe GPU-server met de nieuwe GPU-server, de nieuwe GPU-server met de nieuwe GPU-server en de nieuwe GPU-server met de nieuwe GPU-server.MCX631432AN-ADAB te koopbundels met NVIDIA Spectrum-switches bood de meest kosteneffectieve weg voor toekomstige schaalbaarheid.

Samenvatting en vooruitzichten: een basis voor toekomstige werkdrukinnovatie

Deze productieontplooiing toont aan dat deNVIDIA Mellanox MCX631432AN-ADABHet is een transformatief infrastructuurelement dat het volledige potentieel van moderne GPU-versnelde computing ontgrendelt.De combinatie van 50 Gb/s totale bandbreedte, sub-0.4ms collectieve communicatie latency, en dramatische CPU offload mogelijkheden posities deze adapter als een ideale keuze voor organisaties die gedistribueerde AI, HPC,en real-time analytics workloads.

Het FinTech-team onderzoekt de integratie met NVIDIA DOCA om de programmeerbaarheid van gegevenspaden verder te versnellen en om zero-touch provisioning te implementeren voor toekomstige cluster-uitbreidingen.Zij evalueren ook de telemetrie-mogelijkheden van de adapter.MCX631432AN-ADAB-gegevensblad het opbouwen van voorspellende congestiebeheersmodellen.MCX631432AN-ADAB Ethernet adapter kaart oplossingHet bedrijf is van plan om op dit platform te standaardiseren voor alle toekomstige infrastructuurinvesteringen.Er is geen twijfel over dat het een robuuste en schaalbare basis biedt voor de volgende generatie AI-gedreven financiële toepassingen..