NVIDIA Mellanox MCX623106AN-CDAT Server Adapter in Actie | RDMA/RoCE Lage Latentie Transport & Server Doorvoerstijgingen

July 22, 2026

Laatste bedrijfsnieuws over NVIDIA Mellanox MCX623106AN-CDAT Server Adapter in Actie | RDMA/RoCE Lage Latentie Transport & Server Doorvoerstijgingen

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter in Actie | RDMA/RoCE Lage Latentie Transport & Server Doorvoer Winsten

Achtergrond & De Uitdaging: Wanneer 200GbE de AI Schaalmuur Ontmoet

Een snelgroeiende AI-onderzoeksorganisatie — laten we ze "DeepCore Labs" noemen — werd geconfronteerd met een kritieke schaalbottleneck. Hun vlaggenschip cluster voor het trainen van grote taalmodellen, bestaande uit 512 NVIDIA H100 GPU's verdeeld over 128 nodes, ervoer ernstige prestatievermindering toen ze verder schaalden dan 64 nodes. Het probleem lag niet bij de rekenkracht of het geheugen, maar bij het netwerk. All-reduce synchronisatiegradiënten duurden meer dan 15 seconden per iteratie, en de GPU-gebruiksgraad was gedaald tot slechts 62% door netwerkvertragingen. Hun bestaande 100GbE-infrastructuur, die afhankelijk was van software-gebaseerde TCP/IP, kon de bursty, latentiegevoelige communicatiepatronen van gedistribueerde training simpelweg niet aan. Het team had een oplossing nodig die een doorvoer van 200GbE op lijnsnelheid kon leveren met deterministische latentie op microsecondeniveau.

Hun evaluatie leidde hen naar de NVIDIA Mellanox MCX623106AN-CDAT — een 200GbE serveradapter ontworpen voor de meest veeleisende AI- en HPC-workloads. Het onderzoeksteam realiseerde zich dat de MCX623106AN-CDAT ConnectX adapter PCIe netwerkkaart de geavanceerde offloads en GPUDirect-mogelijkheden bood die nodig waren om de netwerkbottleneck te elimineren en de GPU-gebruiksgraad te maximaliseren.

De Oplossing: Implementatie van de MCX623106AN-CDAT Ethernet Adapter Kaart

DeepCore Labs implementeerde de MCX623106AN-CDAT Ethernet adapter kaart op alle 128 trainingsnodes, waarbij elke server was uitgerust met één dual-port QSFP112 adapter aangesloten op een leaf-spine fabric gebouwd op NVIDIA Spectrum-4 switches. De implementatie maakte gebruik van de native RoCE v2-ondersteuning van de adapter om lossless Ethernet-transport mogelijk te maken, waardoor de noodzaak voor een aparte InfiniBand-fabric werd geëlimineerd. Cruciaal voor de oplossing was de GPUDirect RDMA-mogelijkheid van de adapter, die directe dataoverdracht tussen GPU's over het netwerk mogelijk maakte zonder CPU-interventie — een kritieke functie voor het verminderen van synchronisatieoverhead.

Het team configureerde PFC (Priority Flow Control) en ECN (Explicit Congestion Notification) op switchniveau, waarbij prioriteit 3 werd toegewezen aan collectieve communicatieverkeer en prioriteit 4 aan opslag-I/O. Ze implementeerden ook NVIDIA's adaptieve routeringstechnologie om verkeer dynamisch over meerdere paden te verdelen, waardoor hotspots werden geminimaliseerd. Binnen vier weken draaide de volledige trainingsfabric op RDMA, waarbij alle 512 GPU's naadloos over RoCE communiceerden. Het MCX623106AN-CDAT compatibele ecosysteem bleek robuust — de kaarten integreerden vlekkeloos met de H100-gebaseerde servers en NVIDIA's NCCL (NVIDIA Collective Communications Library) zonder enige aanpassingen.

Het team raadpleegde het MCX623106AN-CDAT datasheet om bufferallocatie en congestiecontroleparameters te finetunen, waardoor optimale prestaties werden bereikt voor hun gemengde workloadomgeving — die zowel synchrone training (gedomineerd door all-reduce) als asynchrone checkpointing omvatte.

Meetbare Resultaten: Schaalbaarheidsefficiëntie, Doorvoer en GPU-gebruiksgraad

De prestatieverbetering was transformerend. Met RDMA over RoCE ingeschakeld via de NVIDIA Mellanox MCX623106AN-CDAT, daalde de all-reduce synchronisatielatentie van een gemiddelde van 15,2 seconden naar slechts 1,8 seconden per iteratie — een verbetering van 8,4x. Dit vertaalde zich direct naar snellere modelconvergentie: de totale trainingstijd voor hun 70B-parameter model daalde van 42 dagen naar 19 dagen, waardoor hun onderzoekscyclus met meer dan 50% werd versneld.

De GPU-gebruiksgraad, die op 62% was blijven steken door netwerkvertragingen, sprong na de upgrade naar 94% — een verbetering van 52% in effectieve rekenkracht. De geavanceerde out-of-order data-plaatsing en packet pacing van de adapter elimineerden de micro-bursts die tail-latentiepieken veroorzaakten, waardoor consistente prestaties over alle nodes werden gegarandeerd.

Naast de trainingsprestaties waren de serverdoorvoerwinsten even indrukwekkend. De hardware offload-engine — inclusief checksum offload, LSO/LRO en RoCE-acceleratie — verminderde de CPU-gebruiksgraad voor netwerkverwerking van 38% naar minder dan 4% over alle nodes. Dit maakte aanzienlijke CPU-capaciteit vrij voor datavoorbewerking, compressie van checkpoints en andere hulp taken die voorheen beperkt waren.

Metriek Voorheen (Legacy 100GbE NIC) Na (MCX623106AN-CDAT) Verbetering
All-Reduce Latentie (per iter) 15,2 s 1,8 s 8,4x sneller
GPU-gebruiksgraad 62% 94% 52% hoger
Model Trainingstijd (70B params) 42 dagen 19 dagen 55% sneller
CPU Netwerk Overhead 38% < 4% 89% lager
NVMe-oF Lees Latentie (opslag) 185 µs 12 µs 15x sneller

Operationele Voordelen: TCO en Infrastructuur Efficiëntie

Hoewel de prestatiewinsten dramatisch waren, waren de operationele en financiële voordelen even opmerkelijk. De MCX623106AN-CDAT Ethernet adapter kaart oplossing verminderde de totale eigendomskosten door de noodzaak van een aparte InfiniBand-fabric te elimineren — wat meer dan $500K bespaarde aan switchinfrastructuurkosten. Het energiezuinige ontwerp van de adapter (minder dan 20W per kaart) droeg bij aan meetbare energiebesparingen over het 128-node cluster, waardoor de jaarlijkse koelingskosten met naar schatting 18% werden verlaagd.

Voor IT-managers die de MCX623106AN-CDAT prijs evalueren ten opzichte van alternatieve oplossingen, merkte de infrastructuurdirecteur van DeepCore op dat de terugverdientijd minder dan zes maanden was — voornamelijk gedreven door verminderde trainingstijd, wat hun productontwikkelingspijplijn direct versnelde. Het team waardeerde ook de toekomstbestendigheid van de adapter: dezelfde MCX623106AN-CDAT te koop vandaag ondersteunt 200GbE, maar is ook compatibel met 100GbE en 50GbE optiek, wat flexibiliteit biedt voor hybride snelheidsomgevingen en geleidelijke upgrades.

Volgens de MCX623106AN-CDAT specificaties, bevat de adapter uitgebreide telemetriefuncties, waaronder in-band network telemetry (INT) en per-flow latentie tracking. DeepCore integreerde deze metrics in hun Prometheus/Grafana stack, waardoor proactieve detectie van micro-congestie mogelijk werd voordat deze de trainingsprestaties beïnvloedde. Het team maakte ook gebruik van de congestiecontrole-algoritmen van de adapter om ECN-drempels dynamisch aan te passen, waardoor lossless gedrag behouden bleef, zelfs tijdens checkpointing-operaties die extra netwerkbelasting genereerden.

Samenvatting & Vooruitzichten: Een Blauwdruk voor AI-Schaal Netwerken

De reis van DeepCore Labs met de NVIDIA Mellanox MCX623106AN-CDAT demonstreert een duidelijke blauwdruk voor organisaties die AI-infrastructuur bouwen of schalen. Door dual-port 200GbE doorvoer, PCIe 5.0 hostinterface en GPUDirect-enabled RDMA te combineren, transformeert de MCX623106AN-CDAT Ethernet adapter kaart het netwerk van een schaalbottleneck naar een prestatievermenigvuldiger. De resultaten — 8,4x snellere all-reduce, 94% GPU-gebruiksgraad en 55% snellere trainingscycli — getuigen van het vermogen van de adapter om tastbare bedrijfsresultaten te leveren in de meest veeleisende rekenomgevingen.

Vooruitkijkend, aangezien modelgroottes elke paar maanden blijven verdubbelen en gedistribueerde trainingsclusters uitbreiden naar duizenden GPU's, biedt de MCX623106AN-CDAT ConnectX adapter PCIe netwerkkaart een solide basis voor lossless, ultra-lage latentie fabrics. Voor architecten en IT-leiders die hun volgende AI-investeringen plannen, vertegenwoordigt deze adapter niet alleen een component, maar een strategische facilitator voor concurrentievoordeel. Gedetailleerde tuningparameters, implementatiescripts en prestatiebenchmarkrapporten zijn beschikbaar in het officiële MCX623106AN-CDAT datasheet — een essentiële referentie voor elke grootschalige AI-implementatie.