NVIDIA Mellanox 920-9B110-00FH-0D0 in de praktijk: het optimaliseren van low-latency RDMA-fabrieken voor HPC- en AI-clusters

August 25, 2026

Laatste bedrijfsnieuws over NVIDIA Mellanox 920-9B110-00FH-0D0 in de praktijk: het optimaliseren van low-latency RDMA-fabrieken voor HPC- en AI-clusters

NVIDIA Mellanox 920-9B110-00FH-0D0 in de praktijk: Optimaliseren van low-latency RDMA-netwerken voor HPC- en AI-clusters

Achtergrond & De Uitdaging: Wanneer HDR-prestaties budgetrealiteit ontmoeten

Een middelgroot AI-onderzoekslaboratorium stond onlangs voor een bekende uitdaging: hun bestaande 100Gb/s EDR InfiniBand-netwerk werd een knelpunt voor hun groeiende GPU-cluster, dat was gegroeid van 128 naar 512 NVIDIA A100-nodes. De trainingstijden voor grootschalige transformatormodellen waren met meer dan 40% toegenomen als gevolg van netwerkcongestie tijdens all-reduce-bewerkingen, en het team had een upgrade nodig die aanzienlijke prestatieverbeteringen kon leveren zonder de kapitaaluitgaven die nodig waren voor een volledige 400Gb/s NDR-implementatie.

Het laboratorium evalueerde verschillende opties en identificeerde 200Gb/s HDR als de ideale balans tussen prestaties en kosten. Ze hadden echter een switch nodig die hoge poortdichtheid, geavanceerde congestiecontrole en naadloze integratie met hun bestaande HDR-compatibele kabels en transceivers kon bieden. Dit is precies waar deNVIDIA Mellanox 920-9B110-00FH-0D0in beeld kwam — een switch die speciaal is gebouwd voor omgevingen waar HDR voldoende bandbreedte biedt zonder overprovisioning.

Oplossing & Implementatie: Een kostengeoptimaliseerd HDR-netwerk

Het laboratorium implementeerde de920-9B110-00FH-0D0 InfiniBand switch OPN(Ordering Part Number) als de hoeksteen van hun nieuwe leaf-spine architectuur. Elke compute-rack ontving één MQM8790-HS2F-gebaseerde switch — het siliciumplatform waarop de920-9B110-00FH-0D0 MQM8790-HS2F 200Gb/s HDRdraait — die 40 poorten van 200Gb/s connectiviteit bood aan GPU-servers via OSFP-naar-OSFP direct-attach kabels. Op de spine-laag verbonden vier extra 920-9B110-00FH-0D0 switches alle leaf-switches, waardoor een niet-blokkerend fat-tree netwerk met volledige bisectiebandbreedte werd gecreëerd.

Wat deze implementatie bijzonder effectief maakte, was de geïntegreerde SHARPv2 (Scalable Hierarchical Aggregation and Reduction Protocol) technologie van de switch, die collectieve communicatiebewerkingen rechtstreeks op het netwerk afhandelde. In de praktijk betekende dit dat all-reduce-bewerkingen, die voorheen aanzienlijke host CPU-cycli en netwerkbandbreedte verbruikten, nu in één keer over het netwerk werden voltooid — waardoor de job-voltooiingstijden drastisch werden verkort.

Volgens de920-9B110-00FH-0D0 datasheetlevert de switch een cut-through latentie van minder dan 200 ns, wat nauw aansloot bij de prestatie-eisen van het laboratorium. Het engineeringteam bevestigde ook dat het920-9B110-00FH-0D0 compatibeleecosysteem alle kabeltypen en optica bevatte waarop ze al hadden gestandaardiseerd, waardoor kostbare herbekabelingsinspanningen overbodig werden.

Resultaten & Meetbare Winsten: Van knelpunt tot facilitator

Na de implementatie mat het laboratorium verbeteringen op verschillende kritieke gebieden:

  • Vermindering van job-voltooiingstijd: Trainingiteraties voor een model met 13 miljard parameters daalden met 35%, waarbij de all-reduce latentie daalde van 12 µs naar minder dan 5 µs voor typische collectieve groottes.
  • Netwerkgebruik: Gemiddeld netwerkgebruik steeg van 58% naar 83% zonder congestie te veroorzaken, dankzij de adaptieve routering en congestiecontrolemechanismen van de switch.
  • Energie- en koelings efficiëntie: Vergeleken met het vorige EDR-netwerk, verminderde de nieuwe HDR-infrastructuur het stroomverbruik per poort met 30%, waardoor het laboratorium meer compute-nodes kon toevoegen zonder hun datacenter stroombudget te overschrijden.

Vanuit het oogpunt van totale eigendomskosten was de920-9B110-00FH-0D0 prijsper poort aanzienlijk lager dan NDR-alternatieven, waardoor het laboratorium hun gehele netwerk binnen hun bestaande budget kon upgraden. De920-9B110-00FH-0D0 specificatiesbenadrukten ook de dubbele redundante voedingen en hot-swappable ventilatormodules van de switch, die bijdroegen aan het doel van het laboratorium van 99,999% beschikbaarheid voor hun productietrainingsjobs.

Netwerkengineers merkten op dat de920-9B110-00FH-0D0 InfiniBand switch OPN-oplossingnaadloos integreerde met NVIDIA's Unified Fabric Manager (UFM), wat gecentraliseerd inzicht bood in de netwerkgezondheid en geautomatiseerde waarschuwingen. Dit verminderde de tijd die werd besteed aan probleemoplossing en proactief onderhoud aanzienlijk, waardoor het team zich kon richten op het optimaliseren van hun trainingspijplijnen in plaats van het beheren van het netwerk.

Samenvatting & Vooruitzichten: De juiste HDR-basis

DeNVIDIA Mellanox 920-9B110-00FH-0D0bleek de juiste keuze voor dit onderzoekslaboratorium, die de prestaties van 200Gb/s HDR leverde tegen een kostprijs die zakelijk zinvol was. Door gebruik te maken van de 40-poorts dichtheid, de in-network computing-mogelijkheden en de robuuste beheerfuncties van de switch, transformeerde het laboratorium hun netwerk van een prestatieknelpunt naar een schaalbare basis voor toekomstige groei.

Vooruitkijkend is het laboratorium van plan om hun cluster in de komende 18 maanden uit te breiden naar 1.024 nodes. Met de ondersteuning van de 920-9B110-00FH-0D0 voor grotere topologieën via meerdere spine-lagen, hebben ze er vertrouwen in dat hun netwerk kan meegroeien met hun rekenkracht. Voor organisaties die hun HDR-infrastructuuropties evalueren, biedt de920-9B110-00FH-0D0 te koopvia de kanaalpartners van NVIDIA een aantrekkelijke, productie-gevalideerde oplossing die prestaties, dichtheid en kosten balanceert.