Mellanox (NVIDIA Mellanox) MCX556A-ECAT Server NIC Technische oplossing
June 9, 2026
Deze whitepaper biedt netwerkarchitecten, pre-sales engineers en operationele leiders een uitgebreid technisch kader voor de implementatie van deMellanox (NVIDIA Mellanox) MCX556A-ECATDe oplossing richt zich op het elimineren van TCP/IP knelpunten door middel van RDMA/RoCE,het leveren van deterministische communicatie met een lage latentie, terwijl de doorvoer van de server voor data-intensieve werklasten wordt gemaksimaliseerd.
1. Achtergrond van het project en analyse van de vereisten
Moderne datacenteromgevingen, waaronder AI-trainingsclusters, gedistribueerde databases, hyperconvergeerde infrastructuur en high-frequency trading platforms, hebben een gemeenschappelijke beperking:de traditionele netwerkstapel verbruikt 30~50% van de CPU-cycli op geheugencopiesAls verbindingssnelheden stijgen tot 100 Gbps en verder, wordt softwaregebaseerd netwerken onhoudbaar.Belangrijkste vereisten voor serverconnectiviteit van de volgende generatie zijn:: sub-5 microsecond inter-node latency, CPU overhead onder 10% per 100Gbps link, verliesloos transport voor opslagprotocollen (NVMe-oF) en naadloze integratie met bestaande Ethernet-infrastructuur.DeMCX556A-ECAT Ethernet adapter kaart oplossingDe Commissie is van mening dat de Commissie de nodige maatregelen moet nemen om deze vraagstukken rechtstreeks aan te pakken.
2. Algemene ontwerp van netwerk/systeemarchitectuur
De aanbevolen architectuur implementeertNVIDIA Mellanox MCX556A-ECATDe oplossing is gebaseerd op een tweelaagse leaf-spine-topologie met ondersteuning voor RoCE (RDMA over Converged Ethernet).:
- Verliesloze Ethernet-basis: Priority Flow Control (PFC) inschakelen op poorten die RoCE-verkeer vervoeren en ECN-drempels (Explicit Congestion Notification) op bladschakelaars configureren.
- Afzonderlijke verkeersklassen: RoCE-verkeer toewijzen aan een speciale prioriteitsrij (meestal 3 of 5) met strikte prioriteitsscheduling.
- Bufferbeheer: Toekenning van gedeelde bufferpools aan switches volgensMCX556A-ECAT-specificaties(aanbevolen 4 MB per poort voor verliesloze werking).
ElkMCX556A-ECAT ConnectX adapter PCIe-netwerkkaartverbinding met een bladschakelaar via QSFP28-optica (SR4, LR4 of AOC/DAC afhankelijk van de afstand)Dual-homing-configuraties verbinden beide poorten actief-actief voor doorvoer of actief-standby voor failoverHet besturingsvlak maakt gebruik van standaard Ethernet en IP, terwijl het gegevensvlak RDMA gebruikt voor zero-copy-overdrachten.
3. Rol en belangrijkste kenmerken van de Mellanox (NVIDIA Mellanox) MCX556A-ECAT in de oplossing
DeMCX556A-ECATDe kernel is de kern van de server, en dient als de kritische offload-engine tussen het servergeheugen en de netwerkstructuur.MCX556A-ECAT-gegevensbladomvatten:
| Kenmerken | Beschrijving | Voordelen |
|---|---|---|
| RDMA & RoCE v2 | Hardwaregebaseerde directe geheugentoegang op afstand via converged Ethernet | Nul CPU-betrokkenheid; hardware-latentie van minder dan 1 μs |
| NVMe-oF-aflading | Volledige ontlading van NVMe/TCP en NVMe/RDMA opdrachtverwerking | Mogelijk maakt gedeelde gedesaggregeerde opslag op lokale prestaties |
| GPUDirect | Peer-to-peercommunicatie tussen GPU en NIC-geheugen | Elimineren van het geheugen van het systeem voor AI-training |
DeMCX556A-ECAT Ethernet-adapterkaartbevat ook geavanceerde besturing (stroomclassificatie in 128 virtuele wachtrijen), SR-IOV met maximaal 512 virtuele functies en hardware timer offload voor precision time protocol (PTP).Deze eigenschappen maken het een complete data path acceleration engine, niet alleen een hogesnelheidsinterface.
4. Aanbevelingen voor implementatie en schaalbaarheid (typische topologie)
Voor een middelgrote cluster (64 ∼ 256 knooppunten) wordt de volgende topologie aanbevolen:
- Bladlaag: twee of vier 48-poort 100GbE RoCE-switches (bijv. NVIDIA SN3700).MCX556A-ECAT-compatibelQSFP28-poorten.
- Wervelkolom: Vier 32-poort 400GbE-switches die 128 niet-blokkerende 100GbE-uplinks van bladeren leveren.
- ServerconfiguratieEén.MCX556A-ECATper server, poort A naar leaf switch A, poort B naar leaf switch B. Dit levert 200Gbps totale bandbreedte en padredundantie op.
Om het weefsel verder te scalen dan 256 knooppunten is het nodig om leaf-spine-paren toe te voegen of te migreren naar een 3-stage Clos-architectuur.MCX556A-ECAT-prijstegen de toekomstige capaciteit, de factor waarin de adapter isMCX556A-ECAT-compatibelmet PCIe 4.0 moederborden (aanvankelijk op 3.0 x16), die een eenvoudig upgradepad bieden.
5Operaties, monitoring, probleemoplossing en optimalisatie
Operational excellence voor RoCE-implementaties vereist specifieke monitoring en afstemming.
- MonitoringsrekenersGebruik:
Het is een mooie manier om te praten.De Commissie heeft de Commissie verzocht om een verslag uit te brengen over de maatregelen die zij heeft genomen om de prioriteiten van de pauze en de CNP (congestie-aankondigingspakketten) te volgen.MCX556A-ECAT-specificatiesde verwachte uitgangswaarden documenteren. - Buffer afstemmen: Configureer switch exit buffers tot 4 ¢ 6 MB voor RoCE wachtrijen. Onvoldoende buffers veroorzaken PFC stormen en doorvoer ineenstorting.
- Firmwarebeheer: Onderhoud van de nieuwste firmware (beschikbaar via de NVIDIA enterprise support portal) om de fouten op te lossen en de prestatieverbeteringen te verbeteren die in deMCX556A-ECAT-gegevensblad.
- PrestatiebaselineLoop.
- Ik heb geen idee.enib_read_latVerwachte resultaten: 98 ‰ 99 Gbps bidirectioneel met een latentie van 0,8 ‰ 1,2 μs voor berichten van 8 byte.
Veel voorkomende problemenoplossingsscenario's: PFC-deadlocks (controle op verkeerd geconfigureerde wachtrij-mapping), linkflapper (validatie van de vermogen- en kabelscores),en RDMA-verbinding timeouts (zorg voor MTU consistentie bij 4200 bytes voor jumbo frames)Voor teams die zoeken.MCX556A-ECAT te koopom clusters uit te breiden, voorkomt de uitlijning van de firmware tussen batches voor het opzetten van de clusters compatibiliteitsverrassingen.
6Samenvatting en waardebeoordeling
DeMCX556A-ECATHet is de bedoeling van de nieuwe technologie om de datacenters te verbeteren en te verbeteren.NVIDIA Mellanox MCX556A-ECATVermindert de latentie van applicaties met 10x in vergelijking met TCP, vermindert de overhead van het CPU-netwerk met 85% en ontgrendelt de opslagdisaggregatie via NVMe-oF.de capaciteit van de kaart met twee poorten van 100 GbE zorgt voor toekomstige voorsprongVoor operationele teams vereenvoudigt de rijpe driverstack (upstream Linux, Windows en VMware) het beheer.MCX556A-ECAT-prijsIn het geval van de installatie van een adapter wordt de totale eigendomskosten, inclusief softwarelicenties, stroom en koeling, doorgaans binnen 6 tot 12 maanden door middel van serverconsolidatie betaald.MCX556A-ECAT Ethernet-adapterkaartofMCX556A-ECAT ConnectX adapter PCIe-netwerkkaart, blijft deze oplossing een referentiedesign voor verliesloze, hoge doorvoer Ethernet-netwerken.

