Prática de Aplicação: NVIDIA Mellanox MCX631102AN-ADAT – Transporte RDMA/RoCE de Baixa Latência e Aumento de Throughput do Servidor
April 27, 2026
No armazenamento distribuído, computação de alto desempenho e clusters de treinamento de IA, a latência da rede e a sobrecarga da CPU tornaram-se os principais gargalos que limitam o desempenho do servidor.Um fornecedor de serviços de nuvem atualizou recentemente o seu backend de armazenamento NVMe-oF selecionando oNVIDIA Mellanox MCX631102AN-ADATAo implantar o RDMA sobre a Ethernet Convergente (RoCEv2), eles alcançaram transporte de baixa latência de ponta a ponta e ganhos significativos de rendimento do servidor.Este estudo de caso examina o desempenho do adaptador num ambiente de produção.
Antecedentes e Desafio: O gargalo da pilha de protocolos TCP/IP
A infraestrutura 25GbE existente do provedor lidava com tráfego de armazenamento usando a pilha de software TCP/IP tradicional.Utilização da CPU para encapsulamento e desencapsulamento de pacotes excedeu 40%, resultando em latências de armazenamento acima de 200μs e capacidade de computação severamente reduzida em servidores de aplicativos.reduzir as interferências da CPU, e manter a taxa de transferência de linha em ligações duplas de 25GbE.MCX631102AN-ADAT ConnectX-6 Lx com duas portas 25GbE SFP28como o hardware principal para a renovação do seu tecido de armazenamento.
Solução e implantação: RDMA/RoCEv2 com descargas de hardware
A implantação substituiu todos os servidores de armazenamentoCartão de adaptador Ethernet MCX631102AN-ADAT, executado no modo sem perdas RoCEv2 (usando ECN e PFC).
- Ativar o SR-IOV e dedicar funções virtuais (VFs) a máquinas virtuais de armazenamento, ignorando a pilha de rede do hipervisor
- Configurar NVMe sobre Fabrics (NVMe-oF) com transporte RDMA, eliminando totalmente a sobrecarga TCP
- Prazos de amortecimento do interruptor de sintonização para tráfego RoCE de 25GbE sem perdas através da topologia da coluna vertebral da folha
OEspecificações MCX631102AN-ADATO sistema de transmissão de conexão dinâmica (DCT) e o motor de recepção vetorizado foram totalmente utilizados para garantir uma latência previsível de até um microsecundo, mesmo sob uma carga agregada de 50 Gbps..
Os ganhos de desempenho medidos e os benefícios operacionais
Após a migração para oNVIDIA Mellanox MCX631102AN-ADAT- baseado em tecidos, foram registadas as seguintes métricas:
| Métrica | Antes (TCP/IP 25GbE) | Após (RoCEv2 com MCX631102AN-ADAT) |
|---|---|---|
| NVMe-oF leitura de latência (P99) | 215 μs | 18 μs |
| Utilização da CPU (Caminho de E/S de armazenamento) | 41% (saturado de núcleo único) | 7% (distribuídos por núcleos) |
| Percorrência agregada do servidor (RX+TX) | 42 Gbps (software limitado) | 49.8 Gbps (taxa de linha) |
| Percorrência de pequenos pacotes (64B) | 8.1 Mpps | 37.5 Mpps (hardware de direção de fluxo) |
Os engenheiros observaram que oMCX631102AN-ADAT Solução de cartão de adaptador Ethernetforneceu uma latência de cauda previsível adequada para bancos de dados de análise em tempo real.Aumentar a densidade global de locatários em aproximadamente 24% nos mesmos servidores físicos.
Compatibilidade e integração dos ecossistemas
Ao expandir a implantação, a equipe de operações verificou que o adaptadorCompatibilidade MCX631102AN-ADATPara o planejamento de aquisições, eles se referiram ao projeto de desenvolvimento de sistemas de computadores de computadores de computadores de computadores.Ficha de dados MCX631102AN-ADATOs primeiros inquéritos a granel confirmaram que a utilização de energia elétrica não é necessária.MCX631102AN-ADAT preçoO número de distribuidores de smartNICs de classe similar é muito elevado.MCX631102AN-ADAT para vendanos termos de acordos de volume normalizados.
Resumo & Perspectivas
O caso da produção demonstra claramente que oMCX631102AN-ADATA utilização de redes de armazenamento TCP-bound permite uma mudança fundamental de redes de armazenamento TCP-bound para redes de armazenamento RDMA-aceleradas sem exigir uma revisão completa da infraestrutura 100GbE.MCX631102AN-ADAT ConnectX-6 Lx com duas portas 25GbE SFP28O projeto, as organizações podem dobrar a capacidade de transferência efetiva para cargas de trabalho sensíveis à latência, ao mesmo tempo em que recuperam recursos significativos da CPU.O mesmo padrão de implantação se estenderá a estruturas de aprendizagem de máquina distribuídas (NCCL sobre RoCE) e aplicações de estado baseadas em microsserviçosPara os arquitetos que avaliam as atualizações de 25GbE, oNVIDIA Mellanox MCX631102AN-ADATé um bloco de construção comprovado e resistente à produção para redes de data centers de alto desempenho e baixa latência.

