Prática de Aplicação: NVIDIA Mellanox MCX631102AN-ADAT – Transporte RDMA/RoCE de Baixa Latência e Aumento de Throughput do Servidor

April 27, 2026

últimas notícias da empresa sobre Prática de Aplicação: NVIDIA Mellanox MCX631102AN-ADAT – Transporte RDMA/RoCE de Baixa Latência e Aumento de Throughput do Servidor

No armazenamento distribuído, computação de alto desempenho e clusters de treinamento de IA, a latência da rede e a sobrecarga da CPU tornaram-se os principais gargalos que limitam o desempenho do servidor.Um fornecedor de serviços de nuvem atualizou recentemente o seu backend de armazenamento NVMe-oF selecionando oNVIDIA Mellanox MCX631102AN-ADATAo implantar o RDMA sobre a Ethernet Convergente (RoCEv2), eles alcançaram transporte de baixa latência de ponta a ponta e ganhos significativos de rendimento do servidor.Este estudo de caso examina o desempenho do adaptador num ambiente de produção.

Antecedentes e Desafio: O gargalo da pilha de protocolos TCP/IP

A infraestrutura 25GbE existente do provedor lidava com tráfego de armazenamento usando a pilha de software TCP/IP tradicional.Utilização da CPU para encapsulamento e desencapsulamento de pacotes excedeu 40%, resultando em latências de armazenamento acima de 200μs e capacidade de computação severamente reduzida em servidores de aplicativos.reduzir as interferências da CPU, e manter a taxa de transferência de linha em ligações duplas de 25GbE.MCX631102AN-ADAT ConnectX-6 Lx com duas portas 25GbE SFP28como o hardware principal para a renovação do seu tecido de armazenamento.

Solução e implantação: RDMA/RoCEv2 com descargas de hardware

A implantação substituiu todos os servidores de armazenamentoCartão de adaptador Ethernet MCX631102AN-ADAT, executado no modo sem perdas RoCEv2 (usando ECN e PFC).

  • Ativar o SR-IOV e dedicar funções virtuais (VFs) a máquinas virtuais de armazenamento, ignorando a pilha de rede do hipervisor
  • Configurar NVMe sobre Fabrics (NVMe-oF) com transporte RDMA, eliminando totalmente a sobrecarga TCP
  • Prazos de amortecimento do interruptor de sintonização para tráfego RoCE de 25GbE sem perdas através da topologia da coluna vertebral da folha

OEspecificações MCX631102AN-ADATO sistema de transmissão de conexão dinâmica (DCT) e o motor de recepção vetorizado foram totalmente utilizados para garantir uma latência previsível de até um microsecundo, mesmo sob uma carga agregada de 50 Gbps..

Os ganhos de desempenho medidos e os benefícios operacionais

Após a migração para oNVIDIA Mellanox MCX631102AN-ADAT- baseado em tecidos, foram registadas as seguintes métricas:

Métrica Antes (TCP/IP 25GbE) Após (RoCEv2 com MCX631102AN-ADAT)
NVMe-oF leitura de latência (P99) 215 μs 18 μs
Utilização da CPU (Caminho de E/S de armazenamento) 41% (saturado de núcleo único) 7% (distribuídos por núcleos)
Percorrência agregada do servidor (RX+TX) 42 Gbps (software limitado) 49.8 Gbps (taxa de linha)
Percorrência de pequenos pacotes (64B) 8.1 Mpps 37.5 Mpps (hardware de direção de fluxo)

Os engenheiros observaram que oMCX631102AN-ADAT Solução de cartão de adaptador Ethernetforneceu uma latência de cauda previsível adequada para bancos de dados de análise em tempo real.Aumentar a densidade global de locatários em aproximadamente 24% nos mesmos servidores físicos.

Compatibilidade e integração dos ecossistemas

Ao expandir a implantação, a equipe de operações verificou que o adaptadorCompatibilidade MCX631102AN-ADATPara o planejamento de aquisições, eles se referiram ao projeto de desenvolvimento de sistemas de computadores de computadores de computadores de computadores.Ficha de dados MCX631102AN-ADATOs primeiros inquéritos a granel confirmaram que a utilização de energia elétrica não é necessária.MCX631102AN-ADAT preçoO número de distribuidores de smartNICs de classe similar é muito elevado.MCX631102AN-ADAT para vendanos termos de acordos de volume normalizados.

Resumo & Perspectivas

O caso da produção demonstra claramente que oMCX631102AN-ADATA utilização de redes de armazenamento TCP-bound permite uma mudança fundamental de redes de armazenamento TCP-bound para redes de armazenamento RDMA-aceleradas sem exigir uma revisão completa da infraestrutura 100GbE.MCX631102AN-ADAT ConnectX-6 Lx com duas portas 25GbE SFP28O projeto, as organizações podem dobrar a capacidade de transferência efetiva para cargas de trabalho sensíveis à latência, ao mesmo tempo em que recuperam recursos significativos da CPU.O mesmo padrão de implantação se estenderá a estruturas de aprendizagem de máquina distribuídas (NCCL sobre RoCE) e aplicações de estado baseadas em microsserviçosPara os arquitetos que avaliam as atualizações de 25GbE, oNVIDIA Mellanox MCX631102AN-ADATé um bloco de construção comprovado e resistente à produção para redes de data centers de alto desempenho e baixa latência.