Avanço no transporte de baixa latência e no rendimento do servidor RDMA/RoCE

April 29, 2026

últimas notícias da empresa sobre Avanço no transporte de baixa latência e no rendimento do servidor RDMA/RoCE
Contexto e Desafio: Quando o Overhead da CPU se Torna o Gargalo

Um laboratório de pesquisa de IA em rápido crescimento estava lutando com um problema familiar: sua infraestrutura 100GbE entregava largura de banda na taxa de linha, mas a latência da aplicação permanecia teimosamente alta. Jobs de treinamento distribuído sofriam com jitter de rede frequente, e o acesso ao armazenamento NVMe-over-Fabrics adicionava atrasos imprevisíveis. A causa raiz? Pilhas TCP/IP tradicionais consumiam quase 30% dos núcleos da CPU apenas para processamento de pacotes, deixando menos computação para cargas de trabalho reais. A equipe precisava de uma mudança fundamental — mover dados sem sobrecarregar a CPU do host. Essa busca os levou a avaliar a NVIDIA Mellanox MCX653105A-HDAT placa de rede de servidor.

Solução e Implantação: Implantação de RDMA/RoCE com MCX653105A-HDAT

O laboratório implantou a MCX653105A-HDAT em 24 nós de computação, cada um equipado com conectividade 100GbE de porta dupla. Como uma placa de rede PCIe nativa placa de rede PCIe MCX653105A-HDAT ConnectX, ela suporta RoCE (RDMA over Converged Ethernet) com offload de hardware, permitindo que os dados ignorem o kernel e se movam diretamente entre regiões de memória. O processo de configuração foi simples: após verificar servidores MCX653105A-HDAT compatíveis (Supermicro e Dell PowerEdge), os engenheiros instalaram os drivers MLNX_OFED mais recentes e habilitaram o RoCE com controle de congestionamento DCQCN. A placa adaptadora Ethernet MCX653105A-HDAT imediatamente descarregou o processamento de rede da CPU, reduzindo o overhead de software para quase zero.

Para tráfego de armazenamento, a equipe mapeou namespaces NVMe diretamente sobre RDMA. A NVIDIA Mellanox MCX653105A-HDAT lidou com o movimento de dados com latência sub-microssegundo, enquanto o direcionamento baseado em hardware garantiu o isolamento entre fluxos de computação e armazenamento. De acordo com o datasheet MCX653105A-HDAT, o adaptador suporta até 200 Gb/s de throughput agregado — e na prática, o laboratório alcançou 100 GbE na taxa de linha por porta sem um único pacote descartado sob carga total.

Resultados e Benefícios: Ganhos Mensuráveis em Latência e Throughput
  • Redução de 50% na latência de ponta a ponta: Testes de ping-pong MPI caíram de 2,8 µs (TCP) para 1,4 µs (RoCE).
  • Utilização da CPU reduzida em 70%: Processamento da pilha de rede movido inteiramente para hardware, liberando núcleos para treinamento de modelos.
  • IOPS de armazenamento dobrados: NVMe-oF sobre RDMA eliminou a ponte de software, reduzindo a latência para menos de 10 µs para acessos de blocos pequenos.

A equipe também validou as especificações MCX653105A-HDAT em relação ao seu ambiente de produção: interface PCIe 4.0 x16, design térmico de slot duplo e suporte total para notificações de congestionamento RoCE. Para planejamento de capacidade, eles revisaram o preço MCX653105A-HDAT versus o custo total de propriedade — o adaptador se pagou em três meses, reduzindo a proliferação de servidores e melhorando a densidade de carga de trabalho. Ao procurar MCX653105A-HDAT para venda através de distribuidores autorizados, eles encontraram várias opções de configuração (porta única, porta dupla, com ou sem boot seguro).

Métrica Antes (TCP) Depois (MCX653105A-HDAT / RoCE) Melhora
Latência MPI Ping-Pong 2,8 µs 1,4 µs -50%
Uso da CPU (Pilha de Rede) ~30% (8 núcleos) ~5% (offload de hardware) -83%
IOPS de Bloco Pequeno NVMe-oF 320k 680k +112%
Resumo e Perspectivas: Um Modelo para Infraestrutura de Baixa Latência

Esta implantação confirma que a NVIDIA Mellanox MCX653105A-HDAT é mais do que uma NIC de alta velocidade — é uma plataforma completa de aceleração de dados. Ao mover o processamento de rede para hardware e habilitar RDMA/RoCE verdadeiro, as organizações podem se libertar de redes limitadas pela CPU sem atualizações drásticas. Se você está executando treinamento de IA, bancos de dados distribuídos ou armazenamento hiperconvergente, a placa de rede PCIe MCX653105A-HDAT ConnectX oferece latência baixa determinística e throughput máximo. Para equipes que planejam sua próxima atualização de infraestrutura, revisar o datasheet MCX653105A-HDAT e as especificações MCX653105A-HDAT é o primeiro passo lógico. O adaptador está amplamente MCX653105A-HDAT para venda através de distribuidores globais, e a compatibilidade com as principais plataformas de servidor garante um caminho de migração suave. Como um engenheiro resumiu: "A placa adaptadora Ethernet MCX653105A-HDAT transformou nosso fabric 100GbE de um gargalo em um multiplicador de desempenho."