Mellanox (NVIDIA Mellanox) NIC de servidor MCX556A-ECAT em ação | Ganho de transferência de servidor e transporte de baixa latência RDMA/RoCE

June 9, 2026

últimas notícias da empresa sobre Mellanox (NVIDIA Mellanox) NIC de servidor MCX556A-ECAT em ação | Ganho de transferência de servidor e transporte de baixa latência RDMA/RoCE

Os data centers de hiperescala e os ambientes de nuvem empresarial enfrentam um desafio comum: à medida que o número de núcleos de CPU aumenta, a rede TCP/IP tradicional se torna o gargalo. A sobrecarga de protocolo, as cópias de memória e as alternâncias de contexto consomem recursos significativos da CPU, limitando o desempenho do aplicativo. Este estudo de caso examina como uma equipe de infraestrutura de serviços financeiros abordou esses pontos problemáticos ao implantar oMellanox (NVIDIA Mellanox) MCX556A-ECATNIC do servidor, alcançando reduções drásticas na latência e melhorias mensuráveis ​​no rendimento do servidor.

Histórico e desafios: quando cada microssegundo conta

A equipe de infraestrutura gerenciava um cluster de banco de dados distribuído que suportava análises de risco em tempo real. Com centenas de servidores comuns conectados via 25 GbE, a comunicação entre nós dependia do TCP. À medida que os volumes de negociação cresciam, surgiram três problemas críticos: a utilização da CPU nos nós do banco de dados excedeu 75% devido ao processamento da pilha da rede; a latência final para operações de memória entre nós aumentou para 200 microssegundos durante os horários de pico; e a empresa enfrentou um provisionamento excessivo e dispendioso – adicionando mais servidores apenas para lidar com a sobrecarga da rede e não com a demanda de computação. A equipe precisava de umSolução de placa adaptadora Ethernet MCX556A-ECATque poderia descarregar a rede e, ao mesmo tempo, permitir o acesso remoto direto à memória (RDMA).

Solução e implantação: implementando RoCE com adaptadores ConnectX

Depois de avaliar as opções, a equipe selecionou asNVIDIA Mellanox MCX556A-ECATbaseado em sua capacidade de 100 GbE de porta dupla e suporte nativo a RoCE (RDMA sobre Ethernet Convergente). Implantado como padrãoAdaptador MCX556A-ECAT ConnectX placa de rede PCIe, cada host recebeu um único adaptador conectado a um switch topo de rack compatível com RoCE com PFC (Priority Flow Control) e ECN (Explicit Congestion Notification) ativados. O caminho da migração foi simples: o adaptador éCompatível com MCX556A-ECATcom slots PCIe 3.0 existentes, eliminando atualizações de servidor. A configuração envolveu a ativação do RoCE na pilha do driver e o ajuste dos limites de buffer conforme descrito noFolha de dados MCX556A-ECAT. Em duas semanas, todo o cluster de 120 nós estava executando comunicação baseada em RDMA para replicação de banco de dados e armazenamento em cache na memória.

OPlaca adaptadora Ethernet MCX556A-ECAToperações de chave descarregadas: desvio do kernel por meio da API Verbs do espaço do usuário, transporte baseado em hardware para gravações/leituras RDMA e movimentação de dados com cópia zero. Isso virou oMellanox (NVIDIA Mellanox) MCX556A-ECATno backbone de baixa latência do cluster sem alterar a lógica do aplicativo existente – apenas mudando de soquetes TCP para libfabric ou UCX, uma mudança gerenciada durante uma janela de manutenção regular.

Resultados e benefícios: ganhos mensuráveis ​​em latência e rendimento

As métricas pós-implantação validaram o investimento. Usando oMCX556A-ECAT especificaçõescomo linha de base (latência de hardware abaixo de microssegundos), a equipe alcançou:

Métrica Antes (TCP/25GbE) Depois (RoCE/MCX556A-ECAT) Melhoria
Média latência entre nós (mensagem pequena) 12–15 µs 1,2–1,5 µs Redução de 10x
Utilização da CPU (pilha de rede) 35% por núcleo <5% por núcleo 86% de descarregamento
Taxa de transferência agregada do banco de dados 1,8 milhões de operações/s 3,9 milhões de operações/s Aumento de 117%

Além dos números brutos, a equipe alcançou latência final estável abaixo de 4 microssegundos no percentil 99,9 – fundamental para cálculos de risco. Os núcleos de CPU liberados permitiram que os servidores existentes lidassem com 40% mais threads de aplicativos, adiando as compras de hardware. OMCX556A-ECAT à vendaa economia ficou clara: um adaptador por servidor proporcionou ROI em seis meses apenas devido à redução da contagem de nós e à redução dos custos de energia/resfriamento. Para quem procuraPreço do MCX556A-ECATem comparação com placas 100G concorrentes, o custo total de propriedade — incluindo compatibilidade de software e estabilidade de driver — favoreceu a solução Mellanox.

A equipe também verificouCompatível com MCX556A-ECATstatus com seu array de armazenamento NVMe existente, habilitando NVMe sobre Fabrics (NVMe-oF) com RDMA. Essa rede de armazenamento consolidada na mesma estrutura, simplificando o cabeamento e as portas de switch. De acordo com oFolha de dados MCX556A-ECAT, a placa suporta até 16 milhões de IOPS por porta – espaço que a equipe planeja utilizar durante a atualização de armazenamento do próximo ano.

Resumo e perspectivas: uma base para data centers de próxima geração

Esta implantação demonstra que oMCX556A-ECATnão é apenas uma NIC mais rápida, mas uma plataforma para transformação arquitetônica. Ao habilitar o RDMA/RoCE, as organizações podem quebrar o gargalo do TCP, redirecionar os ciclos de CPU para cargas de trabalho de valor agregado e expandir com eficiência. ONVIDIA Mellanox MCX556A-ECATprovou seu valor em finanças sensíveis à latência, mas seus benefícios se estendem ao treinamento em IA, simulações de HPC e bancos de dados distribuídos. Para equipes que avaliam atualizações de 100G, oAdaptador MCX556A-ECAT ConnectX placa de rede PCIerepresenta uma escolha madura e bem documentada. Quer você consulte oMCX556A-ECAT especificaçõespara ajuste de desempenho ou pesquiseMCX556A-ECAT à vendapara planejar uma implementação em todo o cluster, este adaptador cumpre a promessa de Ethernet verdadeiramente sem perdas e de baixa latência.