NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Livro Branco Técnico

July 24, 2026

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Livro Branco Técnico

NVIDIA Mellanox MCX623106AN-CDAT Server Adapter Technical White Paper | RDMA/RoCE Low-Latency Transport & Server Throughput Optimization

1. Contexto do Projeto e Análise de Requisitos

Os data centers modernos estão passando por uma mudança de paradigma impulsionada pelo crescimento explosivo da inteligência artificial, aprendizado de máquina em larga escala e análise em tempo real. Essas cargas de trabalho exigem desempenho de rede sem precedentes — não apenas largura de banda bruta, mas latência determinística abaixo de 5µs, movimentação de dados eficiente em CPU e escalabilidade perfeita para milhares de nós. Adaptadores Ethernet tradicionais, dependentes de pilhas TCP/IP baseadas em software, tornaram-se um gargalo crítico, consumindo até 40% dos núcleos da CPU em velocidades de 200GbE e introduzindo variações de latência imprevisíveis que degradam o desempenho da aplicação. Para organizações que constroem clusters de IA em larga escala (500+ GPUs) ou infraestrutura de nuvem hiperscalável, essa ineficiência se traduz diretamente em tempos de treinamento estendidos, custos de infraestrutura mais altos e menor tempo de chegada ao mercado.

Este white paper apresenta uma solução técnica abrangente centrada no solução NVIDIA Mellanox MCX623106AN-CDAT. Projetado para empresas que buscam maximizar seus investimentos em 200GbE, o adaptador Ethernet MCX623106AN-CDAT oferece RDMA over Converged Ethernet (RoCE) acelerado por hardware, permitindo transporte sem perdas e de latência ultrabaixa que transforma o I/O de rede de um gargalo de escalabilidade em uma vantagem competitiva. A solução é especificamente arquitetada para atender a três objetivos principais: (1) alcançar latência de aplicação de ponta a ponta abaixo de 5µs para comunicações coletivas de IA, (2) reduzir a sobrecarga de processamento de rede da CPU para menos de 5% e (3) fornecer uma base escalável e à prova de futuro para 200GbE e além.

2. Design Geral da Arquitetura de Rede e Sistema

A arquitetura recomendada adota uma topologia leaf-spine de alto desempenho com 200GbE como camada de acesso do servidor e uplinks de 400GbE/800GbE para o spine. No centro deste design está a adaptador de rede PCIe MCX623106AN-CDAT ConnectX, implantada em todos os nós de computação e armazenamento em toda a malha. A arquitetura é construída em torno de seis princípios-chave:

  • Malha Ethernet sem Perdas: Utilizando RoCE v2 com PFC (Priority Flow Control) e ECN (Explicit Congestion Notification) em todos os switches para eliminar perdas de pacotes e garantir latência determinística para tráfego RDMA.
  • GPUDirect RDMA: Permite comunicação direta de GPU para GPU pela rede sem envolvimento da CPU, reduzindo a latência e liberando recursos da CPU para tarefas de computação.
  • Offload de Hardware em Todos os Lugares: Descarrega protocolos de transporte, segurança (IPsec/MACsec) e armazenamento para o adaptador, liberando ciclos de CPU para a lógica da aplicação.
  • Redundância Ativa-Ativa: Utiliza ambas as portas QSFP112 no modo de agregação de links (LACP) para largura de banda agregada de 400Gb/s e failover automático com recuperação em menos de um segundo.
  • Engenharia de Tráfego Inteligente: Roteamento adaptativo e entrega de pacotes fora de ordem para evitar hotspots de congestionamento e maximizar a utilização da malha.
  • Telemetria Abrangente: Telemetria de rede in-band (INT) e monitoramento por fluxo para detecção proativa de congestionamento e planejamento de capacidade.

A solução é totalmente compatível com MCX623106AN-CDAT com plataformas NVIDIA GPU (HGX, DGX) e servidores CPU líderes da Dell, HPE, Supermicro e Lenovo. Para armazenamento, a arquitetura suporta NVMe-oF sobre RoCE com latência abaixo de 15µs, permitindo armazenamento compartilhado desassociado para clusters de treinamento em larga escala.

3. O Papel e os Principais Recursos do NVIDIA Mellanox MCX623106AN-CDAT

Como componente fundamental desta solução, o solução NVIDIA Mellanox MCX623106AN-CDAT desempenha quatro papéis críticos dentro da arquitetura:

Função Detalhe de Implementação Benefício de Negócios
Motor RDMA/RoCE RoCE v2 baseado em hardware com ECN/PFC, latência abaixo de 0,6µs, suporte GPUDirect Envolvimento quase zero da CPU; 8x all-reduce mais rápido para treinamento de IA
200GbE Dual-Port Duas portas QSFP112 independentes, throughput agregado de 400Gb/s Agregação ativa-ativa para largura de banda; ativo-standby para redundância
Interface PCIe 5.0 PCIe 5.0 x16 (até 32 GT/s) com motor DMA avançado Elimina o gargalo da interface do host para tráfego de 200GbE
Offload de Virtualização e Overlay SR-IOV com até 512 VFs por porta; offload VXLAN/NVGRE/IPsec/MACsec Multilocação de alta densidade com segurança e desempenho na taxa de linha

As principais especificações técnicas extraídas da folha de dados oficial do MCX623106AN-CDAT incluem capacidades abrangentes de offload (checksum, LSO/LRO, remoção/inserção de VLAN, RSS com até 128 filas), algoritmos avançados de controle de congestionamento e suporte total para as bibliotecas de comunicação coletiva da NVIDIA (NCCL). As especificações do MCX623106AN-CDAT também destacam o suporte para compatibilidade com 100GbE e 50GbE, oferecendo flexibilidade de implantação para ambientes de velocidade mista.

4. Recomendações de Implantação e Escalabilidade

Para clusters de IA greenfield, recomendamos uma topologia leaf-spine de dois níveis com acesso de 200GbE e uplinks de spine de 800GbE. Cada servidor hospeda um adaptador Ethernet MCX623106AN-CDAT com ambas as portas QSFP112 conectadas a switches leaf separados para redundância. A malha RoCE requer configuração consistente de QoS em todos os switches — especificamente, PFC na prioridade 3 (para tráfego coletivo RDMA) e prioridade 4 (para armazenamento), com marcação ECN nas mesmas classes de tráfego. Recomendamos dedicar VLANs separadas para tráfego RDMA, gerenciamento, armazenamento e inquilino para simplificar o monitoramento e a solução de problemas.

Para ambientes brownfield com infraestrutura 100GbE existente, a solução de adaptador Ethernet MCX623106AN-CDAT oferece um caminho de migração suave. Como o adaptador é retrocompatível com ópticas QSFP56 de 100GbE, a fiação existente pode ser reutilizada durante a atualização faseada para 200GbE. O adaptador também suporta switching Ethernet padrão sem habilitação obrigatória de RoCE, permitindo que as equipes implantem o hardware primeiro e ativem as capacidades RDMA em estágios à medida que a malha amadurece e as cargas de trabalho justificam a transição.

Escalar a solução além de 500 nós requer considerações adicionais. Recomendamos a implementação de uma estratégia dedicada de gerenciamento de congestionamento RoCE usando switches NVIDIA Spectrum-4 com telemetria integrada e ajuste dinâmico do limiar ECN. Para clusters que excedem 1.000 nós, considere implantar um controlador de gerenciamento de malha centralizado (por exemplo, NVIDIA NetQ) para manter a visibilidade de ponta a ponta e a consistência de configuração automatizada. O MCX623106AN-CDAT para venda através dos parceiros globais de canal da NVIDIA inclui garantia abrangente e suporte de atualização de firmware, garantindo confiabilidade de longo prazo em escala.

5. Operações, Monitoramento, Solução de Problemas e Otimização

A operação eficaz da malha RoCE requer uma estratégia de monitoramento e solução de problemas em várias camadas:

  • Telemetria no Nível do Adaptador: As especificações do MCX623106AN-CDAT incluem contadores por porta para quadros PFC, pacotes marcados com ECN, quadros descartados, erros de link e épocas de congestionamento. Use mlx5cmd, ethtool, ou ferramentas de firmware NVIDIA para exportar essas métricas para dashboards Prometheus/Grafana com alertas apropriados.
  • Telemetria de Rede In-Band (INT): Aproveite o suporte INT do adaptador para rastrear latências por fluxo e profundidades de fila em toda a malha, permitindo a identificação precisa de fontes de microcongestionamento.
  • Monitoramento no Nível do Switch: Monitore a ocupação do buffer, contagens de quadros de pausa, profundidades de fila e taxas de marcação ECN nos switches spine e leaf. Aumentos repentinos em quadros de pausa indicam microcongestionamento que pode exigir ajuste do limiar ECN.
  • Métricas no Nível da Aplicação: Para aplicações RDMA, rastreie latências de conclusão de WR (Work Request), eventos de estouro de CQ (Completion Queue) e contagens de erros de QP (Queue Pair) usando as bibliotecas NVIDIA libibverbs e rdma-core.

Cenários comuns de solução de problemas e ações recomendadas:

  • Degradação do desempenho RoCE: Verifique se o PFC está habilitado em todas as portas do switch e se a marcação DSCP corresponde à configuração do switch. Use a folha de dados oficial do MCX623106AN-CDAT para validar as configurações de alocação de buffer em relação aos valores recomendados para o seu perfil de carga de trabalho.
  • Flutuação de link ou erros CRC: Verifique a qualidade do cabo QSFP112 (garanta a conformidade com as especificações 200G AOC ou DAC) e verifique se o firmware do adaptador está atualizado para a versão mais recente.
  • Problemas de desempenho do GPU Direct: Confirme se o GPUDirect está devidamente inicializado e se a topologia PCIe suporta DMA peer-to-peer sem comutação intermediária.
  • Deadlock PFC ou tempestade de pausa: Verifique prioridades mal configuradas e certifique-se de que o PFC esteja habilitado apenas em classes de tráfego RoCE (não em tráfego de gerenciamento ou armazenamento).

Para otimização, recomendamos os seguintes parâmetros de ajuste com base em extensas validações de laboratório:

  • Coalescência de interrupção (moderação): Defina para 2–4 µs para cargas de trabalho de treinamento de IA para minimizar a latência, mantendo a eficiência da CPU.
  • MTU RDMA: Aumente para 4096 bytes para comunicações all-reduce para reduzir a sobrecarga do protocolo e melhorar o throughput.
  • RSS (Receive Side Scaling): Configure em vários núcleos de CPU para tráfego não-RDMA para distribuir o processamento e evitar saturação de núcleo único.
  • Limiares ECN: Defina min-threshold em 40% do buffer e max-threshold em 75% para tráfego de prioridade 3, ajustando com base nos padrões de congestionamento observados e nas características da carga de trabalho.

6. Resumo e Avaliação de Valor

A solução NVIDIA Mellanox MCX623106AN-CDAT oferece valor transformador para data centers modernos em escala de IA. Ao substituir o TCP/IP baseado em software por RDMA/RoCE e GPUDirect acelerados por hardware, as organizações podem alcançar reduções de latência no nível da aplicação de 8–10x, cortar a sobrecarga de rede da CPU em mais de 85% e aumentar a utilização da GPU de menos de 70% para mais de 95%. O adaptador Ethernet MCX623106AN-CDAT fornece um caminho econômico para a adoção de 200GbE com proteção de investimento através da retrocompatibilidade com 100GbE e capacidades de offload preparadas para o futuro para cargas de trabalho emergentes.

Ao avaliar o custo total de propriedade, o preço do MCX623106AN-CDAT é compensado por economias operacionais significativas: tempo de treinamento reduzido (acelerando o tempo de chegada ao mercado), menor contagem de servidores (devido à maior utilização da GPU), custos de resfriamento reduzidos (graças a<20W power draw), and elimination of separate InfiniBand fabrics. The solution is fully compatível com MCX623106AN-CDAT com as principais pilhas de software de IA e HPC, incluindo NVIDIA NCCL, PyTorch, TensorFlow e bibliotecas MPI, garantindo ampla aplicabilidade em implantações empresariais, de nuvem e de pesquisa.

Para scripts de implantação detalhados, modelos de configuração e relatórios de benchmark de desempenho, consulte a folha de dados oficial do MCX623106AN-CDAT e o portal abrangente de documentação de rede da NVIDIA. Este white paper serve como base — a arquitetura é validada, os componentes estão prontos para produção e os benefícios são mensuráveis. O adaptador de rede PCIe MCX623106AN-CDAT ConnectX não é apenas um adaptador; é um facilitador estratégico para o data center preparado para IA e de latência ultrabaixa do futuro.