NVIDIA Mellanox MCX631432AN-ADAB em Ação: RDMA/RoCE Transportes de Baixa Latência e Otimização do Processamento do Servidor
July 28, 2026
NVIDIA Mellanox MCX631432AN-ADAB em Ação: RDMA/RoCE Transportes de Baixa Latência e Otimização do Processamento do Servidor
Antecedentes e desafios: O gargalo da rede num aglomerado de formação em IA
Uma empresa de tecnologia financeira líder recentemente implementou um cluster de IA baseado em GPU de 64 nós projetado para treinamento de estratégia de negociação de alta frequência, com cada servidor equipado com armazenamento NVMe de alto desempenho.,Após a entrada em funcionamento, o volume de formação real caiu significativamente abaixo das expectativas.A análise pós-implementação revelou que o tecido de comunicação inter-nodo baseado em TCP/IP de 10GbE tornou-se o principal gargaloAs operações de comunicação colectiva All-Reduce apresentaram latência de até 4 ̊5 milissegundos.enquanto CPU sobrecarga para processamento de protocolo de rede excedeu 40%A equipe precisava urgentemente de uma solução de rede que pudesse reduzir drasticamente a latência de comunicação e recuperar a capacidade de computação da CPU.
Solução e implantação: Construção de uma rede sem perdas RoCE com o MCX631432AN-ADAB
Após uma avaliação técnica abrangente, a equipa selecionou oNVIDIA Mellanox MCX631432AN-ADABCada servidor foi equipado com umMCX631432AN-ADAB ConnectX-6 Lx com duas portas 25GbE SFP28Adaptador, com ambas as portas SFP28 conectadas a switches redundantes NVIDIA Spectrum-3 para estabelecer uma arquitetura altamente disponível.
A implantação foi executada em três fases distintas:
- Fase 1 Pilot (8 nós):A equipa instalou oCartão de adaptador Ethernet MCX631432AN-ADABEm um subconjunto de servidores GPU, configurando o RoCEv2 com controlo de fluxo prioritário (PFC) e notificação de congestionamento explícito (ECN) para criar um tecido Ethernet sem perdas.NCCL (NVIDIA Collective Communications Library) foi recompilada com suporte RDMA.
- Fase 2 - Ajuste e validação:Utilizando os dados de telemetria detalhados noFicha de dados MCX631432AN-ADAB, a equipe ajustou os parâmetros DCB e os limiares de buffer para eliminar tempestades de pausa PFC, mantendo a perda de pacotes quase zero.Especificações MCX631432AN-ADABorientou a otimização da moderação de interrupções e profundidades de fila para o perfil de carga de trabalho específico.
- Fase 3 Lançamento completo da produção (64 nós):Após a validação bem sucedida, os nós restantes foram migrados para o novo adaptador.Compatibilidade MCX631432AN-ADABdrivers integrados perfeitamente com o ambiente existente baseado no Ubuntu e na pilha Mellanox OFED.
A equipa observou que oMCX631432AN-ADAB Solução de cartão de adaptador EthernetA Comissão considera que os adaptadores são devidamente concebidos para permitir a utilização de um sistema de transmissão de dados compatível com a tecnologia SFP28, o que elimina a necessidade de atualizações auxiliares caras.
Resultados e benefícios: transformação mensurável na latência e no rendimento
Os ganhos de desempenho alcançados através doNVIDIA Mellanox MCX631432AN-ADABA tabela a seguir resume as principais métricas antes e após a atualização:
| Métrica | Pre-upgrade (10GbE TCP/IP) | Pós-actualização (MCX631432AN-ADAB com RoCE) | Melhoria |
|---|---|---|---|
| Retardo de redução total (AVG) | 4.7 ms | 0.32 ms | 14.7x redução |
| Utilização da CPU da rede (por nó) | 42% | 9% | 33 pp liberados |
| Utilização da GPU (fase de carregamento de dados) | 61% | 89% | +28% |
| Percorrência de formação em aglomerados | 1.8x linha de base | 4.3x referência | 2.4x aumento |
Além desses ganhos quantitativos, a equipe observou melhorias operacionais que afetaram diretamente a produtividade dos desenvolvedores.Exercícios de treinamento de modelo que antes exigiam 36 horas completados em apenas 15 horasA descarga NVMe-oF baseada em hardware também reduziu a latência de acesso ao armazenamento em 35%, acelerando ainda mais as operações de ponto de verificação intensivos em dados.Para organizações que avaliam o caso de negócio, oMCX631432AN-ADAB preçoA equipe também observou que a capacidade de transferência de dados de um servidor de GPU para outro computador foi muito superior à capacidade de transferência de dados de um servidor de GPU.MCX631432AN-ADAB para vendaOs pacotes com switches NVIDIA Spectrum ofereceram o caminho mais econômico para a futura ampliação.
Resumo & Perspectivas: Uma base para a inovação da carga de trabalho futura
Esta implantação da produção demonstra que oNVIDIA Mellanox MCX631432AN-ADABÉ muito mais do que uma atualização de rede de rotina, é um elemento de infraestrutura transformadora que liberta todo o potencial da computação moderna acelerada por GPU.A combinação de 50 Gb/s de largura de banda agregada, sub-0,4ms latência de comunicação coletiva, e capacidades de descarga de CPU dramática posiciona este adaptador como uma escolha ideal para organizações que executam IA distribuída, HPC,e cargas de trabalho de análise em tempo real.
Olhando para o futuro, a equipe de fintech está explorando a integração com a NVIDIA DOCA para acelerar ainda mais a programabilidade do caminho de dados e implementar o provisionamento zero-touch para futuras expansões de clusters.Os investigadores também estão a avaliar as capacidades de telemetria do adaptador Ficha de dados MCX631432AN-ADAB∆ a construção de modelos de gestão de congestionamento preditivos.MCX631432AN-ADAB Solução de cartão de adaptador Ethernetcontinua a provar o seu valor, a empresa planeia padronizar nesta plataforma para todos os futuros investimentos em infra-estruturas,Confiante de que fornece uma base robusta e escalável para a próxima geração de aplicações financeiras baseadas em IA.

