Adaptador de Servidor NVIDIA Mellanox MCX556A-ECAT em Ação: Desbloqueando o Desempenho de Baixa Latência RDMA/RoCE e Acelerando a IA

September 4, 2026

últimas notícias da empresa sobre Adaptador de Servidor NVIDIA Mellanox MCX556A-ECAT em Ação: Desbloqueando o Desempenho de Baixa Latência RDMA/RoCE e Acelerando a IA

NVIDIA Mellanox MCX556A-ECAT Server Adapter em Ação: Desbloqueio de Rendimento de Baixa Latência RDMA/RoCE e Aceleração de AI e Cargas de Trabalho de Armazenamento Distribuído

Modelo:MCX556A-ECAT♫ Marca: NVIDIA Mellanox ♫ Categoria: Adaptador Ethernet de Alto Desempenho ♫ Capacidades-chave: RDMA/RoCE Transportes de Baixa Latência e Otimização de Transferência de Servidores

Antecedentes e desafios: gargalos de rede na formação em IA em larga escala

Para a equipa de infra-estruturas de dados de uma empresa líder em tecnologia de condução autónoma,O rápido crescimento das cargas de trabalho de formação de modelos de IA ultrapassou as capacidades da infraestrutura de rede existenteO seu cluster de computação era constituído por mais de 200 servidores GPU, cada um equipado com adaptadores de 25GbE, ligados a um sistema de armazenamento distribuído que abrigava petabytes de dados de sensores e simulação.Durante os trabalhos de formação em larga escala, a equipe observou consistentemente dois problemas críticos: a utilização da GPU raramente excedia 70% devido a gargalos de carregamento de dados,As operações de salvamento de pontos de controlo “essenciais para a recuperação do modelo” demoraram mais de 40 segundos., retardando significativamente os ciclos de formação iterativos.

A causa raiz foi rastreada para a camada de acesso à rede: os adaptadores existentes não tinham capacidades robustas de descarga de RDMA, forçando o armazenamento de I / O a atravessar a pilha TCP / IP e consumindo ciclos de CPU excessivos.Isso resultou em altas latências de cauda, uso ineficiente dos recursos da GPU e escalabilidade limitada para expansão futura do cluster.A equipe precisava urgentemente de um adaptador de alto desempenho que pudesse fornecer latencia RDMA sub-5μs e taxa de transferência de linha completa para liberar o potencial de seu tecido de armazenamento NVMe-oFÉ precisamente aqui que oNVIDIA Mellanox MCX556A-ECATA Comissão adoptou, em

Solução e implantação: Construção de um tecido otimizado pelo RDMA em torno do MCX556A-ECAT

Após um exame aprofundado daFicha de dados MCX556A-ECATe validação deEspecificações MCX556A-ECATA equipa de arquitetura elaborou uma estratégia de implantação em fases, em função dos benchmarks internos de desempenho.Cartão de rede PCIe MCX556A-ECAT ConnectX adaptadorFoi selecionado por sua capacidade de 50GbE de duas portas e pelo ASIC ConnectX-5 maduro, que oferecia o equilíbrio ideal de desempenho, eficiência energética e maturidade do ecossistema.

A estratégia de implantação seguiu três fases principais:

  • Fase 1  Implementação piloto (16 nós da GPU):Dois adaptadores MCX556A-ECAT foram instalados por nó de computação, com duas instalações para separar os switches de folha habilitados para RoCEv2.A equipe configurou os adaptadores com SR-IOV para alocar funções virtuais dedicadas ao armazenamento de I / O e comunicação de treinamento, assegurando o isolamento da Qualidade de Serviço.
  • Fase 2 - Integração do tecido de armazenamento:Os alvos de armazenamento NVMe-oF foram configurados para anunciar endpoints compatíveis com RDMA. PFC e ECN foram ativados em todo o tecido para garantir o transporte sem perdas para o tráfego RoCEv2.
  • Fase 3 Expansão da produção (todos os 200 nós da GPU):Com base nos resultados positivos do projecto piloto, a implantação foi alargada a todo o cluster.Compatibilidade MCX556A-ECATO ecossistema garantiu uma integração perfeita com as plataformas de servidores existentes, matrizes de armazenamento e infraestrutura de comutação.

Durante todo o desdobramento, oCartão de adaptador Ethernet MCX556A-ECATdemonstrou uma excepcional simplicidade de plug-and-play.A equipe aproveitou a pilha de drivers MLNX_OFED com a biblioteca de comunicações coletivas da NVIDIA (NCCL) para otimizar o desempenho do RDMA para padrões de comunicação GPU-to-GPU e GPU-to-storage.

Resultados mensuráveis: ganhos significativos no desempenho e libertação de recursos

Após a implantação da produção em larga escala, a equipe documentou melhorias substanciais em várias métricas críticas.O quadro a seguir resume a comparação dos resultados antes e após a introdução do sistema deNVIDIA Mellanox MCX556A-ECAT:

Métrica Antes (25GbE / TCP) Após (MCX556A-ECAT / RoCE) Melhoria
Latência de leitura de armazenamento (P99) ~ 18 μs ~ 4,2 μs Redução de 76%
Checkpoint Save Time (modelo de 200 GB) - 41 segundos. ~ 11 segundos 73% mais rápido
Utilização eficiente da GPU ~ 70% ~ 94% 24 pontos percentuais
Utilização da CPU (percurso de entrada/saída de armazenamento) ~38% ~ 12% 26% da capacidade da CPU liberada

Além das melhorias quantitativas, a equipa relatou uma redução dramática dos tempos de iteração de formação, de uma média de 4,2 dias por modelo para apenas 2,8 dias.representando uma aceleração de 33% no tempo global de colocação no mercado dos novos modelos de condução autónomaAlém disso, ao avaliar aPreço MCX556A-ECATA capacidade de CPU liberada permitiu que a equipe adiasse as atualizações planejadas do servidor,A redução do tempo de formação traduziu-se directamente numa vantagem competitiva.. OMCX556A-ECAT à vendaA NVIDIA, por exemplo, desenvolveu um modelo de aquisição flexível, que se alinhava com os ciclos de investimento da empresa.

Resumo & Perspectivas: Uma base para a futura infraestrutura de IA

A adoção doNVIDIA Mellanox MCX556A-ECATO estudo, que foi realizado em Bruxelas, na Alemanha, e em Bruxelas, na Itália, demonstrou que a conectividade de servidores habilitada para RDMA/RoCE não é mais um luxo, mas uma necessidade para as cargas de trabalho modernas de IA.Solução de cartão de adaptador Ethernet MCX556A-ECATO sistema de armazenamento de dados de computadores de computadores (GPU) tem demonstrado a sua capacidade de eliminar gargalos de armazenamento, maximizar a utilização da GPU e acelerar significativamente os ciclos de formação de modelos, tudo dentro de um tecido de rede unificado e gerenciável.

A partir daí, a equipa pretende explorar casos de utilização adicionaisCartão de rede PCIe MCX556A-ECAT ConnectX adaptador, incluindo a transmissão em tempo real dos dados dos sensores e a sincronização multi-cluster para a aprendizagem federada.Ficha de dados MCX556A-ECATe evoluindoEspecificações MCX556A-ECATA partir daí, a Comissão decidiu, em 1 de Julho de 2002, que o programa de investigação e desenvolvimento da IA e do HPC deveria ser lançado no mercado europeu, com o objectivo de contribuir para a melhoria da qualidade da informação e da informação.MCX556A-ECATOferece um modelo comprovado para equilibrar o desempenho, a confiabilidade e a simplicidade operacional em ambientes de missão crítica.