NVIDIA Mellanox MCX623106AN-CDAT Adaptador de Servidor em Ação

July 22, 2026

últimas notícias da empresa sobre NVIDIA Mellanox MCX623106AN-CDAT Adaptador de Servidor em Ação

NVIDIA Mellanox MCX623106AN-CDAT Adaptador de Servidor em Ação

Antecedentes e o desafio: Quando 200GbE atinge o muro de escala de IA

Uma organização de pesquisa de IA em rápido crescimento, vamos chamá-los de "DeepCore Labs", estava a enfrentar um gargalo de escala crítica.com 512 GPUs NVIDIA H100 distribuídas em 128 nósO problema não era computação ou memória, mas o tecido da rede.Todos os gradientes de sincronização de redução estavam a demorar mais de 15 segundos por iteraçãoA sua infraestrutura existente de 100GbE, baseada em TCP/IP baseado em software, simplesmente não podia lidar com o estouro,padrões de comunicação sensíveis à latência da formação distribuídaA equipa precisava de uma solução que pudesse fornecer um débito de linha de 200 GbE com uma latência determinista de microsecundos.

A sua avaliação levou-os aNVIDIA Mellanox MCX623106AN-CDATA equipe de investigação reconheceu que a utilização de um adaptador de servidor de 200GbE foi concebida para as cargas de trabalho mais exigentes de IA e HPC.MCX623106AN-CDAT Adaptador ConnectX cartão de rede PCIeO GPUDirect ofereceu as capacidades avançadas de descarga e GPUDirect necessárias para eliminar o gargalo da rede e maximizar a utilização da GPU.

A solução: Implementação do cartão de adaptador Ethernet MCX623106AN-CDAT

DeepCore Labs implementou oCartão de adaptador Ethernet MCX623106AN-CDATem todos os 128 nós de treinamento, com cada servidor equipado com um adaptador QSFP112 de duas portas conectado a um tecido de folha-espinha construído em switches NVIDIA Spectrum-4.A implantação aproveitou o suporte nativo RoCE v2 do adaptador para permitir o transporte Ethernet sem perdasA chave para a solução foi a capacidade GPUDirect RDMA do adaptador,que permitiu o movimento direto de dados entre GPUs em toda a rede sem intervenção da CPU, uma característica crítica para reduzir a sobrecarga de sincronização.

A equipa configurou o PFC (Priority Flow Control) e o ECN (Explicit Congestion Notification) no nível do interruptor,que destina a prioridade 3 ao tráfego de comunicações coletivas e a prioridade 4 ao armazenamento de dados I/OEles também implementaram a tecnologia de roteamento adaptativo da NVIDIA para distribuir o tráfego dinamicamente em vários caminhos, minimizando hotspots.Todo o tecido de treinamento estava a funcionar com RDMA., com todas as 512 GPUs comunicando-se perfeitamente através do RoCE.Compatibilidade MCX623106AN-CDATO ecossistema provou ser robusto ∙ os cartões integrados perfeitamente com os servidores baseados no H100 e com a NCCL da NVIDIA (NVIDIA Collective Communications Library) sem quaisquer modificações.

A equipa fez referência aoFicha de dados MCX623106AN-CDATPara ajustar os parâmetros de atribuição de tampões e controlo de congestionamento,Obtenção de um desempenho óptimo para o seu ambiente de carga de trabalho mista, que inclui tanto o treinamento síncrono (dominado por redução total) como o checkpointing assíncrono.

Resultados mensuráveis: eficiência de escala, rendimento e utilização da GPU

O aumento do desempenho foi transformador.NVIDIA Mellanox MCX623106AN-CDAT, a latência de sincronização totalmente reduzida caiu de uma média de 15,2 segundos para apenas 1,8 segundos por iteração, uma melhoria de 8,4x.O tempo total de formação para o seu modelo de parâmetro 70B diminuiu de 42 dias para 19 dias, acelerando o seu ciclo de investigação em mais de 50%.

A utilização da GPU, que estava a languidecer em 62% devido a paralisações da rede, subiu para 94% após a atualização, uma melhoria de 52% na capacidade de computação efetiva.A colocação avançada de dados fora de ordem do adaptador e o pacing de pacotes eliminaram as micro-explosões que causaram picos de latência na cauda., garantindo um desempenho consistente em todos os nós.

Além do desempenho de treinamento, os ganhos de rendimento do servidor foram igualmente convincentes.e aceleração do RoCE Isso liberou uma capacidade significativa da CPU para pré-processamento de dados, compressão de pontos de verificação e outras tarefas auxiliares que anteriormente haviam sido restritas.

Métrica Antes (Legacy 100GbE NIC) Após (MCX623106AN-CDAT) Melhoria
All-Reduce Latency (por reiteração) 15.2 s 1.8 s 8.4 vezes mais rápido
Utilização da GPU 62% 94% 52% mais
Tempo de formação do modelo (70B params) 42 dias 19 dias 55% mais rápido
Custo de rede da CPU 38% < 4% 89% mais baixo
NVMe-oF Leia Latência (armazenamento) 185 μs 12 μs 15 vezes mais rápido.

Benefícios operacionais: TCO e eficiência da infraestrutura

Embora os ganhos de desempenho tenham sido dramáticos, os benefícios operacionais e financeiros foram igualmente notáveis.MCX623106AN-CDAT Solução de cartão de adaptador Ethernetreduziu o custo total de propriedade, eliminando a necessidade de um tecido separado de InfiniBand, economizando mais de US$ 500 mil em custos de infraestrutura de switch.O projeto de eficiência energética do adaptador (menos de 20 W por cartão) contribuiu para economias de energia mensuráveis em todo o cluster de 128 nós, reduzindo as despesas anuais de arrefecimento em cerca de 18%.

Para os gestores de TI que avaliam aMCX623106AN-CDAT preçocontra soluções alternativas, o diretor de infraestruturas da DeepCore observou que o período de recuperação era inferior a seis meses, devido principalmente à redução do tempo de formação,que acelerou diretamente o seu desenvolvimento de produtosA equipa também valorizou a capacidade de adaptação do adaptador para o futuro: a mesmaMCX623106AN-CDAT para vendaAtualmente suporta 200GbE, mas também é compatível com ópticas 100GbE e 50GbE, proporcionando flexibilidade para ambientes de velocidade híbrida e atualizações graduais.

De acordo com oEspecificações MCX623106AN-CDAT, o adaptador inclui recursos abrangentes de telemetria, incluindo telemetria de rede em banda (INT) e rastreamento de latência por fluxo.,permitindo a detecção proativa de micro-congestionamento antes que ele afete o desempenho do treinamento. A equipe também aproveitou os algoritmos de controle de congestionamento do adaptador para ajustar dinamicamente os limiares da ECN,Manter o comportamento sem perdas mesmo durante as operações de checkpointing que geraram carga adicional da rede.

Resumo e Perspectivas: Um Plano para a Rede em Escala de IA

A jornada do DeepCore Labs com oNVIDIA Mellanox MCX623106AN-CDATO projeto de desenvolvimento de um sistema de transmissão de dados para a inteligência artificial (IPM) é um projeto de desenvolvimento de uma infraestrutura de IA para a construção de infraestruturas de IA.Cartão de adaptador Ethernet MCX623106AN-CDATtransforma a rede de um gargalo de escala em um multiplicador de desempenho.A capacidade do adaptador de fornecer resultados empresariais tangíveis nos ambientes de computação mais exigentes.

No futuro, à medida que os tamanhos dos modelos continuam a dobrar a cada poucos meses e os clusters de formação distribuídos se expandem para milhares de GPUs, oMCX623106AN-CDAT Adaptador ConnectX cartão de rede PCIePara arquitetos e líderes de TI que planejam o seu próximo investimento em infraestrutura de IA, este adaptador representa não apenas um componente,Mas um facilitador estratégico para a diferenciação competitivaOs parâmetros de ajuste detalhados, os scripts de implantação e os relatórios de benchmark de desempenho estão disponíveis no site oficial da empresa.Ficha de dados MCX623106AN-CDAT¢ uma referência essencial para qualquer implantação de IA em larga escala.