NVIDIA Mellanox 920-9B210-00FN-0D0 na Prática: Construindo um Tecido NDR de Baixa Latência para Modelos MoE de Trilhão de Parâmetros
August 27, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 na Prática: Construindo uma Rede NDR de Baixa Latência para Modelos MoE de Trilhão de Parâmetros
Contexto e o Desafio: Quando o All-to-All se Torna o Gargalo de Treinamento
Uma organização líder em pesquisa de IA escalou recentemente seu cluster de treinamento de modelos de linguagem grandes de 1.024 para 4.096 GPUs NVIDIA H100, com o objetivo ambicioso de reduzir o tempo de treinamento de um modelo MoE (Mixture of Experts) esparso de 1,8 trilhão de parâmetros de meses para menos de duas semanas. No entanto, durante a validação inicial, a equipe descobriu que sua rede HDR existente de 200 Gb/s estava sofrendo com congestionamento severo durante a fase de comunicação all-to-all — um padrão característico de arquiteturas MoE — causando uma queda na utilização da GPU de um esperado 85% para apenas 52%, muito abaixo do limite necessário para cumprir seu prazo de treinamento.
A análise de rede revelou que a comunicação coletiva all-to-all representava mais de 40% da pegada de comunicação do modelo MoE e, à medida que o número de especialistas escalava, o padrão de tráfego tornava-se cada vez mais fragmentado e intermitente. A rede HDR existente, após acionar mecanismos de controle de congestionamento, experimentou aumentos dramáticos na latência de cauda, deixando uma porção significativa de GPUs ociosas e esperando. A organização precisava urgentemente de uma rede capaz de fornecer latência determinística sub-microssegundo, transporte sem perdas e escalabilidade massiva não bloqueante — e oNVIDIA Mellanox 920-9B210-00FN-0D0 foi construído especificamente para este desafio.
Solução e Implantação: Uma Arquitetura Leaf-Spine NDR Otimizada para MoE
A organização implantou uma rede leaf-spine de dois níveis construída em torno doswitch InfiniBand 920-9B210-00FN-0D0 OPN. Em cada rack de computação, dois switches920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDR foram implantados na camada leaf, fornecendo conectividade de 400 Gb/s para 64 servidores H100 de porta dupla via cabos ópticos ativos OSFP para OSFP. Na camada spine, 16 switches 920-9B210-00FN-0D0 adicionais interconectaram todos os switches leaf, criando uma rede fat-tree totalmente não bloqueante com uma largura de banda de bisseção agregada de 51,2 Tb/s.
A peça central desta solução é a tecnologia integrada SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) do switch. Para a carga de trabalho MoE, a comunicação all-to-all foi descarregada diretamente na rede de switches, com os switches realizando redução e redistribuição de dados na rede. Isso eliminou a necessidade de múltiplas passagens do lado do host, reduzindo drasticamente a sobrecarga de comunicação que havia prejudicado a implantação HDR anterior. Afolha de dados do 920-9B210-00FN-0D0 destaca latência cut-through inferior a 100 ns, que foi validada durante a fase de prova de conceito e provou ser crítica para os rigorosos requisitos de latência da carga de trabalho MoE.
Oespecificações do 920-9B210-00FN-0D0—incluindo fontes de alimentação redundantes e ventiladores hot-swappable—deram à equipe confiança em atingir sua meta de disponibilidade de 99,999%. A equipe de engenharia também confirmou que o ecossistemacompatível com 920-9B210-00FN-0D0 incluía todas as ópticas e cabos OSFP que eles já haviam qualificado, eliminando atrasos de aquisição e simplificando o cronograma de implantação.
Resultados e Ganhos Mensuráveis: De Gargalo a Habilitador
Após a implantação completa da rede NDR e o reinício do trabalho de treinamento MoE, a organização mediu melhorias transformadoras em várias dimensões:
- Recuperação da utilização da GPU: A utilização média da GPU aumentou de 52% para 89%, com pico de utilização atingindo 94% durante fases intensivas em computação — um resultado direto da eliminação de stalls induzidos pela rede.
- Redução da latência all-to-all: O tempo necessário para uma troca all-to-all completa em 4.096 GPUs caiu de 180 ms para menos de 45 ms, uma melhoria de 75% que se traduziu diretamente em iterações de treinamento mais rápidas.
- Tempo de conclusão do trabalho: O cronograma de treinamento projetado para o modelo MoE de 1,8 T foi reduzido de 14 dias para apenas 9 dias — uma aceleração de 36% que reduziu significativamente tanto o tempo de chegada ao mercado quanto os custos de computação em nuvem.
- Eficiência operacional: Com 64 portas por switch, o número de switches spine necessários foi reduzido em 37% em comparação com um design HDR de 40 portas, simplificando a fiação e reduzindo o consumo de energia por rack em 28%.
Do ponto de vista do custo total de propriedade, a equipe financeira da organização observou que, embora opreço do 920-9B210-00FN-0D0 por unidade fosse maior do que as alternativas HDR, o custo de rede por GPU na verdade diminuiu devido ao maior radix e à redução do número de camadas de switch. Essa vantagem econômica, combinada com os ganhos dramáticos de desempenho, tornou a atualização NDR um claro sucesso comercial. Asolução OPN do switch InfiniBand 920-9B210-00FN-0D0 também se integrou perfeitamente com sua implantação NVIDIA UFM existente, fornecendo visibilidade centralizada e alertas automatizados que reduziram a sobrecarga operacional em 40%.
Resumo e Perspectivas: A Base NDR para Cargas de Trabalho MoE de Próxima Geração
ONVIDIA Mellanox 920-9B210-00FN-0D0 provou ser a solução transformadora que esta organização de pesquisa de IA precisava para desbloquear todo o potencial de seu cluster H100 de 4.096 GPUs. Ao fornecer largura de banda NDR de 400 Gb/s, densidade de 64 portas e computação na rede SHARPv3, o switch permitiu que eles escalassem de 1.024 para 4.096 GPUs sem comprometer o desempenho ou a gerenciabilidade — um feito que teria sido impossível com sua infraestrutura HDR anterior.
Olhando para o futuro, a organização planeja expandir para 8.192 GPUs nos próximos 18 meses, aproveitando o920-9B210-00FN-0D0 para venda através dos parceiros de canal da NVIDIA para construir uma rede folded-Clos de três níveis ainda maior. Para organizações que avaliam seus investimentos em rede de IA e HPC de próxima geração, o 920-9B210-00FN-0D0 oferece uma solução comprovada e pronta para produção que cumpre a promessa de otimização de interconexão RDMA de baixa latência em escala exa.

