NVIDIA Mellanox 920-9B210-00FN-0D0 na prática: Construção de um tecido NDR de baixa latência para clusters de IA de trilhão de parâmetros
August 26, 2026
NVIDIA Mellanox 920-9B210-00FN-0D0 na prática: Construção de um tecido NDR de baixa latência para clusters de IA de trilhão de parâmetros
Antecedentes e o desafio: Quando o HDR atende aos modelos de trilhões de parâmetros
Uma organização líder de pesquisa de IA recentemente dimensionou seu grande grupo de treinamento de modelos de linguagem de 1.024 para 4.096 GPUs NVIDIA H100, com o objetivo de comprimir o cronograma de treinamento para um 1.Modelo MoE (Mixture of Experts) de 8 trilhões de parâmetros, de meses a menos de duas semanasNo entanto, durante a validação inicial, a equipe observou congestionamento grave na fase de comunicação de todos para todos em seu tecido HDR de 200Gb/s existente,A utilização da GPU caiu de 85% esperado para apenas 52%, muito abaixo do limiar exigido para cumprir o seu prazo de formação ambicioso..
A análise da rede revelou que as operações coletivas "todos para todos", que são intrínsecas às arquiteturas do Ministério da Energia,estavam saturando os links HDR e desencadeando mecanismos de controle de congestionamento que amplificaram ainda mais a latênciaA organização precisava de um tecido que pudesse entregar determinismo,Latência de sub-microssegundos em milhares de endpoints, proporcionando a largura de banda para absorver explosões de tráfego sem colapso de desempenhoÉ precisamente este o desafio que oNVIDIA Mellanox 920-9B210-00FN-0D0foi concebido para abordar.
Solução e implantação: um tecido NDR de 400Gb / s para IA exascale
A organização utilizou o920-9B210-00FN-0D0 InfiniBand switch OPNA partir daí, o material foi transformado em um tecido de espinha de folha de duas camadas.920-9B210-00FN-0D0 MQM9790-NS2F 400 Gb/s NDRcomutadores, que fornecem 128 portas de conectividade de 400 Gb/s para 64 servidores H100 de duas portas por rack através de cabos ópticos ativos OSFP-OSFP.16 interruptores 920-9B210-00FN-0D0 adicionais interligados todos os interruptores de folha, criando uma árvore de gordura não bloqueadora com largura de banda de bisecção total de 51,2 Tb/s por camada da coluna vertebral.
O que tornou esta solução particularmente atraente foi a tecnologia SHARPv3 (Protocolo de Agregação e Redução Hierárquica Escalavel) integrada no switch.A comunicação de todos para todos foi descarregada diretamente no tecido do interruptor., com os switches realizando a redução e redistribuição de dados na rede.Reduzindo drasticamente a sobrecarga de comunicação que tinha atormentado a implantação HDR anterior.
De acordo com oFicha de dados 920-9B210-00FN-0D0O switch oferece uma latência de corte inferior a 100 ns, que foi validada durante a fase de prova de conceito.920-9B210-00FN-0D0 compatívelO ecossistema incluía todas as ópticas e cabos OSFP que já tinham sido qualificados, eliminando atrasos de aquisição.920-9B210-00FN-0D0 especificações¢incluindo fontes de alimentação duplas redundantes e ventiladores com câmbio a quente ¢que deram à equipa a confiança de que conseguiria atingir o seu objectivo de disponibilidade de 99,999% para o cluster de produção.
Resultados e benefícios mensuráveis: do gargalo ao facilitador
Após a implantação completa do tecido NDR e a reinicialização do trabalho de formação do Ministério da Energia, a organização mediu melhorias transformadoras em várias dimensões:
- Recuperação da utilização da GPU:A utilização média da GPU subiu de 52% para 89%, com a utilização máxima atingindo 94% durante as fases de computação intensiva, resultado direto da eliminação de paralisações induzidas pela rede.
- Redução da latência total:O tempo necessário para uma troca completa de tudo para tudo em 4.096 GPUs caiu de 180ms para menos de 45ms, uma melhoria de 75% que se traduziu diretamente em iterações de treinamento mais rápidas.
- Tempo de conclusão do trabalho:O calendário de formação previsto para o modelo 1.8T MoE foi reduzido de 14 dias para apenas 9 dias, uma aceleração de 36%, que reduziu significativamente o tempo de colocação no mercado e os custos de computação em nuvem.
- Eficiência operacional:Com 64 portas por interruptor, o número de interruptores de coluna necessários foi reduzido em 37% em comparação com um projeto HDR de 40 portas, simplificando o cablagem e reduzindo o consumo de energia por rack em 28%.
A partir de uma perspectiva de custo total de propriedade, a equipa financeira da organização observou que, embora o920-9B210-00FN-0D0 preçoO custo de rede por GPU diminuiu devido ao maior radix e à redução da contagem de camadas de comutação.combinado com os ganhos dramáticos de desempenho, fez com que a atualização da NDR fosse uma clara vitória comercial.920-9B210-00FN-0D0 Solução OPN de interruptor de banda InfiniTambém integrado perfeitamente com a sua implantação NVIDIA UFM existente, fornecendo visibilidade centralizada e alerta automatizado que reduziu as despesas operacionais em 40%.
Resumo & Perspectivas: A Fundação NDR para a IA de Próxima Geração
ONVIDIA Mellanox 920-9B210-00FN-0D0provou ser a solução transformadora que esta organização de pesquisa de IA precisava para liberar todo o potencial do seu cluster H100 de 4.096-GPU.e SHARPv3 computação em rede, a mudança permitiu que eles escalassem de 1.024 para 4.096 GPUs sem comprometer o desempenho ou a gerenciamento, um feito que teria sido impossível com sua infraestrutura HDR anterior.
Olhando para o futuro, a organização planeia expandir para 8.192 GPUs nos próximos 18 meses, alavancando o920-9B210-00FN-0D0 à vendaPara organizações que avaliam seus investimentos em redes de IA e HPC de próxima geração,O 920-9B210-00FN-0D0 oferece uma, uma solução pronta para produção que cumpre a promessa de otimização de interconexão RDMA de baixa latência em exascale.

