NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch em ação: otimização de interconexão de baixa latência para clusters RDMA / HPC / AI
August 21, 2026
NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch em ação: otimização de interconexão de baixa latência para clusters RDMA / HPC / AI
No domínio do treinamento de modelos de IA em larga escala e computação de alto desempenho (HPC), a latência da rede muitas vezes se torna o gargalo crítico que limita a escalabilidade e a eficiência do cluster.Um centro de supercomputação de nível nacional concluiu recentemente uma grande atualização da infraestrutura, a transição de um tecido EDR InfiniBand de 100Gb/s para uma solução HDR de 200Gb/s construída em torno doNVIDIA Mellanox MQM8790-HS2FEste estudo de caso examina os desafios enfrentados, a estratégia de implantação e os ganhos de desempenho mensuráveis alcançados através desta interconexão de próxima geração.
Antecedentes e desafios: quando a latência se torna o teto de desempenho
O centro de supercomputação opera um cluster heterogéneo composto por mais de 2.000 nós GPU, suportando uma mistura diversificada de carga de trabalho que inclui simulação do clima, pesquisa genómica,e formação de grandes modelos linguísticosCom a rede EDR de 100Gb/s anterior,A equipe de operações observou que as operações de comunicação coletiva, tais como "all-reduce" e "all-gather", consumiam uma parcela crescente do tempo total de execução do trabalho à medida que o número de nós aumentava.Em alguns trabalhos de formação distribuída, os custos gerais relacionados com a rede representaram quase 40% do tempo de execução de ponta a ponta, limitando severamente a utilização da GPU e estendendo os ciclos de convergência do modelo.
Outros desafios incluíram:
- Pontos de congestionamento:Os padrões de tráfego no treinamento de IA são muitas vezes explosivos e imprevisíveis, levando ao bloqueio da cabeça da linha e picos de latência da cauda que perturbam a programação do trabalho.
- Aceleração insuficiente na rede:O tecido legado não tinha suporte para capacidades avançadas de descarga coletiva, forçando todas as operações de redução a atravessar a hierarquia de CPU e memória do host.
- Complexidade da gestão:A resolução de problemas de desempenho exigia uma análise manual de várias ferramentas de monitoramento, dificultando a identificação das causas raiz nas implantações em larga escala.
Após avaliar múltiplas opções de interconexão, o centro selecionou oMQM8790-HS2FA partir daí, a Europa passou a ser a base para o seu novo tecido.Ficha de dados MQM8790-HS2F, este switch oferece 40 portas de 200Gb/s HDR não-bloqueio de tráfego, sub-130ns corte-através de latência e suporte para SHARP v3.0 capacidades colectivas de descarga que abordaram directamente os seus principais pontos problemáticos.
Solução e implantação: Construção de um tecido de baixa latência para IA/HPC
A implementação adotou uma topologia de árvore de gordura de dois níveis, com 24MQM8790-HS2F 200Gb/s HDR 40 portas QSFP56Esta configuração fornecia:1 subscrição em excesso em todo o cluster, suficiente para a sua carga de trabalho actual, permitindo ao mesmo tempo espaço para a expansão futura.
| Camada de implantação | Número de interruptores | Portos utilizados | Conectividade |
|---|---|---|---|
| Folha (por estante) | 24 | 32 portos cada | Servidores ToR + uplinks da coluna vertebral |
| Espinha | 8 | 36 portos cada | Máquina completa para todos os interruptores de folhas |
Cada interruptor de folha se conecta a nós de computação através de adaptadores de canal host NVIDIA ConnectX-6 HDR.Compatibilidade MQM8790-HS2FA instalação física completa foi concluída em duas semanas, o que permitiu à equipa reutilizar os cabos QSFP56 existentes, acelerando a implantação e reduzindo os custos de aquisição.com o plano de controle alavancando o Unified Fabric Manager (UFM) da NVIDIA para descoberta e provisionamento automatizados de topologia.
O suporte do switch para roteamento adaptativo e controle de congestionamento provou ser fundamental para lidar com a característica de tráfego explosivo das cargas de trabalho de IA.Ao redistribuir dinamicamente os fluxos entre os caminhos disponíveis, oMQM8790-HS2F Comutador de banda InfiniMinimizou a formação de hotspots e manteve um desempenho consistente mesmo durante os períodos de agendamento de pico.
Resultados e ganhos: Melhorias mensuráveis no rendimento do trabalho e na utilização da GPU
Após três meses de operação de produção, o centro de supercomputação relatou ganhos significativos de desempenho em várias dimensões:
- Redução da latência:A latência média de ping-pong MPI diminuiu de 680 ns no tecido EDR anterior para menos de 130 ns com oNVIDIA Mellanox MQM8790-HS2F, o que representa uma melhoria de 5 vezes na eficiência da troca de mensagens.
- Aceleração da operação coletiva:A latência de redução total para trabalhos de 1024 nós caiu 62%, graças à descarga SHARP v3.0 que executa operações de redução diretamente dentro do tecido do switch.
- Utilização da GPU:O efeito combinado de menor latência e maior largura de banda empurrou a utilização média da GPU de 72% para 91%, traduzindo-se em uma redução de 26% no tempo de solução para grandes corridas de treinamento de modelos de linguagem.
- Eficiência da programação do trabalho:A variação de latência de cauda reduzida permitiu que o agendador SLURM empacotasse mais trabalhos no mesmo conjunto de nós sem interferência de desempenho, aumentando a capacidade de transferência geral do cluster em aproximadamente 18%.
Quando a equipa mais tarde comparou oPreço MQM8790-HS2Fcontra interruptores alternativos de outros fornecedores, they found that the total cost per Gb/s delivered was highly competitive—especially when factoring in the reduced management overhead and the switch's ability to support both HDR and HDR100 link speeds, protegendo os investimentos em ambientes de velocidade mista.
Do ponto de vista operacional, a plataforma UFM integrada forneceu um único painel de vidro para monitorar a saúde do tecido, os padrões de tráfego e os erros no nível do link.Esta visibilidade permitiu à equipa identificar proativamente os cabos degradantes e substituí-los durante a manutenção programada, evitando paralisações não planeadas.
Resumo e perspectivas: um modelo para a próxima geração de tecidos de baixa latência
Este estudo de caso demonstra que oMQM8790-HS2F Solução de comutação InfiniBandA utilização de um sistema de computadores inteligentes é mais do que uma simples atualização de velocidade, é um componente transformador para as organizações que procuram liberar todo o potencial de desempenho da sua infraestrutura de IA e HPC.Combinando a elevada densidade dos portos, ultra-baixa latência, e capacidades de computação na rede, o switch aborda diretamente os gargalos de comunicação que têm historicamente limitada escalabilidade de cluster.
Olhando para o futuro, o centro de supercomputação planeia expandir sua estrutura para 2.400 nós no próximo ano fiscal, alavancando o mesmoMQM8790-HS2FA equipe também está explorando o suporte do switch para os algoritmos de redução aprimorados do SHARP v3.0,que prometem acelerar ainda mais as cargas de trabalho emergentes, tais como redes neurais gráficas e aprendizagem por reforço.
Para os gestores de TI, arquitetos de rede e engenheiros que avaliam as opções de interconexão para as suas próprias construções de clusters, oNVIDIA Mellanox MQM8790-HS2Foferece um caminho comprovado e validado em campo para alcançar latência de sub-microssegundos, maximização da utilização da GPU e gerenciamento simplificado do tecido.Especificações MQM8790-HS2FA NVIDIA disponibiliza um conjunto completo de modelos e de referências no portal de documentação técnica da NVIDIA, e o switch está agora amplamente disponívelMQM8790-HS2F para vendapara localizar um parceiro regional.

