NVIDIA Mellanox MQM9790-NS2F Referência técnica: Optimização de interconexão de baixa latência para clusters RDMA/HPC/AI

August 24, 2026

NVIDIA Mellanox MQM9790-NS2F Referência técnica: Optimização de interconexão de baixa latência para clusters RDMA/HPC/AI

Referência Técnica NVIDIA Mellanox MQM9790-NS2F: Otimização de Interconexão de Baixa Latência para Clusters RDMA/HPC/IA

1. Antecedentes do Projeto e Análise de Requisitos

As cargas de trabalho modernas de treinamento de IA e simulação HPC são caracterizadas por padrões de comunicação intensos, de todos para todos, que impõem demandas extremas ao tecido de rede subjacente. À medida que os clusters de GPU escalam para além de 1.000 nós, a abordagem tradicional de depender do Ethernet com controle de congestionamento baseado em software prova ser insuficiente. Os requisitos-chave emergentes desses ambientes incluem:

  • Latência ultra-baixa determinística: Latência porta a porta sub-microssegundo para minimizar os tempos de conclusão de trabalhos MPI.
  • Tecido sem perdas: Zero quedas de pacotes sob congestionamento para evitar incast TCP e colapso de desempenho.
  • Offload de computação na rede: Redução da sobrecarga da CPU do host para operações coletivas (por exemplo, all-reduce, broadcast).
  • Topologia escalável: Suporte para topologias fat-tree e dragonfly+ com largura de banda de bisseção completa para milhares de endpoints.

O NVIDIA Mellanox MQM9790-NS2F é projetado para atender a essas demandas como um switch InfiniBand NDR de 400 Gb/s com 64 portas OSFP, entregando a densidade e o desempenho necessários para implantações de classe exascale.

2. Projeto Geral da Arquitetura de Rede

A solução proposta emprega uma topologia leaf-spine de dois níveis, que oferece um equilíbrio entre escalabilidade, controle de supersubscrição e simplicidade de cabeamento. Na camada leaf, cada rack de computação abriga uma ou duas unidades MQM9790-NS2F InfiniBand switch, fornecendo 64 portas de conectividade de 400 Gb/s para servidores GPU. Na camada spine, um segundo nível de switches MQM9790-NS2F interconecta todos os leaves, criando um tecido não bloqueante.

Para implantações em larga escala que excedem 2.000 nós de GPU, uma arquitetura folded-Clos de três níveis pode ser adotada, com o MQM9790-NS2F 400Gb/s NDR 64-port OSFP servindo como leaf e spine para manter o desempenho consistente em todos os níveis. Este projeto garante que qualquer servidor possa se comunicar com qualquer outro servidor na taxa de linha, com um máximo de três saltos de switch.

A tabela a seguir resume os parâmetros típicos de escalabilidade para um tecido leaf-spine de 2 níveis construído em torno do MQM9790-NS2F:

Componente Especificação Valor
Switches Leaf MQM9790-NS2F por rack 1–2 unidades
Switches Spine MQM9790-NS2F N/2 (onde N = número de switches leaf)
Endpoints Máximos Servidores GPU por tecido Até 4.096
Largura de banda de bisseção Não bloqueante completo 51,2 Tb/s por nível spine

3. Papel e Principais Recursos do NVIDIA Mellanox MQM9790-NS2F

Dentro desta arquitetura, o NVIDIA Mellanox MQM9790-NS2F serve como o bloco de construção fundamental, fornecendo várias capacidades críticas:

  • 400 Gb/s NDR por porta: Cada uma das 64 portas OSFP suporta 400 Gb/s bidirecionais, com correção de erro forward (FEC) para conectividade confiável de longo alcance.
  • SHARPv3 Integrado (Scalable Hierarchical Aggregation and Reduction Protocol): Descarrega operações de comunicação coletiva das CPUs do host, reduzindo a latência de all-reduce MPI em até 40% em trabalhos de larga escala.
  • Roteamento adaptativo e controle de congestionamento: Redireciona dinamicamente o tráfego para evitar hotspots, garantindo desempenho previsível mesmo sob padrões de tráfego adversos.
  • Telemetria avançada: Contadores por fluxo e por porta, juntamente com monitoramento de ocupação de buffer, fornecem visibilidade profunda da saúde do tecido.

De acordo com a folha de dados detalhada do MQM9790-NS2F, o switch oferece latência cut-through inferior a 100 ns e suporta até 51,2 Tb/s de capacidade de comutação agregada. Essas especificações o tornam uma escolha ideal tanto para implantações greenfield quanto para atualizações graduais de infraestrutura HDR (200 Gb/s).

4. Recomendações de Implantação e Escalabilidade

Para organizações que planejam adotar a solução de switch InfiniBand MQM9790-NS2F, as seguintes diretrizes de implantação são recomendadas:

  • Estratégia de cabeamento: Use cabos de cobre direct-attach (DAC) OSFP-para-OSFP para conexões intra-rack (até 3m) e cabos ópticos ativos (AOC) ou transceptores ópticos para links inter-rack e spine-leaf (até 100m).
  • Redundância: Implante fontes de alimentação duplas e módulos de ventoinha hot-swappable. Conecte cada fonte de alimentação a PDUs separadas para tolerância a falhas.
  • Consistência de firmware: Certifique-se de que todos os switches executem a mesma versão de firmware NVIDIA para evitar incompatibilidades de recursos. Use o recurso de atualização automática de firmware do UFM para atualizações contínuas.
  • Escalabilidade: Para clusters com mais de 4.000 nós, considere uma topologia folded-Clos de três níveis ou dragonfly+ com roteamento adaptativo ativado. O ecossistema compatível com MQM9790-NS2F inclui uma ampla gama de ópticas e cabos para suportar essas topologias.

Ao calcular o custo total de propriedade, considere o número reduzido de níveis de switch e o cabeamento simplificado em comparação com alternativas de radix inferior. Embora o preço do MQM9790-NS2F por unidade seja maior do que os switches de geração anterior, o custo por porta e o custo de rede por GPU são significativamente menores em implantações de larga escala, tornando-o uma escolha econômica para projetos Exascale.

5. Operações, Monitoramento e Solução de Problemas

O gerenciamento eficaz de um tecido NDR requer uma estrutura abrangente de monitoramento e solução de problemas. O Unified Fabric Manager (UFM) da NVIDIA fornece um único ponto de controle para todo o tecido baseado em NVIDIA Mellanox MQM9790-NS2F, oferecendo:

  • Visualização de topologia: Descoberta automática e representação gráfica de todos os switches, links e endpoints.
  • Painéis de desempenho: Visualizações em tempo real de utilização de porta, taxas de erro e indicadores de congestionamento.
  • Alerta proativo: Alarmes baseados em limiares para degradação de link, anomalias de temperatura e falhas de fonte de alimentação.
  • Isolamento de falhas: Fluxos de trabalho guiados de solução de problemas que identificam cabos, transceptores ou portas de switch defeituosos.

Para solução de problemas avançada, as especificações do MQM9790-NS2F incluem monitoramento detalhado de buffer e estatísticas de nível de fluxo que podem ser exportadas via API REST para integração com pilhas de monitoramento personalizadas. Engenheiros de rede também devem alavancar as ferramentas de diagnóstico integradas do switch, como testes de loopback e análise de BER (taxa de erro de bits), para validar a integridade do link antes de implantar cargas de trabalho de produção.

Problemas comuns encontrados durante as primeiras implantações incluem roteamento subótimo causado por velocidades de link desiguais ou tipos de cabo incompatíveis. Habilitar o roteamento adaptativo e verificar se todos os links estão operando a 400 Gb/s (com FEC ativado) resolve a maioria das anomalias de desempenho. A solução de switch InfiniBand MQM9790-NS2F também inclui suporte para redundância do gerenciador de sub-rede, garantindo que a reconfiguração do tecido possa ocorrer sem intervenção manual em caso de falha do nó de gerenciamento.

6. Resumo e Avaliação de Valor

O MQM9790-NS2F representa um avanço significativo em redes de alto desempenho, entregando largura de banda NDR de 400 Gb/s, densidade de 64 portas e aceleração de computação na rede em uma única plataforma gerenciável de 1U. Para arquitetos e engenheiros que projetam clusters de IA e HPC, este switch fornece um caminho comprovado para o desempenho exascale, permitindo:

  • Redução de até 30% nos tempos de conclusão de trabalhos para cargas de trabalho de treinamento em larga escala por meio do offloading SHARPv3.
  • Menor TCO em comparação com soluções alternativas, impulsionado por um radix mais alto e menor contagem de camadas de switch.
  • Operações simplificadas via integração UFM e telemetria abrangente para gerenciamento proativo de falhas.
  • Escalabilidade à prova de futuro para suportar interconexões de GPU e acelerador de próxima geração.

Para organizações que avaliam o MQM9790-NS2F para venda através da rede de parceiros da NVIDIA, recomendamos revisar a folha de dados detalhada do MQM9790-NS2F e engajar com um arquiteto de solução certificado para adaptar a implantação aos seus requisitos específicos de carga de trabalho e escala. O NVIDIA Mellanox MQM9790-NS2F está pronto agora para servir como o backbone de interconexão de alto desempenho para a próxima década de descoberta científica e inovação em IA.