NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch Livro Branco Técnico

August 21, 2026

NVIDIA Mellanox MQM8790-HS2F InfiniBand Switch Livro Branco Técnico

Artigo técnico do switch NVIDIA Mellanox MQM8790-HS2F InfiniBand: Otimizando a interconexão de baixa latência para clusters RDMA/HPC/AI

Este white paper técnico destina-se a arquitetos de rede, engenheiros de pré-vendas e gerentes de operações. Centra-se noNVIDIA Mellanox MQM8790-HS2FSwitch HDR InfiniBand de 200 Gb/s, fornecendo um design de solução abrangente para otimização de interconexão de baixa latência em clusters de computação de alto desempenho (HPC) e inteligência artificial (IA) acelerados por RDMA. O documento abrange o design da arquitetura, as principais tecnologias, as estratégias de implantação e escalonamento, o monitoramento de operações e a avaliação de valor, oferecendo um modelo reproduzível para a infraestrutura de computação com uso intensivo de dados da próxima geração.

1. Antecedentes do Projeto e Análise de Requisitos

À medida que os parâmetros do modelo de IA atingem magnitudes de trilhões de escalas e as simulações de HPC exigem uma resolução cada vez mais precisa, a estrutura da rede subjacente evoluiu de um componente de suporte para um determinante primário de desempenho. Os trabalhos de formação distribuída, por exemplo, podem gastar 40-60% do seu tempo de execução em operações de comunicação colectiva se a interconexão não tiver largura de banda e características de latência suficientes. Para as equipes de TI corporativas, isso se traduz diretamente em um tempo de lançamento no mercado estendido para iniciativas de IA e investimentos subutilizados em GPU.

Os principais requisitos identificados através de extensos compromissos com o cliente incluem:

  • Latência ultrabaixa e previsível:Comutação cut-through abaixo de 200ns para tráfego MPI e RDMA, com jitter mínimo sob contenção.
  • Taxa de transferência sem bloqueio:Desempenho sustentado da taxa de linha em todas as portas simultaneamente, eliminando a formação de pontos de acesso e a degradação da latência final.
  • Computação em rede:Aceleração de hardware para operações coletivas (redução total, transmissão, barreira) para descarregar CPUs host e reduzir a movimentação de dados.
  • Suporte de topologia escalável:Capacidade de construir topologias fat-tree, torus ou dragonfly+ abrangendo centenas a milhares de nós sem camadas de switch excessivas.
  • Gestão simplificada:Monitoramento de malha unificado, descoberta automatizada de topologia e detecção proativa de falhas para reduzir a sobrecarga operacional.

OMQM8790-HS2Ffoi selecionado como o bloco de construção ideal para esta arquitetura de solução, com seu preliminarFolha de dados MQM8790-HS2Fconfirmando 40 portas de HDR de 200 Gb/s, latência de corte inferior a 130ns e suporte para computação em rede SHARP v3.0 – recursos que mapeiam diretamente os requisitos acima.

2. Projeto geral de arquitetura de rede/sistema

A arquitetura proposta emprega uma topologia leaf-spine fat-tree de duas camadas para clusters de até 1.200 nós, com uma opção de extensão para três camadas para implantações maiores. Essa topologia equilibra desempenho, custo e capacidade de gerenciamento, fornecendo largura de banda de bisseção completa e latência determinística em toda a malha.

Nível Tipo de dispositivo Contagem de portas (usada) Função de conectividade
Folha MQM8790-HS2F 32 x 200 Gb/s (16 para nós, 16 para espinhos) Agrega o tráfego do nó de computação
Coluna MQM8790-HS2F 40 x 200 Gb/s (todos para switches leaf) Conexão cruzada sem bloqueio entre folhas

Cada switch leaf conecta até 16 nós de computação por meio de adaptadores de canal host NVIDIA ConnectX-6 ou ConnectX-7 HDR, usando oCompatível com MQM8790-HS2Fecossistema óptico – incluindo cabos ópticos ativos (AOCs) e DACs de cobre passivos, dependendo da distância do link. OMQM8790-HS2F 200 Gb/s HDR QSFP56 de 40 portasO design fornece ampla densidade para agregação em nível de rack, mantendo um formato de 1U para utilização eficiente do espaço em rack.

Para clusters com mais de 1.200 nós, recomenda-se uma topologia de três camadas com uma camada super-spine adicional. Nesta configuração, oSolução de switch InfiniBand MQM8790-HS2Fmantém sua função em todas as camadas, simplificando o gerenciamento de reserva e configuração – um único tipo de switch suporta toda a estrutura, da borda ao núcleo.

3. Função e principais recursos do NVIDIA Mellanox MQM8790-HS2F

ONVIDIA Mellanox MQM8790-HS2Fserve como elemento de comutação fundamental nesta arquitetura, oferecendo os seguintes recursos diferenciados que impulsionam diretamente a otimização da interconexão de baixa latência:

  • Velocidade da porta HDR 200 Gb/s:Duplica a largura de banda do EDR da geração anterior (100 Gb/s), mantendo a compatibilidade retroativa com HDR100 (100 Gb/s) para ambientes de velocidade mista, protegendo investimentos anteriores.
  • Switching cut-through com latência abaixo de 130ns:Minimiza o tempo gasto pelos pacotes no switch, fundamental para operações RDMA sensíveis à latência e padrões de comunicação coletiva.
  • Computação em rede SHARP v3.0:Transfere operações de redução de carga das CPUs host para a malha do switch, reduzindo o tráfego de dados em até 30% e acelerando o desempenho totalmente reduzido para treinamento de IA em até 2x.
  • Roteamento adaptativo e controle de congestionamento:Distribui dinamicamente o tráfego por vários caminhos para evitar pontos de acesso, com sinalizadores de congestionamento e controle de fluxo baseado em crédito garantindo operação sem perdas – um pré-requisito para o desempenho do RDMA.
  • Telemetria e diagnóstico integrados:Fornece visibilidade granular da ocupação do buffer por porta, taxas de erro de link e padrões de tráfego, permitindo otimização proativa e rápido isolamento de falhas.

De acordo com o detalhadoespecificações deMQM8790-HS2F, o switch oferece suporte a variantes de fluxo de ar direto e reverso, acomodando diversos designs de resfriamento de data center. Suas fontes de alimentação duplas redundantes e módulos de ventilador hot-swap melhoram ainda mais a confiabilidade e a facilidade de manutenção.

4. Recomendações de implantação e expansão (com topologia típica)

Para uma implantação inicial equilibrada e econômica, são recomendadas as seguintes práticas recomendadas:

  • Conectividade nó a folha:Use cabos HDR de 200 Gb/s (DAC de cobre para ≤3m, AOC para ≤30m) com oCompatível com MQM8790-HS2FConectores QSFP56. Certifique-se de que os adaptadores de canal do host estejam configurados para a mesma velocidade de link e configurações de FEC que as portas do switch.
  • Conectividade folha-espinha:Implante AOCs de 200 Gb/s ou transceptores de fibra óptica multimodo para distâncias de até 100 m. OMQM8790-HS2Fnegocia automaticamente os parâmetros do link, simplificando a implantação.
  • Planejamento de excesso de assinaturas:Para cargas de trabalho de IA/HPC de uso geral, uma proporção de excesso de assinatura de 2:1 (dois nós de computação por uplink de 200 Gb/s) fornece um ponto ideal de custo-desempenho. Para cargas de trabalho com otimização de latência ou com uso intensivo de armazenamento, considere a assinatura excessiva de 1:1 (completa).
  • Caminho de expansão:Ao adicionar novos racks, basta implantar switches leaf adicionais e conectá-los aos switches de coluna existentes. Para aumentos significativos de capacidade (duplicação da contagem de nós), atualize a camada de coluna vertebral para uma base mais alta ou adicione uma camada super-espinha.

Ao avaliar oPreço MQM8790-HS2Fe o custo total de propriedade, considere que a arquitetura unificada — usando o mesmo tipo de switch em todas as camadas de malha — reduz os requisitos de estoque de peças sobressalentes em aproximadamente 70% em comparação com abordagens de vários SKU. Essa simplificação acelera a resposta a incidentes e minimiza o tempo de inatividade durante falhas de hardware.

5. Monitoramento, solução de problemas e otimização de operações

Gestão eficaz de umInterruptor InfiniBand MQM8790-HS2Fambiente requer uma abordagem sistemática para monitoramento, diagnóstico e ajuste de desempenho.

Monitorando as melhores práticas:

  • Implante o Unified Fabric Manager (UFM) da NVIDIA para obter visibilidade centralizada da malha, incluindo mapas de topologia, mapas de calor de utilização por link e histogramas de latência em tempo real.
  • Monitore contadores de erros por porta – especialmente erros de CRC, erros de símbolos e eventos de link down – para identificar antecipadamente a degradação de ópticas ou cabos. Defina armadilhas SNMP para limites predefinidos para permitir a manutenção proativa.
  • Acompanhe a eficiência da operação coletiva SHARP por meio dos contadores de desempenho integrados do switch, identificando oportunidades para otimizar os padrões de comunicação coletiva no nível do aplicativo.

Solução de problemas comuns:

  • Erros de link CRC em portas específicas:Verifique o assentamento dos cabos e a limpeza dos conectores ópticos. Se os erros persistirem, substitua o cabo ou transceptor. OFolha de dados MQM8790-HS2Ffornece limites de diagnóstico detalhados por porta.
  • Picos inesperados de latência:Verifique se há pontos de congestionamento usando a análise de fluxo de tráfego da UFM. O roteamento adaptativo pode precisar de reconfiguração para determinados padrões de tráfego – experimente diferentes algoritmos de roteamento (mínimo versus não mínimo).
  • Problemas de partição de malha:Garanta configurações adequadas de chave de partição (PKey) e gerenciador de sub-rede IPoIB. O gerenciador de sub-rede integrado do switch fornece descoberta automatizada de malha, mas ajustes manuais podem ser necessários para ambientes multilocatários.

Dicas de otimização de desempenho:

  • Para cargas de trabalho de treinamento de IA, habilite o SHARP v3.0 e configure bibliotecas de comunicação coletiva (NCCL, OpenMPI) para usar os recursos de descarregamento do switch. Isso pode reduzir totalmente a latência em até 2x para mensagens grandes.
  • Para aplicações HPC sensíveis à latência, considere desabilitar o roteamento adaptativo para impor a seleção de caminho determinística, trocando alguma diversidade de caminho por latência previsível.
  • Revise e atualize periodicamente o firmware do switch, pois a NVIDIA lança regularmente melhorias de desempenho e patches de segurança. Consulte oFolha de dados MQM8790-HS2Fpara matrizes de compatibilidade de versão.

6. Resumo e avaliação de valor

ONVIDIA Mellanox MQM8790-HS2Foferece uma proposta de valor atraente para organizações que criam ou atualizam clusters RDMA/HPC/AI. Ao fornecer 200 Gb/s por porta, latência inferior a 130ns e aceleração de computação em rede em um chassi de 1U e 40 portas, o switch atende aos requisitos de interconexão mais rigorosos das cargas de trabalho modernas com uso intensivo de dados.

Os principais fatores de valor incluem:

  • Escalabilidade de desempenho:A arquitetura de árvore gorda sem bloqueio construída em tornoMQM8790-HS2F 200 Gb/s HDR QSFP56 de 40 portasos nós podem ser dimensionados de 200 a mais de 10.000 nós sem alterações fundamentais de topologia.
  • Eficiência operacional:Um único tipo de switch em todas as camadas de malha reduz o estoque de peças sobressalentes, simplifica o treinamento e acelera a solução de problemas.
  • Proteção do investimento:A compatibilidade retroativa com HDR100 e EDR permite atualizações em fases, enquanto o formato do switch e a densidade da porta se alinham com os futuros roteiros de 400G (NDR).
  • Ecossistema comprovado:A profunda integração com os adaptadores ConnectX da NVIDIA, DPUs BlueField e plataforma de gerenciamento UFM garante previsibilidade de desempenho de ponta a ponta.

Para organizações prontas para implantar, oMQM8790-HS2F à vendaatravés da rede global de distribuidores autorizados da NVIDIA inclui opções de suporte abrangentes, incluindo peças sobressalentes no local, substituição avançada e assinaturas de atualização de firmware. Detalhadoespecificações deMQM8790-HS2Fe projetos de referência estão disponíveis no portal de documentação técnica da NVIDIA, e consultoria de topologia personalizada é oferecida para implantações brownfield ou greenfield em grande escala.