Solução Técnica de Switch InfiniBand Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0

July 15, 2026

Solução Técnica de Switch InfiniBand Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 InfiniBand Switch Solução Técnica

1Análise dos antecedentes e requisitos do projecto

As estruturas de treinamento de IA modernas e as aplicações de HPC são cada vez mais limitadas pelo desempenho da interconexão de rede, em vez de apenas pela densidade de computação.Os empregos de formação distribuídos, em especial os que utilizam grandes modelos linguísticos, geram, padrões de tráfego sincronizados de redução total e total que sobrecarregam os tecidos Ethernet tradicionais. Os principais requisitos identificados em implementações empresariais incluem:Latência de comutação de submicrossegundos para minimizar a sobrecarga de comunicação, capacidade de transferência não bloqueadora em escala para eliminar a sobre-subscrição, controlo avançado da congestão para lidar com explosões incas,e integração contínua com RDMA através da Ethernet Convergente (RoCE) ou ecossistemas nativos InfiniBandAlém disso, as equipas operacionais exigem telemetria profunda para a detecção proativa de falhas e gestão simplificada em centenas de portos.

2. Projeto geral da arquitetura de rede/sistema

A arquitetura proposta centra-se numa topologia de dois níveis de leaf-spine, especialmente construída para cargas de trabalho centradas na GPU.Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0como o switch ToR (Top-of-Rack) primário, conectando até 40 nós de computação através de ligações NDR de 400Gb/s. A camada espinhal consiste num segundo nível de920-9B210-00FN-0D0 MQM9790-NS2F 400 Gb/s NDRComutadores, que fornecem conectividade de malha completa com sobre-subscrição 4:1 ou totalmente não-bloqueio quando implantados com portas de coluna suficiente.Este projeto suporta até 512 nós GPU em um único domínio de tecido, com a opção de dimensionar horizontalmente através de múltiplas sub-redes interconectadas através do UFM da NVIDIA (Unified Fabric Manager).

A arquitetura aproveita o motor de computação em rede SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) da NVIDIA, descarregando operações coletivas diretamente no switch ASIC.Isto reduz o volume de dados que atravessam os buses de memória da CPU/GPU e reduz a latência de operação coletiva em até 40% em comparação com as abordagens baseadas em software. O920-9B210-00FN-0D0 InfiniBand switch OPNtambém suporta roteamento adaptativo, que seleciona dinamicamente o caminho menos congestionado para cada pacote, garantindo uma utilização ideal da largura de banda mesmo sob cargas de tráfego assimétricas.

3Função e características principais do 920-9B210-00FN-0D0 na solução

ONVIDIA Mellanox 920-9B210-00FN-0D0A sua função principal é a de:

  • Agregação de alta densidade:Com até 64 portas 400Gb/s sem bloqueio num fator de forma 2U, o switch oferece uma capacidade de comutação agregada de 25,6 Tb/s. Esta densidade reduz o número de switches necessários por rack,simplificação do cabeamento e redução do consumo de energia por porto.
  • Comutação de latência ultra-baixa:O switch mantém uma latência inferior a 600ns para qualquer tamanho de pacote, crítico para aplicações sensíveis à latência de cauda, como inferência on-line e HPC financeiro.
  • Computação em rede:A integração do SHARPv3 permite a aceleração de hardware das operações coletivas, reduzindo o número de travessões em todo o tecido e melhorando os tempos de conclusão de trabalhos em até 30%.
  • Telemetria avançada e controlo de congestionamento:O interruptor fornece visibilidade por fluxo, marcando fluxos congestionados para ajustes do lado do anfitrião e permitindo o alerta precoce de hotspots incipientes.

De acordo com oFicha de dados 920-9B210-00FN-0D0, o interruptor suporta transceptores QSFP-DD de cobre e ópticos, tornando-o920-9B210-00FN-0D0 compatívelO sistema de transmissão de dados de alta velocidade, com uma infra-estrutura de cablagem existente na maioria dos centros de dados, e um fluxo de ar front-to-back e fontes de alimentação redundantes garantem alta disponibilidade em ambientes empresariais.

4Recomendações de implantação e escalagem (topologia típica)

Para uma implantação de campo verde de 128 nós GPU, recomendamos uma arquitetura de dois níveis com 4 interruptores de folha e 2 interruptores de coluna,cada coluna vertebral ligando-se a cada folha através de 4x400Gb/s uplinks resultando num 2Para aplicações sensíveis à latência ou de grande largura de banda, um 1:1 pode ser alcançado aumentando a contagem da coluna vertebral para 4, resultando numa capacidade agregada de ligação ascendente igual às portas de ligação descendente.

A escalação para além de 512 nós requer a partição do tecido em várias sub-redes, cada uma gerenciada pela UFM como uma ilha de tecido distinta.A comunicação entre sub-redes pode ser encaminhada através dos gateways Quantum-2 da NVIDIA ou através de roteamento baseado em host, embora a abordagem recomendada para cargas de trabalho sensíveis ao desempenho seja manter o tecido dentro de uma única sub-rede sempre que possível.920-9B210-00FN-0D0 especificaçõesSuporte a estas topologias de grande escala, com controlo de fluxo integrado e controlo de fluxo baseado em prioridades (PFC) para evitar quedas de pacotes durante eventos de redirecionamento do caminho.

Ao planejar cablagem física, considere usar cabos de ruptura MPO-QSFP-DD para conexões de folha de espinha para reduzir a densidade do cabo, ou cabos ópticos ativos (AOCs) para distâncias superiores a 3 metros.920-9B210-00FN-0D0 à vendaNormalmente inclui um kit de acessórios abrangente, mas recomendamos validar a compatibilidade do transceptor de terceiros através da matriz de interoperabilidade do fornecedor para evitar problemas de treinamento de link.

5Operações, Monitorização e Diagnóstico de Falhas

A excelência operacional é uma pedra angular da920-9B210-00FN-0D0 Solução OPN de interruptor de banda InfiniO switch integra-se perfeitamente com a plataforma UFM da NVIDIA, que fornece:

  • Monitorização da saúde dos tecidos em tempo real:Painéis de comando para o estado da ligação, temperatura, consumo de energia e contadores de erros por porta (CRC, símbolo e erros de alinhamento).
  • Análise de falhas preditivas:Os modelos de aprendizagem de máquina na UFM identificam proativamente ópticas falhas ou ligações deterioradas antes que causem falhas no trabalho.
  • Solução automática de problemas:O sistema recomenda ações corretivas, tais como redirecionar o tráfego ou isolar ligações defeituosas, reduzindo significativamente o tempo médio de resolução (MTTR).

Para diagnósticos avançados, o switch suporta o sFlow e o espelhamento de portas, permitindo a inspeção profunda de pacotes para depuração em nível de protocolo.920-9B210-00FN-0D0 especificaçõespara limiares de buffer e configurações recomendadas, em especial para ajustar o tráfego RoCEv2 se for utilizado em ambientes mistos InfiniBand/Ethernet.O ajuste de desempenho deve concentrar-se nos limiares de roteamento adaptativo e nos intervalos de agregação SHARPv3, que podem ser ajustados por fase de carga de trabalho, por exemplo, formação versus inferência.

A manutenção de rotina inclui atualizações de firmware, que são realizadas com o mínimo de interrupções, utilizando a capacidade de atualização contínua da UFM,e limpeza periódica dos conectores ópticos para manter a integridade do sinalA potência redundante do interruptor e os módulos de ventilador permitem a substituição de trocas a quente durante o funcionamento.

6Resumo e Avaliação do Valor

OMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0oferece uma solução abrangente para organizações que buscam liberar o pleno desempenho de seus investimentos em IA e HPC.A gestão inteligente do congestionamentoA arquitetura descrita fornece um caminho comprovado dos clusters piloto de 128 nós para 2,0 milhões de clusters.Tecidos para supercomputação, com ferramentas operacionais que simplificam a gestão e reduzem o custo total de propriedade.

Para avaliar a920-9B210-00FN-0D0 preço, considerar o valor a longo prazo: os tempos de conclusão reduzidos do trabalho traduzem-se directamente em custos mais baixos na nuvem ou em tempo de visão mais rápido para as cargas de trabalho no local.920-9B210-00FN-0D0 Solução OPN de interruptor de banda Infinié apoiado pela rede de suporte global da NVIDIA e pelo extenso ecossistema de parceiros, garantindo que as organizações possam implantar, dimensionar e otimizar com confiança sua infraestrutura para os próximos anos.


Para informações mais pormenorizadas, consulte oFicha de dados 920-9B210-00FN-0D0e920-9B210-00FN-0D0 especificaçõesDocumento que inclui desenhos mecânicos, perfis térmicos e referências de desempenho.