NVIDIA Mellanox MQM9790-NS2F em Ação: Construindo um Tecido RDMA de Baixa Latência para Clusters de IA e HPC

August 24, 2026

últimas notícias da empresa sobre NVIDIA Mellanox MQM9790-NS2F em Ação: Construindo um Tecido RDMA de Baixa Latência para Clusters de IA e HPC

NVIDIA Mellanox MQM9790-NS2F em ação: Construção de um tecido RDMA de baixa latência para AI e HPC Clusters

Antecedentes e o desafio: Quando a ampliação se torna um gargalo

À medida que os grandes modelos de linguagem aumentam de milhares para dezenas de milhares de GPUs, e as simulações meteorológicas avançam em direção à resolução em escala de quilômetros,As limitações dos tecidos Ethernet tradicionais tornam-se evidentesNestes ambientes, os padrões de comunicação colectiva MPI, tais como "reduzir tudo" e "todo para todos", colocam exigências extremas em matéria de latência e controlo de congestionamento da rede.Mesmo os nós de computação mais poderosos gastam uma parte significativa de seus ciclos esperando por dados, efetivamente desperdiçando recursos GPU caros.

É precisamente este o desafio que oNVIDIA Mellanox MQM9790-NS2FComo um comutador NDR InfiniBand de 400Gb/s com 64 portas OSFP, é projetado para fornecer latência determinística de sub-microssegundos em milhares de endpoints,Permitindo a escalação linear verdadeira para cargas de trabalho distribuídas.

Solução e implantação: um tecido de espinha de folha construído para RDMA

Em um cenário de implantação típico para um grande laboratório de investigação de IA, oMQM9790-NS2F Comutador de banda Infiniforma o núcleo de uma topologia de espinha dorsal de folhas de dois níveis. Na camada de folhas, cada rack de computação é equipado com uma ou duas unidades MQM9790-NS2F,fornecendo 64 portas de conectividade de 400 Gb/s para servidores GPU através de cabos de cobre de ligação direta OSFP-OSFP ou cabos ópticos ativosNa camada da coluna vertebral, os interruptores MQM9790-NS2F adicionais interligam as folhas, criando um tecido de árvore de gordura não-bloqueante com largura de banda de bisecção completa.

What makes this solution particularly compelling is the switch's native support for RDMA over Converged Ethernet (RoCE) when operating in InfiniBand mode—though here it leverages InfiniBand's native RDMA capabilities for even lower latency and CPU offload. OMQM9790-NS2F 400Gb/s NDR OSFP de 64 portasintegra a tecnologia SHARPv3 (Scalable Hierarchical Aggregation and Reduction Protocol) da NVIDIA, que descarrega operações coletivas diretamente no tecido do switch.Isto significa que uma operação de redução total que normalmente atravessaria a rede várias vezes é agora concluída em uma única passagem, reduzindo os tempos de conclusão de trabalhos em até 30% para cargas de trabalho de comunicação intensiva.

Para os arquitetos de rede que avaliam aMQM9790-NS2F Solução de comutação InfiniBand, o processo de implantação é simplificado pelo Unified Fabric Manager (UFM) da NVIDIA.e monitorização proactiva do congestionamentoOs primeiros utilizadores relataram que oMQM9790-NS2F compatívelO ecossistema, que inclui uma ampla gama de cabos e transceptores certificados pela NVIDIA, simplifica a aquisição e reduz o risco de implantação.

Resultados e ganhos mensuráveis: da teoria à realidade da produção

Em uma recente implantação de produção para um cluster de 2.048 GPU dedicado ao treinamento de modelos de transformadores em larga escala, a atualização da infraestrutura HDR (200Gb/s) para NDR (400Gb/s)NVIDIA Mellanox MQM9790-NS2FO objectivo principal é a melhoria dos sistemas de gestão dos riscos.

  • Redução do tempo de conclusão do trabalho:Iterações de treinamento de ponta a ponta para um modelo de parâmetro 175B diminuíram 28%, em grande parte atribuídas ao descarregamento do SHARPv3 e à redução da latência de cauda.
  • Utilização da rede:A utilização média do tecido aumentou de 62% para 89% sem desencadear o colapso do congestionamento, graças aos avançados mecanismos de roteamento adaptativo e controle de congestionamento do interruptor.
  • Simplicidade operacional:Com 64 portas por interruptor, o número de interruptores de coluna necessários foi reduzido pela metade em comparação com um projeto HDR de 32 portas, reduzindo significativamente a complexidade do cablagem e o consumo de energia por rack.

De acordo com oEspecificações MQM9790-NS2F, o switch oferece latência de porta a porta inferior a 100 ns e suporta até 51,2 Tb/s de capacidade de comutação agregada – números que se alinham estreitamente com o desempenho observado nesta implantação.Os engenheiros de rede também observaram que oFicha de dados MQM9790-NS2FReflecte com precisão o desempenho do mundo real, sem surpresas durante a fase de validação.

Do ponto de vista do TCO, a capacidade de consolidar mais terminais por nível de comutação reduziu directamente os gastos de capital.Preço MQM9790-NS2FO custo de rede por GPU diminuiu devido ao maior radix e ao número reduzido de camadas de comutador.combinado com os ganhos de desempenho, tornou o caso claro para o comité de direcção do laboratório.

Resumo & Perspectivas: A Fundação NDR para a Computação Exascale

ONVIDIA Mellanox MQM9790-NS2FA utilização de um sistema de transmissão automática de dados é mais do que uma atualização incremental, mas representa uma mudança fundamental na forma como os clusters de HPC e IA são projetados.e aceleração de computação na rede num único fator de forma de 1U, permite que os arquitetos construam tecidos que se escalam para dezenas de milhares de pontos finais sem sacrificar o desempenho ou a gerenciamento.

No futuro, à medida que as cargas de trabalho continuam a exigir maior largura de banda e menor latência, oMQM9790-NS2F Comutador de banda InfiniServirá de base para a próxima geração de sistemas exascale.Sua compatibilidade com as plataformas NVIDIA Quantum-2 existentes e integração perfeita com UFM garantem um caminho de migração suave para organizações que atualizam de tecidos HDRPara os gestores de TI e arquitetos que avaliam os seus investimentos em redes de próxima geração, o MQM9790-NS2F oferece umaSolução pronta para produção que cumpre a promessa de otimização de interconexão RDMA de baixa latência.