NVIDIA Mellanox 920-9B110-00FH-0D0 na Prática: Otimizando Tecidos RDMA de Baixa Latência para Clusters de HPC e IA

August 25, 2026

últimas notícias da empresa sobre NVIDIA Mellanox 920-9B110-00FH-0D0 na Prática: Otimizando Tecidos RDMA de Baixa Latência para Clusters de HPC e IA

NVIDIA Mellanox 920-9B110-00FH-0D0 na prática: otimização de tecidos RDMA de baixa latência para clusters de HPC e IA

Antecedentes e o desafio: Quando o desempenho HDR atende à realidade do orçamento

Um laboratório de pesquisa de IA de tamanho médio enfrentou recentemente um desafio familiar: seu tecido EDR InfiniBand de 100Gb/s estava se tornando um gargalo para o seu cluster de GPU em expansão,que tinha crescido de 128 para 512 nós NVIDIA A100Os tempos de formação dos modelos de transformadores de grande escala aumentaram mais de 40% devido ao congestionamento da rede durante as operações de redução total,e a equipe precisava de uma atualização que pudesse oferecer ganhos substanciais de desempenho sem os gastos de capital necessários para uma implantação completa de NDR de 400Gb/s.

O laboratório avaliou várias opções e identificou o HDR de 200Gb/s como o equilíbrio ideal entre desempenho e custo.controlo avançado do congestionamento, e integração perfeita com os seus cabos e transceptores HDR-compatíveis existentes.NVIDIA Mellanox 920-9B110-00FH-0D0O HDR é um switch especialmente concebido para ambientes em que o HDR fornece ampla largura de banda sem sobreprovisionamento.

Solução e implantação: um tecido HDR otimizado em termos de custos

O laboratório implementou o920-9B110-00FH-0D0 InfiniBand switch OPNCada rack de computação recebeu um switch baseado no MQM8790-HS2F, a plataforma de silício subjacente ao computador.920-9B110-00FH-0D0 MQM8790-HS2F- fornecendo 40 portas de conectividade de 200Gb/s aos servidores GPU através de cabos de ligação direta OSFP-OSFP.criar um tecido de árvore de gordura não bloqueante com largura de banda de bisecção completa.

O que tornou esta implantação particularmente eficaz foi a tecnologia SHARPv2 integrada do switch (Protocolo de Agregação e Redução Hierárquica Escalavel),que descarregou as operações de comunicação coletiva diretamente no tecido do interruptorNa prática, isto significava que as operações de redução total, que anteriormente consumiam ciclos significativos da CPU do host e largura de banda da rede,Os trabalhos foram agora concluídos numa única passagem através do tecido, reduzindo drasticamente os tempos de conclusão dos trabalhos..

De acordo com oFicha de dados 920-9B110-00FH-0D0O equipamento foi equipado com um sistema de transmissão automática, que permite que o computador seja ligado a um computador de computador.920-9B110-00FH-0D0 compatívelO ecossistema incluiu todos os tipos de cabos e ópticas que já tinham sido padronizados, eliminando a necessidade de esforços dispendiosos de recabelhamento.

Resultados e benefícios mensuráveis: do gargalo ao facilitador

Após a implantação, o laboratório mediu melhorias em várias dimensões críticas:

  • Redução do tempo de conclusão do trabalho:As iterações de treinamento para um modelo de parâmetro 13B diminuíram 35%, com a latência de redução total caindo de 12 μs para menos de 5 μs para tamanhos coletivos típicos.
  • Utilização da rede:A utilização média do tecido aumentou de 58% para 83% sem desencadear congestionamento, graças aos mecanismos de roteamento adaptativo e controle de congestionamento do interruptor.
  • Eficiência energética e de arrefecimento:Em comparação com o tecido EDR anterior, a nova infraestrutura HDR reduziu o consumo de energia por porta em 30%, permitindo que o laboratório adicionasse mais nós de computação sem exceder seu orçamento de energia do data center.

Do ponto de vista do custo total de propriedade, a920-9B110-00FH-0D0 preçoO laboratório, por exemplo, utilizou um sistema de transmissão por porto significativamente inferior às alternativas NDR, o que permitiu ao laboratório modernizar toda a sua estrutura dentro do seu orçamento existente.Especificações 920-9B110-00FH-0D0Também destacou as fontes de alimentação duplas redundantes do interruptor e os módulos de ventilador trocáveis a quente, que contribuíram para o objetivo do laboratório de 99,999% de disponibilidade para seus trabalhos de treinamento de produção.

Os engenheiros da rede observaram que o920-9B110-00FH-0D0 Solução OPN de comutação InfiniBandintegrado perfeitamente com o Unified Fabric Manager (UFM) da NVIDIA, fornecendo visibilidade centralizada sobre a saúde do tecido e alerta automatizado.Isto reduziu significativamente o tempo gasto em solução de problemas e manutenção proativa, liberando a equipa para se concentrar na otimização dos seus canais de formação em vez de gerir a rede.

Resumo e perspectivas: A Fundação HDR de tamanho adequado

ONVIDIA Mellanox 920-9B110-00FH-0D0provou ser a escolha certa para este laboratório de pesquisa, oferecendo o desempenho de 200Gb/s HDR a uma estrutura de custo que fazia sentido comercial.Capacidades de computação em rede, e recursos de gestão robustos, o laboratório transformou a sua rede de um gargalo de desempenho em uma base escalável para o crescimento futuro.

Olhando para o futuro, o laboratório planeia escalar o seu cluster para 1.024 nós nos próximos 18 meses.Eles têm confiança de que a sua rede pode crescer ao lado de sua capacidade de computaçãoPara as organizações que avaliam as suas opções de infra-estrutura de RHD, o920-9B110-00FH-0D0 à vendaA NVIDIA oferece uma solução convincente e validada pela produção que equilibra desempenho, densidade e custo.