Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Switch InfiniBand na prática

July 15, 2026

últimas notícias da empresa sobre Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Switch InfiniBand na prática

Mellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0 Switch InfiniBand na prática | Otimização de interconexão de baixa latência para clusters RDMA/HPC/AI

Antecedentes e desafios: quando a escala do cluster encontra gargalos de interconexão

A divisão de pesquisa de IA de uma empresa líder na Internet se viu em uma encruzilhada familiar. Sua crescente frota de servidores GPU — abrangendo vários racks e cada vez mais usados ​​para treinamento de modelos de linguagem de grande porte — estava sofrendo com tempos de conclusão de trabalho imprevisíveis. A estrutura existente baseada em Ethernet, embora adequada para cargas de trabalho de uso geral, não conseguia lidar com os padrões de tráfego sincronizados e em rajadas do treinamento distribuído. As operações de redução total paralisariam regularmente devido a quedas de pacotes e congestionamento de incast, aumentando os ciclos de treinamento de dias para semanas. A equipe de infraestrutura precisava de uma mudança fundamental na forma como a rede de back-end lidava com o tráfego RDMA, e precisava disso sem revisar toda a arquitetura do data center.

Design da solução: implantando o OPN do switch InfiniBand 920-9B210-00FN-0D0

Depois de avaliar diversas opções de interconexão, a equipe selecionou aMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0como a pedra angular de seu novo tecido backend. A implantação centrou-se em uma topologia leaf-spine de duas camadas, com cada switch leaf conectando até 40 nós de GPU por meio de links de 400 Gb/s. O920-9B210-00FN-0D0 MQM9790-NS2F 400Gb/s NDRA variante foi escolhida especificamente por sua arquitetura sem bloqueio e recursos integrados de computação em rede SHARPv3. Isso permitiu que a equipe transferisse as operações de comunicação coletiva diretamente para a malha do switch, reduzindo a sobrecarga da CPU e liberando os ciclos da GPU para a computação real.

Em termos de implantação física, os switches foram instalados com fluxo de ar frontal para trás para corresponder à configuração existente de corredor quente/corredor frio. A equipe aproveitouFolha de dados 920-9B210-00FN-0D0para verificar os requisitos de energia e resfriamento, garantindo integração perfeita em suas unidades de distribuição de energia existentes. O cabeamento foi mantido consistente usando transceptores QSFP-DD, com oCompatível com 920-9B210-00FN-0D0óptica validada em todo o orçamento do link, incluindo as conexões espinha-folha que abrangem até 100 metros.

Abordagem de implantação: integração passo a passo

  • Fase 1 – Validação de Laboratório:Um ambiente de teste de pequena escala com 8 nós de GPU e dois switches foi usado para avaliar a latência e o rendimento. ONVIDIA Mellanox 920-9B210-00FN-0D0demonstrou latência de switch sub-600ns, uma melhoria de 60% em relação à geração HDR anterior.
  • Fase 2 – Implementação gradual:A equipe migrou um pod de treinamento por vez, usando o Unified Fabric Manager da NVIDIA para monitorar a integridade do link e as métricas de congestionamento em tempo real. Isso minimizou a interrupção das cargas de trabalho de produção contínuas.
  • Fase 3 – Integração em Grande Escala:Todos os 18 switches foram implantados em três racks, formando uma coluna totalmente sem bloqueio com uplinks de 400 Gb/s. O roteamento adaptativo foi habilitado para equilibrar dinamicamente o tráfego e evitar excesso de inscrições durante picos de envio de trabalhos.

Durante toda a implantação, a equipe de engenharia referiu-se ao abrangenteEspecificações 920-9B210-00FN-0D0para ajustar as configurações de buffer e parâmetros de controle de congestionamento. A telemetria avançada do switch proporcionou visibilidade granular da contagem de erros por porta e da utilização do link, permitindo manutenção proativa e planejamento de capacidade.

Resultados mensuráveis ​​e benefícios operacionais

Duas semanas após a implantação em grande escala, as melhorias eram tangíveis. Os tempos de conclusão totalmente reduzidos para um trabalho de treinamento padrão de 1.024 GPUs caíram de 12,3 segundos para 7,8 segundos, representando uma redução de 37% na sobrecarga de comunicação. Os tempos de conclusão do trabalho para um modelo típico do estilo GPT melhoraram quase 30%, permitindo que a equipe de pesquisa iterasse mais rapidamente e executasse mais experimentos por semana. O mecanismo SHARPv3 integrado aliviou uma média de 18% das operações coletivas, traduzindo-se diretamente em maior utilização da GPU e menor consumo de energia por treino.

Operacionalmente, a equipe de TI relatou menos falhas de trabalho relacionadas à rede e significativamente menos tempo gasto no diagnóstico de problemas no nível do link. OSolução OPN do switch InfiniBand 920-9B210-00FN-0D0mostrou-se notavelmente estável, com zero interrupções não planejadas durante o período de observação de três meses. A interface de gerenciamento unificada reduziu a curva de aprendizado da equipe de operações de rede, que agora podia gerenciar toda a estrutura por meio de um único painel de controle.

Considerações sobre custos e aquisições

Enquanto o inicialPreço 920-9B210-00FN-0D0posicionou a mudança no segmento premium do mercado, a análise do custo total de propriedade contou uma história diferente. Ao reduzir os tempos de conclusão de trabalhos e melhorar a utilização da GPU, a organização alcançou uma redução de 22% nos custos de instâncias de nuvem para capacidade computacional equivalente. Além disso, o920-9B210-00FN-0D0 para vendapor meio de vários parceiros de canal permitiu licitações competitivas, e o compromisso de suporte de longo prazo da NVIDIA Mellanox proporcionou confiança no investimento.

Resumo e perspectivas: um modelo para infraestrutura de IA de última geração

A implantação doMellanox (NVIDIA Mellanox) 920-9B210-00FN-0D0neste centro de pesquisa de IA em larga escala serve como uma arquitetura de referência atraente para organizações que enfrentam desafios de interconexão semelhantes. A combinação de velocidades NDR de 400 Gb/s, latência de submicrossegundos e recursos de computação em rede aborda os principais pontos problemáticos dos clusters de HPC e IA baseados em RDMA. Os arquitetos de rede apreciarão a flexibilidade do920-9B210-00FN-0D0 Interruptor InfiniBand OPNem diversas topologias, enquanto os gerentes de TI podem contar com ferramentas de gerenciamento robustas e abrangentesFolha de dados 920-9B210-00FN-0D0para planejamento de capacidade.

Olhando para o futuro, a organização já está planejando expandir a estrutura para suportar clusters de GPU maiores, incluindo a integração de DPUs BlueField-3 para transferência adicional de armazenamento e isolamento de segurança. OCompatível com 920-9B210-00FN-0D0O ecossistema garante que atualizações futuras – sejam para NICs mais recentes ou tecnologias ópticas – serão perfeitamente suportadas. Para qualquer empresa que implemente cargas de trabalho de IA ou HPC em larga escala, essa opção representa não apenas uma atualização incremental, mas um facilitador fundamental de desempenho em escala.