Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 Livro Branco técnico

September 1, 2026

Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 Livro Branco técnico

Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 White Paper Técnico

Este livro branco centra-se naMellanox (NVIDIA Mellanox) 980-9I45T-00H020A Comissão considera que o dispositivo de rede é a pedra angular de uma estratégia de conectividade de alta fiabilidade e de excelência operacional para centros de dados modernos e redes empresariais.980-9I45T-00H020é uma solução de interconexão de alto desempenho projetada para lidar com as cargas de trabalho mais exigentes em clusters de IA, ambientes de HPC e infraestrutura de missão crítica.

1. Antecedentes e Requisitos de Negócios

Os centros de dados modernos estão mudando de arquiteturas centradas na CPU para projetos orientados por GPU e DPU.latênciaSimultaneamente, as redes empresariais enfrentam desafios na interconexão de vários locais, no acesso a várias nuvens e na conformidade com a regulamentação.tornar as arquiteturas de rede tradicionais de três níveis inadequadas para a escalabilidade elástica das empresas.

A introdução doMellanox (NVIDIA Mellanox) 980-9I45T-00H020aborda os seguintes pontos críticos de dor:

  • Gargalos de desempenho: As redes 25G/40G existentes não podem satisfazer os requisitos de tráfego norte-sul dos clusters de GPU da classe 800G;
  • Complexidade operacional: O equipamento de vários fornecedores leva a um monitoramento em silos e a um tempo médio de reparação prolongado (MTTR);
  • Lacunas de fiabilidade: Falhas de ligação e eventos de congestionamento causam degradação significativa do desempenho do aplicativo e violações do SLA.

As principais métricas de sucesso para esta solução incluem latência de sub-microssegundos, perda zero de pacotes sob congestionamento e detecção e correção automática de falhas.

2. Design geral da arquitetura da rede

A arquitetura proposta adopta umaTecido de folhas de coluna vertebralO sistema de gestão de dados é baseado numa topologia de dois níveis de Clos, permitindo uma baixa latência determinística e uma capacidade de escalagem maciça.980-9I45T-00H020 produto de redeNa camada principal, os switches de alta densidade fornecem conectividade inter-rack sem bloqueio.

Os principais princípios arquitetônicos incluem:

  • Tecido RDMA de perda zero: Aproveitamento do RoCEv2 e do controlo de fluxo PFC/ECN para garantir o transporte sem perdas para NVMe-oF e GPUDirect Storage;
  • Roteamento adaptativo: Seleção dinâmica de trajectos baseada na telemetria em tempo real, evitando ligações congestionadas sem intervenção manual;
  • Isolamento de múltiplos ocupantes: O suporte à superposição VXLAN e GENEVE baseado em hardware permite uma segmentação segura para cargas de trabalho de IA, HPC e de uso geral mistas.

A arquitetura é projetada para suportar até 2.048 nós GPU por pod de tecido, com o980-9I45T-00H020 Centro de dados rede de alta velocidadeDispositivo que serve como nó de borda primário para a conectividade de computação/armazenamento.

3O papel da Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 na solução

OMellanox (NVIDIA Mellanox) 980-9I45T-00H020é um adaptador de rede multifunção/elemento de comutação que liga o barramento host (PCIe 6.0) e o tecido (InfiniBand ou Ethernet).

  • Transmissão de velocidade por fio 800G: Suporta XDR InfiniBand e 800GbE, proporcionando espaço suficiente para futuras gerações de GPU (por exemplo, B100, X100);
  • Descarga de computação em rede (SHARPv3): Reduz o tempo de comunicação coletiva MPI em até 30% através da realização de operações de agregação diretamente no tecido da rede;
  • Telemetria de hardware: A detecção de congestionamento incorporada (por exemplo, marcação ECN, limitação da taxa de fluxo) proporciona visibilidade granular da dinâmica da fila sem sobrecarga da CPU;
  • Segurança avançada: A raiz de hardware de confiança, o arranque seguro e a criptografia IPSec/MACsec em linha protegem os dados em trânsito de ataques de camada física.

Como um980-9I45T-00H020 solução de produto de rede, integra-se perfeitamente com os switches Mellanox existentes e com a pilha de software NVIDIA DOCA, reduzindo o risco de integração e acelerando o tempo de produção.

4Recomendações de implantação e escalagem

Os cenários de implantação típicos incluem:

  • Pequena escala (até 64 GPU): 2 racks com 1x980-9I45T-00H020Por servidor, utilizando cabos DAC OSFP-OSFP de ligação direta para comunicação intra-rack de baixa latência;
  • Gravação em grande escala (256+ GPUs): Arquitetura multi-pod com980-9I45T-00H020Dispositivos que agregam os switches de folha através de uplinks 800G para os switches de coluna, permitindo uma largura de banda completa de bisecção;
  • Tecido híbrido de armazenamento AI +O980-9I45T-00H020podem ser configurados com split de porta (2x 400G ou 8x 100G) para servir simultaneamente redes de computação e armazenamento, reduzindo o capex.

Ilustração de topologia (simplificada):

Componente Quantidade Interligação
Servidores de GPU (8 GPU cada) 32 1 x 980-9I45T-00H020 por servidor
Comutadores de folha (32-port 800G) 8 Ligação ascendente à coluna vertebral através de 800G
Interruptores de coluna vertebral (64 portas 800G) 4 De espessura igual ou superior a 30 cm

Para expansão futura, a arquitetura suporta escalabilidade pay-as-you-grow adicionando blocos de folhas adicionais sem redesenhar a camada de coluna vertebral.

5. Ops Monitoramento, solução de problemas e otimização

O980-9I45T-00H020Integra-se com a pilha de telemetria da NVIDIA para fornecer visibilidade em tempo real em:

  • Detecção de micro-explosões: Relatório a nível de hardware da ocupação do buffer por fluxo, permitindo ajustes preventivos da Qualidade de Serviço;
  • Monitorização da qualidade da ligação: Contadores FEC (Forward Error Correction) e alertas de relação sinal/ruído para degradação da ligação óptica;
  • Simulação de rede: Utilizando os dados de telemetria incorporados para reconstruir padrões de tráfego num ambiente de gémeos digitais para análise de "e se".

Melhores práticas operacionais recomendadas:

  • ConfiguraçãoPerfis de referência automatizadospara a latência e o débito sob carga normal, e acionar alertas quando os desvios forem superiores a 10%;
  • Auditoria regularversões do firmwarePara garantir a compatibilidade com as versões mais recentes do NVIDIA DOCA e dos controladores;
  • Utilizar oEspecificações 980-9I45T-00H020eFicha de dados 980-9I45T-00H020Para calibrar os limiares de amortecimento para misturas de tráfego específicas (por exemplo, padrões de redução total versus de redução total para todos);
  • Ao dimensionar, validar980-9I45T-00H020 compatívelÓptica e cabos utilizando a matriz de compatibilidade oficial para evitar problemas de integridade do sinal.

6Resumo e Avaliação do Valor

OMellanox (NVIDIA Mellanox) 980-9I45T-00H020A sua combinação de capacidade de transferência de 800G, computação em rede,A telemetria granular permite que as organizações:

  • Redução de 30-40% no tempo de conclusão da formação em IAatravés de uma comunicação colectiva otimizada;
  • Impacto zero do utilizador durante falhas de ligaçãograças ao roteamento adaptativo e à transição por falha de subsegundo;
  • Redução de 50% das despesas gerais operacionaisatravés de fluxos de trabalho unificados de monitorização e reparação automatizada.

Com o980-9I45T-00H020 produto de redeComo a base de ponta, as empresas podem implantar com confiança cargas de trabalho de IA de próxima geração, mantendo o controle total sobre a confiabilidade, segurança e custo total de propriedade.980-9I45T-00H020 preçoe980-9I45T-00H020 à vendaPara consultas, por favor contacte o seu parceiro autorizado da NVIDIA Mellanox.