Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 Livro Branco técnico
September 1, 2026
Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 White Paper Técnico
Este livro branco centra-se naMellanox (NVIDIA Mellanox) 980-9I45T-00H020A Comissão considera que o dispositivo de rede é a pedra angular de uma estratégia de conectividade de alta fiabilidade e de excelência operacional para centros de dados modernos e redes empresariais.980-9I45T-00H020é uma solução de interconexão de alto desempenho projetada para lidar com as cargas de trabalho mais exigentes em clusters de IA, ambientes de HPC e infraestrutura de missão crítica.
1. Antecedentes e Requisitos de Negócios
Os centros de dados modernos estão mudando de arquiteturas centradas na CPU para projetos orientados por GPU e DPU.latênciaSimultaneamente, as redes empresariais enfrentam desafios na interconexão de vários locais, no acesso a várias nuvens e na conformidade com a regulamentação.tornar as arquiteturas de rede tradicionais de três níveis inadequadas para a escalabilidade elástica das empresas.
A introdução doMellanox (NVIDIA Mellanox) 980-9I45T-00H020aborda os seguintes pontos críticos de dor:
- Gargalos de desempenho: As redes 25G/40G existentes não podem satisfazer os requisitos de tráfego norte-sul dos clusters de GPU da classe 800G;
- Complexidade operacional: O equipamento de vários fornecedores leva a um monitoramento em silos e a um tempo médio de reparação prolongado (MTTR);
- Lacunas de fiabilidade: Falhas de ligação e eventos de congestionamento causam degradação significativa do desempenho do aplicativo e violações do SLA.
As principais métricas de sucesso para esta solução incluem latência de sub-microssegundos, perda zero de pacotes sob congestionamento e detecção e correção automática de falhas.
2. Design geral da arquitetura da rede
A arquitetura proposta adopta umaTecido de folhas de coluna vertebralO sistema de gestão de dados é baseado numa topologia de dois níveis de Clos, permitindo uma baixa latência determinística e uma capacidade de escalagem maciça.980-9I45T-00H020 produto de redeNa camada principal, os switches de alta densidade fornecem conectividade inter-rack sem bloqueio.
Os principais princípios arquitetônicos incluem:
- Tecido RDMA de perda zero: Aproveitamento do RoCEv2 e do controlo de fluxo PFC/ECN para garantir o transporte sem perdas para NVMe-oF e GPUDirect Storage;
- Roteamento adaptativo: Seleção dinâmica de trajectos baseada na telemetria em tempo real, evitando ligações congestionadas sem intervenção manual;
- Isolamento de múltiplos ocupantes: O suporte à superposição VXLAN e GENEVE baseado em hardware permite uma segmentação segura para cargas de trabalho de IA, HPC e de uso geral mistas.
A arquitetura é projetada para suportar até 2.048 nós GPU por pod de tecido, com o980-9I45T-00H020 Centro de dados rede de alta velocidadeDispositivo que serve como nó de borda primário para a conectividade de computação/armazenamento.
3O papel da Mellanox (NVIDIA Mellanox) 980-9I45T-00H020 na solução
OMellanox (NVIDIA Mellanox) 980-9I45T-00H020é um adaptador de rede multifunção/elemento de comutação que liga o barramento host (PCIe 6.0) e o tecido (InfiniBand ou Ethernet).
- Transmissão de velocidade por fio 800G: Suporta XDR InfiniBand e 800GbE, proporcionando espaço suficiente para futuras gerações de GPU (por exemplo, B100, X100);
- Descarga de computação em rede (SHARPv3): Reduz o tempo de comunicação coletiva MPI em até 30% através da realização de operações de agregação diretamente no tecido da rede;
- Telemetria de hardware: A detecção de congestionamento incorporada (por exemplo, marcação ECN, limitação da taxa de fluxo) proporciona visibilidade granular da dinâmica da fila sem sobrecarga da CPU;
- Segurança avançada: A raiz de hardware de confiança, o arranque seguro e a criptografia IPSec/MACsec em linha protegem os dados em trânsito de ataques de camada física.
Como um980-9I45T-00H020 solução de produto de rede, integra-se perfeitamente com os switches Mellanox existentes e com a pilha de software NVIDIA DOCA, reduzindo o risco de integração e acelerando o tempo de produção.
4Recomendações de implantação e escalagem
Os cenários de implantação típicos incluem:
- Pequena escala (até 64 GPU): 2 racks com 1x980-9I45T-00H020Por servidor, utilizando cabos DAC OSFP-OSFP de ligação direta para comunicação intra-rack de baixa latência;
- Gravação em grande escala (256+ GPUs): Arquitetura multi-pod com980-9I45T-00H020Dispositivos que agregam os switches de folha através de uplinks 800G para os switches de coluna, permitindo uma largura de banda completa de bisecção;
- Tecido híbrido de armazenamento AI +O980-9I45T-00H020podem ser configurados com split de porta (2x 400G ou 8x 100G) para servir simultaneamente redes de computação e armazenamento, reduzindo o capex.
Ilustração de topologia (simplificada):
| Componente | Quantidade | Interligação |
|---|---|---|
| Servidores de GPU (8 GPU cada) | 32 | 1 x 980-9I45T-00H020 por servidor |
| Comutadores de folha (32-port 800G) | 8 | Ligação ascendente à coluna vertebral através de 800G |
| Interruptores de coluna vertebral (64 portas 800G) | 4 | De espessura igual ou superior a 30 cm |
Para expansão futura, a arquitetura suporta escalabilidade pay-as-you-grow adicionando blocos de folhas adicionais sem redesenhar a camada de coluna vertebral.
5. Ops Monitoramento, solução de problemas e otimização
O980-9I45T-00H020Integra-se com a pilha de telemetria da NVIDIA para fornecer visibilidade em tempo real em:
- Detecção de micro-explosões: Relatório a nível de hardware da ocupação do buffer por fluxo, permitindo ajustes preventivos da Qualidade de Serviço;
- Monitorização da qualidade da ligação: Contadores FEC (Forward Error Correction) e alertas de relação sinal/ruído para degradação da ligação óptica;
- Simulação de rede: Utilizando os dados de telemetria incorporados para reconstruir padrões de tráfego num ambiente de gémeos digitais para análise de "e se".
Melhores práticas operacionais recomendadas:
- ConfiguraçãoPerfis de referência automatizadospara a latência e o débito sob carga normal, e acionar alertas quando os desvios forem superiores a 10%;
- Auditoria regularversões do firmwarePara garantir a compatibilidade com as versões mais recentes do NVIDIA DOCA e dos controladores;
- Utilizar oEspecificações 980-9I45T-00H020eFicha de dados 980-9I45T-00H020Para calibrar os limiares de amortecimento para misturas de tráfego específicas (por exemplo, padrões de redução total versus de redução total para todos);
- Ao dimensionar, validar980-9I45T-00H020 compatívelÓptica e cabos utilizando a matriz de compatibilidade oficial para evitar problemas de integridade do sinal.
6Resumo e Avaliação do Valor
OMellanox (NVIDIA Mellanox) 980-9I45T-00H020A sua combinação de capacidade de transferência de 800G, computação em rede,A telemetria granular permite que as organizações:
- Redução de 30-40% no tempo de conclusão da formação em IAatravés de uma comunicação colectiva otimizada;
- Impacto zero do utilizador durante falhas de ligaçãograças ao roteamento adaptativo e à transição por falha de subsegundo;
- Redução de 50% das despesas gerais operacionaisatravés de fluxos de trabalho unificados de monitorização e reparação automatizada.
Com o980-9I45T-00H020 produto de redeComo a base de ponta, as empresas podem implantar com confiança cargas de trabalho de IA de próxima geração, mantendo o controle total sobre a confiabilidade, segurança e custo total de propriedade.980-9I45T-00H020 preçoe980-9I45T-00H020 à vendaPara consultas, por favor contacte o seu parceiro autorizado da NVIDIA Mellanox.

