CodingBox Documentação

Topologias de fabric de GPU

A rede de um cluster de IA é construída em camadas, e cada camada usa interconexões diferentes — e ópticas diferentes. Entender as camadas explica por que um cluster tem tantos transceptores e onde um transceptor com defeito prejudica mais.

Scale-up vs. scale-out

Scale-upScale-out
ConectaGPUs dentro de um servidor ou de um rackservidores entre si
Tecnologiaenlaces proprietários GPU-a-GPU (por exemplo, NVLink/NVSwitch)InfiniBand ou Ethernet/RoCE
Mídiabackplanes e cabos de cobre, cada vez mais ópticas entre racksópticas conectáveis: 400G/800G OSFP, QSFP-DD
Largura de banda por GPUa mais altaalta, compartilhada com a fabric

Os transceptores conectáveis vivem principalmente na camada de scale-out — cada servidor de GPU tem várias portas de 400G/800G voltadas para a fabric, além de redes separadas de front-end/armazenamento.

Fat-tree e non-blocking

A fabric de scale-out costuma ser uma fat-tree (Clos): switches leaf conectam os servidores, switches spine conectam os leaves, com uplinks leaf–spine suficientes para que qualquer servidor converse com qualquer outro em taxa plena (non-blocking). A maior parte das ópticas de um cluster está nesses enlaces leaf–spine e servidor–leaf — milhares de módulos DR4/DR8 idênticos.

Projeto otimizado por rail

O tráfego de treinamento é dominado por operações coletivas entre GPUs do mesmo rank em servidores diferentes. Uma topologia otimizada por rail explora isso: a GPU 0 de cada servidor se conecta ao switch leaf 0, a GPU 1 ao leaf 1 e assim por diante, de modo que GPUs do mesmo rank ficam a um salto de distância e as operações coletivas nunca cruzam o spine. A consequência para as ópticas: uma falha em um único rail afeta uma posição de GPU em todos os servidores — um padrão que vale a pena reconhecer.

Redes separadas

Um cluster normalmente opera várias fabrics fisicamente separadas:

  • Fabric de computação — GPU-a-GPU (IB ou RoCE), a maior e a que mais usa ópticas.
  • Fabric de armazenamento — para sistemas de arquivos paralelos e armazenamento de objetos, geralmente Ethernet (redes de armazenamento).
  • Front-end / gerenciamento — acesso de usuários, orquestração, telemetria.

Cada uma tem seu próprio inventário de ópticas e suas próprias regras de validação de fabricante.

Por que um enlace ruim importa tanto

Uma operação coletiva termina na velocidade do seu participante mais lento. Um transceptor com uma lane em degradação — mais correções de FEC, retransmissões ocasionais — estica a latência de cauda de cada etapa e pode custar uma fração mensurável do throughput de todo o cluster. É por isso que os operadores de IA acompanham a tendência do DDM por lane em toda a frota e substituem ópticas de forma proativa (Transceptores em clusters de IA).

No CodingBox

Qualifique as ópticas na bancada antes de elas entrarem em um rail: identidade via CMIS, baseline de DDM por lane na tela DDM, e um registro no code database para que o histórico de um módulo esteja disponível quando um rail começar a apresentar erros.

Os adaptadores na ponta de GPU dessas fabrics — BlueField, ConnectX-8 SuperNIC, Pensando — e suas ópticas OSFP de porta dupla: SmartNICs e DPUs.


Se você encontrar uma imprecisão ou um erro neste artigo, selecione o trecho correspondente e pressione Ctrl+Enter para .