Fundamentos do fabric InfiniBand
Uma fabric de InfiniBand se comporta de forma diferente de uma rede Ethernet, de maneiras que importam quando você diagnostica um enlace. Esta página cobre os conceitos que um engenheiro de óptica encontra: o subnet manager, o controle de fluxo sem perdas, as topologias e como um enlace com problema aparece.
O subnet manager
Toda sub-rede de IB tem um Subnet Manager (SM) ativo. Ele descobre todas as portas e switches, atribui identificadores locais (LIDs), calcula tabelas de encaminhamento e as programa em cada switch. Quando um enlace oscila, o SM varre a fabric novamente — então uma óptica marginal não apenas perde um enlace, ela desencadeia eventos de reroteamento em toda a fabric que todo mundo percebe.
Sem perdas por créditos
Os enlaces de IB nunca descartam pacotes em operação normal: um transmissor só transmite quando o receptor anunciou créditos de buffer. O congestionamento, portanto, gera contrapressão em vez de descartes, e um enlace degradado (erros de símbolo crescentes, correções de FEC) desacelera todo o job que depende dele — o problema do “um enlace lento” em operações coletivas.
Topologias
- Fat-tree (Clos) — o padrão: switches leaf conectam hosts, switches spine conectam leaves, com uplinks suficientes para ser non-blocking. A maioria dos enlaces é óptica leaf–spine.
- Variantes Dragonfly+ e torus aparecem nos maiores sistemas para economizar switches e cabos.
- Projetos otimizados por rail para IA colocam a NIC de cada GPU em um “rail” separado da fabric, de forma que GPUs com o mesmo rank em servidores diferentes fiquem a um salto de distância — veja Topologias de fabric de GPU.
RDMA e GPUDirect
As aplicações usam verbs de RDMA para mover dados entre as memórias dos nós sem cópias pela CPU; o GPUDirect RDMA estende isso à memória da GPU. O resultado é que uma falha na fabric fica visível para as aplicações como uma paralisação ou um timeout em uma coletiva, muitas vezes bem antes de um operador ver uma porta inativa.
Como aparece um enlace com problema
| Sintoma na fabric | Causa de camada física a verificar |
|---|---|
| Erros de símbolo crescentes / blocos corrigidos por FEC em uma porta | MPO sujo, potência Rx marginal, lane se degradando |
| Enlace travado em uma largura ou velocidade menor | incompatibilidade de FEC, módulo não anunciando a taxa esperada |
| Porta “Not supported”, sem enlace | identidade de módulo não reconhecida — bloqueio do fabricante |
| Varreduras repetidas do SM | um enlace oscilando em algum lugar — encontre-o pelos contadores de erro por porta |
Siga a escada de diagnóstico usual: níveis → limpeza → troca → cabo.
No CodingBox
Leia um módulo de IB suspeito na bancada: Rx/Tx por lane e o bias na tela DDM mostram se uma lane de um módulo SR4/DR4 está morrendo, e os campos de identidade mostram se a fabric vai aceitar um substituto.
As camadas de protocolo, queue pairs e as funções do subnet manager em detalhe: Protocolo e transporte do IB; o cabeamento da fabric por geração e alcance: Cabeamento do IB.