Cabeamento de um cluster de IA: quantidades, distâncias, mídia, controle de qualidade
Um cluster de GPU é, na maior parte, cabos. Oito GPUs em um nó significam oito enlaces de scale-out de 400G (ou 800G) mais gerenciamento e armazenamento; mil GPUs significam milhares de pontas ópticas em dois ou três níveis de switch, cada uma uma possível parada no treinamento. Esta página transforma os projetos de fabric de Fabrics de GPU em contagens de cabos, classes de alcance, escolhas de conector e um checklist de instalação.
Contando enlaces
Para um nó típico de 8 GPUs com uma NIC de 400G por GPU, fabric de dois níveis otimizada por rail:
| Item | Fórmula | 1 024 GPUs (128 nós) |
|---|---|---|
| Enlaces GPU-a-leaf | GPUs × 1 | 1 024 × 400G |
| Enlaces leaf-a-spine (non-blocking) | = GPU-a-leaf | 1 024 × 400G |
| Pontas ópticas/de cabo (duas por enlace) | enlaces × 2 | 4 096 |
| NICs de armazenamento + gerenciamento | 2–4 por nó | mais 256–512 enlaces |
| Ópticas sobressalentes (3–5 %) | — | 150–250 |
Com módulos de switch NDR de porta dupla (2 × 400G por OSFP), a contagem do lado do switch cai pela metade em módulos, mas não em fibras. Projetos de três níveis acrescentam mais 1 024 enlaces spine-a-core a cada 1 024 GPUs. Cada uma dessas pontas é um transceptor ou um plugue de cabo com identidade e DDM (Confiabilidade e monitoramento de enlace).
Distâncias em um layout otimizado por rail
| Segmento | Distância típica | Mídia |
|---|---|---|
| NIC de GPU → leaf, mesmo rack | ≤ 2 m | DAC passivo (400G ≤ 2 m; 800G ≤ 1–1,5 m) — mais barato, zero consumo, pesado |
| NIC de GPU → leaf, racks adjacentes (grupos de rail cobrem uma fileira) | 3–10 m | AEC (≤ 3–5 m) ou AOC / transceptores SR sobre MMF |
| Leaf → spine, mesma sala | 10–100 m | AOC até ~50–100 m; SR4/SR8 / VR em OM4 ≤ 50–100 m; DR4/DR8 em SMF 500 m — o DR está prevalecendo em 400G+ |
| Spine → core / entre salas | 100 m – 2 km | DR4 / FR4 / 2×FR4 monomodo |
| DCI entre prédios | 2–80 km | LR4, ZR/ZR+ (Coerente e longa distância) |
O cabeamento otimizado por rail coloca a GPU i de cada nó no leaf i, então os oito cabos de um nó se espalham para oito leaves diferentes — a maioria dos enlaces GPU-a-leaf sai do rack, e a fração de DAC é menor do que em projetos ToR clássicos. Detalhes: Interior dos cabos.
Escolhas de conector e fibra
| Óptica | Conector | Fibra | Notas |
|---|---|---|---|
| 400G DR4 / 800G DR8 | MPO-12 APC / MPO-16 APC (ou 2 × MPO-12) | SMF, Base-8/Base-16 | APC em toda parte no paralelo monomodo; módulos pinned, cordões ópticos unpinned |
| 400G/800G SR8 / VR8 | MPO-16 UPC | OM4/OM5 | 50–100 m; ópticas mais baratas, fibra mais cara por metro |
| 400G FR4 / 2×FR4 | LC duplex / 2 × LC | SMF | menos fibras, WDM dentro do módulo |
| OSFP NDR de porta dupla | 2 × MPO-12 APC | SMF | duas portas lógicas por módulo; cabos split 1:2 / 1:4 (Cabeamento IB) |
| DAC / AEC | nenhum | twinax | identidade nas duas pontas |
Método de polaridade B de ponta a ponta para trunks MPO; trunks Base-8 para ópticas de 4 lanes (Breakout e cabeamento MPO).
Potência e calor apenas das ópticas
| Óptica | Potência | Por switch de 64 portas |
|---|---|---|
| 400G DR4 QSFP-DD | 8–12 W | 0,5–0,8 kW |
| 800G DR8 / 2×FR4 OSFP | 14–18 W | 0,9–1,2 kW |
| Ponta de AOC 400G | 3–5 W | — |
| Ponta de AEC 800G | 4–6 W | — |
| DAC | 0 | — |
Por isso, os painéis frontais do switch precisam de fluxo de ar de frente para trás sem obstrução; OSFP com aletas nos switches, topo plano nas NICs; feixes de cabos não podem bloquear a admissão de ar (Potência e aspectos térmicos, Temperatura e tensão). Ópticas lineares (LPO) cortam a potência do módulo aproximadamente pela metade onde o host as suporta (Modulação e DSP).
Checklist de instalação e QA
- Inspeção de entrada de cada óptica e ponta de cabo: identidade, somas de verificação, DDM ativo, baseline salva (Fabricação e testes).
- Faça burn-in das ópticas novas por 24–72 h na temperatura de operação antes da implantação.
- Inspecione e limpe cada MPO (pontas de scope APC para conectores APC) na instalação; nunca acople um conector não inspecionado.
- Rotule as duas pontas: nó/GPU/NIC ↔ leaf/porta; cabos split por perna.
- Raio de curvatura e gerenciamento de peso — bandejas e feixes para DAC/AEC, alças de serviço para fibra.
- Verificação de bring-up: cada enlace na velocidade e largura plenas, FEC ativado, Rx por lane a até 2 dB dos seus pares, BER pré-FEC < 10⁻⁷ em repouso (Métricas de VDM e FEC).
- Registre o DDM por lane e as identidades no fabric manager / CMDB como baseline.
- Sobressalentes por classe de mídia e conector; mantenha-os com o burn-in feito.
Falhas comuns de instalação
| Falha | Assinatura |
|---|---|
| Cordão óptico UPC em DR4 APC | todas as lanes baixas em 3–10 dB, nas duas pontas |
| Trunk com polaridade errada | todas as lanes sem luz |
| MPO sujo | uma ou duas lanes baixas; BER pré-FEC alto nessas lanes |
| DAC longo demais para o host | enlace em velocidade reduzida ou oscilando |
| Perna do cabo split trocada | as portas estabelecem enlace com os parceiros errados; incompatibilidade de topologia no fabric manager |
| OSFP com aletas em gaiola (cage) plana (ou vice-versa) | não encaixa / superaquece |
No CodingBox
Nessa escala, a inspeção de entrada é um fluxo de trabalho, não uma verificação pontual: o CodingBox lê cada módulo ou ponta de cabo, verifica identidade e somas de verificação, registra o DDM ao vivo por lane como baseline e o armazena vinculado ao número de série no code database, para que um módulo retirado depois de uma porta oscilando possa ser comparado com seu estado do primeiro dia.