Visão geral de redes para IA
Treinar grandes modelos de IA distribui o trabalho entre muitas GPUs em muitos servidores. A rede entre elas — não uma GPU isolada — costuma determinar a velocidade de treinamento de um cluster, e é por isso que as fabrics de IA dependem dos transceptores ópticos de maior largura de banda disponíveis.
Por que a rede é crítica
- Operações coletivas — as GPUs trocam gradientes e parâmetros constantemente em padrões all-to-all, gerando tráfego leste-oeste pesado.
- A latência de cauda importa — um step espera pelo enlace mais lento, então latência baixa e consistente e entrega sem perdas são essenciais.
- Escala — milhares de GPUs significam switches densos, de alto radix, e contagens enormes de ópticas.
Dois estilos de fabric
- InfiniBand — bem estabelecido em HPC, com RDMA e controle de fluxo sem perdas (veja InfiniBand).
- Ethernet com RoCE — RDMA over Converged Ethernet, cada vez mais usado para IA em escala sobre Ethernet sem perdas.
Ópticas
Os enlaces de IA costumam ser de 400G e 800G, em módulos QSFP-DD e OSFP. As escolhas específicas de interconexão e ópticas estão cobertas em Interconexões e ópticas de IA.
Os mesmos fatores de forma e a mesma memória de gerenciamento se aplicam — o CodingBox lê esses módulos de taxa alta como qualquer outro.
Leitura adicional
- Cabeamento de um cluster de IA — contagens de enlaces por GPU, distâncias em layouts otimizados por rail, combinação de DAC/AEC/AOC/DR, escolhas de conector, potência das ópticas, QA de instalação.
- Confiabilidade e monitoramento de enlace em fabrics de IA — por que um enlace trava um job, aritmética de FIT, métricas preditivas, arquitetura de monitoramento, isolamento e prevenção.