CodingBox Documentação

Visão geral de redes para IA

Treinar grandes modelos de IA distribui o trabalho entre muitas GPUs em muitos servidores. A rede entre elas — não uma GPU isolada — costuma determinar a velocidade de treinamento de um cluster, e é por isso que as fabrics de IA dependem dos transceptores ópticos de maior largura de banda disponíveis.

Por que a rede é crítica

  • Operações coletivas — as GPUs trocam gradientes e parâmetros constantemente em padrões all-to-all, gerando tráfego leste-oeste pesado.
  • A latência de cauda importa — um step espera pelo enlace mais lento, então latência baixa e consistente e entrega sem perdas são essenciais.
  • Escala — milhares de GPUs significam switches densos, de alto radix, e contagens enormes de ópticas.

Dois estilos de fabric

  • InfiniBand — bem estabelecido em HPC, com RDMA e controle de fluxo sem perdas (veja InfiniBand).
  • Ethernet com RoCE — RDMA over Converged Ethernet, cada vez mais usado para IA em escala sobre Ethernet sem perdas.

Ópticas

Os enlaces de IA costumam ser de 400G e 800G, em módulos QSFP-DD e OSFP. As escolhas específicas de interconexão e ópticas estão cobertas em Interconexões e ópticas de IA.

Os mesmos fatores de forma e a mesma memória de gerenciamento se aplicam — o CodingBox lê esses módulos de taxa alta como qualquer outro.

Leitura adicional


Se você encontrar uma imprecisão ou um erro neste artigo, selecione o trecho correspondente e pressione Ctrl+Enter para .