Interconexões de IA e óptica
Clusters de IA conectam GPUs usando InfiniBand ou Ethernet de alta velocidade. As duas opções empurram as ópticas para os módulos mais rápidos em produção.
InfiniBand vs. Ethernet (RoCE)
| InfiniBand | Ethernet + RoCE | |
|---|---|---|
| Controle de fluxo | baseado em créditos, sem perdas | PFC/ECN, sem perdas |
| RDMA | nativo | RoCEv2 |
| Taxa atual | NDR (400G) | 400G / 800G |
| Ecossistema | com raízes em HPC | amplo, multifabricante |
As duas são escolhas válidas; muitos clusters grandes usam InfiniBand, enquanto Ethernet+RoCE está crescendo rapidamente para IA em escala.
Taxas e módulos
- 400G — QSFP-DD ou OSFP, construído a partir de 4×100G ou 8×50G lanes.
- 800G — OSFP ou QSFP-DD800, tipicamente 8×100G lanes.
A taxa e o número de lanes determinam o fator de forma; as gerações do InfiniBand e suas taxas por lane estão em Velocidades do InfiniBand.
Tipos de alcance
Dentro de um rack, predominam ópticas curtas DR/SR ou cabos direct-attach e ativos; entre fileiras, ópticas monomodo FR/LR cobrem os saltos mais longos. A alta densidade significa que um único switch pode hospedar centenas desses módulos.
Seja qual for o alcance, esses módulos carregam memória gerenciada padrão — o CodingBox lê a identidade e o DDM deles para verificar um enlace antes que ele entre na fabric.