Transceptores em clusters de IA
Os clusters de treinamento de IA são os maiores consumidores de ópticas de alta velocidade já construídos, e eles levam os módulos ao limite em taxa, potência e quantidade. A engenharia que importa aqui é menos sobre um enlace isolado e mais sobre operar dezenas de milhares deles de forma confiável.
Quais ópticas
| Papel | Módulo | PMD típico | Conector |
|---|---|---|---|
| Servidor de GPU ↔ leaf (scale-out, IB NDR) | OSFP de porta dupla 2×400G | DR4 ×2 | 2 × MPO-12 APC |
| Servidor de GPU ↔ leaf (Ethernet) | QSFP-DD / OSFP 400G–800G | DR4, DR8, 2×FR4 | MPO-12/16 APC, dual LC |
| Leaf ↔ spine | OSFP 800G / QSFP-DD800 | DR8, 2×FR4 | MPO-16 APC, dual LC |
| Saltos curtos dentro do rack | DAC / AOC onde o alcance permitir | — | — |
As ópticas DR monomodo predominam porque alcançam 500 m — suficiente para qualquer sala — e escalam de 400G a 800G na mesma planta de fibra. São necessários conectores APC angulados.
Potência e calor
Um módulo de 800G consome da ordem de 14–18 W; o painel frontal de um switch de 64 portas concentra um quilowatt de ópticas. O dissipador de calor integrado do OSFP é o motivo pelo qual ele é preferido para os módulos mais quentes; o QSFP-DD depende do resfriamento do host. O throttling térmico — um módulo reduzindo o desempenho quando superaquece — é uma causa real de oscilações intermitentes em 400G/800G (Problemas de CMIS).
As ópticas conectáveis de drive linear (LPO) removem o DSP do módulo para cortar potência e latência, movendo a equalização para o ASIC do switch; elas estão aparecendo em enlaces DR curtos onde o host as suporta.
Confiabilidade em escala
A aritmética muda tudo: com 100 000 ópticas, uma taxa de falha anual de apenas 0,5% já significa dez substituições por semana. Consequências:
- Monitoramento de DDM por lane em toda a frota, com análise de tendência, para substituir um módulo em degradação antes que ele trave um step de treinamento (Falhas).
- Sobressalentes por lote e inspeção de entrada — as falhas se concentram por lote de produção.
- Disciplina de limpeza de MPO — 16 fibras por conector, e uma partícula derruba uma lane (Oscilação de enlace).
- Uma única lane lenta atrasa toda a coletiva: a latência de cauda é a métrica que importa.
Identidade e interoperabilidade
Clusters grandes padronizam em uma lista curta de módulos qualificados, e as plataformas de switch validam a identidade. Ópticas de terceiros de 400G/800G são usadas onde a plataforma tolera, e são codificadas para a identidade esperada onde não tolera — as mesmas regras de bloqueio do fabricante que valem em qualquer outro lugar, a um custo por unidade muito mais alto.
O que vem a seguir
Portas de 1,6T (OSFP-XD, 16 lanes) e interfaces elétricas de 200G por lane são o próximo passo; as ópticas co-packaged movem o transceptor para dentro do encapsulamento do switch nos maiores sistemas.
No CodingBox
O CodingBox lê módulos OSFP e QSFP-DD de 400G/800G através do CMIS: estado do módulo, anúncio de aplicação, identidade e Tx/Rx/bias por lane na tela DDM — os dados que um operador precisa para qualificar lotes de entrada, estabelecer a baseline de enlaces novos e identificar uma única lane com falha entre oito.
Transformando essas escolhas em contagens de cabos, distâncias e um checklist de instalação: Cabeamento de um cluster de IA; mantendo os enlaces no ar depois de instalados: Confiabilidade e monitoramento de enlace.
Os próprios módulos de 1,6T — lanes, potência, bancos, compatibilidade: OSFP224, OSFP-XD.