O treinamento de modelos de inteligência artificial em larga escala deixou de ser uma tarefa confinada a um único data center. Gigantes da tecnologia como Google, Microsoft, AWS e Meta já implementam arquiteturas que distribuem o processamento por clusters em diferentes localidades geográficas. Essa tendência é motivada pela crescente demanda por recursos computacionais e energéticos, que sobrecarregam a capacidade de instalações únicas. Pesquisadores estimam que os maiores projetos de treinamento de IA podem consumir entre 4 a 16 GW de energia até 2030, tornando a distribuição de infraestrutura uma estratégia essencial para acessar locais com maior disponibilidade de energia e espaço, e menos restrições de planejamento.

O Desafio da Sincronização em Larga Escala

No cerne de modelos como os de linguagem grande (LLMs) está uma rede neural com bilhões de parâmetros ajustados durante o treinamento. O processo envolve a passagem de lotes de dados, a realização de previsões, o cálculo de erros e a atualização dos pesos. Em modelos modernos, essa tarefa é distribuída entre milhares de GPUs e aceleradores. Embora essas unidades possam processar dados ou partes do modelo de forma independente, elas necessitam de trocas constantes de resultados e sincronização antes que a próxima etapa possa começar. O tráfego gerado não são os dados de treinamento em si, mas grandes volumes de dados numéricos, como gradientes e resultados intermediários. "Se você olhar para qualquer trabalho de treinamento, é basicamente uma repetição de computação e sincronização", explica Ramesh Sivakolundu, da Cisco. "Você computa os pesos, comunica esses pesos para sincronizar cada GPU no cluster e, em seguida, reinicia a computação." Essa dinâmica gera um tráfego intermitente e de alta intensidade, com milhares de aceleradores potencialmente finalizando uma fase de computação e iniciando a comunicação simultaneamente. Isso pode levar a problemas de "incast", onde múltiplos remetentes convergem para um mesmo destino, sobrecarregando os links de rede. A questão fundamental reside na sincronização: em um trabalho de treinamento síncrono, um grupo de GPUs não pode avançar sem que um grupo mais lento complete sua tarefa. Qualquer atraso na rede se traduz diretamente em atraso computacional, transformando a rede em um potencial gargalo.

Redes de Interconexão: De DCI a Fabric Distribuído

Dentro de um único data center, a rede é projetada para oferecer altíssima largura de banda, tipicamente entre 800 Gbps a 1,6 Tbps, em distâncias curtas. A extensão dessa malha computacional para instalações vizinhas ou distantes, conhecida como "scale-across", introduz complexidades inéditas. Ao contrário da Interconexão de Data Centers (DCI) tradicional, que conecta ambientes independentes e geralmente lida com tráfego assíncrono (como replicação de dados), o "scale-across" para treinamento de IA transforma a rede inter-site em parte integrante de um cálculo distribuído coordenado. Isso exige não apenas largura de banda suficiente, mas também previsibilidade na entrega dos dados. As conexões de longa distância requerem tecnologias como ópticas coerentes, que utilizam modulação sofisticada e processamento de sinal digital para compensar as perdas em fibras ópticas que se acentuam com a distância. A Cisco estima que conectar dois sites de IA de 100 MW pode demandar entre 12.000 a 32.000 portas ópticas coerentes, um número significativamente maior do que as 1.000 a 2.000 portas típicas para DCI convencional. A gestão desse volume colossal de dados também apresenta desafios de energia e espaço, mas soluções como "coherent pluggables" integram a função de transponder diretamente nas portas de roteadores e switches, reduzindo a necessidade de equipamentos adicionais.

Latência e Buffering: Combatendo os Atrasos Geográficos

Mesmo com largura de banda adequada e a tecnologia óptica correta, a distância inerentemente adiciona latência. Em conexões locais, o feedback para desacelerar o tráfego em caso de congestionamento é quase instantâneo. No entanto, em links de 100 km, uma quantidade considerável de dados pode ser transmitida antes que o remetente receba o aviso. A Cisco argumenta que esses loops de feedback mais longos aumentam a importância de silício de rede com buffers mais profundos. Arquiteturas de switching com buffers rasos, projetadas para baixa latência em ambientes internos de data center, têm capacidade limitada para absorver tráfego enquanto o sinal de congestionamento atravessa longas distâncias. "A razão pela qual você precisa de buffers mais profundos à medida que as distâncias aumentam é que você não recebe feedback sobre a transferência de pacotes por um período mais longo de tempo", afirma Sivakolundu. "Se você não tiver buffer suficiente, pode acabar descartando e retransmitindo pacotes, aumentando a latência." Buffers profundos atuam como um amortecedor para absorver picos temporários de tráfego ou interrupções, enquanto os mecanismos de gerenciamento de tráfego e sinalização de congestionamento atuam para resolver o problema subjacente. A gestão flexível desses buffers, como um pool compartilhado que aloca memória onde a congestão é maior, é crucial para evitar a perda de pacotes e garantir a continuidade do treinamento.

O Futuro das Redes para IA Distribuída

A Cisco aposta em uma abordagem de "co-design", onde suas equipes de silício, sistemas e ópticas trabalham em conjunto para definir requisitos de rede que retroalimentam o design de chips. Essa integração visa otimizar a densidade de portas, buffering, consumo de energia e interfaces ópticas para as demandas específicas do treinamento de IA distribuído. Embora a arquitetura "scale-across" ainda esteja em evolução, com diferentes operadores experimentando variadas topologias e técnicas de gerenciamento de tráfego, o objetivo comum é manter o desempenho coordenado da IA em múltiplos sites. As implementações variam significativamente, mas o desafio persiste em evitar que a rede se torne o gargalo. A tecnologia "scale-across" não elimina a latência imposta pela distância, mas busca garantir que a interconexão não limite a capacidade de escalabilidade. Isso confere aos hiperscaladores e operadores de data center a flexibilidade de adicionar capacidade computacional onde a energia e o espaço são mais disponíveis, tratando múltiplos sites como uma única infraestrutura de treinamento coesa. A jornada para redes otimizadas para IA distribuída está apenas começando, com previsões de que levará alguns anos para amadurecer completamente.

Com reportagem de Brazil Valley

Source · The Register