Pesquisadores de segurança identificaram uma vulnerabilidade de alta gravidade em um serviço de monitoramento da Nvidia que afeta milhares de servidores equipados com GPUs. A falha, rastreada como CVE-2026-47483, permite que atacantes não autenticados causem a interrupção do serviço de monitoramento de GPUs (DCGM Exporter) e, consequentemente, de cargas de trabalho de inteligência artificial. A descoberta, feita pela startup de segurança Lava, revela uma exposição significativa de infraestruturas críticas para IA.

O DCGM Exporter é responsável por coletar e expor métricas detalhadas sobre o desempenho e o uso de GPUs, como utilização, consumo de energia e identificação única (UUID). Essas informações são transmitidas em texto plano pela internet, o que, por si só, já representa um risco de reconhecimento para potenciais atacantes. Eles podem mapear a infraestrutura de GPUs, identificar sistemas vulneráveis e monitorar a atividade das cargas de trabalho. A escala dessa exposição se mostrou "especialmente significativa", segundo Michael Katchinskiy, pesquisador da Lava, que realizou varreduras entre março e maio e encontrou cerca de 2.100 servidores GPU expondo métricas do DCGM Exporter à internet, totalizando 12.000 UUIDs de GPU. Quase metade desses sistemas estava nos EUA, representando um valor estimado de US$ 100 milhões em hardware, incluindo modelos de ponta como Blackwell Ultra B300, H200 e H100, além de placas de consumidor como RTX 5090 e 4090.

A vulnerabilidade em si reside na forma como oExporter lida com requisições não autenticadas. Com um número suficiente de requisições simultâneas, o serviço pode ficar sem memória e travar, interrompendo a visibilidade sobre a saúde e atividade das GPUs. Essa pressão sobre CPU e memória também pode impactar diretamente o desempenho de tarefas de treinamento ou inferência de IA. A Nvidia lançou um patch para a falha em setembro, na versão 4.8.2 de seu software, e recomenda que os operadores atualizem seus sistemas.

Além do DCGM Exporter, a equipe da Lava investigou o Prometheus Node Exporter, outro serviço de monitoramento comum em clusters de GPU. Eles encontraram 12.096 hosts públicos com Node Exporter exposto, revelando informações sobre modelos de servidores, sistemas operacionais, versões de firmware e hardware de rede. Esses dados podem ser usados para identificar configurações de ambiente e correlacioná-las com vulnerabilidades conhecidas. A exposição desses serviços de monitoramento afetou provedores de nuvem e infraestrutura de GPU, incluindo Nebius, Voltage Park, Lambda, Northern Data e DigitalOcean. Os provedores afetados trabalharam com seus clientes para corrigir as exposições após serem notificados.

A situação aponta para uma lacuna de segurança crescente na infraestrutura de IA. Empresas investem massivamente em GPUs de ponta, mas negligenciam a proteção de sistemas críticos de monitoramento. Essa exposição pode não apenas revelar detalhes sobre como os ambientes de IA são construídos, mas também abrir portas para ataques que causem interrupções significativas. A recomendação para operadores é clara: restringir o acesso a serviços como Nvidia DCGM Exporter e Prometheus Node Exporter, tornando-os inacessíveis diretamente da internet pública e acessíveis apenas por infraestruturas de monitoramento autorizadas.

Com reportagem de Brazil Valley

Source · The Register