Em 2026, o uso de obras protegidas por direitos autorais no treinamento de sistemas de inteligência artificial (IA) se consolida como um dos temas mais complexos e sensíveis no cenário regulatório global. O avanço dos modelos generativos, capazes de criar conteúdos novos a partir de padrões aprendidos, transformou uma discussão técnica em uma questão estratégica de alta relevância. A base do dilema reside na necessidade de volumes massivos de dados para o aprimoramento desses modelos. Frequentemente, esses conjuntos de dados incluem livros, artigos, fotografias, músicas e outras criações protegidas por direitos autorais. A capacidade crescente dessas IAs de gerar material com qualidade similar à humana levanta uma questão jurídica fundamental: a utilização dessas obras para treinamento é legítima, ou configura exploração que exige autorização e remuneração dos titulares?
Essa pergunta não se restringe ao Brasil, e as respostas globais divergem, criando um cenário de fragmentação regulatória. Essa divergência pode impactar a capacidade de países atraírem investimentos, desenvolverem tecnologia própria e competirem na corrida pela liderança em IA. A União Europeia, por exemplo, tem buscado um caminho que equilibre inovação e proteção autoral, enquanto outras jurisdições ponderam abordagens distintas, com consequências diretas para o ecossistema de IA.
O Modelo Europeu: Inovação com Controle
A União Europeia foi pioneira ao abordar diretamente a questão do uso de dados no treinamento de IA. A Diretiva (EU) 2019/790 introduziu regras específicas para atividades de "text and data mining" (TDM), que consistem na análise automatizada de grandes volumes de dados para identificar padrões e tendências. A diretiva reconhece o TDM como essencial para a pesquisa científica e a inovação tecnológica. Contudo, para preservar os interesses dos titulares de direitos, a UE implementou mecanismos de reserva de uso, conhecidos como "opt-out". Isso permite que os titulares excluam suas obras dessas atividades mediante manifestação expressa.
A abordagem europeia parte da premissa de que o desenvolvimento da IA depende do acesso a dados em larga escala. Em vez de impor uma autorização prévia para cada uso de obra protegida, o modelo busca um equilíbrio. Essa estratégia é complementada pelo Regulamento Europeu de Inteligência Artificial (AI Act), que, embora não discipline diretamente o direito autoral, impõe obrigações de transparência sobre os dados usados no treinamento de certos modelos de IA. Isso fortalece a exigência de rastreabilidade e governança dos conjuntos de dados empregados pelos desenvolvedores.
Debate Brasileiro: Rumo a um Regime Mais Restritivo?
No Brasil, a discussão ganha contornos importantes com a tramitação do Projeto de Lei nº 2.338/2023, que visa estabelecer um marco regulatório para a inteligência artificial. A legislação autoral brasileira atual, a Lei nº 9.610/1998, foi concebida em um contexto tecnológico anterior à IA generativa e carece de disposições específicas sobre mineração de dados ou treinamento algorítmico. Sem regras claras, o debate se concentra na legalidade das cópias técnicas realizadas durante o treinamento de modelos: elas são reproduções juridicamente relevantes e, portanto, sujeitas à autorização dos titulares?
As diferentes versões discutidas no âmbito do PL nº 2.338 indicam uma inclinação regulatória potencialmente mais protetiva dos titulares de direitos. As propostas em debate tendem a atribuir maior peso à necessidade de autorização e remuneração pelo uso de conteúdos protegidos, com exceções mais limitadas para pesquisa e instituições sem fins lucrativos. Caso essa orientação prevaleça, o Brasil poderá adotar um regime significativamente mais restritivo que o europeu, com implicações para a atração de investimentos e o desenvolvimento local de IA.
Impasse entre Titulares e Desenvolvedores
Entidades representativas de autores argumentam que os sistemas de IA extraem valor de suas obras sem que os titulares participem dos benefícios econômicos gerados. Sob essa ótica, mecanismos de autorização e remuneração seriam cruciais para manter os incentivos econômicos que fundamentam a proteção autoral. Por outro lado, setores de infraestrutura econômica e social, empresas de tecnologia e organizações da economia digital apontam a inviabilidade de negociar autorizações individuais com milhões ou bilhões de titulares de direitos, o que geraria custos de transação incompatíveis com a escala do treinamento de modelos.
A expansão da IA generativa adicionou uma nova camada de preocupação. Mesmo que o treinamento tenha finalidade analítica, há o receio de que os modelos possam gerar resultados que reproduzam elementos expressivos, estilos ou trechos identificáveis de obras utilizadas, afetando mercados já explorados pelos titulares. Essa tensão entre a necessidade de dados para inovação e a proteção dos criadores é o cerne do debate.
Além do Direito Autoral: Acesso ao Conhecimento e Governança
As discussões sobre treinamento de IA frequentemente são abstratas, mas os impactos são concretos. A crescente demanda por dados de alta qualidade afeta o ecossistema de produção e acesso ao conhecimento. Relatos recentes indicam práticas como a aquisição em larga escala de livros físicos para digitalização e descarte posterior, visando alimentar modelos de IA. Embora defendida como método eficiente de conversão de acervos, essa prática suscita preocupações que transcendem o direito autoral.
Surgem debates sobre a concentração privada de vastos repositórios de conhecimento e a crescente assimetria de informação entre grandes empresas de tecnologia e demais atores da cadeia criativa. O episódio evidencia que a regulação do treinamento de IA envolve não apenas a tutela de interesses econômicos, mas também questões mais amplas de acesso ao conhecimento, diversidade cultural e governança da informação na economia digital. O desafio brasileiro é construir soluções que ofereçam previsibilidade jurídica sem comprometer a inovação.
O caminho regulatório brasileiro para o treinamento de IA definirá a participação do país na economia digital nas próximas décadas. A forma como o Brasil tratará o uso de dados autorais para alimentar modelos de inteligência artificial será um fator determinante para sua competitividade tecnológica em um cenário cada vez mais orientado por dados. A busca por um equilíbrio entre a proteção dos criadores e o avanço tecnológico é essencial para garantir que o país possa desenvolver soluções locais customizadas às suas necessidades, sem acelerar a fuga de talentos e investimentos para o exterior.
Com reportagem de Brazil Valley
Source · MIT Tech Review Brasil





