#inteligenciaartificial #direitosdeautor
Em O que é que um autor pode fazer? Bibliotecas Sombra na Era da IA, M. Swartz (2026) explora a crescente tensão jurídica e ética entre as plataformas de inteligência artificial e os direitos de autor, focando-se no papel das bibliotecas sombra como fontes de dados.
O autor destaca o processo judicial contra a Anna’s Archive, sublinhando que estas bases de dados piratas são agora utilizadas para treinar modelos de linguagem em larga escala sem o consentimento dos criadores. Grandes editoras estão a reagir através de litígios estratégicos, enquanto outras optam por acordos de licenciamento lucrativos que frequentemente excluem os escritores dos lucros.
A análise aponta para um vácuo regulatório global que deixa os produtores de conteúdos com mecanismos de proteção limitados perante a exploração tecnológica. Em suma, o artigo reflete sobre como a IA generativa está a transformar a indústria editorial e a desafiar os conceitos tradicionais de propriedade intelectual.
👉Como é que as bibliotecas-sombra impactam o treino de modelos de IA?
As bibliotecas-sombra, como o Anna’s Archive, LibGen e Sci-Hub, desempenham um papel fundamental e controverso no desenvolvimento da Inteligência Artificial (IA), atuando como fontes massivas de dados para o treino de Modelos de Linguagem de Grande Escala (LLMs).
O impacto destas plataformas manifesta-se de várias formas:
Fornecimento de grandes conjuntos de dados: As bibliotecas-sombra deixaram de ser apenas canais de pirataria para se tornarem fornecedores ativos de dados. O Anna's Archive, por exemplo, é acusado de publicitar e fornecer acesso de alta velocidade a obras protegidas por direitos de autor especificamente para programadores de sistemas de IA e corretores de dados.
Contorno de barreiras éticas e legais: Devido à intensa competição e à abordagem de que "o progresso está acima de tudo", muitas empresas de tecnologia recorrem a estes sites piratas para obter materiais de treino, frequentemente sem pagar qualquer compensação aos autores.
Uso de coleções específicas: Existem casos documentados de utilização de bases de dados derivadas de bibliotecas-sombra. A Meta foi acusada de treinar o seu LLM no Books3, um conjunto de dados que continha o texto integral de quase 200.000 livros piratas. Outras gigantes como Nvidia, Salesforce e Apple também enfrentaram acusações semelhantes.Ineficácia dos mecanismos de "Opt-out": O uso de bibliotecas-sombra torna quase inúteis as tentativas de proteção dos autores. Mesmo que um autor utilize modelos de licenciamento progressivos ou opte por não permitir o uso do seu trabalho em acordos com editoras oficiais, o seu conteúdo pode ainda assim acabar num LLM se for extraído de uma biblioteca-sombra.
Aceleração de conflitos jurídicos: O papel destas bibliotecas no treino de IA motivou uma nova vaga de processos judiciais. Grandes editoras globais (como Hachette, Penguin Random House e HarperCollins) processaram o Anna’s Archive, argumentando que a ação é crítica dado o papel do site em "alimentar chatbots de IA".
Em suma, as bibliotecas-sombra criaram um cenário onde a vasta maioria das publicações em língua inglesa já foi provavelmente utilizada como dado de treino para múltiplos modelos de IA, deixando os criadores com poucas opções para controlar o uso das suas obra.
👉Que empresas foram processadas por usar dados do Books3?
Com base nas fontes, a principal empresa mencionada como tendo sido processada especificamente pelo uso do conjunto de dados Books3 (que contém cerca de 200.000 livros piratas) é a Meta. O processo em questão é o caso Kadrey v. Meta, no qual foi alegado que a empresa treinou o seu modelo de linguagem utilizando esse repositório.
Além da Meta, as fontes indicam outras empresas envolvidas em litígios ou acusações semelhantes relacionadas com o uso de bibliotecas-sombra e obras piratas: Anthropic: Foi alvo do caso Bartz et al. v. Anthropic PBC, que resultou no maior acordo de ação coletiva de direitos de autor na história dos EUA (1,5 mil milhões de dólares). A empresa foi acusada de utilizar uma "biblioteca central" de obras piratas e conteúdos de bibliotecas-sombra para treinar os seus modelos.
Nvidia, Salesforce e Apple: Estas grandes empresas tecnológicas também foram acusadas de utilizar estratégias semelhantes (recurso a bibliotecas-sombra e livros piratas) para o treino dos seus modelos de IA. No caso da Salesforce, a fonte menciona explicitamente que a empresa foi processada por autores em outubro de 2025.
As fontes sublinham que este cenário de processos judiciais é alimentado pela tendência das empresas de IA de utilizarem sites como o Anna’s Archive (sucessor do LibGen e Sci-Hub) como fontes massivas de dados sem a devida ccompensação aos autores.
Com base nas fontes, a principal empresa mencionada como tendo sido processada especificamente pelo uso do conjunto de dados Books3 (que contém cerca de 200.000 livros piratas) é a Meta. O processo em questão é o caso Kadrey v. Meta, no qual foi alegado que a empresa treinou o seu modelo de linguagem utilizando esse repositório.
Além da Meta, as fontes indicam outras empresas envolvidas em litígios ou acusações semelhantes relacionadas com o uso de bibliotecas-sombra e obras piratas: Anthropic: Foi alvo do caso Bartz et al. v. Anthropic PBC, que resultou no maior acordo de ação coletiva de direitos de autor na história dos EUA (1,5 mil milhões de dólares). A empresa foi acusada de utilizar uma "biblioteca central" de obras piratas e conteúdos de bibliotecas-sombra para treinar os seus modelos.
Nvidia, Salesforce e Apple: Estas grandes empresas tecnológicas também foram acusadas de utilizar estratégias semelhantes (recurso a bibliotecas-sombra e livros piratas) para o treino dos seus modelos de IA. No caso da Salesforce, a fonte menciona explicitamente que a empresa foi processada por autores em outubro de 2025.
As fontes sublinham que este cenário de processos judiciais é alimentado pela tendência das empresas de IA de utilizarem sites como o Anna’s Archive (sucessor do LibGen e Sci-Hub) como fontes massivas de dados sem a devida ccompensação aos autores.
👉Existem alternativas para os autores protegerem as suas obras da IA?
Atualmente, as opções para os autores que pretendem proteger as suas obras do treino de IA são consideradas limitadas, uma vez que é provável que a grande maioria das publicações em língua inglesa e conteúdos online já tenha sido utilizada para esse fim. No entanto, as fontes identificam algumas alternativas e estratégias:
- Seleção de editoras com políticas de "Opt-out": Uma das alternativas é publicar em editoras ou plataformas que ofereçam o direito de exclusão (opt-out). Um exemplo destacado é a Cambridge University Press, que adotou um modelo considerado mais progressivo, permitindo que os autores optem por não ter as suas obras utilizadas para treino de IA, ao mesmo tempo que assegura o pagamento de royalties.
- Novos modelos de licenciamento (Creative Commons Signals): O projeto CC Signals é uma iniciativa emergente que visa permitir aos detentores de direitos sinalizar as suas preferências sobre como o seu conteúdo deve ser reutilizado por máquinas. Este sistema baseia-se num conjunto de opções moldadas pelo interesse público para tentar criar um "novo contrato social" na era da IA.
- Ações judiciais coletivas: Como mencionado anteriormente, os autores têm recorrido aos tribunais para contestar o uso não autorizado das suas obras. Casos como Kadrey v. Meta e Bartz et al. v. Anthropic PBC (que resultou num acordo histórico de 1,5 mil milhões de dólares) mostram que a via judicial é uma forma de retaliação e tentativa de proteção dos direitos de autor contra o uso de bases de dados piratas como o Books3.
- Obstáculos à proteção: Estas alternativas enfrentam desafios significativos: iIneficácia perante Bibliotecas-Sombra: Um mecanismo de "opt-out" oficial tem pouco valor se as empresas de IA continuarem a recolher dados de bibliotecas-sombra como o Anna’s Archive, que operam à margem das licenças e acordos legais.
- Dependência da boa vontade tecnológica: O sucesso de iniciativas como o CC Signals depende de as empresas de IA respeitarem esses sinais. Dado o histórico de "o progresso acima de tudo" e o uso frequente de sites piratas, é incerto se estas empresas tratarão tais sinais como algo mais do que opcional.
- Acordos de editoras sem consentimento: Muitas vezes, grandes editoras (como Taylor & Francis e Wiley) celebram acordos de licenciamento de dados com empresas tecnológicas sem que os autores sejam informados ou consultados previamente.
👉Como funciona o projeto CC Signals para proteger conteúdos?
O projeto Creative Commons (CC) Signals é apresentado como uma resposta às dificuldades dos autores em controlar o uso de suas obras no treino de IA, funcionando como um modelo emergente de licenciamento para a era digital.
O seu funcionamento baseia-se nos seguintes pilares:
Sinalização de preferências: O projeto permite que os detentores de direitos "sinalizem as suas preferências" sobre a forma como o seu conteúdo pode ser reutilizado por máquinas.
Opções estruturadas: Estas preferências não são arbitrárias; baseiam-se num conjunto de opções limitadas, mas significativas, que foram desenhadas e moldadas tendo em conta o interesse público.
Novo contrato social: O objetivo de fundo é estabelecer um "novo contrato social" para a era da inteligência artificial, criando uma linguagem clara entre criadores e desenvolvedores de tecnologia.
Desafios à sua eficácia: O sucesso do CC Signals não depende apenas da ferramenta em si, mas da boa vontade das empresas de tecnologia. O sistema só funciona se as empresas que treinam modelos de IA decidirem respeitar esses "sinais". Dado o histórico das grandes tecnológicas no uso de bibliotecas-sombra e a sua abordagem de que "o progresso está acima de tudo", existe o receio de que estas empresas tratem o CC Signals como algo meramente opcional e não vinculativo.
👉As empresas de IA são obrigadas a respeitar estes sinais?
De acordo com as fontes, as empresas de IA não são obrigadas a respeitar estes sinais no sentido de existir um mecanismo legal que as force a tal. O sucesso do projeto CC Signals depende das empresas de tecnologia decidirem, voluntariamente, respeitar essas preferências de licenciamento.
De acordo com as fontes, as empresas de IA não são obrigadas a respeitar estes sinais no sentido de existir um mecanismo legal que as force a tal. O sucesso do projeto CC Signals depende das empresas de tecnologia decidirem, voluntariamente, respeitar essas preferências de licenciamento.
Os principais pontos de preocupação destacados nas fontes incluem:
- Carácter opcional: Dado o histórico das grandes empresas tecnológicas em relação ao cumprimento de direitos de autor e ao uso de bibliotecas-sombra, considera-se difícil que estas venham a tratar o CC Signals como algo mais do que meramente opcional.
- Abordagem de "Progresso acima de tudo": As grandes empresas de IA têm adotado uma mentalidade em que o desenvolvimento tecnológico rápido é prioritário, o que as leva frequentemente a ignorar barreiras éticas e a recorrer a sites piratas para obter dados de treino.
- Ineficácia perante a pirataria: Mesmo que uma empresa respeite os sinais em fontes oficiais, os autores continuam vulneráveis se os seus conteúdos forem extraídos de bibliotecas-sombra (como o Anna’s Archive), onde as preferências de licenciamento e os mecanismos de "opt-out" não têm qualquer efeito.
Em suma, embora o CC Signals tente criar um "novo contrato social", a sua eficácia depende inteiramente da boa vontade das empresas de IA em honrar as sinalizações dos criadores.
Swartz, M. (2026). O que é que um autor pode fazer? Bibliotecas Sombra na Era da IA. Slaw, 8 de maio de 2026. https://www.slaw.ca/2026/05/08/whats-an-author-to-do-shadow-libraries-in-the-age-of-ai/
Swartz, M. (2026). O que é que um autor pode fazer? Bibliotecas Sombra na Era da IA. Slaw, 8 de maio de 2026. https://www.slaw.ca/2026/05/08/whats-an-author-to-do-shadow-libraries-in-the-age-of-ai/
Sem comentários:
Enviar um comentário