#inteligenciaartificial
Estima-se que um quarto das fontes de IA são livros
Livros, web, redes sociais e artigos científicos na corrida para treinar LLMs (Modelos de Linguagem de Grande Escala)
Uma análise do cientista de dados Olivier Khatib, CEO da T1U.ai, estima a distribuição das principais fontes de dados usadas para treinar cinco dos modelos de linguagem mais importantes – ChatGPT (OpenAI), Claude (Anthropic), Gemini (Google), Llama (Meta) e Grok (xAI) – com base na documentação pública das empresas, dos seus relatórios técnicos e outras evidências disponíveis.
O estudo mostra que, embora todos esses modelos se baseem numa combinação de fontes semelhantes, cada um apresenta uma estratégia distinta de recolha e ponderação de dados que reflete tanto os seus objetivos técnicos como as forças das organizações que os desenvolvem.
Um dos resultados mais marcantes é que o Llama, o modelo da Meta, teria obtido cerca de um quarto de seus dados de treino a partir de livros, uma proporção maior do que a estimada para qualquer um dos outros modelos analisados. Isso é particularmente relevante porque o uso de livros protegidos por direitos autorais é atualmente um dos principais focos de litígio entre empresas de IA e detentores de direitos. Enquanto autores, editoras e organizações culturais entraram com inúmeros processos por uso não autorizado de suas obras, a investigação judicial também revelou o armazenamento de milhões de livros digitalizados para o treino de alguns modelos, intensificando o debate sobre os limites legais da aprendizagem de máquina e o uso legítimo de conteúdo protegido.
O estudo também mostra diferenças significativas entre os diferentes sistemas. O Claude destaca-se por incorporar uma proporção relativamente alta de artigos científicos e publicações académicas, consistente com a orientação que a Anthropic deu ao seu modelo para tarefas analíticas, pesquisa e raciocínio complexo. Por sua vez, o Gemini depende mais fortemente de dados provenientes do rastreamento web, aproveitando o enorme ecossistema de informações indexado pela Google para construir um modelo com ampla cobertura temática e linguística. No caso do Grok, desenvolvido pela xAI, o peso dos dados das redes sociais destaca-se, especialmente devido à integração com o ecossistema X (anteriormente Twitter), que oferece ao modelo acesso privilegiado a conversas e eventos recentes. O ChatGPT apresenta uma mistura mais equilibrada de fontes, distribuindo seu treino entre conteúdo web, livros, código, documentos e outras recolhas de dados.
Fonte predominante por modelo
ChatGPT (OpenAI) - Mistura equilibrada de páginas web, livros, código e documentos públicos.
Claude (Anthropic) - Maior presença de artigos científicos e literatura académica.
Gemini (Google) - Predominância do rastreamento da web.
Llama (Meta) - Alta proporção de livros (cerca de um quarto do conjunto de treino).
Grok (xAI) - Uso significativo das redes sociais, especialmente conteúdo do X (Twitter).
Além das diferenças quantitativas, o relatório ilustra a crescente importância da diversidade das fontes de treino como fator estratégico no desenvolvimento de modelos fundamentais. Os livros fornecem profundidade concetual e riqueza linguística; os artigos científicos fornecem conhecimento especializado e rigor técnico; o conteúdo do site oferece uma amplitude temática; as redes sociais incorporam atualidades e linguagem coloquial; enquanto outras fontes, como repositórios de código ou documentos públicos, enriquecem capacidades de programação e resolução de problemas. Essa combinação explica em grande parte as diferentes forças e limitações observadas entre os modelos atuais.
Por fim, o artigo coloca esses dados no contexto da crescente controvérsia legal sobre o treino de inteligência artificial. Processos por violação de direitos autorais continuam a multiplicar-se, especialmente contra empresas como a Meta e a Anthropic, à medida que os tribunais começam a restringir as práticas legais de recolha e armazenamento de dados e a clarificar as que infringem a propriedade intelectual. Como resultado, a composição dos conjuntos de treino já não é apenas uma questão técnica, tornando-se na questão central para o futuro da regulação, transparência e sustentabilidade do desenvolvimento da IA generativa.


