A Universidade de Oxford autorizou que materiais digitalizados da Bodleian Library fossem incorporados aos conjuntos de treinamento da OpenAI, segundo documentos internos obtidos pelo Guardian. Essa finalidade não havia sido explicitada no anúncio público da parceria, apresentado em 2025 principalmente como um projeto de digitalização e ampliação do acesso a material histórico.

Os registros indicam que, até junho de 2025, cerca de 125 mil imagens de dissertações históricas já haviam sido compartilhadas com a OpenAI. O projeto envolve sobretudo materiais em domínio público, incluindo dissertações europeias e americanas dos séculos 19 e 20.

Oxford havia descrito oficialmente a iniciativa como um piloto para testar digitalização em escala e tornar coleções antes indisponíveis online pesquisáveis e acessíveis. A página atual do projeto também informa que aproximadamente 429 mil arquivos de fichas de catálogo foram digitalizados.

Oxford diz que uso não foi ocultado

A universidade afirmou ao Guardian que o volume de material é “modesto em escala”, limitado a obras fora de copyright e disponibilizado à OpenAI de forma não exclusiva. A Bodleian mantém os direitos sobre as digitalizações e pretende publicar o conteúdo abertamente na internet.

Oxford também rejeitou a interpretação de que o uso para treinamento tenha sido escondido. Segundo a instituição, a digitalização era o principal objetivo da parceria, mas havia transparência sobre a contribuição dos materiais para sistemas de inteligência artificial.

O anúncio original, porém, não dizia explicitamente que os textos digitalizados seriam adicionados aos conjuntos de treinamento da OpenAI. Documentos internos também registraram preocupações de funcionários sobre possíveis riscos reputacionais associados à parceria.

O caso reforça o valor estratégico de acervos acadêmicos e históricos pouco representados na internet e levanta questões sobre transparência e governança quando instituições culturais fornecem dados para modelos comerciais de IA.

Continue no Radar