Amazon está comprando libros raros, quitando sus lomos y digitalizando las páginas para ampliar el material disponible para el entrenamiento de sistemas de inteligencia artificial.

La operación incluye obras agotadas o difíciles de encontrar en formato digital. Estos ejemplares ofrecen acceso a textos que no están disponibles en internet y pueden ampliar el conjunto de datos utilizado en el desarrollo de modelos de lenguaje.

La práctica salió a la luz después de que un dispositivo de rastreo colocado dentro de un libro raro siguiera el ejemplar hasta una instalación de Amazon en Las Vegas, conocida como VGT3. El lugar utiliza como identificación visual un dinosaurio sosteniendo un libro.

Al ser consultada sobre la operación, Amazon afirmó que “compra libros a través de canales comerciales para mejorar los productos y servicios que utilizan los clientes”.

Por qué los libros raros interesan a la IA

Los grandes modelos de lenguaje dependen de grandes volúmenes de texto para su entrenamiento. Las obras impresas que nunca fueron digitalizadas ofrecen una fuente adicional de contenido fuera de los materiales disponibles públicamente en internet.

Los libros antiguos también tienen otra característica relevante para este proceso: los textos publicados antes de la popularización de la IA generativa fueron producidos por humanos, sin contenido creado por grandes modelos de lenguaje.

Este tipo de material puede ser utilizado para reducir la presencia de textos sintéticos en los conjuntos de entrenamiento. Cuando los modelos comienzan a aprender repetidamente a partir de contenido producido por otras IAs, los investigadores señalan el riesgo de un fenómeno conocido como “colapso de modelo”.

En este escenario, la calidad de los resultados puede deteriorarse a medida que sucesivas generaciones de contenido artificial comienzan a alimentar nuevos ciclos de entrenamiento.

Sigue en Radar