Los buscadores de las plataformas que alojan a las revistas científicas permiten localizar artículos localizando títulos, autores, palabras clave o términos presentes en los documentos. Pero, ¿qué ocurre si queremos hacer una pregunta sobre el contenido de una colección («documentos sobre comportamiento informacional«, por ejemplo) y obtener una respuesta elaborada a partir de los artículos publicados en esas revistas? Necesitaríamos un buscador IA con más capacidades.
DOCUMENTALIA es un proyecto experimental para desarrollar un buscador basado en inteligencia artificial sobre el texto completo de revistas científicas (Anales de Documentación y Cuadernos de Gestión de Información en este caso, dos de las revistas editadas por nuestra facultad y en las que participamos en el comité editorial. El objetivo de este proyecto es que el usuario pueda formular preguntas en lenguaje natural y recibir respuestas construidas a partir de los documentos de la colección, manteniendo siempre la posibilidad de identificar y consultar las fuentes utilizadas (tanto los artículos publicados en estas dos revistas como las referencias en las que se han basado los autores).

A lo largo de esta serie de entradas iremos explicando paso a paso cómo estamos construyendo el sistema, los problemas encontrados y las soluciones adoptadas.
¿Por qué construir un buscador con IA para una revista científica?
Un buscador convencional suele responder bien a una pregunta del tipo: «¿Qué artículos contienen el término «preservación digital»?«. Sin embargo, resulta algo más complicado utilizarlo para responder a preguntas como: «¿Qué problemas relacionados con la preservación digital han estudiado los artículos publicados en la revista?» (aunque el «modo IA» de Google puede matizar esta afirmación). La diferencia es importante: de forma habitual se buscan documentos que contienen determinadas palabras, con la ayuda de la IA intentaremos recuperar información relevante, relacionarla y generar una respuesta fundamentada en los documentos recuperados.
Aquí es donde entran en juego los sistemas de recuperación aumentada mediante generación ‘Retrieval-Augmented Generation‘ de los que hablamos en un post anterior. Esta tecnología combina dos procesos:
- Recuperación de información: localizar de forma selectiva dentro de una colección los documentos o fragmentos más relacionados con la pregunta.
- Generación de la respuesta: un modelo de lenguaje utiliza la información recuperada como contexto para elaborar la respuesta.
En DOCUMENTALIA vamos a añadir una tercera exigencia: la trazabilidad, entendida bajo el paradigma de que una respuesta sobre literatura científica solo resulta verdaderamente útil si podemos saber qué documentos sustentan la información proporcionada.
¿Qué queremos conseguir?
El objetivo se representa en un esquema muy simple: Pregunta del usuario → búsqueda en los artículos → recuperación de evidencias → generación de la respuesta → identificación de las fuentes

Nuestro proyecto de buscador no pretende entrenar un nuevo modelo IA con los artículos de estas revistas. El planteamiento es diferente porque se aspira a construir una infraestructura que permita a un modelo consultar una colección documental previamente procesada y recuperar de ella la información necesaria para responder a una pregunta. Esta distinción va a ser muy importante durante todo el proyecto.
Sorpresa: el verdadero problema empieza antes de la IA
Cabe pensar que la parte más complicada consiste en conectar los documentos con un modelo de lenguaje, pero no es así. Antes de llegar a ese punto necesitamos responder a preguntas mucho más elementales:
- ¿Qué documentos forman el corpus?
- ¿En qué formatos se encuentran editadas?
- ¿Siguen todas las mismas plantillas a lo largo de los años de edición de las revistas (Anales de Documentación tiene casi 30 años de antigüedad). ¿Los editores y/o los autores han respetado las plantillas y las normas editoriales?
- ¿Cómo extraemos de los artículos títulos, autores, resúmenes, palabras clave, secciones y referencias?
- ¿Cómo identificamos inequívocamente cada artículo?
- ¿Cómo almacenamos toda esa información?
- ¿Cómo comprobamos que la extracción ha sido correcta?
- ¿Qué parte del contenido debemos proporcionar posteriormente al sistema de recuperación?
El paso del tiempo no es cuestión baladí. Una revista científica evoluciona. Los artículos más recientes de Anales de Documentación se editan en PDF y XML-JATS, y presentan una estructura muy regular, mientras que buena parte del corpus solo está disponible en PDF y el diseño editorial, la estructura de los artículos y las normas bibliográficas han cambiado durante los años (se pasó de ISO 690 a APA hace unos años). La otra revista, que aporta menos artículos porque sólo se editó durante unos años, tiene normas de formato diferentes sustancialmente, otra dificultad añadida. Por ello, antes de construir el buscador hay que convertir un conjunto documental heterogéneo en un corpus estructurado, normalizado y susceptible de ser procesado automáticamente.
La elección de un corpus real nos lleva a enfrentarnos a problemas que difícilmente aparecen en una demostración construida con unos pocos documentos:
- documentos PDF y XML-JATS
- artículos publicados en diferentes épocas
- textos en español, portugués e inglés
- artículos de investigación, reseñas y otros tipos documentales
- diferentes estructuras y diseños de página
- cambios en los sistemas de identificación de los documentos (hoy en día nadie discute el uso del DOI, identificador que no existía hasta hace unos años)
- distintas formas de presentar autores, afiliaciones, resúmenes, palabras clave y referencias bibliográficas.
Esta heterogeneidad convierte nuestras dos revistas en un buen laboratorio para estudiar cómo construir sistemas de recuperación con IA sobre colecciones científicas reales.
Un proyecto que explicaremos paso a paso
Esta entrada inicia una serie en la que documentaremos el desarrollo de DOCUMENTALIA desde la preparación de los documentos hasta la construcción y evaluación del buscador.
El proceso puede resumirse inicialmente en varias etapas: Corpus → extracción → estructuración → base de datos → fragmentación → embeddings → recuperación → modelo de lenguaje → respuesta con fuentes

En las próximas entradas comentaremos (o lo intentaremos al menos) qué ocurre en cada una de estas etapas, prestando especial atención a los problemas encontrados, porque algunas de las decisiones más interesantes del proyecto han ido surgiendo precisamente cuando los documentos reales no se comportaban como esperábamos (lo que ha ocurrido más frecuentemente de lo deseado).
¿Puede aplicarse este procedimiento a otras colecciones?
Ese es uno de los objetivos de esta serie de entradas: transferir el conocimiento adquirido. Buena parte de los problemas que estamos abordando en nuestro proyecto con dos revistas aparecen también al trabajar con repositorios institucionales, colecciones digitalizadas, revistas históricas, tesis doctorales, informes técnicos o bibliotecas digitales. Por eso no queremos presentar únicamente el resultado final, vamos a documentar el proceso de construcción y explicar qué decisiones pueden reutilizarse en otros proyectos.

En la siguiente entrada partiremos de una pregunta básica: ¿qué componentes necesitamos realmente para construir un buscador IA sobre una colección documental?



























