Pipeline for Automatic Retrieval and Structuring of Academic Literature

PARSAL

Pipeline for Automatic Retrieval and Structuring of Academic Literature.

Ricerca bibliografica

Le fasi di ricerca bibliografiche sono lo step fondamentale per l’inizio di un task di ricerca. Questo è un processo dispendioso in termini di tempo e risorse che grazie a PARSAL può essere reso più veloce e facilmente consultabile.

  • Time-consuming
  • Difficile gestione della base documentale
  • Interrogazione successiva complessa
Rete Neurale Bioattività
PDF/XML
OCR/Parser
RAG + LLM
DB Strutturato

Retrieve automatico

PARSAL è un sistema che consente la dematerializzazione intelligente di corpora documentali in diversi formati e la relativa organizzazione, gestione e interrogazione sfruttando modelli generativi quali Large Language Models (LLMs) collegati con applicazioni di tipo Retrieval-Augmented Generation (RAG) che sfruttano la conoscenza strutturata ottenuta, nonché riarrangiata in Knowledge Graph (KG).

  • Retrieve automatico
  • RAG
  • LLMs

PARSAL

PARSAL è stato sviluppato per consentire e semplificare all’utente il processo di revisione della letteratura scientificaù del settore di interesse. Infatti, partendo da una ricerca basata su keywords e, interfacciandosi con le API messe a disposizione delle principali case editrici scientifiche (Elsevier, Springer Nature) e antologie pubblicamente accessibili (arXiv), il sistema è in grado di:

  • Download e parsing della letteratura
  • OCR per la formattazione intelligente
  • Formattazione in formato JSON unico
Explainable AI Dashboard