A Roma Massimiliano Nicolini incontra oltre 400 giovani universitari e racconta la ricerca OLITEC sulla semantica tassonomica del dato
Immagine principale illustrativa fornita per questa notizia.
Roma. Davanti a una platea di oltre 400 giovani universitari, Massimiliano Nicolini, capo ricercatore della Fondazione Olivetti Tecnologia e Ricerca, ha portato al centro della conferenza una domanda comprensibile anche fuori dai laboratori informatici: come parlano i dati tra di loro? Il tema riguarda la possibilità di interrogare insieme archivi nati in epoche differenti, costruiti con programmi diversi e descritti con parole che, a prima vista, sembrano inconciliabili.
Un numero isolato, ha spiegato il quadro di ricerca presentato da Nicolini, non racconta ancora un fatto. «120» può indicare posti autorizzati, persone presenti, edifici censiti o risposte raccolte in un questionario. Per attribuirgli un significato bisogna conoscere la fonte, il soggetto osservato, la definizione della misura, il periodo e il metodo con cui il valore è stato prodotto. È qui che comincia la semantica del dato: nello studio di ciò che un’informazione afferma davvero, oltre la sequenza di caratteri conservata in una tabella.
La tassonomia aggiunge un secondo passaggio. Organizza i concetti e stabilisce relazioni controllate fra loro, senza scambiare per identiche due espressioni soltanto perché si assomigliano. Il campo «Comune» in un archivio può indicare il territorio cui si riferisce una statistica; in un altro, la località scritta in un indirizzo. Le parole coincidono, ma le domande a cui rispondono sono diverse. Per lo stesso motivo «posti disponibili», «posti autorizzati» e «posti occupati» appartengono alla stessa famiglia di informazioni, pur misurando condizioni differenti.
La Fondazione OLITEC sta sviluppando, sotto la direzione scientifica di Nicolini, algoritmi di normalizzazione tassonomica e semantica. Il loro compito è conservare il dato originario, ricostruire le definizioni delle fonti e proporre corrispondenze verificabili fra i concetti. Ogni osservazione viene accompagnata, per quanto la documentazione lo consenta, da una sorta di contratto semantico: che cosa misura, a chi si riferisce, in quale intervallo di tempo, su quale territorio e con quali trasformazioni lecite. In questo modo il collegamento fra due banche dati diventa una decisione argomentata e riproducibile.
Per rendere concreta la difficoltà, il saggio tecnico della Fondazione propone un caso ipotetico: un archivio scolastico del 1996, registrato in un vecchio tracciato, e una piattaforma del 2026 che risponde tramite interfacce moderne. Il primo può contare alunni per istituto; la seconda può descrivere iscrizioni o singoli plessi. Decodificare il file storico e tradurre i nomi delle colonne non basta. Occorre verificare se le unità osservate coincidono, come sono cambiati i confini dei comuni, a quale anno scolastico si riferiscono i conteggi e quali studenti rientrano in ciascuna misura. L’esempio illustra il metodo: il saggio non lo presenta come un risultato ottenuto su quei due archivi reali.
Il possibile esito non è un semplice sì o no. Due misure possono essere equivalenti, richiedere una conversione, consentire un confronto a condizioni precise o offrire soltanto un collegamento di contesto. In altri casi il sistema deve spiegare perché non sono confrontabili. La prudenza conta soprattutto quando una somiglianza apparente rischia di trasformarsi in una conclusione pubblica: un aumento dei servizi, per esempio, potrebbe dipendere da un nuovo criterio di classificazione anziché da un cambiamento reale sul territorio.
La distanza di trent’anni tra le sorgenti mette in evidenza un’altra difficoltà. Nel frattempo una scuola può cambiare sede, due comuni possono fondersi, una categoria amministrativa può essere suddivisa in più servizi. Un algoritmo affidabile deve custodire queste storie, la provenienza dei record e le versioni delle regole impiegate. Se manca una definizione originaria, il sistema non può inventarla: registra l’incertezza, chiede una revisione o limita la risposta alla domanda che le prove disponibili permettono davvero di affrontare.
Quando cambia la geografia, il problema non si risolve sostituendo una sigla con quella nuova. Se due comuni diventano uno, i conteggi storici possono essere sommati soltanto dopo aver verificato che descrivano lo stesso fenomeno e coprano davvero il territorio risultante. Per confrontare i tassi occorre ricostruire anche i rispettivi denominatori: la media semplice di due percentuali può restituire un valore sbagliato. Lo stesso vale per le categorie che nel tempo si dividono in più sottoclassi. Se l’archivio antico conserva soltanto un totale aggregato, l’algoritmo non può redistribuirlo con esattezza nelle voci moderne senza ulteriori prove.
Il progetto descritto dalla Fondazione non si esaurisce nella costruzione di un dizionario comune. Prevede la decodifica dei sistemi storici, la ricerca di candidati semantici, il controllo umano delle corrispondenze nuove, test sulla qualità dei collegamenti e la tracciabilità delle trasformazioni. Prevede anche regole di accesso: rendere due fonti tecnicamente collegabili non autorizza automaticamente a diffondere dati sensibili o a ricostruire informazioni su persone in territori piccoli.
Il lavoro si appoggia a strumenti già disponibili, fra cui vocabolari controllati, registri delle fonti, tracciamento della provenienza e codici territoriali storicizzati. La specificità della proposta OLITEC sta nel combinarli in regole operative che possano essere ispezionate e corrette quando arriva una nuova versione di una sorgente. Per chi usa una mappa o un indicatore, questo significa poter risalire ai dati originari e capire quale definizione ha reso possibile il confronto. Per chi progetta l’algoritmo, significa rendere visibili anche le corrispondenze rifiutate, affinché un successivo aggiornamento non ripeta un errore già riconosciuto.
Nel saggio «Tassonomia semantica del dato e algoritmi di normalizzazione», pubblicato dalla Fondazione nel settembre 2026, questa impostazione è presentata come un programma di ricerca da sottoporre a prove su archivi rappresentativi. Precisione dei collegamenti, errori, casi sospesi e lavoro necessario per aggiungere nuove fonti dovranno essere misurati. È una distinzione essenziale per i giovani che si formano sui sistemi informativi: una procedura promettente diventa affidabile quando dichiara ciò che ha verificato e rende visibili i propri limiti.
La conferenza romana ha così offerto agli universitari una chiave per leggere un problema che riguarda ricerca, servizi pubblici e decisioni basate sui dati. Far dialogare archivi di generazioni diverse significa recuperare conoscenza senza cancellare le differenze fra le fonti. La domanda più utile, prima di produrre un grafico o una previsione, resta quella formulata nel saggio: «Quale affermazione diventa lecita dopo aver collegato questi due dati?».
Fonte tecnica: Fondazione OLITEC, Tassonomia semantica del dato e algoritmi di normalizzazione, settembre 2026.
Scopri di più da
Abbonati per ricevere gli ultimi articoli inviati alla tua e-mail.

