Come funziona
Come il programma riconosce i dati
Il riconoscimento lavora su quattro livelli, che si fondono in modo che il più affidabile vinca quando due indicano lo stesso pezzo di testo. Accanto ne corre un quinto, che non sostituisce nulla e ha un trattamento suo.
I quattro livelli
Dal modello alle parole che si insegnano
Il modello linguistico locale
Addestrato sull’italiano e distribuito dentro il pacchetto, non chiamato in rete. Copre le categorie generiche, ventidue in tutto, dai nomi di persona ai codici fiscali, e riconosce anche ciò che non ha una forma fissa, come i nomi propri che non compaiono in nessun elenco.
Le regole per le forme italiane
Quello che i modelli sbagliano o spezzano: gli indirizzi con via, corso e piazza, le date per esteso e numeriche, i numeri di fascicolo e di protocollo, l’età, gli orari, le iniziali puntate. Codice fiscale, partita IVA, IBAN e carte passano un controllo matematico, quindi o sono validi o non vengono scambiati per tali.
Il glossario del servizio
I termini che si insegnano al programma, e che da quel momento vengono coperti sempre: i nomi delle comunità, dei centri diurni, delle scuole e dei servizi del territorio in cui si lavora. Vince su tutto il resto, perché è la conoscenza che nessun elenco generale contiene.
Le esclusioni
I termini dichiarati non personali, che non vengono coperti mai. Servono a togliere il rumore, cioè le parole che il riconoscimento scambierebbe per nomi e che invece appartengono al lessico del mestiere.
I dati particolari, che corrono a parte
Nove temi, descritti qui sotto, riconosciuti per parole e per contesto. Non sostituiscono i quattro livelli e hanno un trattamento proprio, perché in una relazione il contenuto clinico è spesso il senso stesso del testo, e decidere che cosa può uscire spetta a chi la firma.
Che cosa copre
Le venticinque categorie che il programma distingue
La versione completa le copre tutte; la versione libera copre i nomi delle persone e le date, e le altre le riconosce e le dichiara senza coprirle. Sono le persone (nomi, iniziali, età, riferimenti al genere), il tempo (date, periodi senza giorno, orari), i luoghi (città, indirizzi, numeri civici, codici di avviamento postale, province), i recapiti (posta elettronica, telefono), gli enti e le organizzazioni, i codici che identificano una persona (codice fiscale, partita IVA, IBAN, carte, documenti d’identità), i riferimenti delle pratiche (fascicoli, protocolli e decreti, codici utente, riferimenti catastali, targhe) e gli importi in denaro.
Tre categorie arrivano spente, cioè gli orari, i periodi senza giorno e i riferimenti al genere: in gran parte dei testi coprirle produrrebbe più rumore che tutela. Nella versione completa si accendono dalle regolazioni, insieme a tutte le altre, perché la scelta di che cosa coprire dipende dal documento e non dal programma.
I dati particolari
I nove temi, e perché non vengono coperti d’ufficio
Sette temi sono le informazioni protette dagli articoli 9 e 10 del Regolamento (UE) 2016/679, il regolamento generale sulla protezione dei dati; gli altri due, la condizione economica e i dettagli che fanno riconoscere una persona nel suo contesto, il Regolamento non li nomina, e sono stati aggiunti perché nei documenti dei servizi pesano quanto gli altri. Per ciascuno si sceglie se ignorarlo, segnalarlo o coprirlo.
| Tema | Che cosa comprende | Norma |
|---|---|---|
| Salute | diagnosi, terapie, certificazioni, ricoveri, servizi sanitari | articolo 9 |
| Sostanze e dipendenze | consumi, dipendenze, servizi e percorsi di cura | articolo 9 |
| Vicende giudiziarie | procedimenti, provvedimenti, misure, tutela e affido | articolo 10 |
| Origine e cittadinanza | provenienza, cittadinanza, documenti di soggiorno, appartenenza | articolo 9 |
| Convinzioni religiose | fede dichiarata, pratiche, luoghi di culto | articolo 9 |
| Vita intima e identità | orientamento sessuale, identità di genere, vita affettiva | articolo 9 |
| Opinioni politiche e sindacali | adesioni, appartenenze, attività sindacale | articolo 9 |
| Condizione economica | ISEE, sostegni al reddito, morosità, sfratti, debiti | dato delicato |
| Dettagli che fanno riconoscere | la classe con la sezione, il mestiere legato al luogo, la composizione del nucleo, la scala del paese | riconoscibilità |
L’impostazione di partenza è segnalare e non coprire, e la ragione è la stessa per cui i nove temi esistono. Coprire d’ufficio il contenuto clinico produrrebbe pagine illeggibili, nelle quali si chiede a un’intelligenza artificiale di riordinare un testo che non dice più niente; lasciarlo passare senza dirlo, tuttavia, sarebbe peggio. Il programma lo porta davanti a chi scrive, e chi scrive decide.
I limiti
Che cosa il programma non fa
Un ausilio efficace non è una garanzia, e vale la pena dire dove si ferma.
Non sostituisce la revisione di chi scrive, e non promette una copertura totale: nel banco di prova, severo e con il glossario ancora vuoto, riconosce il 98,5 per cento dei dati. Al termine di ogni analisi il pannello «Da rileggere» mostra ciò che merita un ultimo sguardo, ed è un passaggio previsto dal metodo, non un ripiego.
Non legge il testo dentro le immagini. Un documento scansionato, cioè fotografato e non scritto al computer, per il programma è una figura e non un testo: va quindi trascritto o riconosciuto altrove prima di passare di qui.
Non decide che cosa sia opportuno mandare a un’intelligenza artificiale. Copre i dati identificativi e segnala il resto, ma la scelta di affidare un documento a un fornitore esterno resta una decisione professionale e organizzativa, che il programma rende più sicura e non prende al posto di nessuno.
Che cosa serve per farlo girare. Windows 10 o 11 a 64 bit; Mac con macOS 14 o più recente e processore Apple, cioè M1 o successivo, mentre i Mac con processore Intel restano esclusi. Servono un gigabyte e mezzo di spazio libero sul disco. I pacchetti pesano circa seicento megabyte, perché portano dentro il modello linguistico che permette al programma di lavorare senza rete.