Salta al contenuto
ilLasciapassare anonimizzatore di documenti

Come funziona

Come il programma riconosce i dati

Il riconoscimento lavora su quattro livelli, che si fondono in modo che il più affidabile vinca quando due indicano lo stesso pezzo di testo. Accanto ne corre un quinto, che non sostituisce nulla e ha un trattamento suo.

I quattro livelli

Dal modello alle parole che si insegnano

1

Il modello linguistico locale

Addestrato sull’italiano e distribuito dentro il pacchetto, non chiamato in rete. Copre le categorie generiche, ventidue in tutto, dai nomi di persona ai codici fiscali, e riconosce anche ciò che non ha una forma fissa, come i nomi propri che non compaiono in nessun elenco.

2

Le regole per le forme italiane

Quello che i modelli sbagliano o spezzano: gli indirizzi con via, corso e piazza, le date per esteso e numeriche, i numeri di fascicolo e di protocollo, l’età, gli orari, le iniziali puntate. Codice fiscale, partita IVA, IBAN e carte passano un controllo matematico, quindi o sono validi o non vengono scambiati per tali.

3

Il glossario del servizio

I termini che si insegnano al programma, e che da quel momento vengono coperti sempre: i nomi delle comunità, dei centri diurni, delle scuole e dei servizi del territorio in cui si lavora. Vince su tutto il resto, perché è la conoscenza che nessun elenco generale contiene.

4

Le esclusioni

I termini dichiarati non personali, che non vengono coperti mai. Servono a togliere il rumore, cioè le parole che il riconoscimento scambierebbe per nomi e che invece appartengono al lessico del mestiere.

5

I dati particolari, che corrono a parte

Nove temi, descritti qui sotto, riconosciuti per parole e per contesto. Non sostituiscono i quattro livelli e hanno un trattamento proprio, perché in una relazione il contenuto clinico è spesso il senso stesso del testo, e decidere che cosa può uscire spetta a chi la firma.

Che cosa copre

Le venticinque categorie che il programma distingue

La versione completa le copre tutte; la versione libera copre i nomi delle persone e le date, e le altre le riconosce e le dichiara senza coprirle. Sono le persone (nomi, iniziali, età, riferimenti al genere), il tempo (date, periodi senza giorno, orari), i luoghi (città, indirizzi, numeri civici, codici di avviamento postale, province), i recapiti (posta elettronica, telefono), gli enti e le organizzazioni, i codici che identificano una persona (codice fiscale, partita IVA, IBAN, carte, documenti d’identità), i riferimenti delle pratiche (fascicoli, protocolli e decreti, codici utente, riferimenti catastali, targhe) e gli importi in denaro.

Tre categorie arrivano spente, cioè gli orari, i periodi senza giorno e i riferimenti al genere: in gran parte dei testi coprirle produrrebbe più rumore che tutela. Nella versione completa si accendono dalle regolazioni, insieme a tutte le altre, perché la scelta di che cosa coprire dipende dal documento e non dal programma.

I dati particolari

I nove temi, e perché non vengono coperti d’ufficio

Sette temi sono le informazioni protette dagli articoli 9 e 10 del Regolamento (UE) 2016/679, il regolamento generale sulla protezione dei dati; gli altri due, la condizione economica e i dettagli che fanno riconoscere una persona nel suo contesto, il Regolamento non li nomina, e sono stati aggiunti perché nei documenti dei servizi pesano quanto gli altri. Per ciascuno si sceglie se ignorarlo, segnalarlo o coprirlo.

Tema Che cosa comprende Norma
Salute diagnosi, terapie, certificazioni, ricoveri, servizi sanitari articolo 9
Sostanze e dipendenze consumi, dipendenze, servizi e percorsi di cura articolo 9
Vicende giudiziarie procedimenti, provvedimenti, misure, tutela e affido articolo 10
Origine e cittadinanza provenienza, cittadinanza, documenti di soggiorno, appartenenza articolo 9
Convinzioni religiose fede dichiarata, pratiche, luoghi di culto articolo 9
Vita intima e identità orientamento sessuale, identità di genere, vita affettiva articolo 9
Opinioni politiche e sindacali adesioni, appartenenze, attività sindacale articolo 9
Condizione economica ISEE, sostegni al reddito, morosità, sfratti, debiti dato delicato
Dettagli che fanno riconoscere la classe con la sezione, il mestiere legato al luogo, la composizione del nucleo, la scala del paese riconoscibilità

L’impostazione di partenza è segnalare e non coprire, e la ragione è la stessa per cui i nove temi esistono. Coprire d’ufficio il contenuto clinico produrrebbe pagine illeggibili, nelle quali si chiede a un’intelligenza artificiale di riordinare un testo che non dice più niente; lasciarlo passare senza dirlo, tuttavia, sarebbe peggio. Il programma lo porta davanti a chi scrive, e chi scrive decide.

I limiti

Che cosa il programma non fa

Un ausilio efficace non è una garanzia, e vale la pena dire dove si ferma.

Non sostituisce la revisione di chi scrive, e non promette una copertura totale: nel banco di prova, severo e con il glossario ancora vuoto, riconosce il 98,5 per cento dei dati. Al termine di ogni analisi il pannello «Da rileggere» mostra ciò che merita un ultimo sguardo, ed è un passaggio previsto dal metodo, non un ripiego.

Non legge il testo dentro le immagini. Un documento scansionato, cioè fotografato e non scritto al computer, per il programma è una figura e non un testo: va quindi trascritto o riconosciuto altrove prima di passare di qui.

Non decide che cosa sia opportuno mandare a un’intelligenza artificiale. Copre i dati identificativi e segnala il resto, ma la scelta di affidare un documento a un fornitore esterno resta una decisione professionale e organizzativa, che il programma rende più sicura e non prende al posto di nessuno.

Che cosa serve per farlo girare. Windows 10 o 11 a 64 bit; Mac con macOS 14 o più recente e processore Apple, cioè M1 o successivo, mentre i Mac con processore Intel restano esclusi. Servono un gigabyte e mezzo di spazio libero sul disco. I pacchetti pesano circa seicento megabyte, perché portano dentro il modello linguistico che permette al programma di lavorare senza rete.