OCR: quando non funziona e come ridurre gli errori di riconoscimento
Hai fatto l’OCR e il risultato è pieno di parole sbagliate: lettere scambiate, numeri diventati altro, righe spezzate. Prima di rifare tutto da capo conviene capire da dove arriva l’errore, perché nella maggior parte dei casi il problema non è il motore di riconoscimento ma il file che gli hai dato in pasto.
Prima verifica: il PDF ha del testo o è solo un’immagine?
Molti problemi nascono dal chiedere l’OCR a un documento che non ne ha bisogno, o dal non chiederlo a un documento che ne avrebbe bisogno. Il test è semplice: apri il PDF, prova a selezionare una riga con il mouse e cerca una parola che sai esserci.
- La selezione funziona e la ricerca trova la parola: il documento ha già un livello di testo. Rifare l’OCR non serve e peggiora le cose, perché il riconoscimento sostituisce il testo originale con una versione approssimata.
- Non si seleziona niente: è una scansione, l’OCR è la strada giusta.
Le cause più frequenti di errore
- Risoluzione bassa: sotto i 200 DPI le lettere hanno pochi pixel e il motore tira a indovinare. È il primo sospetto su una scansione fatta in modalità “risparmia inchiostro” o su un PDF costruito da foto ridotte.
- Pagina storta o capovolta: se il testo è inclinato, il motore non capisce dove finisce una riga e le parole si incollano.
- Contrasto scarso: scansioni grigie, con ombre sui bordi o con il fondo colorato confondono la lettura dei caratteri.
- Lingua sbagliata: con la lingua impostata male le parole vengono lette con lettere sostituite, e i termini tecnici si rovinano tutti insieme.
- Testo piccolo: note a piè di pagina, clausole in corpo minuscolo e tabelle fitte sono le zone dove gli errori si concentrano.
- Pieghe e macchie: una piega in mezzo alla riga diventa una lettera inventata.
Come migliorare il riconoscimento, passo per passo
- Guarda com’è fatto il file: numero di pagine, formato, quante pagine contengono testo estraibile. Un referto del documento ti dice se stai lavorando su una scansione pura o su un file misto.
- Raddrizza le pagine storte prima del riconoscimento con Ruota PDF: il motore legge una pagina per volta, e una pagina dritta vale più di dieci tentativi.
- Se la scansione è grigia o ha ombre e bordi scuri, converti le pagine in scala di grigi: il testo nero su fondo chiaro è la condizione in cui l’OCR lavora meglio. Vale per le scansioni; su un documento digitale non serve.
- Apri OCR PDF e indica le lingue presenti con i codici separati dal più: “ita” per l’italiano, “ita+eng” quando ci sono entrambe. Se il documento è in una sola lingua, indicarne una sola di solito dà un risultato più preciso.
- Avvia e aspetta: il motore fotografa le pagine a 300 DPI e riconosce il testo una per una, quindi calcola qualche secondo per pagina. Su un documento lungo conviene lasciare la scheda aperta.
- Verifica subito: cerca una parola che sai esserci, meglio se un nome proprio o un numero di protocollo. Se la trova, il riconoscimento ha funzionato.
Quello che l’OCR non risolve
Ci sono limiti che nessuna impostazione corregge. La scrittura a mano è il primo: testo corsivo e firme non vengono riconosciuti in modo affidabile. Timbri e testi su fondo colorato confondono il motore. Le tabelle vengono lette come righe di testo, quindi i numeri finiscono in colonne sbagliate: sul risultato di un modulo o di un estratto conto il controllo a occhio non è opzionale. Anche i caratteri molto piccoli e le lingue poco diffuse restano difficili.
Controllare il risultato prima di fidarsi
Il PDF che scarichi si vede esattamente come prima, ma sotto le immagini c’è il testo riconosciuto: cercabile e copiabile. Il modo più veloce per controllarlo è estrarre il testo con PDF in Testo e leggere il risultato in un file .txt: gli errori si vedono tutti insieme, molto meglio che pagina per pagina. Sui documenti che contano — atti, referti, contratti — il testo riconosciuto è una comodità per la ricerca, non una copia ufficiale: quello che serve per un uso formale resta l’originale.
Domande frequenti
Perché il mio OCR sbaglia le lettere “l” e il numero “1”?
Perché in molti caratteri sono quasi identici e a bassa risoluzione diventano lo stesso disegno. Su codici, importi e codici fiscali la verifica manuale è necessaria: è il tipo di errore che il motore non può evitare con certezza.
Il riconoscimento migliora se indico due lingue?
Indica tutte le lingue presenti, altrimenti le parti nell’altra lingua si rovinano. Tieni però presente che più lingue insieme rendono il riconoscimento un po’ meno preciso: se il documento è in una sola lingua, indicane una.
L’OCR funziona su un documento scritto a mano?
In modo inaffidabile. Su testo stampato e scansioni nitide va molto bene; sulla calligrafia sbaglia spesso: sui documenti manoscritti conviene trascrivere a mano quello che serve.
Il mio documento viene conservato?
No. Il PDF viene elaborato sul nostro server e la cartella di lavoro viene cancellata subito dopo il download. Non conserviamo copie e il riconoscimento avviene tutto qui, senza inviare il file a servizi esterni.
Rendi cercabile la tua scansione
Apri OCR PDF, indica le lingue e avvia: se il risultato ha errori, quasi sempre basta raddrizzare le pagine e ripetere. Per un controllo rapido estrai il testo e rileggilo in un file .txt.
PDF