OCR: come rendere ricercabile un PDF scansionato
Hai un PDF che non si può selezionare: clicchi sul testo e non succede niente, la ricerca non trova nulla, il copia e incolla restituisce righe vuote. Non è un file rotto: è una scansione, cioè una fotografia di pagine di carta. Per trasformarla in un documento utile serve l’OCR, e il risultato cambia tutto: se cerchi una parola la trovi, se selezioni un paragrafo lo copi.
Che cos’è l’OCR e perché il tuo PDF non si può cercare
OCR significa riconoscimento ottico dei caratteri. Il software analizza l’immagine, individua le righe di testo, riconosce ogni lettera confrontandola con i modelli del carattere usato e produce una versione testuale di ciò che vede. I motori più diffusi, come Tesseract, sono open source e lavorano bene su scansioni pulite.
Il risultato tipico è il PDF ricercabile: l’immagine originale resta al suo posto e sotto di essa viene inserito un livello di testo invisibile, posizionato parola per parola. Tu vedi la pagina di sempre, ma il computer può leggerla. È il formato giusto quando devi archiviare, non riscrivere.
Cinque regole per un OCR preciso
La qualità dell’OCR dipende più dalla scansione che dal software. Prima di riconoscere, sistema queste cose:
- Risoluzione 300 dpi: sotto i 200 dpi il riconoscimento peggiora molto, sopra i 600 non migliora quasi nulla e il file diventa pesantissimo.
- Pagina dritta: un documento ruotato di pochi gradi confonde il motore, che non capisce dove finisce una riga.
- Contrasto alto: testo nero su fondo bianco. Una scansione grigia o con ombre ai bordi produce errori a raffica.
- Lingua corretta: se il documento è in italiano, indica italiano. Con la lingua sbagliata le parole vengono lette con lettere sostituite.
- Pagine senza pieghe e ditate: una piega in mezzo alla riga diventa una lettera inventata.
Se la scansione è proprio brutta, l’OCR non è magia: serve rifare la scansione, oppure accettare un risultato approssimativo da correggere a mano.
Come farlo su raiai.cloud
- Apri lo strumento OCR PDF.
- Carica la scansione e seleziona le lingue presenti nel documento: per un testo italiano con termini tecnici in inglese, indica entrambe.
- Avvia il riconoscimento: ottieni un PDF con il livello di testo sovrapposto all’immagine.
- Verifica subito il risultato cercando una parola che sai essere presente, per esempio il tuo cognome o un numero di protocollo.
Il controllo al punto quattro è il passaggio che quasi tutti saltano. Cercare due o tre parole chiave richiede dieci secondi e ti dice se il documento è utilizzabile o se va rifatto.
Riconoscere non basta: dal PDF ricercabile al contenuto modificabile
Il PDF ricercabile è perfetto per l’archivio, ma se devi lavorare sul testo ti serve altro. Due strade utili:
- PDF in Word: ricostruisce un documento modificabile, con paragrafi, elenchi e tabelle. È la scelta giusta per riprendere un contratto e aggiornarlo.
- PDF in testo: estrae solo il testo, senza formattazione. Ideale per incollarlo in un foglio di calcolo, in un gestionale o in un sistema di ricerca.
Attenzione a due limiti reali dell’OCR. Il primo: tabelle e moduli compilati sono difficili, perché il motore legge righe e non celle: controlla sempre l’allineamento dei numeri. Il secondo: le lettere che si somigliano vengono confuse, per esempio la elle minuscola e il numero uno, oppure la esse e il cinque. Sui dati che contano, come importi e codici fiscali, la verifica a occhio non è opzionale.
Domande frequenti
L’OCR funziona anche sulle fotografie di documenti?
Sì, se la foto è dritta, ben illuminata e senza ombre. Una foto scattata al buio o in diagonale produce molti più errori di una scansione: prima di riconoscere, raddrizza e schiarisci l’immagine.
Il file diventa più pesante dopo l’OCR?
Un po’, perché al PDF si aggiunge il livello di testo. L’aumento è in genere modesto, qualche punto percentuale. Se il file resta troppo grande, comprimi il PDF dopo il riconoscimento: il livello di testo, essendo leggero, non si perde.
Posso rendere ricercabile un PDF che ha già del testo?
Se il PDF ha già un livello di testo, non serve l’OCR: usa direttamente l’estrazione del testo. L’OCR serve solo quando il documento è un’immagine, cioè quando la selezione e la ricerca non funzionano.
Trasforma la tua scansione in un documento vero
Apri OCR PDF, carica la scansione e scegli la lingua: in pochi minuti il documento diventa cercabile, selezionabile e pronto per l’archivio. Se poi devi riscriverlo, passa il risultato a PDF in Word o a PDF in testo e prosegui da lì.
PDF