Da dispensa scansionata a testo ricercabile: come fare l’OCR

Hai una dispensa fotocopiata, un estratto di libro o un modulo che ti è arrivato come scansione. È un PDF, ma dentro c’è solo l’immagine della pagina: non riesci a cercare una parola e non riesci nemmeno a copiare una riga. Qui sotto trovi la strada per trasformarlo in un documento ricercabile, nell’ordine giusto.

Cosa serve

  • Il file della dispensa in PDF, JPG o PNG: fino a 512 MB per file e fino a 20 file nella stessa lavorazione.
  • Due minuti per capire se il PDF contiene già del testo: basta provare a selezionare una parola con il mouse.
  • Le pagine dritte e ripulite: bordo nero, dita e bordo della scrivania vanno tolti prima, non dopo.
  • Se parti da fotografie, le immagini in ordine, numerate come le pagine della dispensa.
  • Un nome chiaro da dare al file finale, per esempio dispensa-statistica-ricercabile.
  • Un’idea delle parole che cercherai dopo, così puoi verificare subito se il riconoscimento ha funzionato.
  • La pazienza di rileggere a campione due o tre pagine: il riconoscimento del testo non è perfetto.
  • Un posto dove conservare l’originale non toccato, come copia di sicurezza.

Come si fa, passo per passo

  1. Capire se il PDF è già testo o è solo un’immagine Apri la dispensa e prova a selezionare una parola con il mouse: se la selezione si ferma su quella parola, il testo c’è già e l’OCR non serve. Se invece si evidenzia tutta la pagina come una fotografia, o non si evidenzia niente, dentro c’è solo l’immagine. Un secondo controllo lo fai con Referto PDF, che ti dice com’è fatto il documento: se è tutto immagine, non c’è nessun testo da cercare.
  2. Raddrizza le pagine e togli quello che avanza Una scansione inclinata di pochi gradi manda in crisi il riconoscimento. Se il file è ruotato, sistema tutte le pagine in una volta con Ruota PDF. Poi taglia i bordi neri, le dita e il pezzo di scrivania che sono finiti nell’inquadratura con Ritaglia PDF. Più la pagina è dritta e pulita, meglio lavora l’OCR.
  3. Se parti da fotografie, mettile in un PDF unico Se hai fotografato le pagine con il telefono, prima mettile in ordine dentro un solo PDF con Scansione in PDF. Un file unico è più comodo da controllare e ti evita di ripetere venti volte la stessa lavorazione su venti immagini sciolte.
  4. Fai il riconoscimento del testo Adesso usa OCR PDF: lo strumento aggiunge uno strato di testo sotto la scansione, così le parole diventano cercabili. Funziona bene su scansioni dritte, nitide e con testo stampato. Sbaglia invece su scrittura a mano, foto storte, ombre, testo molto piccolo o sfondo colorato.
  5. Controlla che il riconoscimento sia andato bene Non fidarti del primo risultato: apri il PDF e cerca due o tre parole che conosci, poi leggi un passaggio pieno di numeri o di nomi propri, che è la parte dove il riconoscimento sbaglia più spesso. Se una pagina è venuta male, quasi sempre dipende da com’era la scansione: rifalla dritta, con più luce e con il foglio ben centrato, e ripeti la lavorazione solo su quella.
  6. Estrai il testo quando ti serve Se ti serve il testo da incollare nei tuoi appunti, usa PDF in Testo e prendi la parte che ti interessa. Il file estratto è anche il modo più rapido per capire se lo strato di testo esiste davvero: se l’estrazione esce vuota, o piena di simboli senza senso, il riconoscimento non ha funzionato.
  7. Cerca dentro il documento Con lo strato di testo al suo posto, cerchi una parola e la trovi in tutte le pagine in un secondo. Puoi anche appoggiarti a Chiedi al PDF, che cerca le parole dentro il testo e ti mostra i passaggi che le contengono. Tienilo a mente per non farti illusioni: non ragiona e non capisce il documento, quindi su un file che non ha lo strato di testo non trova niente.
  8. Conserva il PDF ricercabile senza buttare l’originale Rinomina il file con un nome che si capisce e tienilo come documento di lavoro, mentre l’originale non toccato lo archivi a parte. Se il file diventa pesante da allegare, puoi alleggerirlo, ma senza esagerare: comprimere troppo una scansione peggiora la nitidezza del testo. Ricorda come funziona il sito: i file vengono caricati sul nostro server per essere lavorati e la cartella di lavoro viene cancellata subito dopo il download del risultato.

Gli strumenti usati in questa guida

Gli errori che si fanno più spesso

Quasi tutti i risultati deludenti non dipendono dall’OCR, ma da come è arrivata la pagina.

  • Fare il riconoscimento su pagine storte, con l’ombra della mano o con il foglio piegato: il risultato peggiora molto e sembra colpa dello strumento.
  • Caricare la versione sbagliata del file, magari la copia a bassa qualità scaricata da una chat.
  • Dare per buono il risultato senza rileggere: numeri, nomi e formule sono la parte che sbaglia più spesso.
  • Cancellare l’originale dopo il riconoscimento: se il lavoro è venuto male, ripartire dall’originale è l’unica strada.
  • Aspettarsi che funzioni sugli appunti scritti a mano: non è quello il suo campo.

Che cosa aspettarsi, onestamente

L’OCR non fa miracoli e non promette un riconoscimento perfetto: su una buona scansione stampata il risultato è buono, su una foto mossa è inutilizzabile. Lo strato di testo sta sotto la scansione, quindi quello che vedi a schermo resta la tua immagine originale; il testo si nota solo quando selezioni, cerchi o estrai.

Il sito è gratis, non serve registrarsi e non c’è nessuna quota d’uso: se una pagina è venuta male puoi rifare la lavorazione quante volte vuoi, con file fino a 512 MB e fino a 20 file per volta.

Domande frequenti

L’OCR riconosce anche la scrittura a mano?

No, non in modo affidabile: funziona su testo stampato. Su appunti scritti a mano il risultato è quasi sempre inutilizzabile, e conviene trascriverli a mano invece di contarci.

Perché dopo l’OCR non trovo ancora niente con la ricerca?

Le cause più comuni sono due: le pagine erano storte o troppo piccole, oppure stai cercando in un file diverso da quello che hai lavorato. Prova a estrarre il testo: se esce vuoto, lo strato di testo non c’è stato.

Il testo riconosciuto si vede sopra la scansione?

No. Lo strato di testo sta sotto l’immagine, quindi a schermo continui a vedere la scansione originale. Il testo si accorge di esistere solo quando selezioni una parola, la cerchi o lo estrai.

Quanti file posso caricare e quanto possono pesare?

Fino a 512 MB per file e fino a 20 file nella stessa lavorazione, senza quota e senza registrazione. I file vengono caricati sul nostro server per essere lavorati e la cartella di lavoro viene cancellata subito dopo il download.

Chiedi al PDF può spiegarmi che cosa dice la dispensa?

No: cerca le parole dentro il testo e ti mostra i passaggi che le contengono. Non ragiona sul contenuto e non risponde a domande che richiedono di capire il documento; su un file senza strato di testo non trova niente.

Una dispensa ricercabile cambia il modo in cui studi: cerchi, copi e citi invece di sfogliare pagina per pagina. Perdici dieci minuti in più prima di fare il riconoscimento e il risultato sarà molto più utile.

Altri tutorial che possono servire

Se la tua domanda non è qui, puoi scriverla nella sezione Domande della community: le leggiamo e rispondiamo a mano.

← Tutti i tutorial