Estrai il testo da un PDF

Carica un PDF e recupera tutto il testo, pronto da copiare o da scaricare in un file .txt. Tutto avviene nel tuo browser, senza caricare nulla online.

📄 Tocca qui o trascina un PDF

Un file PDF

⬇️ Scarica .txt

🔒 Privacy totale: il PDF viene letto sul tuo dispositivo, senza caricarlo online.

Come funziona

Lo strumento legge il livello di testo del PDF e lo ricompone pagina per pagina. Funziona con i PDF «veri» (creati da Word, Google Docs, export digitali). Se invece il PDF è una scansione o una foto, il testo è in realtà un'immagine e non può essere estratto in questo modo: in quel caso serve un OCR (riconoscimento ottico dei caratteri).

A cosa serve

Utile per copiare rapidamente il contenuto di un documento, riutilizzare paragrafi, cercare parole, o convertire un PDF in un semplice file di testo modificabile. Se i PDF sono tanti e cerchi in quale c'è una parola, c'è Cerca una parola in tanti PDF.

Perché il copia-incolla da un PDF viene male

Un PDF non contiene paragrafi, contiene pezzi di testo con delle coordinate: il programma che l'ha scritto ha detto «metti questa parola qui». Non c'è nessuna informazione su dove finisce una riga e comincia la successiva, e il lettore deve dedurla dalle posizioni.

È il motivo per cui incollando si ottengono righe spezzate, colonne mescolate e parole tagliate dal trattino di fine riga. Con un testo a due colonne l'ordine di lettura può risultare mescolato, perché sulla pagina i due blocchi convivono e nel file sono solo pezzi con delle x e delle y.

Se il PDF è una scansione, testo non ce n'è

Un documento scansionato è una fotografia della pagina: sotto non c'è nessun testo, e infatti la ricerca del lettore non trova niente. Il segnale è semplice: se provando a selezionare una parola si seleziona un rettangolo intero, è un'immagine.

In quel caso serve il riconoscimento ottico dei caratteri, che è un mestiere diverso: guarda i pixel e prova a indovinare le lettere. Molte scansioni recenti hanno già uno strato di testo nascosto sotto l'immagine, e allora il testo si estrae normalmente.

Che cosa fare del testo estratto

Il testo che esce va quasi sempre ricucito: unire le righe dello stesso paragrafo, togliere i trattini di sillabazione, buttare le intestazioni e i numeri di pagina che si ripetono. Farlo a mano su venti pagine è un pomeriggio, e nessuno lo fa fino in fondo.

Se il PDF conteneva delle tabelle, il testo estratto le perde: le colonne diventano una sequenza di parole e il rapporto fra le celle sparisce. Per quelle serve uno strumento che guardi le coordinate invece del solo testo, altrimenti il risultato è illeggibile.

Strumenti vicini

Per rimettere in ordine il testo copiato c'è Ricuci il testo copiato da un PDF, e per le tabelle Estrai le tabelle da un PDF. Se il file è una scansione, la strada è Immagine in testo.