Extraer el texto de un PDF

Sube un PDF y obtén todo su texto, listo para copiar o descargar como archivo .txt. Todo ocurre en tu navegador, no se sube nada.

📄 Toca aquí o suelta un PDF

Un archivo PDF

⬇️ Descargar .txt

🔒 Totalmente privado: el PDF se lee en tu dispositivo, no se sube nunca.

Cómo funciona

La herramienta lee la capa de texto del PDF y la reconstruye página a página. Funciona con PDF «de verdad» (creados desde Word, Google Docs, exportaciones digitales). Si el PDF es un escaneo o una foto, el texto es en realidad una imagen y no se puede extraer así: en ese caso hace falta OCR (reconocimiento óptico de caracteres).

Para qué sirve

Útil para copiar rápidamente el contenido de un documento, reutilizar párrafos, buscar palabras o convertir un PDF en un simple archivo de texto editable. Si los PDF son muchos y buscas en cuál está una palabra, está Busca una palabra en muchos PDF.

Por qué copiar y pegar de un PDF sale mal

Un PDF no contiene párrafos, contiene trozos de texto con coordenadas: el programa que lo escribió dijo «pon esta palabra aquí». No hay ninguna información sobre dónde acaba una línea y empieza la siguiente, y el lector tiene que deducirlo de las posiciones.

Por eso al pegar salen líneas partidas, columnas mezcladas y palabras cortadas por el guion de final de línea. Con un texto a dos columnas el orden de lectura puede salir revuelto, porque en la página los dos bloques conviven y en el archivo son solo trozos con unas x y unas y.

Si el PDF es un escaneo, no hay texto

Un documento escaneado es una fotografía de la página: debajo no hay ningún texto, y por eso la búsqueda del lector no encuentra nada. La señal es sencilla: si al intentar seleccionar una palabra se selecciona un rectángulo entero, es una imagen.

En ese caso hace falta el reconocimiento óptico de caracteres, que es un oficio distinto: mira los píxeles e intenta adivinar las letras. Muchos escaneos recientes ya llevan una capa de texto oculta bajo la imagen, y entonces el texto se extrae con normalidad.

Qué hacer con el texto extraído

El texto que sale casi siempre hay que recoserlo: unir las líneas de un mismo párrafo, quitar los guiones de partición, tirar los encabezados y los números de página que se repiten. Hacerlo a mano en veinte páginas es una tarde, y nadie lo termina.

Si el PDF contenía tablas, el texto extraído las pierde: las columnas se convierten en una ristra de palabras y la relación entre las celdas desaparece. Para esas hace falta una herramienta que mire las coordenadas y no solo el texto, si no el resultado es ilegible.

Herramientas cercanas

Para ordenar el texto copiado está Recose el texto copiado de un PDF, y para las tablas Extrae las tablas de un PDF. Si el archivo es un escaneo, el camino es Imagen a texto.