Extraer el texto de un PDF
Saca las palabras de un PDF como texto plano, gratis y al instante. Honesto sobre por qué esto no es un documento de Word y qué no puede dar un escaneo.
Arrastra un archivo aquí
o pega desde el portapapeles
Cómo funciona
pdfjs-dist, el motor que Firefox usa para mostrar PDF, devuelve los fragmentos de texto de cada página junto con la posición y la matriz de transformación de cada uno. La herramienta ordena esos fragmentos por su posición vertical y luego horizontal, y reconstruye las líneas a partir de los saltos entre coordenadas. Ese trabajo de ordenación es necesario porque un PDF no guarda párrafos ni siquiera líneas: guarda glifos colocados en un plano, y el orden en que están escritos dentro del archivo no tiene por qué ser el orden de lectura.
Qué tener en cuenta
Si el documento es una fotografía de papel, dentro no hay palabras que extraer, solo píxeles. La herramienta lo detecta y te lo dice en lugar de devolver un archivo vacío. Lo que hace falta ahí es OCR, que es otro problema y no está aquí.
La reconstrucción se basa en coordenadas, y un texto a dos columnas tiene fragmentos de ambas a la misma altura. El resultado mezcla las columnas línea a línea. Las tablas pierden su estructura por el mismo motivo: las celdas eran posiciones, no filas.
Muchas maquetaciones parten palabras al final de la línea y usan glifos ligados para «fi» o «fl». Salen tal cual, porque deshacerlos requeriría un diccionario del idioma y adivinar cuál es acabaría estropeando texto correcto.
Límites
Los archivos de hasta unos 100 MB funcionan sin problemas. A partir de ahí el techo es la memoria de tu dispositivo, no una regla que impongamos nosotros: el trabajo ocurre en tu propia máquina. Probado en Chrome 140, Firefox 143, Safari 18.
Por qué un PDF es difícil de leer
Merece la pena entenderlo, porque explica todas las limitaciones de esta página y las de cualquier otra herramienta que haga lo mismo.
Un procesador de textos guarda estructura: esto es un párrafo, esto es un título, esto es un elemento de lista. Un PDF guarda otra cosa completamente distinta: coloca este glifo de esta tipografía en esta coordenada, y luego este otro tres milímetros a la derecha. Es una descripción de una página impresa, no de un texto.
Recuperar el texto significa, por tanto, deshacer la maquetación por ingeniería inversa: agrupar glifos que están a la misma altura, decidir que un hueco horizontal grande es un espacio y no una separación de columna, decidir que un salto vertical es un párrafo nuevo y no solo interlineado.
Se hace bien la mayoría de las veces y se hace mal exactamente donde uno esperaría.
Marcar los saltos de página
El separador entre páginas es útil cuando el destino es un archivo de referencia y quieres poder volver a la hoja original. Estorba cuando el destino es un texto para leer o para procesar, donde interrumpe párrafos por la mitad.
Qué hacer con documentos escaneados
Si la herramienta te dice que no hay capa de texto, no es un fallo del archivo ni de la herramienta: el documento es un conjunto de imágenes. La única vía es el reconocimiento óptico de caracteres, que es un problema distinto y considerablemente más pesado. Muchos escáneres modernos pueden hacerlo al escanear si se les activa la opción, y esa suele ser la mejor manera de resolverlo de raíz.
Tus archivos nunca salen de tu navegador. Última actualización: 2026-08-02.
Siguiente paso
Tu archivo ya está aquí, en este navegador, así que la siguiente herramienta empieza con él cargado.
Herramientas relacionadas
- Convertir las páginas de un PDF a JPGConvierte cada página de un PDF en una imagen JPG gratis, sin límite de páginas. Elige la resolución, indica un rango y descárgalo todo en un zip.
- Unir archivos PDFCombina varios PDF en uno solo gratis: sin límite de páginas, sin marca de agua y sin registro. El texto sigue siendo seleccionable y no se sube nada.