Sacar el texto de un archivo de Word
Extrae el texto de un .docx gratis, como texto plano o como Markdown conservando los títulos. Sin licencia de Word, sin cuenta y sin subir tu documento.
Arrastra archivos aquí (hasta 20)
o pega desde el portapapeles
Cómo funciona
Un .docx es un archivo ZIP, así que se lee su directorio central para localizar word/document.xml y solo ese miembro se descomprime con la implementación de deflate del propio navegador; no interviene ninguna biblioteca. Después se recorre el XML buscando los cuatro elementos que llevan contenido visible: w:p para los párrafos, w:t para los fragmentos de texto, y w:tab y w:br para los espacios en blanco que Word guarda como elementos en lugar de como caracteres. Los títulos salen del nombre del pStyle, que es el único sitio donde queda registrado el nivel.
Qué tener en cuenta
Cualquier cosa guardada antes de 2007, o guardada deliberadamente como .doc desde entonces, es un archivo binario compuesto y no un ZIP de XML. No hay nada que descomprimir ni XML que analizar. Abrirlo en Word o LibreOffice y guardarlo como .docx es la única vía, y la herramienta lo dice en vez de informar de un archivo dañado.
Una tabla se registra como filas de celdas que contienen párrafos, y cada uno de esos párrafos se convierte aquí en su propia línea. Las palabras están todas y en orden; la cuadrícula no. La sintaxis de tablas de Markdown necesitaría que el número de columnas fuera constante en todas las filas, cosa que los documentos reales rara vez cumplen.
Viven en partes separadas del archivo comprimido —los archivos de medios, footnotes.xml, comments.xml— y ninguna de ellas se lee. Lo que obtienes es el texto del cuerpo del documento tal y como aparece en el flujo principal, que es lo que la gente quiere al pedir el texto y merece decirse claramente cuando no lo es.
Límites
Los archivos de hasta unos 50 MB funcionan sin problemas. A partir de ahí el techo es la memoria de tu dispositivo, no una regla que impongamos nosotros: el trabajo ocurre en tu propia máquina. Probado en Chrome 140, Firefox 143, Safari 18.
Por qué esto no necesita nada instalado
Un archivo de Word moderno parece un formato cerrado y no lo es. Cambia la
extensión de un .docx por .zip, ábrelo y verás una carpeta con archivos XML
dentro. Todo el texto del documento está en uno de ellos, word/document.xml, en
texto legible antes de comprimirse.
Los navegadores llevan años incorporando descompresión deflate, así que abrir el archivo y leer ese XML es algo que la página puede hacer directamente, sin descargar ninguna biblioteca y sin enviar nada a ningún sitio.
Texto plano o Markdown
El texto plano da las palabras y los saltos de línea. Es lo que quieres para pegar en un campo de formulario, contar palabras o procesar el contenido con otra herramienta.
Markdown conserva la estructura que el documento sí registra de verdad: los títulos con su nivel y las listas con viñetas. Si el documento se escribió usando los estilos de Word en lugar de poniendo negritas a mano, el Markdown que sale es sorprendentemente fiel y sirve directamente para publicar.
Ese matiz importa: el nivel de un título vive en el nombre del estilo, no en el tamaño de la letra. Un texto que alguien puso en cuerpo 18 y negrita no es un título para el archivo, y aquí saldrá como párrafo normal.
Frente a extraer texto de un PDF
Merece la pena comparar, porque el resultado es muy distinto.
Un .docx guarda estructura real: esto es un párrafo, esto es un título de nivel dos. Un PDF guarda glifos en coordenadas, y recuperar el texto significa adivinar la estructura a partir de posiciones.
Por eso lo que sale de aquí conserva su forma y lo que sale de un PDF llega aplanado. Si tienes el .docx original, siempre es la mejor fuente.
Tus archivos nunca salen de tu navegador. Última actualización: 2026-08-02.
Herramientas relacionadas
- Extraer el texto de un PDFSaca las palabras de un PDF como texto plano, gratis y al instante. Honesto sobre por qué esto no es un documento de Word y qué no puede dar un escaneo.
- Convertir imágenes en un PDFCombina fotos JPG en un único PDF gratis, sin límite de páginas ni marca de agua. Los JPEG de línea base se incrustan byte a byte y no se pierde calidad.
- Unir archivos PDFCombina varios PDF en uno solo gratis: sin límite de páginas, sin marca de agua y sin registro. El texto sigue siendo seleccionable y no se sube nada.