PDF Techno

Convertir PDF a Markdown

Convierta cualquier PDF en Markdown limpio y estructurado: se conservan títulos, tablas, listas y enlaces.

Tablas y títulos conservados
Conversión por lotes
Seguro y privado

Suelte los archivos PDF aquí

Suelte para añadir archivos

Un analizador de PDF, no un volcado de texto

La mayoría de las herramientas «PDF a texto» devuelven un muro de líneas en el orden en que el archivo las guardó por casualidad. Esta reconstruye el documento: qué líneas eran un título, qué bloque era una tabla, qué columna va primero y dónde un salto de página partió un párrafo por la mitad.

Extracción de texto plano

Resultados trimestrales
Los ingresos crecieron un 18 %
interanual. La tabla siguiente
Región T3 T4
EMEA 4,1 4,8
APAC 2,7 3,9
desglosa el rendimiento por
región.

Este conversor

## Resultados trimestrales

Los ingresos crecieron un 18 %
interanual. La tabla siguiente
desglosa el rendimiento por región.

| Región | T3  | T4  |
|--------|-----|-----|
| EMEA   | 4,1 | 4,8 |
| APAC   | 2,7 | 3,9 |

El mismo PDF. La diferencia es la estructura: un nivel de título, una tabla real y un párrafo recompuesto alrededor del bloque que lo interrumpía.

Lo que sobrevive a la conversión

La estructura se deduce de la geometría del diseño, no se adivina por la puntuación.

Títulos y listas

Los niveles de título se obtienen del tamaño y el grosor relativos de la fuente, de modo que un H2 sigue siendo un H2 en lugar de convertirse en otro párrafo. Las listas ordenadas y sin ordenar mantienen su anidamiento, y las secuencias en negrita, cursiva y monoespaciada pasan como énfasis y código en línea de Markdown.

Tablas, con líneas o sin ellas

Las tablas con bordes se detectan por sus líneas. Las que no los tienen —en realidad, simples columnas de texto alineadas— se localizan agrupando las posiciones de las celdas, que es justo donde la mayoría de los conversores se rinden y emiten un revoltijo de fragmentos separados por tabuladores.

Orden de lectura a varias columnas

Una página a dos columnas guarda su texto en un único flujo que zigzaguea entre columnas. Leído de forma ingenua, una de cada dos líneas viene del sitio equivocado. Los límites de columna se detectan primero, así que cada columna se lee de arriba abajo antes de empezar la siguiente.

Enlaces y reparación de saltos de página

Las anotaciones de hipervínculo se convierten en enlaces reales de Markdown en lugar de aplanarse en texto suelto. Los párrafos partidos por un límite de página —con un encabezado, un pie y un número de página encajados en medio— se vuelven a unir en un solo párrafo.

Conversión por lotes

Envíe una carpeta entera de PDF como un único trabajo y reciba un ZIP con cada archivo .md más un manifiesto CONVERSION_REPORT.md que registra qué ocurrió con cada uno. Disponible en planes con la conversión por lotes habilitada.

Privado por defecto

Los archivos se suben por TLS, se procesan y se eliminan automáticamente cuando vence el periodo de conservación de su plan. Las vistas previas se generan localmente en su navegador, así que un PDF que decida no convertir nunca sale de su equipo.

Las cuatro cosas que rompen los conversores de PDF

Un PDF guarda glifos en coordenadas. No guarda párrafos, tablas ni orden de lectura: todo eso hay que inferirlo. Esto es lo que esa inferencia tiene que superar.

Diseños a dos columnas

El problema

Los artículos académicos, los boletines y las memorias anuales disponen el texto en columnas, pero el flujo de contenido subyacente suele recorrer la página de lado a lado. Si se extrae en el orden guardado, se obtiene la línea uno de la columna A, luego la línea uno de la columna B, luego la línea dos de la columna A: un enredo intercalado que se lee como galimatías. El analizador detecta primero el corondel vertical y lee cada columna como un bloque aparte.

Tablas sin líneas

El problema

Muchísimas tablas no tienen ninguna línea dibujada; una persona las lee como tabla únicamente porque los valores están alineados. Sin líneas que detectar, la única señal es el análisis geométrico de dónde empieza y acaba el texto en cada fila. Las filas y las columnas se infieren de esas alineaciones y se reconstruyen como tablas de tuberías de Markdown.

Párrafos cortados por saltos de página

El problema

Una frase que empieza al final de la página 4 y termina al principio de la 5 tiene un encabezado, un pie y un número de página entre sus dos mitades. Esos elementos repetidos se identifican a lo largo de las páginas y se eliminan, y los dos fragmentos se reúnen en un solo párrafo.

Páginas sin texto alguno

El problema

Una página escaneada contiene una imagen, no caracteres: literalmente no hay nada que extraer. En lugar de emitir una sección en blanco sin avisar, esas páginas se cuentan y se comunican por número, de modo que un resultado corto queda explicado en vez de parecer un error. Active el OCR y se leerán.

Páginas escaneadas: avisadas por defecto, legibles si lo pide

Si una página no tiene capa de texto, el conversor le dice qué páginas se han visto afectadas en lugar de producir en silencio un archivo más corto. El OCR opcional lee esas páginas como texto; viene desactivado porque es un compromiso real, no una mejora gratuita.

Lo que recupera

Títulos, listas, tablas y orden de lectura vuelven todos, porque se deducen de dónde se sitúan las palabras en la página y no de los metadatos de fuente.

Lo que cuesta

Alrededor de 1,5 segundos por página frente a unos 50 milisegundos sin él —unas treinta veces más lento— y está limitado a 50 páginas por documento.

Lo que no puede recuperar

La negrita y la cursiva. La salida del OCR no lleva información de fuente, así que el énfasis en las páginas reconocidas se pierde definitivamente. Los errores de reconocimiento en escaneos de mala calidad también son normales.

El OCR usa el mismo permiso de plan que la herramienta de OCR independiente. Las páginas leídas así aparecen por separado en el resultado, para que sepa exactamente qué partes del documento conviene revisar.

Convertir muchos archivos a la vez

El modo por lotes parte de la idea de que, en cualquier carpeta real de PDF, al menos uno será problemático.

1

Un trabajo, un ZIP

Cada PDF pasa a ser su propio archivo .md dentro de un único comprimido, de modo que migrar documentación es una subida y una descarga en vez de un bucle repetitivo.

2

Un archivo malo nunca hunde el lote

Un PDF dañado o bloqueado falla por su cuenta. El resto se convierte con normalidad y sigue siendo descargable: nunca vuelve a la casilla de salida por un solo archivo.

3

Un registro de lo ocurrido

CONVERSION_REPORT.md, dentro del ZIP, recoge el resultado de cada archivo de origen: páginas convertidas, páginas que eran escaneos y páginas que no se pudieron procesar.

4

Una contraseña por archivo

Los PDF protegidos rara vez comparten contraseña. Cada archivo bloqueado tiene su propio campo, comprobado en su navegador antes de subir, así que una errata se detecta al momento y no tras una transferencia larga.

¿Markdown, texto plano o Word?

Los tres sacan palabras de un PDF. Se diferencian en cuánta forma del documento viene con ellas y en qué puede hacer después.

MarkdownTexto plano (.txt)Word (.docx)
TítulosConservados como niveles #Se pierdenConservados como estilos
TablasTablas de tuberías de MarkdownSe pierdenConservadas
Se lee bien en un diffNo: formato binario
Se muestra en GitHub, wikis y sitios de documentaciónDe forma nativaComo bloque de códigoNo sin conversión
Buena entrada para un LLM o un índice de búsquedaLa mejor: mantiene la estructuraAceptable, sin estructuraRequiere extracción previa
Editable en cualquier editor de textoNo

Regla práctica: Markdown cuando el texto se vaya a leer, versionar o procesar; Word cuando se vaya a maquetar de nuevo e imprimir.

Cómo convertir un PDF a Markdown

No hace falta cuenta para probarlo ni software que instalar.

1

Añada sus PDF

Arrastre archivos a cualquier parte de la página o use el selector. Cada uno recibe una miniatura de la primera página y un recuento de páginas, generados localmente en su navegador.

2

Ajuste las opciones

Si quiere, extraiga las imágenes incrustadas, active el OCR para páginas escaneadas e introduzca la contraseña de cualquier archivo que aparezca bloqueado.

3

Convierta

Un archivo se convierte al momento. Varios se ponen en cola como lote y se procesan juntos, mostrando el avance a medida que cada uno termina.

4

Descargue y lea las notas

Obtendrá un archivo .md, o un ZIP si se extrajeron imágenes o convirtió varios archivos. Lea el aviso si aparece: indica qué páginas requirieron atención.

Dónde se usa esto de verdad

En cualquier sitio donde un PDF deba convertirse en texto con el que puedan trabajar una máquina o un control de versiones.

Migración de documentación

Manuales antiguos, procedimientos y fichas técnicas atrapados en PDF pasan a un sitio de documentación, un wiki o un repositorio con sus títulos y tablas intactos: sin retecleos ni una pasada de reformateo.

Canalizaciones RAG y contexto para LLM

La calidad de la recuperación depende mucho del troceado, y el troceado depende de la estructura. Los títulos de Markdown dan al divisor límites reales por donde cortar, algo que el texto plano sencillamente no ofrece.

Investigación y toma de notas

Lleve artículos a Obsidian, Notion o Logseq con secciones y tablas conservadas, de modo que las citas y las figuras sigan ligadas al título del que proceden.

Documentos con control de versiones

Markdown se compara línea a línea en git. Un contrato o una política convertidos una vez pueden luego seguirse, revisarse y aprobarse con el mismo flujo de trabajo que el código.

Contenido para sitios estáticos y CMS

Markdown es la entrada nativa de Hugo, Jekyll, Astro, Docusaurus y la mayoría de los CMS headless, así que los archivos convertidos caen directamente en un directorio de contenido.

Extracción de datos de informes

Los estados financieros y los informes de estudios entierran sus cifras en tablas. Las tablas de Markdown se analizan trivialmente, lo que pone esos números al alcance de un script.

Lo que no va a hacer

Conviene saberlo de antemano, porque cuesta más fiarse de un conversor que esconde sus fallos que de uno que los nombra.

Las páginas difíciles se señalan, no se ocultan

Las páginas que eran escaneos, las que no se pudieron procesar y las que resultaron demasiado complejas para la detección de tablas se indican por número en el resultado. Las páginas complejas siguen produciendo su texto como párrafos: lo que se pierde es la forma de tabla.

Los límites de tamaño y páginas vienen de su plan

El tamaño máximo de archivo, las páginas por documento y los archivos por lote los fija su plan y se muestran en el panel junto al área de subida. La cifra que ve siempre es la suya actual.

Los archivos cifrados necesitan su contraseña

Un PDF bloqueado no se puede leer sin ella. Las contraseñas se usan para esa única conversión, se comprueban antes en su navegador y nunca se almacenan.

Preguntas frecuentes

¿Funciona con PDF escaneados?

No sin OCR, porque una página escaneada contiene una imagen en lugar de caracteres: no hay nada que extraer. El conversor le dice exactamente qué páginas eran escaneos, y al activar el OCR se leen. Cuente con que será bastante más lento y con perder la negrita y la cursiva en esas páginas.

¿Las tablas se conservan de verdad o solo se aproximan?

Tanto las tablas con líneas como los diseños de columnas alineadas sin bordes se detectan y se reconstruyen como tablas de tuberías de Markdown. Las páginas muy complejas —celdas combinadas, tablas anidadas, mucho estilo visual— pasan a párrafos simples, y esas páginas se listan en el resultado para que sepa cuáles revisar.

¿Qué ocurre con las imágenes del PDF?

Por defecto se omiten y obtiene un único archivo .md. Marque «extraer imágenes incrustadas» y el resultado será un ZIP con su Markdown más una carpeta images/, con el Markdown enlazando a cada archivo extraído.

¿Puedo convertir varios PDF a la vez?

Sí, en un plan con la conversión por lotes habilitada. Los archivos se ponen en cola como un único trabajo y se devuelven en un ZIP con un informe de conversión. Sin esa función del plan, puede convertir cualquier número de archivos de uno en uno.

¿Cómo trata los artículos académicos a dos columnas?

Los límites de columna se detectan antes de leer nada de texto, así que cada columna se procesa de arriba abajo por turnos. Sin ese paso, la extracción alterna entre columnas línea a línea y el resultado es inservible, que es justo por lo que tantas herramientas tropiezan concretamente con los artículos.

¿Puedo convertir un PDF protegido con contraseña?

Sí. Los archivos bloqueados muestran un campo de contraseña en su propia tarjeta, y la contraseña se verifica en su navegador antes de subir nada, así que una equivocada se detecta al instante. En un lote, cada archivo puede tener una contraseña distinta.

¿De qué tamaño puede ser el archivo?

Depende de su plan. El límite que se muestra bajo el área de subida es el suyo actual y se lee en vivo desde su cuenta en lugar de ser una cifra fija, así que mejorar de plan lo eleva de inmediato.

¿El Markdown está listo para publicar tal cual?

Suele quedar cerca. Títulos, listas, tablas y enlaces salen limpios, y el resultado es CommonMark estándar que se muestra en GitHub, en wikis y en generadores de sitios estáticos. Los documentos con maquetación inusual merecen una lectura rápida, y el aviso del resultado le dice dónde mirar.

¿Cuánto tiempo se guardan mis archivos?

Las subidas y los resultados se eliminan automáticamente tras el periodo de conservación de su plan, que se indica bajo el área de subida. También puede borrar un archivo convertido al instante desde la pantalla de descarga.

¿Necesito una cuenta?

No. La conversión funciona sin iniciar sesión, dentro de los límites del plan anónimo en tamaño de archivo, páginas y conversiones diarias. Iniciar sesión eleva esos límites y conserva los archivos más tiempo.

Herramientas relacionadas

Otras formas de sacar contenido de un PDF o de meterlo en uno.

Related Guides

Common document management mistakes small business make
General

Common document management mistakes small business make

Discover the most common document management mistakes small businesses make and learn simple ways to organize, store, share, and manage important files efficiently." focus_keyword: Document Management Mistakes

31 ago 20265 min read
The Difference Between Storing Documents and Actually Managing Them
General

The Difference Between Storing Documents and Actually Managing Them

Learn the difference between storing documents and actually managing them. Discover how better organization, version control, PDF tools, and workflows save time." focus_keyword: Document Storage vs Document Management

31 ago 20265 min read
PDF Techno vs iLovePDF OCR: Which Is More Accurate?
General

PDF Techno vs iLovePDF OCR: Which Is More Accurate?

Compare PDF Techno vs iLovePDF OCR for text accuracy, scanned PDFs, multilingual documents, tables, ease of use, and overall OCR performance.

31 ago 20265 min read
PDF Techno vs Smallpdf PDF to JPG: Which Is Better?
General

PDF Techno vs Smallpdf PDF to JPG: Which Is Better?

Compare PDF Techno vs Smallpdf PDF to JPG conversion for image quality, text clarity, scanned documents, file size, ease of use, and overall results.

26 ago 20265 min read
Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?
General

Edit PDF vs Repair PDF: What's the Difference and Which One Do You Need?

Confused between editing a PDF and repairing one? Learn the difference, when to use each option, and how PDF Techno helps you edit and repair PDF files quickly.

15 jul 20265 min read
PDF Security Checklist: 10 Things You Should Do Before Sharing a File
General

PDF Security Checklist: 10 Things You Should Do Before Sharing a File

Protect your sensitive documents with this PDF security checklist. Learn 10 essential steps to secure your PDF before sharing it online using PDF Techno.

15 jul 20265 min read