IPDFOCR

OCR completo por tandas

Convertir PDF escaneado completo a Markdown

Sube una imagen, PDF escaneado, PDF con texto, TXT o MD. Si el PDF es escaneado, esta versión procesa todas las páginas, sin límite artificial de páginas, por tandas con barra de avance.

También puedes arrastrar y soltar el archivo aquí. Después presiona el botón rojo.

Sin límite desde la aplicación. Depende de PHP/Nginx.

Recomendado: 5 a 10. Este número NO limita el total del PDF; solo define cuántas páginas procesa por cada tanda. Puedes poner más si tu VPS aguanta.

No corta el archivo: procesa desde la página 1 hasta la última, aunque sean 100, 300, 500 o más páginas. Debes dejar abierta la pestaña mientras avanza.

Qué hace esta versión

Primero detecta si el PDF ya tiene texto. Si tiene texto, lo convierte sin OCR. Si es escaneado, lo procesa completo por tandas y muestra avance página por página, sin tope de páginas desde la aplicación.

Instalación OCR en Contabo

Instala Poppler y Tesseract con español.

sudo apt update
sudo apt install poppler-utils coreutils tesseract-ocr tesseract-ocr-spa -y