Read this article in English.
Cómo extraer el texto de un PDF (sin copiar y pegar a mano)
Tienes varios PDFs (facturas, informes, contratos) y lo que necesitas no es el archivo en sí, es el texto que hay dentro: para buscar una palabra, para analizarlo, para meterlo en una hoja de cálculo o para pasárselo a otra herramienta. Copiar y pegar página a página no escala cuando hablamos de más de un par de archivos.
Es un problema habitual en casos como:
- Facturas de proveedores donde necesitas el importe o el número de factura en una hoja de cálculo.
- Contratos o informes donde buscas una cláusula o un dato concreto sin abrirlos uno a uno.
- PDFs que quieres pasar a un traductor, un resumidor o cualquier otra herramienta que solo entiende texto plano.
- Archivos de cientos de páginas donde buscar a mano no es una opción real.
Extraer texto de un PDF hace exactamente eso: le mandas el PDF, te devuelve el texto.
Cómo funciona
Mandas el PDF a pelo (application/pdf) o un JSON con { file, pages }. La respuesta siempre es JSON (nunca un PDF, porque lo que estás pidiendo es texto, no un archivo) con { text, num_pages, info, pages? }: el texto completo, el número de páginas y algo de información del documento.
Si necesitas el texto página por página
Por defecto (pages: false) solo te llega el texto completo, todo junto en text. Si pones pages: true, además te llega un array pages con el texto de cada página por separado. Útil cuando no basta con saber que una frase está en el documento, necesitas saber en qué página exacta.
Cuando el texto sale vacío, no es un error
Este es el caso que más confunde: si el PDF es un escaneo (una imagen metida dentro de un PDF, sin una capa de texto real detrás), la respuesta trae text: "" (vacío) pero success: true, y consume 1 crédito igualmente. No es que algo haya fallado: es que ese PDF, literalmente, no tiene texto que extraer, solo una foto de una página. Para sacar texto de ahí haría falta OCR, y esta herramienta no lo hace.
Si te encuentras con esto, el primer paso es comprobar si puedes seleccionar texto con el ratón al abrir el PDF en el navegador. Si no puedes, es un escaneo, y el resultado vacío es correcto, no un fallo de la herramienta.
Preguntas frecuentes
¿Por qué me devuelve el texto vacío si el PDF se abre perfectamente? Porque "abrirse bien" y "tener texto real" son cosas distintas. Un PDF puede ser solo una imagen escaneada metida en un archivo PDF: se ve perfectamente, pero no hay ni una letra de texto real dentro, así que no hay nada que extraer sin OCR.
¿Puedo saber en qué página está una frase concreta? Sí, pidiendo pages: true. Además del texto completo en text, te llega el array pages con el contenido de cada página por separado.
¿Cuánto cuesta cada extracción? 1 crédito por llamada, tenga el PDF el texto que tenga (incluso si sale vacío por ser un escaneo).
Prueba estas herramientas
Tienes las instrucciones completas de Extraer texto de un PDF, con los dos modos de salida. Y si aún no tienes cuenta, puedes crear una gratis.