English

Read this article in English.

Cómo extraer el texto de un PDF (sin copiar y pegar a mano)

Tienes varios PDFs (facturas, informes, contratos) y lo que necesitas no es el archivo en sí, es el texto que hay dentro: para buscar una palabra, para analizarlo, para meterlo en una hoja de cálculo o para pasárselo a otra herramienta. Copiar y pegar página a página no escala cuando hablamos de más de un par de archivos.

Es un problema habitual en casos como:

Extraer texto de un PDF hace exactamente eso: le mandas el PDF, te devuelve el texto.

Cómo funciona

Mandas el PDF a pelo (application/pdf) o un JSON con { file, pages }. La respuesta siempre es JSON (nunca un PDF, porque lo que estás pidiendo es texto, no un archivo) con { text, num_pages, info, pages? }: el texto completo, el número de páginas y algo de información del documento.

Si necesitas el texto página por página

Por defecto (pages: false) solo te llega el texto completo, todo junto en text. Si pones pages: true, además te llega un array pages con el texto de cada página por separado. Útil cuando no basta con saber que una frase está en el documento, necesitas saber en qué página exacta.

Cuando el texto sale vacío, no es un error

Este es el caso que más confunde: si el PDF es un escaneo (una imagen metida dentro de un PDF, sin una capa de texto real detrás), la respuesta trae text: "" (vacío) pero success: true, y consume 1 crédito igualmente. No es que algo haya fallado: es que ese PDF, literalmente, no tiene texto que extraer, solo una foto de una página. Para sacar texto de ahí haría falta OCR, y esta herramienta no lo hace.

Si te encuentras con esto, el primer paso es comprobar si puedes seleccionar texto con el ratón al abrir el PDF en el navegador. Si no puedes, es un escaneo, y el resultado vacío es correcto, no un fallo de la herramienta.

Preguntas frecuentes

¿Por qué me devuelve el texto vacío si el PDF se abre perfectamente? Porque "abrirse bien" y "tener texto real" son cosas distintas. Un PDF puede ser solo una imagen escaneada metida en un archivo PDF: se ve perfectamente, pero no hay ni una letra de texto real dentro, así que no hay nada que extraer sin OCR.

¿Puedo saber en qué página está una frase concreta? Sí, pidiendo pages: true. Además del texto completo en text, te llega el array pages con el contenido de cada página por separado.

¿Cuánto cuesta cada extracción? 1 crédito por llamada, tenga el PDF el texto que tenga (incluso si sale vacío por ser un escaneo).

Prueba estas herramientas

Tienes las instrucciones completas de Extraer texto de un PDF, con los dos modos de salida. Y si aún no tienes cuenta, puedes crear una gratis.