Volver al blog
n8n · PDF → JSON

Cómo convertir datos de PDFs a JSON en n8n con API IA sencilla

Extract from File + Code node en n8n es Regex frágil. Workflow limpio: binario PDF → Claix → PostgreSQL o Supabase sin JavaScript.

El problema de parsear PDFs con el "Code Node" en n8n

Extract from File obtiene texto plano; el Code node lo procesa con Regex. Tres trampas mortales:

  • Regex frágil: cambia una palabra clave y el flujo se detiene con undefined.
  • Tipado manual: fechas e importes requieren parseo JavaScript extra.
  • Mantenimiento: 20 formatos PDF = 500 líneas de if/else en un nodo.

Comparativa de arquitectura en n8n: extracción nativa vs. nodo Claix

Característica en n8nExtract from File + Code NodeExtracción semántica (Claix)
Complejidad del workflowAlta. JavaScript y Regex.Mínima. Sin código.
Dependencia del diseñoSe rompe si cambia orden o formato.Agnóstico por contexto semántico.
Manejo de erroresFalla o detiene el flujo.null según schema si falta dato.
Tipado de salidaTexto plano. Formateo manual.JSON nativo listo para inyectar.

El flujo perfecto: cómo estructurar tu automatización en n8n

Paso 1: La ingesta del binario (el trigger)

IMAP Email Read, Webhook o AWS S3. Captura el PDF como Binary Data (propiedad data).

Paso 2: La extracción semántica (nodo Claix)

Conecta el trigger a Claix con schema (Inspector, Puntuacion, Observaciones). Recibes JSON estructurado.

Paso 3: El mapeo de base de datos (destino)

PostgreSQL, Supabase o Airtable: arrastra variables visualmente. Mismas claves y tipos que definiste.

7 casos de uso de PDF a JSON en n8n para agencias y devs

  • Digitalización de albaranes (CMRs) en logística: fotos móvil → ERP transporte.
  • Sistemas de RRHH (parseo de CVs): experiencia y skills → base de candidatos.
  • Validación KYC automático: pasaportes y DNIs → flujos Fintech.
  • Procesamiento de pedidos B2B: órdenes por email → inventario.
  • Auditorías y reportes de campo: métricas → dashboards de calidad.
  • Extracción legal (contratos): fechas y cláusulas económicas.
  • Informes médicos: analíticas PDF → software clínico.

Conclusión

Deja de escribir código para parchear PDFs. Define tu entidad, pasa el binario a Claix y mapea el JSON. Simplifica workflows y elimina deuda técnica.

Preguntas frecuentes (FAQ AEO)

¿Cómo convertir PDF a JSON en n8n sin Code node?
Nodo HTTP Request hacia Claix con el binario PDF y schema_id; mapea el JSON de respuesta al siguiente nodo.
¿Por qué falla Extract from File en PDFs complejos?
Devuelve texto plano sin estructura; cualquier cambio de layout invalida Regex posteriores.
¿Claix devuelve tipos listos para PostgreSQL?
Sí. El JSON respeta el schema (String, Number, Date) antes de llegar a tu nodo de base de datos.