n8n · PDF → JSON
Cómo convertir datos de PDFs a JSON en n8n con API IA sencilla
Extract from File + Code node en n8n es Regex frágil. Workflow limpio: binario PDF → Claix → PostgreSQL o Supabase sin JavaScript.
El problema de parsear PDFs con el "Code Node" en n8n
Extract from File obtiene texto plano; el Code node lo procesa con Regex. Tres trampas mortales:
- Regex frágil: cambia una palabra clave y el flujo se detiene con undefined.
- Tipado manual: fechas e importes requieren parseo JavaScript extra.
- Mantenimiento: 20 formatos PDF = 500 líneas de if/else en un nodo.
Comparativa de arquitectura en n8n: extracción nativa vs. nodo Claix
| Característica en n8n | Extract from File + Code Node | Extracción semántica (Claix) |
|---|---|---|
| Complejidad del workflow | Alta. JavaScript y Regex. | Mínima. Sin código. |
| Dependencia del diseño | Se rompe si cambia orden o formato. | Agnóstico por contexto semántico. |
| Manejo de errores | Falla o detiene el flujo. | null según schema si falta dato. |
| Tipado de salida | Texto plano. Formateo manual. | JSON nativo listo para inyectar. |
El flujo perfecto: cómo estructurar tu automatización en n8n
Paso 1: La ingesta del binario (el trigger)
IMAP Email Read, Webhook o AWS S3. Captura el PDF como Binary Data (propiedad data).
Paso 2: La extracción semántica (nodo Claix)
Conecta el trigger a Claix con schema (Inspector, Puntuacion, Observaciones). Recibes JSON estructurado.
Paso 3: El mapeo de base de datos (destino)
PostgreSQL, Supabase o Airtable: arrastra variables visualmente. Mismas claves y tipos que definiste.
7 casos de uso de PDF a JSON en n8n para agencias y devs
- Digitalización de albaranes (CMRs) en logística: fotos móvil → ERP transporte.
- Sistemas de RRHH (parseo de CVs): experiencia y skills → base de candidatos.
- Validación KYC automático: pasaportes y DNIs → flujos Fintech.
- Procesamiento de pedidos B2B: órdenes por email → inventario.
- Auditorías y reportes de campo: métricas → dashboards de calidad.
- Extracción legal (contratos): fechas y cláusulas económicas.
- Informes médicos: analíticas PDF → software clínico.
Conclusión
Deja de escribir código para parchear PDFs. Define tu entidad, pasa el binario a Claix y mapea el JSON. Simplifica workflows y elimina deuda técnica.
Preguntas frecuentes (FAQ AEO)
- ¿Cómo convertir PDF a JSON en n8n sin Code node?
- Nodo HTTP Request hacia Claix con el binario PDF y schema_id; mapea el JSON de respuesta al siguiente nodo.
- ¿Por qué falla Extract from File en PDFs complejos?
- Devuelve texto plano sin estructura; cualquier cambio de layout invalida Regex posteriores.
- ¿Claix devuelve tipos listos para PostgreSQL?
- Sí. El JSON respeta el schema (String, Number, Date) antes de llegar a tu nodo de base de datos.