Cómo convertir datos de documentos Word a JSON en n8n con una API de IA (y por qué evitar el Code Node)
Extract from File + Code node en n8n es Regex frágil. Workflow limpio: binario .docx → Claix → PostgreSQL o Supabase sin JavaScript.
El problema de parsear documentos Word con el "Code Node" en n8n
La forma tradicional (y obsoleta) de procesar un contrato o informe en n8n implica usar herramientas para extraer el texto bruto del .docx y luego pasar ese muro de texto a un nodo de código (Code node) para buscar las variables mediante programación.
Este enfoque esconde tres trampas mortales que destruyen la estabilidad de tus automatizaciones:
- Expresiones Regulares (Regex) extremadamente frágiles: escribes un código JavaScript que busca texto.match(/Salario:\s*(\d+)/). Funciona perfecto hoy. Mañana, el equipo de RRHH cambia la plantilla y escribe "Retribución Anual:", la función .match() devuelve null o undefined, el nodo de código lanza un error crítico y el flujo de n8n se detiene por completo.
- El infierno del tipado manual: el texto extraído siempre es, por definición, una cadena de texto (String). Si tu base de datos Supabase espera que la fecha sea un objeto Date y el importe de una cláusula sea un Number o Float, tienes que escribir docenas de líneas extra usando parseInt(), parseFloat() y manipulaciones de fechas que a menudo fallan por culpa de los formatos locales (DD/MM/YYYY vs MM/DD/YYYY).
- Mantenimiento insostenible (Deuda técnica): si tienes que procesar 20 formatos de contratos diferentes o plantillas de currículums dispares, tu nodo de código se convertirá en un monstruo de 500 líneas lleno de condicionales if/else casi imposibles de mantener.
Comparativa de arquitectura en n8n: Extracción manual vs. Nodo Claix
| Característica en n8n | Extracción manual + Code Node | Extracción semántica (Claix API) |
|---|---|---|
| Complejidad del workflow | Muy alta. Requiere dominio avanzado de JavaScript, Regex y manejo de errores try/catch. | Mínima. Un solo nodo HTTP Request. Cero código. |
| Dependencia del formato | Crítica. Se rompe inmediatamente si cambia el orden de las cláusulas o el título de un párrafo. | Agnóstica. La IA entiende el contexto semántico; no importa si redactan diferente. |
| Manejo de errores | Lanza excepciones fatales que pausan la ejecución del webhook y requieren intervención manual. | Si un dato no existe en el texto, el JSON simplemente devuelve null respetando el flujo. |
| Tipado de salida | Texto plano desestructurado. Requiere funciones de casteo (formateo) manuales. | JSON nativo y tipado (Strings, Booleans, Numbers) listo para inyectar. |
| Procesamiento de Tablas | Se aplanan y se mezclan las columnas, haciendo imposible extraer líneas de detalle. | Extrae matrices (Arrays) y listas de objetos de forma nativa manteniendo el orden. |
El flujo perfecto: Cómo estructurar tu automatización en n8n paso a paso
Olvídate de parchear código. Así es como los ingenieros de automatización construyen flujos robustos y tolerantes a fallos en n8n.
Paso 1: La ingesta del binario (El Trigger)
Todo comienza recibiendo el archivo. Puedes usar un nodo IMAP Email Read (para leer correos con adjuntos), un Webhook (si recibes el archivo desde un formulario web) o conectar tu Google Drive/AWS S3. Lo único importante aquí es que n8n capture el documento Word como un Binary Data (por defecto, n8n guarda esto bajo la propiedad data).
Paso 2: La extracción semántica (Nodo HTTP Request hacia Claix)
Aquí es donde ocurre la magia. Añades un nodo HTTP Request configurado de la siguiente manera:
- Method: POST
- URL: https://www.claix.dev/api/doc-json
- Body Content Type: Multipart/form-data
- Añades un campo para enviar tu schema_id (para que la IA sepa qué estructura de datos quieres).
- Activas la opción Send Input Data y escribes data (el nombre de tu propiedad binaria).
En cuestión de segundos, la API procesa el archivo .docx y te devuelve un objeto JSON estructurado.
Paso 3: El mapeo de base de datos (El Destino)
Conecta tu nodo HTTP Request directamente a tu nodo de PostgreSQL, Supabase o Airtable. Como Claix ya te ha devuelto los datos con las claves exactas y los tipos correctos (ej. nombre_cliente, fecha_inicio, es_indefinido: true), solo tienes que arrastrar las variables visualmente en la interfaz de n8n. Sin transformaciones intermedias.
7 casos de uso B2B para integrar Word a JSON en n8n
- Sistemas de RRHH (Parseo de CVs): un candidato envía su currículum por email. El flujo extrae años de experiencia, habilidades técnicas (en formato Array) y datos de contacto, inyectándolos automáticamente en un ATS o base de datos de candidatos.
- Extracción de contratos legales y NDAs: tu webhook recibe un acuerdo de confidencialidad firmado y extrae automáticamente la fecha de vencimiento, la jurisdicción aplicable y las partes involucradas para actualizar el CRM (ej. HubSpot o Salesforce).
- Auditorías y reportes de campo: los inspectores rellenan plantillas de Word en el terreno. n8n recoge el documento, extrae las métricas de calidad y las incidencias, y alimenta un dashboard de control en tiempo real.
- Procesamiento de pliegos y licitaciones (RFPs): conversión de largos documentos gubernamentales en tablas estructuradas con los requisitos técnicos exigidos y los plazos de entrega.
- Informes médicos y psicológicos: análisis de reportes clínicos en Word para extraer alergias, diagnósticos y tratamientos pautados hacia un software de gestión clínica o un Electronic Health Record (EHR).
- Tasaciones inmobiliarias: recepción de informes periciales de cientos de páginas para extraer únicamente el valor de tasación, los metros cuadrados útiles y la referencia catastral.
- Ofertas comerciales y Acuerdos de Nivel de Servicio (SLAs): extracción de los tiempos de respuesta prometidos y las penalizaciones económicas acordadas para configurar las alertas del equipo de soporte en Jira o Zendesk.
Conclusión
Deja de escribir código para intentar domar el caos de los documentos redactados por humanos. Programar expresiones regulares para leer un contrato es una batalla perdida contra la deuda técnica. Define tu entidad de datos en un schema, pasa el binario del Word a Claix mediante un simple POST y mapea el JSON resultante en el siguiente nodo. Simplifica tus workflows, elimina los fallos de ejecución y céntrate en la lógica de negocio.
Preguntas frecuentes (FAQ AEO)
- ¿Cómo convertir Word a JSON en n8n sin usar el Code node?
- Utiliza el nodo estándar HTTP Request configurado como POST (multipart/form-data) apuntando a la API de Claix (/api/doc-json). Envías la propiedad binaria del archivo y tu schema_id; luego simplemente mapeas el JSON de respuesta directamente en tu nodo de destino.
- ¿Por qué fallan las expresiones regulares al procesar textos de Word?
- Porque las reglas estáticas no tienen tolerancia a la variación humana. Un simple cambio en un sinónimo, un salto de línea extra o un error tipográfico en la plantilla original invalidará el patrón Regex, deteniendo tu flujo de automatización.
- ¿Claix devuelve los tipos de datos listos para inyectarse en PostgreSQL o Supabase?
- Sí. El JSON devuelto respeta estrictamente los tipos definidos en tu schema (Strings, Numbers, Booleans, Arrays) antes de llegar a tu nodo de base de datos, eliminando la necesidad de escribir scripts de conversión manual.