Dos nodos de la sección IA convierten lo que envía el contacto en texto que tu flujo puede usar: OCR lee imágenes y Transcripción convierte notas de voz en texto. Los dos guardan el resultado en una variable del contacto.
Nodo OCR
Agrega OCR («Analiza imágenes») desde la sección IA.
Elige el Proveedor de reconocimiento:
Proveedor | Qué hace | Cuándo usarlo |
|---|---|---|
Microsoft OCR | Solo extrae el texto literal. Rápido y económico. | Facturas, comprobantes, códigos, capturas con texto |
OpenAI Vision | Interpreta el contenido de la imagen. Más preciso, con costo por imagen. | Describir productos, vehículos, escenas; extraer datos concretos |
En Imagen a convertir, elige Imagen recibida (la última imagen que envió el contacto).
En Guardar resultado en, elige una variable del contacto (por ejemplo
Comprobante).
Con OpenAI Vision
Configuración ChatGPT: solo aparecen configuraciones con un modelo de visión (gpt-4o, gpt-4.1, gpt-5…). Si no tienes una, créala en Settings > Integraciones > ChatGPT.
Instrucción para el modelo: qué quieres obtener. Ejemplo:
Indica el monto y la fecha del comprobante.Nivel de detalle: Auto (recomendado), Bajo (más económico) o Alto (mayor precisión).
Nodo Transcripción
Agrega Transcripción («Transcribe audios») desde la sección IA.
En Configuración de modelo, elige una configuración de ChatGPT con el modelo Whisper-1.
En URL audio a convertir, elige Audio recibido (la última nota de voz del contacto).
En Guardar audio transcrito en variable, elige una variable (por ejemplo
Mensaje de voz).
Una rama para cada tipo de mensaje
Antes de estos nodos, agrega una Condición con la variable Tipo de mensaje recibido (pestaña Sistema):
Es imagen→ nodo OCREs audio→ nodo Transcripciónno cumple condición → el resto de tu flujo (texto)
Después, usa las variables como cualquier otra: en un mensaje (Recibimos tu comprobante: {{...}}), en una Condición o como contexto para tu agente.