# OCR y transcripción de audios

> OCR y transcripción de audios

Source: https://docs.plazbot.com/kb/ocr-y-transcripcion-de-audios

Dos nodos de la sección **IA** convierten lo que envía el contacto en texto que tu flujo puede usar: **OCR** lee imágenes y **Transcripción** convierte notas de voz en texto. Los dos guardan el resultado en una variable del contacto.

[Watch the video on YouTube](https://www.youtube.com/watch?v=NH4apOFz4kY)

## Nodo OCR

1. Agrega **OCR** («Analiza imágenes») desde la sección **IA**.
2. Elige el **Proveedor de reconocimiento**:

Proveedor

Qué hace

Cuándo usarlo

**Microsoft OCR**

Solo extrae el texto literal. Rápido y económico.

Facturas, comprobantes, códigos, capturas con texto

**OpenAI Vision**

Interpreta el contenido de la imagen. Más preciso, con costo por imagen.

Describir productos, vehículos, escenas; extraer datos concretos

3. En **Imagen a convertir**, elige **Imagen recibida** (la última imagen que envió el contacto).
4. En **Guardar resultado en**, elige una variable del contacto (por ejemplo `Comprobante`).

### Con OpenAI Vision

- **Configuración ChatGPT**: solo aparecen configuraciones con un modelo de visión (gpt-4o, gpt-4.1, gpt-5…). Si no tienes una, créala en **Settings > Integraciones > ChatGPT**.
- **Instrucción para el modelo**: qué quieres obtener. Ejemplo: `Indica el monto y la fecha del comprobante.`
- **Nivel de detalle**: Auto (recomendado), Bajo (más económico) o Alto (mayor precisión).

## Nodo Transcripción

1. Agrega **Transcripción** («Transcribe audios») desde la sección **IA**.
2. En **Configuración de modelo**, elige una configuración de ChatGPT con el modelo **Whisper-1**.
3. En **URL audio a convertir**, elige **Audio recibido** (la última nota de voz del contacto).
4. En **Guardar audio transcrito en variable**, elige una variable (por ejemplo `Mensaje de voz`).

La transcripción usa el modelo de la configuración elegida. El selector muestra todas tus configuraciones de ChatGPT: elige la que tenga Whisper-1, o la transcripción no funcionará. Si no tienes una, créala en **Settings > Integraciones > ChatGPT** con el modelo Whisper-1.

## Una rama para cada tipo de mensaje

Antes de estos nodos, agrega una **Condición** con la variable **Tipo de mensaje recibido** (pestaña Sistema):

- `Es imagen` → nodo **OCR**
- `Es audio` → nodo **Transcripción**
- **no cumple condición** → el resto de tu flujo (texto)

Después, usa las variables como cualquier otra: en un mensaje (`Recibimos tu comprobante: {{...}}`), en una Condición o como contexto para tu agente.
