¿Qué es la IA multimodal y qué cambia frente a un chatbot que solo lee texto?
Hace tres semanas nos escribió un cliente que vende lámparas y decoración online. Quería automatizar un trozo del proceso de devoluciones: cuando un comprador manda una foto diciendo “llegó rota”, que alguien del sistema pudiera mirar esa imagen y decidir si aprobar la devolución sin que una persona del equipo tuviera que abrir cada correo a mano.
Eso es justo lo que hace la IA multimodal: entender texto e imagen (a veces también audio o vídeo) en la misma conversación, sin necesitar un sistema aparte para cada tipo de contenido. Le mandas una foto junto con una pregunta y te responde sobre lo que ve, como si se lo describieras a una persona por teléfono.
Hasta hace un par de años, montar algo así implicaba pegar piezas sueltas: un modelo de visión por un lado que clasificaba la imagen, un OCR si había texto en la foto, y luego un modelo de lenguaje aparte que redactaba la respuesta con lo que los otros dos le pasaban. Tres sistemas, tres puntos donde algo se puede romper. Con un modelo multimodal como Claude o GPT-4o eso se reduce a una llamada: la imagen entra en la misma ventana de contexto que el texto, y el modelo razona sobre las dos cosas a la vez.
El prototipo para el cliente lo montamos en una tarde, literal. Le pasamos la foto y un prompt con las condiciones de su política de devoluciones, y el modelo devuelve si hay daño visible, de qué tipo, y una nota breve para el equipo. Funciona bien con roturas evidentes —un cristal partido se ve a la legua— y peor con matices: un arañazo pequeño en un acabado mate, por ejemplo, unas veces lo detecta y otras no. Ahí seguimos con revisión humana antes de aprobar nada automáticamente. La IA reduce el trabajo de mirar cada foto una por una. No sustituye el criterio final.
Lo que casi nadie pregunta al principio, y debería, es qué pasa con esas fotos una vez salen de tu servidor. Van a la API de un proveedor externo igual que pasaría con cualquier modelo de lenguaje, así que si el cliente sube algo con datos personales visibles (una dirección en una etiqueta, una cara de fondo) hay que tratarlo con el mismo cuidado que cualquier otro dato que le des a una IA. En nuestro caso avisamos al cliente de que las fotos de devolución pasan por ese proceso, y lo dejamos por escrito en la política, no como nota a pie de página.
Todavía no hemos probado a meter audio en el mismo flujo, aunque el mismo cliente ya ha preguntado si se puede hacer algo parecido con las notas de voz que a veces manda la gente explicando qué ha pasado. Técnicamente sí se puede. Si merece la pena montarlo para el volumen de devoluciones que tiene, esa es otra pregunta que todavía no tengo respuesta clara.