Básicos

Qué significa que una IA es multimodal (texto, imagen, audio y vídeo)

Por David González Gaitán · 26 jul 2026 · 4 min de lectura

«Multimodal» es una de esas palabras que aparecen en todas las fichas técnicas sin que nadie explique qué implica en la práctica. Es más útil de lo que parece.

Qué es una modalidad

Una modalidad es un tipo de información: texto, imagen, audio, vídeo o código. Los primeros modelos solo manejaban texto. Un modelo multimodal procesa varias, y eso cambia por completo cómo lo usas.

Entender no es lo mismo que generar

Aquí está el matiz que se pierde siempre. Muchos modelos entienden imágenes (les mandas una foto y te la describen o te resuelven el problema que sale en ella) pero no las generan. Generar imágenes, audio o vídeo suele requerir modelos especializados distintos. Cuando veas «multimodal», comprueba si se refiere a entrada, a salida o a ambas.

Para qué sirve de verdad

Los usos más prácticos son cotidianos: fotografías un error en pantalla y te lo explica, le pasas la foto de un documento y te lo transcribe, le mandas un gráfico y te lo interpreta, o le enseñas una foto de la nevera y te propone una receta. Todo eso sin escribir apenas nada.

Qué modelos lo hacen

Prácticamente todos los punteros aceptan texto e imagen. El audio y el vídeo están menos extendidos y ahí es donde hay más diferencias entre modelos, así que conviene mirarlo caso por caso.

Filtra por modalidad

En nuestra comparativa cada modelo indica con iconos qué modalidades admite: texto, imagen, audio, vídeo y código.

Ver qué admite cada modelo →

Sigue leyendo

Qué son los pesos abiertos en IA (y en qué se diferencian del open source)

Kimi K3, Llama o DeepSeek son modelos de pesos abiertos: puedes descargarlos y usarlos por tu cuenta. Te explico qué implica, qué no, y cuándo te conviene.

Leer →

Qué es una alucinación de IA (y cómo detectarla a tiempo)

Las IA se inventan datos con total seguridad. Se llama alucinación, le pasa a todos los modelos y te explico por qué ocurre y cómo pillarla antes de meter la pata.

Leer →

Qué es un LLM o modelo de lenguaje (explicado sin tecnicismos)

LLM significa modelo de lenguaje grande y es lo que hay detrás de ChatGPT, Claude o Gemini. Te explico qué es, cómo funciona y qué sabe y qué no sabe hacer.

Leer →

Qué es la ventana de contexto de una IA (y por qué importa tanto)

La ventana de contexto es la memoria de trabajo de un modelo: cuánto texto puede tener en cuenta a la vez. Qué significa 1M de tokens y cuándo lo necesitas.

Leer →