Básicos

Qué es un benchmark de IA (y por qué no deberías fiarte solo de ellos)

Por David González Gaitán · 28 jul 2026 · 5 min de lectura

Cada vez que sale un modelo nuevo, el anuncio va lleno de porcentajes: «93,5% en GPQA», «88% en Terminal-Bench». Son benchmarks, y conviene saber qué te están contando exactamente.

Qué es un benchmark

Es un examen estandarizado: un conjunto fijo de preguntas o tareas con respuestas conocidas, que se pasa a todos los modelos para poder compararlos con la misma vara de medir. Hay benchmarks de razonamiento, de programación, de matemáticas, de uso de herramientas o de manejo del ordenador.

Por qué son útiles

Porque sin ellos solo tendríamos impresiones. Permiten ver progresos reales entre generaciones y detectar en qué destaca cada modelo: uno puede ir muy bien en código y regular en escritura, y eso se ve en los números.

Y por qué no bastan

Tres razones. Una: las empresas eligen qué benchmarks publican, y curiosamente suelen ser los que ganan. Dos: existe el riesgo de contaminación, es decir, que las preguntas del examen hayan acabado en los datos de entrenamiento. Y tres, la más importante: un examen no se parece a tu trabajo real, y un modelo puede puntuar altísimo y resultarte incómodo de usar.

Cómo interpretarlos bien

Míralos como una orientación, no como un veredicto. Fíjate en diferencias grandes, no en dos décimas. Prioriza el benchmark que se parezca a lo que tú haces. Y prueba el modelo con tu caso real antes de pagar: es la única medida que de verdad importa.

Cómo puntuamos nosotros

Aplicamos los mismos cinco criterios a todos los modelos y explicamos cada nota. Sin cherry-picking de benchmarks.

Ver nuestra metodología →

Sigue leyendo

Qué es una API de IA y cuándo te sale más barata que la suscripción

Usar una IA por API significa pagar solo por lo que consumes en vez de una cuota fija. Te explico cómo funciona y en qué casos ahorras dinero de verdad.

Leer →

Qué significa que una IA es multimodal (texto, imagen, audio y vídeo)

Multimodal quiere decir que el modelo entiende más que texto: también imágenes, audio o vídeo. Te explico qué puedes hacer con ello y qué modelos lo permiten.

Leer →

Qué son los pesos abiertos en IA (y en qué se diferencian del open source)

Kimi K3, Llama o DeepSeek son modelos de pesos abiertos: puedes descargarlos y usarlos por tu cuenta. Te explico qué implica, qué no, y cuándo te conviene.

Leer →

Qué es una alucinación de IA (y cómo detectarla a tiempo)

Las IA se inventan datos con total seguridad. Se llama alucinación, le pasa a todos los modelos y te explico por qué ocurre y cómo pillarla antes de meter la pata.

Leer →