¿Qué es un benchmark? (y por qué no debes creértelo todo)
MMLU, HumanEval, GPQA... Los benchmarks son el carnet de notas de los modelos de IA. Te explicamos qué miden, cómo y cuándo te engañan.

Cada vez que sale un modelo nuevo, la marca presume con números: “89.4% en MMLU”, “SOTA en GPQA”, “Elo de 1400 en LMArena”. ¿Qué significan? ¿Te sirven para decidir qué modelo usar? Vamos a destriparlo.
La idea básica
Un benchmark es un examen estandarizado para modelos de IA. Igual que la selectividad tiene unas preguntas fijas y una nota comparable, los benchmarks hacen lo mismo con los modelos: les pasan un conjunto fijo de preguntas y cuentan cuántas acierta.
¿Para qué sirve? Para tres cosas:
- Comparar modelos entre sí con la misma vara de medir.
- Medir el progreso del campo: ¿el modelo nuevo de verdad es mejor, o solo parece?
- Detectar puntos débiles: le va bien en código pero fatal en razonamiento largo.
Los benchmarks que verás siempre (chuleta rápida)
| Benchmark | Qué mide | Analogía |
|---|---|---|
| MMLU / MMLU-Pro | Conocimiento general en 57 materias | El examen de oposiciones de todo |
| GPQA | Preguntas nivel doctorado, las llama “Google-Proof” | El examen que ni con Google apruebas |
| HumanEval / SWE-bench | Programar: funciones y bugs reales | La prueba técnica de una entrevista |
| MATH / AIME | Matemáticas | La olimpiada matemática |
| IFEval | Seguir instrucciones al pie de la letra | Si pides “solo 3 frases”, obedece |
| LMArena | Duelos a ciegas votados por humanos | El Tinder de los LLMs |
| LongBench / RULER | Contexto largo: recordar documentos enormes | Memoria de elefante |
Cómo se miden (por detrás)
Depende del tipo de examen:
- Opción múltiple (MMLU): se le da la pregunta y se compara la letra que responde con la correcta. Número de aciertos sobre total, y a vivir.
- Código (HumanEval): se le da una función a medias y se ejecutan tests automáticos. Si los tests pasan, acierta. Es la forma más honesta de medir.
- Duelos humanos (LMArena): dos modelos anónimos responden a lo mismo, la gente vota cuál es mejor, y todo ello alimenta una liga tipo Elo de ajedrez.
- Respuesta abierta (IFEval, LongBench): se usan jueces automáticos (muchas veces otro LLM) o reglas duras para puntuar.
Los 3 pecados de los benchmarks (por qué no debes creértelo todo)
1. Contaminación
Si las preguntas del examen se han filtrado en internet (y acaban en los datos de entrenamiento), el modelo no razona la respuesta: la ha memorizado. Es como aprobar un examen porque tienes el solucionario. MMLU lleva años sospechoso de esto.
2. Optimizar para el examen
Si todo el mundo compite en los mismos exámenes, los fabricantes acaban entrenando (o elegiendo) los modelos que puntúan mejor en ellos. El número sube, y la mejora real no es tan grande. Teaching to the test, de toda la vida.
3. No miden lo que TÚ necesitas
Da igual que un modelo saque 92 en MMLU si para tu caso (escribir correos, resumir reuniones, programar scripts pequeños) otro modelo “peor” te va mejor, es más rápido o es gratis en tu servidor.
Nuestro consejo del laboratorio
- Mira los benchmarks como filtros: un modelo por debajo del top 30 en todo, difícil que te sorprenda.
- Para decidir entre 3-4 finalistas, pruébalos con tus tareas reales. Nuestro truco: una lista de 10 prompts que uses a diario, guardada en un archivo, para pasársela a cada modelo nuevo.
- Desconfía de benchmarks donde solo se cita el bueno. Si un lanzamiento solo menciona “logramos SOTA en X” y esconde el resto, hay gato encerrado.
En el próximo post: cómo montar tu propio mini-benchmark casero para evaluar modelos con tus casos de uso. Con receta incluida, por supuesto. 🍳