Cada vez que sale un modelo nuevo aparece la misma tabla: puntuaciones en una decena de benchmarks, comparadas con los modelos de la competencia, con el nuevo ganando en la mayoría. Y cada vez que lo pruebo en mi caso concreto, el resultado no siempre coincide con lo que prometía la tabla.

Esto no es porque los benchmarks estén mal hechos. Es porque miden algo distinto de lo que a mí me importa.

Qué mide en realidad un benchmark público

Un benchmark mide rendimiento en un conjunto fijo de tareas, conocido de antemano, con una forma concreta de puntuar la respuesta. Eso es útil para comparar modelos entre sí de forma objetiva. Pero tu tarea no es el benchmark: tiene tu formato de entrada, tu dominio específico, tus restricciones de estilo, y un criterio de "correcto" que probablemente no coincide con el criterio del benchmark.

Un modelo puede estar sobreoptimizado precisamente para ese conjunto de tareas conocido —de forma intencionada o no— sin que eso se traduzca en mejor rendimiento en tareas fuera de ese conjunto.

El problema de generalizar desde una media

Un benchmark da una puntuación media sobre cientos de casos. Tu tarea es un caso, no una media. Un modelo puede tener mejor puntuación media y aun así rendir peor específicamente en el tipo de tarea que tú le pides con más frecuencia, si esa tarea está infrarrepresentada en el conjunto de evaluación.

Lo que hago en su lugar

  • Un set de prueba propio, pequeño pero real. Entre diez y veinte casos reales de mi trabajo diario, con el resultado correcto que yo mismo verificaría a mano. No necesito mil casos, necesito que sean representativos de lo que realmente le pido al modelo.
  • Comparar en el mismo prompt, no en abstracto. El mismo prompt exacto contra los modelos candidatos, no una versión "adaptada" a cada uno. Si un modelo necesita un prompt distinto para rendir bien, eso también es información relevante.
  • Fijarme en los fallos, no solo en los aciertos. Dos modelos pueden acertar el 80% de mis casos y aun así ser muy distintos si fallan de formas diferentes: uno falla de forma obvia y detectable, el otro falla de forma silenciosa y convincente. El segundo es mucho más peligroso aunque su puntuación sea igual.

Cuándo sí miro los benchmarks públicos

Los uso como primer filtro grosero, para decidir qué dos o tres modelos merece la pena someter a mi propio set de prueba. No los uso como decisión final. Son útiles para reducir el universo de candidatos, no para elegir el ganador.

La recomendación

Un benchmark público te dice qué modelos merece la pena probar. No te dice cuál te sirve a ti. Antes de migrar a un modelo nuevo porque lidera una tabla, pruébalo contra un set de casos reales de tu propio trabajo, con el mismo prompt que usarías de verdad. La única puntuación que importa es la que sale de tu caso, no de la media de otro.

Relacionado: Cómo pruebo un IDE de IA nuevo antes de migrarme