Cómo evaluar modelos de IA más allá del ranking
Comprende qué mide un benchmark y prepara casos de tu producto. Compara resultados, errores, costes y esfuerzo de revisión.

Dos modelos ocupan posiciones cercanas en un ranking. Uno puede servir mejor porque respeta el formato de salida; otro, porque investiga un error difícil. La posición general no dice qué capacidad falta en tu trabajo.
Un benchmark ayuda a formular una hipótesis. Para convertirla en una decisión de producto, hay que probar tareas, herramientas y criterios que representen tu operación.
Lee primero qué se está midiendo
SWE-bench presenta variantes y resultados por tareas resueltas. La puntuación necesita el conjunto y el entorno usados para ser interpretable.
Comprueba si el sistema recibió solo un enunciado o acceso a archivos, terminal y navegador. Revisa tiempo, intentos, versión y reglas de selección de la respuesta. Varias tentativas no deben compararse sin indicarlo con una sola respuesta.
Distingue la evaluación del modelo de la del agente completo. El mismo modelo puede comportarse de otra forma con distintas instrucciones, recuperación de contexto y herramientas. Si todo cambia junto, el resultado describe el sistema.
Prepara casos que representen decisiones
Para un asistente de código, reúne correcciones, pequeñas extensiones, lectura de código y tareas que deban detenerse por falta de contexto o permisos. Incluye errores discretos, como consultar la cuenta equivocada.
Escribe el resultado esperado antes de ejecutar. En una exportación, comprueba filtros, orden, columnas, datos vacíos y autorización. “Se generó el archivo” no basta si contiene información de otro cliente.

Separa los tipos de error
| Criterio | Comprobación |
|---|---|
| Corrección | ¿Resuelve el caso y sus variaciones relevantes? |
| Restricciones | ¿Respeta acceso, alcance y datos permitidos? |
| Utilidad | ¿Se puede utilizar sin rehacerlo? |
| Esfuerzo | ¿Cuánto cuestan intentos, espera y revisión? |
Define qué errores impiden adoptar pese a una buena media. Clasificar casi todo correctamente y revelar un dato restringido requiere un tratamiento distinto a sugerir una etiqueta equivocada que alguien revisa.
Guarda el resultado, no solo la explicación
La referencia de Anthropic sobre evaluaciones distingue el registro de ejecución del estado final. Decir que algo se actualizó no demuestra que cambiara el registro correcto.
Repite casos para observar variación y conserva todos los intentos del protocolo. No ocultes una ejecución fallida porque la siguiente funcionó. Si otro modelo puntúa las respuestas, calibra sus criterios con revisión humana y errores conocidos.
Convierte la evaluación en rutina
Reserva casos que no se usarán para ajustar instrucciones. Repítelos al cambiar modelo, configuración o herramientas. Un resultado anterior deja de describir exactamente el sistema tras esas modificaciones.
Consulta la selección de modelos para SaaS para una decisión concreta. El ciclo de desarrollo con IA permite integrar la evaluación en la entrega. El ranking selecciona candidatos; el comportamiento observado decide la aprobación.
Sobre el autor
Tiago F SantiagoComentarios
Todavía no hay comentarios
Comparte una pregunta o una experiencia relacionada con el artículo.


