
Por Thomas Cohen, fundador de Maestro
Nuestros benchmarks publican nuestras derrotas: lo que SWE-bench ya no puede decirte
El 32,7 % de las correcciones exitosas de SWE-bench contienen una filtración de la solución, según un reciente documento de posición. Mientras se derrumba la clasificación de referencia, publicamos nuestros propios duelos, con victorias Y derrotas.
Un reciente documento de posición identifica un 32,7 % de filtraciones de la solución en las correcciones exitosas de SWE-bench, la clasificación de referencia de los agentes de código (arxiv.org/pdf/2606.17799). Mientras la referencia del sector se derrumba bajo sus propios sesgos, publicamos nuestros duelos con ejercicios inventados en cada campaña, incluidas victorias y derrotas.
Lo que rompió la confianza
SWE-bench no es el único implicado. Una encuesta de Stack Overflow de 2025 mide un 46 % de desconfianza entre desarrolladores en la exactitud de las herramientas de IA, frente a un 33 % de confianza, aunque un 84 % las utiliza igualmente (survey.stackoverflow.co/2025/ai). Y un estudio de Cohere/Stanford/MIT/Allen AI mostró que Meta probó 27 variantes privadas de sus modelos en la clasificación LMArena antes de Llama 4 y publicó solo la mejor (arxiv.org/abs/2504.20879). El problema ya no es un fallo aislado, es una práctica asentada, y explica por qué una cifra presentada sola, sin un protocolo verificable detrás, ya no convence a nadie serio.
Lo que hacemos de otra forma
Cada campaña parte de ejercicios nuevos, nunca publicados antes de la ejecución, evaluados por tres jueces en ambos lados con las mismas rúbricas y las entregas anonimizadas. Empezamos perdiendo a principios de agosto: nuestro primer duelo terminó con 82,1 frente a 90,8 para la metodología de referencia. Ese resultado siguió siendo público. Cada versión posterior del motor corrigió exactamente lo que aquel jurado había criticado, hasta invertir la tendencia: el detalle completo, con la derrota inicial, está en la calidad medida durante seis días de duelos.
También sentimos la tentación del cherry-picking
Publicar la mejor ejecución y callar las demás es una tentación real, no un vicio que atribuimos a otros desde la distancia. Nuestra protección: los mismos jueces evalúan ambos lados del duelo, con el mismo orden de presentación elegido al azar, y los costes en dólares de cada campaña se publican junto a las puntuaciones. Una puntuación sin su coste y sin la pregunta «¿ha terminado realmente?» no dice nada.
Lo que se gana mostrando una derrota
Una derrota documentada es una lección que se puede transmitir; una victoria aislada no. En una campaña reciente, una puntuación que parecía excelente (92,5 sobre 100) premiaba en realidad un proyecto que no compilaba y borraba su propia base en cada arranque. Solo al profundizar y sondear el código ejecutado en lugar de leer el documento que lo describe apareció el defecto. Publicar este tipo de resultado, explicando qué se midió mal y por qué, vale infinitamente más que una cifra redonda sin contexto, por muy favorable que nos resulte a corto plazo.
Lo que puedes comprobar por tu cuenta
Los informes detallados de cada campaña, ejercicio por ejercicio, con los veredictos completos de los jueces y los costes en dólares, existen internamente y alimentan cada artículo que publicamos sobre nuestra metodología. No pedimos que se nos crea por nuestra palabra; pedimos que se nos compruebe con pruebas, exactamente como hacemos con lo que mide nuestro ×10 de concisión. Un benchmark que su lector no puede cuestionar no es un benchmark: es un cartel publicitario vestido de cifras.