Dos pequeñas fichas manuscritas sobre un escritorio, una cubierta de marcas de verificación y otra de cruces, con un trofeo de latón en miniatura situado exactamente entre ambas

23 de agosto de 2026 · 6 min de lectura

Por Thomas Cohen, fundador de Maestro

Nuestros benchmarks publican nuestras derrotas: lo que SWE-bench ya no puede decirte

El 32,7 % de las correcciones exitosas de SWE-bench contienen una filtración de la solución, según un reciente documento de posición. Mientras se derrumba la clasificación de referencia, publicamos nuestros propios duelos, con victorias Y derrotas.

Un reciente documento de posición identifica un 32,7 % de filtraciones de la solución en las correcciones exitosas de SWE-bench, la clasificación de referencia de los agentes de código (arxiv.org/pdf/2606.17799). Mientras la referencia del sector se derrumba bajo sus propios sesgos, publicamos nuestros duelos con ejercicios inventados en cada campaña, incluidas victorias y derrotas.

Lo que rompió la confianza

SWE-bench no es el único implicado. Una encuesta de Stack Overflow de 2025 mide un 46 % de desconfianza entre desarrolladores en la exactitud de las herramientas de IA, frente a un 33 % de confianza, aunque un 84 % las utiliza igualmente (survey.stackoverflow.co/2025/ai). Y un estudio de Cohere/Stanford/MIT/Allen AI mostró que Meta probó 27 variantes privadas de sus modelos en la clasificación LMArena antes de Llama 4 y publicó solo la mejor (arxiv.org/abs/2504.20879). El problema ya no es un fallo aislado, es una práctica asentada, y explica por qué una cifra presentada sola, sin un protocolo verificable detrás, ya no convence a nadie serio.

Lo que hacemos de otra forma

Cada campaña parte de ejercicios nuevos, nunca publicados antes de la ejecución, evaluados por tres jueces en ambos lados con las mismas rúbricas y las entregas anonimizadas. Empezamos perdiendo a principios de agosto: nuestro primer duelo terminó con 82,1 frente a 90,8 para la metodología de referencia. Ese resultado siguió siendo público. Cada versión posterior del motor corrigió exactamente lo que aquel jurado había criticado, hasta invertir la tendencia: el detalle completo, con la derrota inicial, está en la calidad medida durante seis días de duelos.

También sentimos la tentación del cherry-picking

Publicar la mejor ejecución y callar las demás es una tentación real, no un vicio que atribuimos a otros desde la distancia. Nuestra protección: los mismos jueces evalúan ambos lados del duelo, con el mismo orden de presentación elegido al azar, y los costes en dólares de cada campaña se publican junto a las puntuaciones. Una puntuación sin su coste y sin la pregunta «¿ha terminado realmente?» no dice nada.

Lo que se gana mostrando una derrota

Una derrota documentada es una lección que se puede transmitir; una victoria aislada no. En una campaña reciente, una puntuación que parecía excelente (92,5 sobre 100) premiaba en realidad un proyecto que no compilaba y borraba su propia base en cada arranque. Solo al profundizar y sondear el código ejecutado en lugar de leer el documento que lo describe apareció el defecto. Publicar este tipo de resultado, explicando qué se midió mal y por qué, vale infinitamente más que una cifra redonda sin contexto, por muy favorable que nos resulte a corto plazo.

Lo que puedes comprobar por tu cuenta

Los informes detallados de cada campaña, ejercicio por ejercicio, con los veredictos completos de los jueces y los costes en dólares, existen internamente y alimentan cada artículo que publicamos sobre nuestra metodología. No pedimos que se nos crea por nuestra palabra; pedimos que se nos compruebe con pruebas, exactamente como hacemos con lo que mide nuestro ×10 de concisión. Un benchmark que su lector no puede cuestionar no es un benchmark: es un cartel publicitario vestido de cifras.

Volver al diario

Toma la batuta.

Deja tu correo para probar Maestro en las primeras tandas.

La beta se abre por tandas. Las personas inscritas la prueban primero y Maestro sigue siendo gratis durante toda la beta.

La beta está disponible actualmente en macOS 13 o posterior. Tu respuesta nos ayuda a preparar otras versiones.

Tu correo solo se usa para avisarte de la apertura. Nada más, prometido.