
Por Thomas Cohen, fundador de Maestro
¿Puede un equipo de agentes de IA entregar tu software? Lo que hemos medido
Nueve proyectos desde la idea hasta el producto verificado, tres jueces por entrega y costes publicados al céntimo. Lo que la medición dice sobre la capacidad real de un equipo de agentes y lo que no dice.
Sí, siempre que lo dirijas. En nueve proyectos desde la idea hasta el producto verificado, el equipo de agentes de Maestro obtuvo 93,3 sobre 100 ante un jurado común, frente a 83,5 de la metodología abierta de referencia, llegando a la meta nueve veces de nueve por 115,65 $ en tokens.
Primero, qué entendemos por «equipo de agentes»
Un agente de IA es un modelo encargado de un rol acotado: definir una necesidad, escribir una especificación, construir una etapa o verificar el resultado. Un equipo de agentes encadena estos roles con puntos de validación humana entre ellos. La pregunta incómoda: ¿este sistema produce programas que funcionan o bonitas demostraciones? Queríamos una respuesta medida, no una opinión.
El protocolo, sin jerga
Nueve proyectos realistas, del tipo que encarga una pyme: gastos profesionales con IVA, gastos compartidos, un control horario, reservas de salas, facturación y un inventario. Dos metodologías parten del mismo brief: la nuestra y BMAD-METHOD v6, la metodología abierta de referencia del ámbito. Cada entrega llega hasta el producto final y después tres jueces la puntúan con las mismas rúbricas y las entregas anonimizadas. Instrucción para los jueces: compilar, ejecutar y sondear el código, en lugar de limitarse a leer los documentos.
Los resultados, incluida la derrota
El primer duelo terminó con una derrota: 82,1 frente a 90,8. Los veredictos señalaban casos que nunca se habían provocado (la retroactividad, los duplicados, los céntimos perdidos en redondeos) y documentos que contradecían el código. Corregimos la metodología a partir de cada veredicto: doce versiones en seis días. Al final de la campaña: 93,3 frente a 83,5 y nueve llegadas a la meta de nueve, mientras que la referencia agotó su presupuesto tres veces durante el recorrido, por 238,66 $.
La anécdota que justifica la medición
Una entrega de control horario había recibido 92,5 sobre 100 por sus documentos. El día que un juez ejecutó su código, no compilaba y borraba su base en cada arranque. Recuerda este detalle al elegir una herramienta: un programa entregado por IA se juzga ejecutándolo. Nuestros jueces lo ejecutan todo; exige lo mismo a lo que te entreguen.
Lo que no dice la medición
Estas puntuaciones salen de nuestro propio protocolo, con jurados de IA, no de un laboratorio independiente. Una sola ejecución por proyecto deja ruido, de cinco a nueve puntos de una ejecución a otra; concluimos sobre las diferencias claras y los duelos emparejados, nunca sobre los decimales. Y nueve proyectos de gestión no demuestran nada sobre un sistema crítico con mucha carga: para eso, una agencia especializada sigue siendo el interlocutor adecuado.
La respuesta a la pregunta del título
Un equipo de agentes entrega un programa de gestión real y verificado, por un coste que cabe en un presupuesto de pyme, con una condición sin excepción en nuestras mediciones: alguien dirige. Tú validas el documento de requisitos, decides las reglas y rechazas lo que no está bien. Las nueve llegadas a la meta tienen ese punto en común. El protocolo y sus límites se explican en detalle en nuestros artículos de benchmark.