
Par Thomas Cohen, fondateur de Maestro
Une équipe d’agents IA peut-elle livrer un logiciel ? Nos essais et leurs limites
Nos essais ont porté sur un premier lot de développement. Voici ce qu’ils ont montré, comment nous l’avons évalué et ce qui restait à vérifier avant un usage réel.
Un écran de réservation peut sembler terminé alors qu’il accepte deux clients au même horaire. Pour savoir ce qu’une équipe d’agents a vraiment livré, il faut regarder les fonctions disponibles et les essayer. Nos mesures internes nous ont appris à distinguer un parcours de test achevé d’un logiciel prêt à utiliser.
Ce que fait une équipe d’agents
Les agents se répartissent des tâches : comprendre la demande, écrire les règles, construire une partie du logiciel et vérifier le résultat. Dans Maestro, vous dirigez ce travail à partir d’un cahier des charges. Cette organisation aide à suivre les décisions ; elle ne supprime pas les erreurs de l’IA.
Ce que nous avons testé le 6 août 2026
La campagne historique de notre méthode v2.5 portait sur neuf scénarios : dépenses partagées, temps de travail, réservations, inventaire… Chaque parcours allait du besoin au premier lot développé, avec une phase de vérification et de réparation. Il ne construisait pas l’ensemble des fonctionnalités prévues pour le produit.
Nous avons comparé ces résultats à neuf copies BMAD-METHOD v6.10 conservées lors d’essais antérieurs sur les mêmes sujets. Trois juges IA évaluaient chaque copie anonymisée à partir de grilles communes. Un seul essai retenu par méthode et par scénario ne suffit pas à mesurer la régularité des résultats.
Les résultats de cette campagne
Notre méthode obtenait une note supérieure sur huit scénarios sur neuf. BMAD gardait l’avantage sur la réservation de salles. Ces notes créditaient aussi des éléments de conception : elles ne représentent pas un pourcentage de fonctionnalités opérationnelles ni une note de fiabilité du logiciel actuel.
Les neuf parcours retenus de notre méthode sont arrivés au terme du test, pour 115,65 $ de consommation IA. Les copies BMAD totalisaient 238,66 $, avec trois parcours interrompus par leur plafond de dépense. Ces montants excluent notamment le travail humain et les essais invalidés ; ce ne sont pas des devis de création d’application.
Ce que les notes avaient laissé passer
Lors d’une campagne ultérieure, une pointeuse bien notée ne compilait pas quand un juge a essayé de la lancer. Ce constat a renforcé notre exigence d’exécuter les logiciels. Il interdit aussi de présenter les anciennes notes comme la preuve que chaque fonction avait été testée. Le récit des campagnes explique cette limite.
Ce que vous pouvez en retenir
Demandez une démonstration sur vos propres cas : réserver un horaire, tenter un doublon, corriger puis retrouver une donnée après fermeture. Faites vérifier les points que vous ne savez pas contrôler. Une équipe d’agents peut aider à construire ; son résultat doit encore faire ses preuves dans votre activité. Notre article sur les coûts mesurés précise aussi ce que couvrent les dépenses publiées.
Comparer les alternatives à Lovable : prix, code et travail en local