Une femme dirige une équipe d'agents IA depuis son bureau du soir, le tableau de suivi de Maestro à l'écran

· 3 min de lecture · Mis à jour le

Une équipe d’agents IA peut-elle livrer un logiciel ? Nos essais et leurs limites

Nos essais ont porté sur un premier lot de développement. Voici ce qu’ils ont montré, comment nous l’avons évalué et ce qui restait à vérifier avant un usage réel.

Un écran de réservation peut sembler terminé alors qu’il accepte deux clients au même horaire. Pour savoir ce qu’une équipe d’agents a vraiment livré, il faut regarder les fonctions disponibles et les essayer. Nos mesures internes nous ont appris à distinguer un parcours de test achevé d’un logiciel prêt à utiliser.

Ce que fait une équipe d’agents

Les agents se répartissent des tâches : comprendre la demande, écrire les règles, construire une partie du logiciel et vérifier le résultat. Dans Maestro, vous dirigez ce travail à partir d’un cahier des charges. Cette organisation aide à suivre les décisions ; elle ne supprime pas les erreurs de l’IA.

Ce que nous avons testé le 6 août 2026

La campagne historique de notre méthode v2.5 portait sur neuf scénarios : dépenses partagées, temps de travail, réservations, inventaire… Chaque parcours allait du besoin au premier lot développé, avec une phase de vérification et de réparation. Il ne construisait pas l’ensemble des fonctionnalités prévues pour le produit.

Nous avons comparé ces résultats à neuf copies BMAD-METHOD v6.10 conservées lors d’essais antérieurs sur les mêmes sujets. Trois juges IA évaluaient chaque copie anonymisée à partir de grilles communes. Un seul essai retenu par méthode et par scénario ne suffit pas à mesurer la régularité des résultats.

Les résultats de cette campagne

89,5 / 100notre méthode v2.5, moyenne sur neuf scénarios
83,5 / 100les copies BMAD v6.10 sur ces mêmes scénarios

Notre méthode obtenait une note supérieure sur huit scénarios sur neuf. BMAD gardait l’avantage sur la réservation de salles. Ces notes créditaient aussi des éléments de conception : elles ne représentent pas un pourcentage de fonctionnalités opérationnelles ni une note de fiabilité du logiciel actuel.

Les neuf parcours retenus de notre méthode sont arrivés au terme du test, pour 115,65 $ de consommation IA. Les copies BMAD totalisaient 238,66 $, avec trois parcours interrompus par leur plafond de dépense. Ces montants excluent notamment le travail humain et les essais invalidés ; ce ne sont pas des devis de création d’application.

Ce que les notes avaient laissé passer

Lors d’une campagne ultérieure, une pointeuse bien notée ne compilait pas quand un juge a essayé de la lancer. Ce constat a renforcé notre exigence d’exécuter les logiciels. Il interdit aussi de présenter les anciennes notes comme la preuve que chaque fonction avait été testée. Le récit des campagnes explique cette limite.

Ce que vous pouvez en retenir

Demandez une démonstration sur vos propres cas : réserver un horaire, tenter un doublon, corriger puis retrouver une donnée après fermeture. Faites vérifier les points que vous ne savez pas contrôler. Une équipe d’agents peut aider à construire ; son résultat doit encore faire ses preuves dans votre activité. Notre article sur les coûts mesurés précise aussi ce que couvrent les dépenses publiées.

Comparer les alternatives à Lovable : prix, code et travail en local

Retour au journal

Prenez la baguette.

Laissez votre email : vous essaierez Maestro dans les premières vagues.

La beta est ouverte sur invitation sur macOS 13 et plus. Laissez votre email pour une prochaine vague d'accès. Windows est en préparation.

La beta est actuellement disponible sur macOS 13 ou plus. Votre réponse nous aide à préparer les autres versions.

Votre email ne sert qu'à vous prévenir de l'ouverture. Rien d'autre, promis.