Journal
Journal : méthode
Sur ce thème, 18 articles du journal, entre guides pratiques et coulisses du produit.

Le test d'abord, et malheur à l'agent qui le retouche : le TDD imposé aux machines
TDFlow atteint 88,8 % sur SWE-Bench Lite quand les tests sont fournis avant le code. Chez Maestro, les tests sont écrits AVANT chaque story depuis juillet, avec une règle simple : un agent qui modifie un test, même préexistant, est signalé.
Lire l'article
Expert-comptable, kiné, architecte : le sur-mesure des professions libérales
Les professions réglementées partagent un problème : des règles métier fines que les logiciels génériques aplatissent. La spécification validée par le professionnel, désormais à portée de cabinet, les restitue telles quelles.
Lire l'article
« Ça me va » : pourquoi la validation humaine est la vraie sécurité de l'IA
L'article 14 de l'AI Act européen impose une supervision humaine « effective » sur l'IA à haut risque. Chez Maestro, rien ne s'acte sans un « Ça me va » : pas une contrainte réglementaire ajoutée après coup, le mécanisme central du produit depuis le premier jour.
Lire l'article
Qui a dérivé, le système ou le juge ? Nous avons mesuré la sévérité de notre jury
Une évaluation de 21 juges IA montre des classements qui bougent jusqu'à 14 positions selon le benchmark utilisé. Chez nous, un score moyen a chuté de six points d'une campagne à l'autre : nous avons dû prouver si c'était notre moteur, ou notre jury, qui avait changé.
Lire l'article
Nos benchmarks publient nos défaites : ce que SWE-bench ne peut plus vous dire
32,7 % des correctifs réussis sur SWE-bench contiennent une fuite de la solution, selon un position paper récent. Pendant que le leaderboard de référence s'effondre, nous publions nos propres duels, victoires ET défaites comprises.
Lire l'article
Une équipe d'agents IA peut-elle livrer votre logiciel ? Ce que nous avons mesuré
Neuf projets menés de l'idée au produit vérifié, trois juges par copie, des coûts publiés au centime. Ce que la mesure dit de la vraie capacité d'une équipe d'agents, et ce qu'elle ne dit pas.
Lire l'article
Pourquoi nous avons quitté BMAD : l'autopsie chiffrée
Maestro a démarré sur BMAD-METHOD. Nous l'avons quitté pour un moteur maison, Partition, et mesuré le remplacement campagne après campagne : 89,5 contre 83,5 de moyenne sur neuf sujets, huit duels gagnés sur neuf.
Lire l'article
Le vibe coding expliqué à ceux qui ne coderont jamais
Décrire ce qu'on veut et laisser l'IA coder : le vibe coding a conquis les développeurs en 2025. Pour un non-développeur, il y manque une chose : un endroit où poser ses décisions.
Lire l'article
« Le waterfall contre-attaque » : notre réponse, point par point
225 points et 191 commentaires : le fil Hacker News qui accuse le spec-driven development de ressusciter le waterfall a marqué les esprits. Trois critiques précises, une réponse chiffrée, sans esquive.
Lire l'article
Refondre un logiciel métier vieillissant : ce que l'IA change en 2026
Le logiciel que personne n'ose toucher contient votre trésor : quinze ans de règles métier jamais écrites nulle part. La refonte par agents IA commence par les extraire noir sur blanc, avant toute reconstruction.
Lire l'article
Notre testeur le plus cruel est un agent : cinq tempéraments, du pressé au casseur
Depuis juillet, chaque nouvelle version du moteur affronte un agent qui joue l'utilisateur en cinq tempéraments, du pressé au casseur, plafonné à 15 dollars : cinq bugs réels attrapés dès le premier jour.
Lire l'article
Première semaine de beta : ce qui a cassé, ce qu'on a réparé
Notre premier testeur n'a jamais vu le deuxième écran. Le récit honnête des premiers jours : trois défauts réels, ce qu'ils nous ont appris, et ce qui reste ouvert.
Lire l'article
La qualité, mesurée : six jours de duels avec la méthode de référence
Nous avions promis de mesurer un jour plus que la sobriété. C'est fait : plus de 180 verdicts de jury, douze versions de méthode, une défaite au départ, et une leçon sur la mesure elle-même.
Lire l'article
Vos spécifications vaudront bientôt plus cher que votre code
L'IA rend le code abondant. La denrée rare devient la compréhension : savoir ce qu'on a voulu construire, et pourquoi. Trois niveaux de maturité se dessinent.
Lire l'article
Le cahier des charges qui évite les mauvaises surprises
La plupart des projets dérapent avant la construction, dans ce que personne n'a écrit noir sur blanc. Guide pratique pour le non-technique.
Lire l'article
Diriger des agents IA sans savoir coder : ce qui a changé
L'IA sait écrire du code depuis un moment. La nouveauté : un non-technique peut désormais la diriger.
Lire l'article
Le contraire délibéré du terminal
Pourquoi Maestro ressemble à une salle de concert plutôt qu'à un écran noir : le décor fait partie du produit.
Lire l'article
Pourquoi neuf agents avec des prénoms
Margaux, Victor, Salomé, Maurice, Constance, Marcel, Amélie, Félix et Léa. Des prénoms qui rendent le travail lisible.
Lire l'article