Journal
Journal : coulisses
Sur ce thème, 12 articles du journal, entre guides pratiques et coulisses du produit.

« Ça me va » : pourquoi la validation humaine est la vraie sécurité de l'IA
L'article 14 de l'AI Act européen impose une supervision humaine « effective » sur l'IA à haut risque. Chez Maestro, rien ne s'acte sans un « Ça me va » : pas une contrainte réglementaire ajoutée après coup, le mécanisme central du produit depuis le premier jour.
Lire l'article
Qui a dérivé, le système ou le juge ? Nous avons mesuré la sévérité de notre jury
Une évaluation de 21 juges IA montre des classements qui bougent jusqu'à 14 positions selon le benchmark utilisé. Chez nous, un score moyen a chuté de six points d'une campagne à l'autre : nous avons dû prouver si c'était notre moteur, ou notre jury, qui avait changé.
Lire l'article
Thérapeutes et professions du soin : la confidentialité comme exigence numéro un
Le 6 novembre 2025, Doctolib a été condamnée à 4,6 millions d'euros d'amende pour abus de position dominante. En juin 2026, des données de santé partaient entraîner des modèles d'IA. Pour un thérapeute, la question n'est plus quel logiciel, mais où vivent ses notes.
Lire l'article
Nos benchmarks publient nos défaites : ce que SWE-bench ne peut plus vous dire
32,7 % des correctifs réussis sur SWE-bench contiennent une fuite de la solution, selon un position paper récent. Pendant que le leaderboard de référence s'effondre, nous publions nos propres duels, victoires ET défaites comprises.
Lire l'article
Une équipe d'agents IA peut-elle livrer votre logiciel ? Ce que nous avons mesuré
Neuf projets menés de l'idée au produit vérifié, trois juges par copie, des coûts publiés au centime. Ce que la mesure dit de la vraie capacité d'une équipe d'agents, et ce qu'elle ne dit pas.
Lire l'article
Pourquoi nous avons quitté BMAD : l'autopsie chiffrée
Maestro a démarré sur BMAD-METHOD. Nous l'avons quitté pour un moteur maison, Partition, et mesuré le remplacement campagne après campagne : 89,5 contre 83,5 de moyenne sur neuf sujets, huit duels gagnés sur neuf.
Lire l'article
Notre testeur le plus cruel est un agent : cinq tempéraments, du pressé au casseur
Depuis juillet, chaque nouvelle version du moteur affronte un agent qui joue l'utilisateur en cinq tempéraments, du pressé au casseur, plafonné à 15 dollars : cinq bugs réels attrapés dès le premier jour.
Lire l'article
Première semaine de beta : ce qui a cassé, ce qu'on a réparé
Notre premier testeur n'a jamais vu le deuxième écran. Le récit honnête des premiers jours : trois défauts réels, ce qu'ils nous ont appris, et ce qui reste ouvert.
Lire l'article
La qualité, mesurée : six jours de duels avec la méthode de référence
Nous avions promis de mesurer un jour plus que la sobriété. C'est fait : plus de 180 verdicts de jury, douze versions de méthode, une défaite au départ, et une leçon sur la mesure elle-même.
Lire l'article
Le contraire délibéré du terminal
Pourquoi Maestro ressemble à une salle de concert plutôt qu'à un écran noir : le décor fait partie du produit.
Lire l'article
Ce que notre ×10 mesure, et ce qu'il ne mesure pas
Nous affichons un chiffre : environ 10 fois moins de contexte de méthode injecté aux agents. La mesure complète, avec ses limites.
Lire l'article
Pourquoi neuf agents avec des prénoms
Margaux, Victor, Salomé, Maurice, Constance, Marcel, Amélie, Félix et Léa. Des prénoms qui rendent le travail lisible.
Lire l'article