Diario
Diario: entre bastidores
Sobre este tema, 17 artículos del diario, entre guías prácticas y experiencias del producto.

El desarrollo de una aplicación se dirige como una orquesta
Una partitura escrita antes de tocar, secciones con un ámbito definido y un director que lleva la batuta sin tocar un instrumento: la metáfora que estructura Maestro, asumida hasta en el logotipo.
Leer el artículo
Por qué los precios de las agencias no han seguido la caída de los costes de IA
Lo que costaba 60 dólares por millón de tokens a finales de 2021 cuesta hoy entre 0,06 y 0,40 dólares a rendimiento equivalente: una reducción de entre 150 y 1 000 veces. La tarifa diaria media de un desarrollador en Francia sigue en unos 629 euros. Ese margen se lo queda alguien.
Leer el artículo
Skills de autoservicio: la cadena de suministro que nadie mira
El repositorio github/spec-kit muestra 130 054 estrellas un año después de su lanzamiento. El ecosistema de habilidades para agentes de IA crece al mismo ritmo, e instalar un skill sobre la marcha se convierte en el nuevo curl canalizado a un terminal.
Leer el artículo
Lo que rompieron nuestros probadores de la beta, segunda ronda: el silencio que lo bloqueaba todo
Después de una primera prueba con un usuario real, 21 comentarios escritos revelaron un defecto invisible internamente: un tipo entero de etapa no se gestionaba en ninguna parte del motor. La cadena se congelaba en silencio, esperando una respuesta que nunca llegaba.
Leer el artículo
¿Cuánto cuesta realmente una aplicación desarrollada por agentes? Nuestras facturas, línea por línea
Las tarifas ilimitadas de IA desaparecen y los presupuestos se disparan en las empresas que no tienen un límite. Publicamos nuestros costes reales: 105,64 dólares para una campaña completa de 5 ejercicios evaluados, del brief al producto verificado.
Leer el artículo
«Me parece bien»: por qué la validación humana es la verdadera seguridad de la IA
El artículo 14 del Reglamento europeo de IA exige una supervisión humana «efectiva» para la IA de alto riesgo. En Maestro, nada se confirma sin un «Me parece bien»: no es una exigencia normativa añadida después, sino el mecanismo central del producto desde el primer día.
Leer el artículo
¿Quién cambió, el sistema o el juez? Medimos la severidad de nuestro jurado
Una evaluación de 21 jueces de IA muestra clasificaciones que varían hasta 14 posiciones según el benchmark utilizado. En nuestro caso, una puntuación media cayó seis puntos entre campañas: tuvimos que demostrar si había cambiado nuestro motor o nuestro jurado.
Leer el artículo
Terapeutas y profesiones del cuidado: la confidencialidad como requisito número uno
El 6 de noviembre de 2025, Doctolib recibió una multa de 4,6 millones de euros por abuso de posición dominante. En junio de 2026, datos de salud se destinaban a entrenar modelos de IA. Para un terapeuta, la pregunta ya no es qué programa usar, sino dónde viven sus notas.
Leer el artículo
Nuestros benchmarks publican nuestras derrotas: lo que SWE-bench ya no puede decirte
El 32,7 % de las correcciones exitosas de SWE-bench contienen una filtración de la solución, según un reciente documento de posición. Mientras se derrumba la clasificación de referencia, publicamos nuestros propios duelos, con victorias Y derrotas.
Leer el artículo
¿Puede un equipo de agentes de IA entregar tu software? Lo que hemos medido
Nueve proyectos desde la idea hasta el producto verificado, tres jueces por entrega y costes publicados al céntimo. Lo que la medición dice sobre la capacidad real de un equipo de agentes y lo que no dice.
Leer el artículo
Por qué dejamos BMAD: la autopsia con cifras
Maestro empezó con BMAD-METHOD. Lo dejamos por un motor propio, Partition, y medimos el cambio campaña tras campaña: una media de 89,5 frente a 83,5 en nueve ejercicios, con ocho duelos ganados de nueve.
Leer el artículo
Nuestro probador más cruel es un agente: cinco temperamentos, del impaciente al destructor
Desde julio, cada nueva versión del motor se enfrenta a un agente que interpreta al usuario con cinco temperamentos, del impaciente al destructor, con un límite de 15 dólares: cinco fallos reales detectados el primer día.
Leer el artículo
Primera semana de beta: qué falló y qué reparamos
Nuestro primer probador nunca llegó a ver la segunda pantalla. El relato honesto de los primeros días: tres defectos reales, lo que nos enseñaron y lo que sigue pendiente.
Leer el artículo
La calidad, medida: seis días de duelos con la metodología de referencia
Prometimos medir algún día algo más que la concisión. Ya lo hemos hecho: más de 180 veredictos de jurado, doce versiones de la metodología, una derrota inicial y una lección sobre la propia medición.
Leer el artículo
Qué mide nuestro ×10 y qué no mide
Publicamos una cifra: aproximadamente 10 veces menos contexto metodológico enviado a los agentes. La medición completa, con sus límites.
Leer el artículo
Lo contrario del terminal, deliberadamente
Por qué Maestro se parece a una sala de conciertos y no a una pantalla negra: el entorno forma parte del producto.
Leer el artículo
Por qué nueve agentes con nombre propio
Margaux, Victor, Salomé, Maurice, Constance, Marcel, Amélie, Félix y Léa. Nombres que hacen comprensible el trabajo.
Leer el artículo