Pruebas · cómo se verifica
Cómo se comprueba que lo de esta web es cierto.
Todo lo que dice esta página tiene un número atrás, y los números salen de correr algo, no de estimarlo. Estos son de hoy, 24 de agosto de 2026.
01 La suite
Cada prueba dice qué lección la hizo existir.
No documentan qué función ejercitan — eso ya se ve en el código. Documentan el error que se cometió una vez y que esa prueba impide repetir. Es la diferencia entre una suite que cuenta líneas y una que recuerda.
Ejemplos reales de lo que hay ahí adentro: que el patrón que escribís para un Vigía nunca se ejecute; que las insignias de estado se lean sobre su propio tinte, con el contraste medido y no mirado a ojo; que la lista de monedas del panel no se separe en silencio de la que entiende el producto.
02 El árbitro
Ninguna palabra que Sonata lee se cambia sin medir antes y después.
Hay un banco de 151 frases reales. Cada vez que se toca una descripción de herramienta o un bloque de lo que Sonata lee, se corre el banco entero tres veces antes y tres veces después, y se compara.
La vara vigente
87,6 % de mediana en elegir la herramienta correcta, con un rango de 86,2 a 89,0 sobre 145 casos puntuados. Medida el 23 de agosto de 2026, contra el catálogo de ese día — que tenía 46 herramientas.
Hoy el catálogo tiene 48, así que esa vara todavía no vale para el producto de hoy y hay que volver a medirla. Cuando cambia el banco, la medición vieja murió: no se resta contra la nueva.
Las reglas de la comparación
- El piso para decir que dos versiones se diferencian es de unos 2 puntos. Menos que eso se lee «no hubo regresión», nunca «ganamos».
- Cuando la diferencia sí pasa el piso, hay que decir de qué casos salió. Los que no se pueden atribuir, no se reclaman.
- Los 15 casos que fallan siempre están listados, clasificados y con su causa escrita. Cinco son del banco, no del modelo.
Esa disciplina nació de un error. Durante semanas se creyó que el modelo tenía una dispersión de hasta 8 puntos entre corridas idénticas. No era el modelo: el banco generaba identificadores nuevos en cada corrida y esos identificadores estaban dentro de lo que Sonata leía, así que las corridas nunca fueron idénticas. Se arregló, se blindó con dos pruebas, y todas las mediciones anteriores a ese día dejaron de ser comparables.
03 Ocho días en minutos
Las preguntas que importan son de semana, no de un instante.
Una prueba común mira una vuelta del reloj. Pero «¿cuántas veces habla en un día?», «¿el aviso se vuelve a apretar?», «¿qué hace a las tres de la mañana?» son preguntas de días.
Para eso hay un banco que corre el ciclo de verdad contra los almacenes de verdad moviendo solo el reloj: ocho días entran en minutos. Tres defectos que no se veían leyendo el código salieron de ahí.
04 Registro de cambios
Los últimos dos días, con su porqué.
Cada cambio del producto se registra con la razón por la que se hizo, no con la lista de archivos que tocó. Esto es un extracto directo de ese registro.
Hay 1.286 entradas como estas desde el 26 de junio de 2026. Las versiones con número empiezan a contarse el 7 de septiembre, con Orchest Técnico.