Blind Eval
Effort: light — una sola corrida de juez ciego: varias lecturas barajadas del par congelado por un modelo que no escribió ninguno de los dos. Elimina: aterrizajes autocalificados de "quedó mejor" — regresiones de gusto que el autor dejaría pasar.
Una puerta de calidad de conservar-o-revertir para decisiones que un test no puede
tomar — la calidad de una prosa, el copy de una UI, la legibilidad de un refactor,
la salida de un prompt, la sensación de un diseño. Juzga el cambio por sus méritos
con la autoría oculta, y luego CONSÉRVALO o REVIÉRTELO. Un empate revierte. Solo
aterriza la mejora probada.
Cuándo ejecutarla
- Antes de aterrizar cualquier cambio donde "¿es mejor?" es una pregunta de gusto o calidad.
- Como la puerta dentro de un loop de mejora: proponer → probar → medir → conservar o descartar.
- Cada vez que el autor sienta la tentación de declarar su propio trabajo una mejora.
El método
- Escribe qué significa "mejor" ANTES de mirar. Una meta en lenguaje llano.
Una medida primaria o un eje de rúbrica con una barra dura — un nivel que
superar, no un número que empujar. Ejes secundarios en orden de prioridad
(costo, longitud, latencia).
- Congela ambas versiones. La base y la candidata, como artefactos reales —
nunca una descripción de ellos.
- Quita la autoría. Etiquétalas A y B, baraja el orden, elimina cada nombre,
id de modelo y el razonamiento del autor. El juez ve solo los artefactos y la
rúbrica.
- Sienta un juez que no escribió ninguna de las dos — un modelo de otra
familia, o un humano. El autor nunca califica su propio trabajo.
- Juzga por méritos. Puntúa cada eje de la rúbrica. Cita evidencia del
artefacto para cada puntaje — un veredicto sin evidencia es una corazonada.
- CONSERVA solo si la candidata supera la barra Y le gana estrictamente a la
base. Un empate no es mejora — revierte.
- Revierte limpio. Restaura el árbol byte a byte idéntico al estado previo al
cambio (una rama de trabajo o un stash lo dejan en un solo comando). Registra el
veredicto en ambos casos.
Reglas que frenan las trampas
- La barra se revisa primero, y los ejes se ordenan por prioridad. Una
regresión en un eje de mayor prioridad es fatal aunque todos los ejes menores
mejoren. Y superar la barra con margen extra no compra nada — no puedes
sobrepasar el eje primario para "pagar" una regresión de costo.
- Nunca bajes la barra después de ver el resultado. Arreglar el puntaje
debilitando la evaluación está prohibido. Mantén la rúbrica y la evaluación
fuera de los archivos que el cambio tiene permitido tocar.
- Nada de autocalificarse. El juez nunca ve la justificación del autor — un
juez que lee el discurso de venta califica el discurso, no el trabajo.
- Quítale el ruido a un juez estocástico. Las lecturas ciegas varían de
corrida en corrida, y los jueces prefieren la primera opción que ven. Corre cada
comparación varias veces con el orden barajado y toma el voto de la mayoría — el
barajado mata el sesgo de posición y las repeticiones matan el ruido, en un solo
movimiento. Si la mejora real es más chica que la oscilación del juez entre
corridas, la puerta no distingue señal de suerte — agrega lecturas o elige una
medida más estable.
- ¿Equipo solo? ¿No hay una segunda familia de modelos disponible? Una sesión
ciega fresca que nunca vio la conversación del autor juzga — y el reporte nombra
la puerta debilitada ("juzgado a ciegas misma-familia, no entre familias").
- ¿Sin barra confiable? Usa dominancia. Cuando el nivel de la base es
desconocido o ruidoso, suelta la barra absoluta y conserva solo lo que le gana
estrictamente al campeón actual. Una regresión nunca puede dominar, así que no
hace falta piso.
- Nunca puntúes un eje de costo sobre fracasos. "Menos pasos" calculado sobre
intentos fallidos premia rendirse rápido. Calcula costo y esfuerzo solo sobre
los éxitos.
Quítale el sesgo al juez
El piso de mecánica del juez. Estas reglas viven aquí y en ningún otro lado:
- Suite reservada. Califica sobre una suite que queda FUERA del alcance de
escritura del constructor — el constructor nunca ve los tests que califican, así
que no puede programar a la medida de ellos.
- Limpieza a commit fresco. Deja el workspace en un solo commit fresco y
bloquea el egreso de red antes de una corrida calificada, para que un pase sea
DERIVADO — no recuperado del historial de git ni del arreglo de otro.
- Normaliza por longitud. Los jueces prefieren con fuerza la respuesta más
larga — corrige por longitud antes de comparar puntajes.
- Criterios reservados rotados. Usa una rúbrica de ejes nombrados con
respuestas sí/no y criterios ocultos que rotan entre corridas. Un puntaje
holístico visible se termina jugando con teatro de citas.
- Califica el estado final. Califica el trabajo de varios pasos sobre el
estado FINAL, no sobre cada paso intermedio.
- Calibra al juez. Calibra al juez con un set chico etiquetado por humanos —
reporta sus tasas de verdaderos positivos y verdaderos negativos — antes de
confiarle tu dominio.
El barajado del orden es parte de la regla de quitar ruido de arriba — una ley,
dicha una sola vez.
La variante en loop
La misma puerta alimenta un loop de mejora autónomo: proponer un cambio chico →
correr un experimento corto → medir a ciegas → conservar si es mejor, revertir si
no → repetir, con un presupuesto fijo de rondas. Aliméntale al proponente las
trazas de fracaso de la ronda anterior, no solo la meta — un proponente que no ve
por qué falla edita a ciegas. Incluso un loop que no conserva nada paga su costo:
las trazas que junta apuntan a bugs concretos y arreglables que ningún puntaje
agregado revela.
Combina bien con
- blind-tribunal — el panel de jurados más pesado cuando la pregunta son defectos, no gusto.
- red-first — cuando un test SÍ puede decidirlo, escribe el test.
- clean-code-gauntlet — puertas medidas de calidad de código para acompañar la decisión de gusto.
Crédito del nombre: Andrej Karpathy. Inspiración del nombre; la disciplina de
conservar-o-revertir tiene un paralelo independiente en el autoresearch de
Karpathy (2026, github.com/karpathy/autoresearch, MIT). El aspecto ciego
(autoría oculta) y la composición y reglas duras de aquí son de BACKS AIOS.
1---2name: blind-eval-33description: Úsala antes de aterrizar cualquier cambio donde la pregunta es de gusto o de calidad y un test no puede decidirla. Juzga el cambio por sus méritos con la autoría oculta, y luego lo conserva o lo revierte — un empate revierte; solo aterriza la mejora probada. Trigger words: blind eval, karpathy, keep or revert, quality gate, taste call, blind judge, A/B judge, prove uplift. Disparadores: evaluación ciega, conservar o revertir, puerta de calidad, juicio a ciegas, juez A/B, probar la mejora.4license: MIT5---67# Blind Eval8**Effort:** light — una sola corrida de juez ciego: varias lecturas barajadas del par congelado por un modelo que no escribió ninguno de los dos. Elimina: aterrizajes autocalificados de "quedó mejor" — regresiones de gusto que el autor dejaría pasar.910Una puerta de calidad de conservar-o-revertir para decisiones que un test no puede11tomar — la calidad de una prosa, el copy de una UI, la legibilidad de un refactor,12la salida de un prompt, la sensación de un diseño. Juzga el cambio por sus méritos13con la autoría oculta, y luego CONSÉRVALO o REVIÉRTELO. Un empate revierte. Solo14aterriza la mejora probada.1516## Cuándo ejecutarla1718- Antes de aterrizar cualquier cambio donde "¿es mejor?" es una pregunta de gusto o calidad.19- Como la puerta dentro de un loop de mejora: proponer → probar → medir → conservar o descartar.20- Cada vez que el autor sienta la tentación de declarar su propio trabajo una mejora.2122## El método23241. **Escribe qué significa "mejor" ANTES de mirar.** Una meta en lenguaje llano.25 Una medida primaria o un eje de rúbrica con una barra dura — un nivel que26 superar, no un número que empujar. Ejes secundarios en orden de prioridad27 (costo, longitud, latencia).282. **Congela ambas versiones.** La base y la candidata, como artefactos reales —29 nunca una descripción de ellos.303. **Quita la autoría.** Etiquétalas A y B, baraja el orden, elimina cada nombre,31 id de modelo y el razonamiento del autor. El juez ve solo los artefactos y la32 rúbrica.334. **Sienta un juez que no escribió ninguna de las dos** — un modelo de otra34 familia, o un humano. El autor nunca califica su propio trabajo.355. **Juzga por méritos.** Puntúa cada eje de la rúbrica. Cita evidencia del36 artefacto para cada puntaje — un veredicto sin evidencia es una corazonada.376. **CONSERVA solo si la candidata supera la barra Y le gana estrictamente a la38 base.** Un empate no es mejora — revierte.397. **Revierte limpio.** Restaura el árbol byte a byte idéntico al estado previo al40 cambio (una rama de trabajo o un stash lo dejan en un solo comando). Registra el41 veredicto en ambos casos.4243## Reglas que frenan las trampas4445- **La barra se revisa primero, y los ejes se ordenan por prioridad.** Una46 regresión en un eje de mayor prioridad es fatal aunque todos los ejes menores47 mejoren. Y superar la barra con margen extra no compra nada — no puedes48 sobrepasar el eje primario para "pagar" una regresión de costo.49- **Nunca bajes la barra después de ver el resultado.** Arreglar el puntaje50 debilitando la evaluación está prohibido. Mantén la rúbrica y la evaluación51 fuera de los archivos que el cambio tiene permitido tocar.52- **Nada de autocalificarse.** El juez nunca ve la justificación del autor — un53 juez que lee el discurso de venta califica el discurso, no el trabajo.54- **Quítale el ruido a un juez estocástico.** Las lecturas ciegas varían de55 corrida en corrida, y los jueces prefieren la primera opción que ven. Corre cada56 comparación varias veces con el orden barajado y toma el voto de la mayoría — el57 barajado mata el sesgo de posición y las repeticiones matan el ruido, en un solo58 movimiento. Si la mejora real es más chica que la oscilación del juez entre59 corridas, la puerta no distingue señal de suerte — agrega lecturas o elige una60 medida más estable.61- **¿Equipo solo?** ¿No hay una segunda familia de modelos disponible? Una sesión62 ciega fresca que nunca vio la conversación del autor juzga — y el reporte nombra63 la puerta debilitada ("juzgado a ciegas misma-familia, no entre familias").64- **¿Sin barra confiable? Usa dominancia.** Cuando el nivel de la base es65 desconocido o ruidoso, suelta la barra absoluta y conserva solo lo que le gana66 estrictamente al campeón actual. Una regresión nunca puede dominar, así que no67 hace falta piso.68- **Nunca puntúes un eje de costo sobre fracasos.** "Menos pasos" calculado sobre69 intentos fallidos premia rendirse rápido. Calcula costo y esfuerzo solo sobre70 los éxitos.7172## Quítale el sesgo al juez7374El piso de mecánica del juez. Estas reglas viven aquí y en ningún otro lado:7576- **Suite reservada.** Califica sobre una suite que queda FUERA del alcance de77 escritura del constructor — el constructor nunca ve los tests que califican, así78 que no puede programar a la medida de ellos.79- **Limpieza a commit fresco.** Deja el workspace en un solo commit fresco y80 bloquea el egreso de red antes de una corrida calificada, para que un pase sea81 DERIVADO — no recuperado del historial de git ni del arreglo de otro.82- **Normaliza por longitud.** Los jueces prefieren con fuerza la respuesta más83 larga — corrige por longitud antes de comparar puntajes.84- **Criterios reservados rotados.** Usa una rúbrica de ejes nombrados con85 respuestas sí/no y criterios ocultos que rotan entre corridas. Un puntaje86 holístico visible se termina jugando con teatro de citas.87- **Califica el estado final.** Califica el trabajo de varios pasos sobre el88 estado FINAL, no sobre cada paso intermedio.89- **Calibra al juez.** Calibra al juez con un set chico etiquetado por humanos —90 reporta sus tasas de verdaderos positivos y verdaderos negativos — antes de91 confiarle tu dominio.9293El barajado del orden es parte de la regla de quitar ruido de arriba — una ley,94dicha una sola vez.9596## La variante en loop9798La misma puerta alimenta un loop de mejora autónomo: proponer un cambio chico →99correr un experimento corto → medir a ciegas → conservar si es mejor, revertir si100no → repetir, con un presupuesto fijo de rondas. Aliméntale al proponente las101trazas de fracaso de la ronda anterior, no solo la meta — un proponente que no ve102por qué falla edita a ciegas. Incluso un loop que no conserva nada paga su costo:103las trazas que junta apuntan a bugs concretos y arreglables que ningún puntaje104agregado revela.105106## Combina bien con107108- [blind-tribunal](../blind-tribunal/SKILL.md) — el panel de jurados más pesado cuando la pregunta son defectos, no gusto.109- [red-first](../red-first/SKILL.md) — cuando un test SÍ puede decidirlo, escribe el test.110- [clean-code-gauntlet](../clean-code-gauntlet/SKILL.md) — puertas medidas de calidad de código para acompañar la decisión de gusto.111112> Crédito del nombre: Andrej Karpathy. Inspiración del nombre; la disciplina de113> conservar-o-revertir tiene un paralelo independiente en el autoresearch de114> Karpathy (2026, github.com/karpathy/autoresearch, MIT). El aspecto ciego115> (autoría oculta) y la composición y reglas duras de aquí son de BACKS AIOS.