# Planos de video etiquetados para evaluar jueces automáticos (v1)

75 descripciones de planos para un generador de imágenes (en inglés), etiquetadas como
fuertes o genéricas, y las probabilidades que les dieron 8 jueces y 2 líneas base. Más 13
listas de cinco planos para medir la detección de escenas repetidas.

- Página: https://efraingaray.com/datasets/juez-decision-75/
- Artículo con el análisis: https://efraingaray.com/blog/juez-decision-2b/
- Scripts: https://gist.github.com/EfrainGaray/108dda29e4796288af8a63197fd42e36
- Licencia: CC-BY-4.0 (https://creativecommons.org/licenses/by/4.0/)

## Archivos
- `planos.csv`: id, stratum (production, weak-model, adversarial), source, text, subject,
  action, framing (rasgos de la rúbrica, 0/1), label (literal: fuerte si los tres),
  label_loose (sujeto y acción o encuadre), borderline (1 = caso frontera).
- `juicios.csv`: id, judge, model (identificador exacto), p_strong (probabilidad de
  "fuerte"), latency_ms, latency_kind (local_call = cronómetro alrededor de la llamada en
  la misma GPU; api_reported = latencia que reporta la API).
- `listas.json`: las 13 listas (kind: distinct o repeated; variant), con la probabilidad de
  "repetida" de cada juez, la similitud media de embeddings y la proporción de escenas
  distintas por texto.

## Cómo se construyó
22 escenas de corridas reales de producción, 41 salidas de un modelo débil (qwen2.5 14B y
gemma3 4B corriendo el nodo real con el prompt sin mejorar) y 12 adversariales escritos a
mano. Los rasgos de cada plano se anotaron antes de correr los jueces; la regla que los
agrega en etiqueta se corrigió después para que coincida con la pregunta (se publican las
dos variantes). Las anotaciones las hizo el autor; 8 planos están marcados como frontera.

## Cita
Garay, E. (2026). Planos de video etiquetados para evaluar jueces automáticos (v1) [Dataset]. efraingaray.com. https://efraingaray.com/datasets/juez-decision-75/. Licencia CC-BY-4.0.
