12°

Dataset · v1

Planos de video etiquetados para evaluar jueces automáticos

Los datos detrás del benchmark de decision models: 75 descripciones de planos de mi propio pipeline de video, etiquetadas como fuertes o genéricas, con lo que respondió cada juez. Libres de usar si los citas.

Versión
1 · 7 de octubre de 2026
Licencia
CC-BY-4.0: cualquier uso, incluso comercial, citando la fuente
Contenido
75 descripciones de planos (44 fuertes, 31 genéricas) y 13 listas de cinco planos
Idioma de los textos
Inglés (así le llegan los prompts al generador de imágenes)
Jueces
Strands Decider 2B v19 y v21 (noul y choice), qwen2.5 14B, Claude Opus, Claude Haiku, MiniMax M3 y 2 líneas base sin modelo
Autor
Efrain Garay

Qué contiene

Tres archivos y un LEEME. Cada valor sale de los resultados crudos; nada se escribió a mano.

ArchivoColumnas
planos.csvun renglón por plano (75)id, stratum, source, text, subject, action, framing (0/1 cada uno), label, label_loose, borderline
juicios.csvun renglón por plano × juez (750)id, judge, model (identificador exacto), p_strong, latency_ms, latency_kind
listas.jsonuna entrada por lista de cinco planos (13)kind, variant, shots, p_repeated por juez, similitud de embeddings, proporción de textos distintos

Cómo se construyó

22 escenas de producción de corridas reales de mi paso que escribe la lista de planos, 41 salidas de un modelo débil (qwen2.5 14B y gemma3 4B corriendo el mismo paso con el prompt sin mejorar, donde aparecen las fallas reales: una escena pegada diez veces, el prefijo de estilo sin escena, sujetos de relleno) y 12 adversariales escritos a mano, con palabras trampa o jerga de cámara sin contenido.

Cada plano está anotado con tres rasgos: un sujeto concreto, una acción o estado visible y una decisión de cámara explícita. Un plano es fuerte si tiene los tres. Los jueces respondieron la misma pregunta, y sus probabilidades se guardan tal como salieron, sin umbrales.

Cómo citarlo

Garay, E. (2026). Planos de video etiquetados para evaluar jueces automáticos (v1) [Dataset]. efraingaray.com. https://efraingaray.com/datasets/juez-decision-75/. Licencia CC-BY-4.0.

Límites

  • 75 ítems es un banco chico: compara jueces con pruebas pareadas, como hace el artículo.
  • Un solo anotador, el autor. Otro anotador podría mover algunos casos frontera.
  • Los textos están en inglés y salen de un solo pipeline y sus estilos visuales.
  • Las listas de repetición son fáciles: copias exactas y paráfrasis leves.