Dataset · v1
Planos de video etiquetados para evaluar jueces automáticos
Los datos detrás del benchmark de decision models: 75 descripciones de planos de mi propio pipeline de video, etiquetadas como fuertes o genéricas, con lo que respondió cada juez. Libres de usar si los citas.
- Versión
- 1 · 7 de octubre de 2026
- Licencia
- CC-BY-4.0: cualquier uso, incluso comercial, citando la fuente
- Contenido
- 75 descripciones de planos (44 fuertes, 31 genéricas) y 13 listas de cinco planos
- Idioma de los textos
- Inglés (así le llegan los prompts al generador de imágenes)
- Jueces
- Strands Decider 2B v19 y v21 (noul y choice), qwen2.5 14B, Claude Opus, Claude Haiku, MiniMax M3 y 2 líneas base sin modelo
- Autor
- Efrain Garay
Qué contiene
Tres archivos y un LEEME. Cada valor sale de los resultados crudos; nada se escribió a mano.
| Archivo | Columnas |
|---|---|
planos.csvun renglón por plano (75) | id, stratum, source, text, subject, action, framing (0/1 cada uno), label, label_loose, borderline |
juicios.csvun renglón por plano × juez (750) | id, judge, model (identificador exacto), p_strong, latency_ms, latency_kind |
listas.jsonuna entrada por lista de cinco planos (13) | kind, variant, shots, p_repeated por juez, similitud de embeddings, proporción de textos distintos |
Cómo se construyó
22 escenas de producción de corridas reales de mi paso que escribe la lista de planos, 41 salidas de un modelo débil (qwen2.5 14B y gemma3 4B corriendo el mismo paso con el prompt sin mejorar, donde aparecen las fallas reales: una escena pegada diez veces, el prefijo de estilo sin escena, sujetos de relleno) y 12 adversariales escritos a mano, con palabras trampa o jerga de cámara sin contenido.
Cada plano está anotado con tres rasgos: un sujeto concreto, una acción o estado visible y una decisión de cámara explícita. Un plano es fuerte si tiene los tres. Los jueces respondieron la misma pregunta, y sus probabilidades se guardan tal como salieron, sin umbrales.
Cómo citarlo
Garay, E. (2026). Planos de video etiquetados para evaluar jueces automáticos (v1) [Dataset]. efraingaray.com. https://efraingaray.com/datasets/juez-decision-75/. Licencia CC-BY-4.0.
Límites
- 75 ítems es un banco chico: compara jueces con pruebas pareadas, como hace el artículo.
- Un solo anotador, el autor. Otro anotador podría mover algunos casos frontera.
- Los textos están en inglés y salen de un solo pipeline y sus estilos visuales.
- Las listas de repetición son fáciles: copias exactas y paráfrasis leves.