17°
Portada del artículo: Ocho modelos de decisión contra mis datos: ninguno superó a lo que ya uso, y el segundo del índice ordenó al revés el fraude
IABenchmarksInferencia local

Ocho modelos de decisión contra mis datos: ninguno superó a lo que ya uso, y el segundo del índice ordenó al revés el fraude

Corrí ocho modelos de decisión en el Decision Index, que reproduje, y en tres bancos propios con etiqueta real: planos de video, fraude de tarjetas y lluvia. Ninguno superó con claridad a la referencia clásica de cada banco. En fraude, el único banco donde se separan con claridad, d1-3B, segundo del índice, ordenó al revés y JEV-9B fue el mejor claro; en planos y lluvia los de arriba quedaron empatados.

Efrain Garay 10 de octubre de 2026

Reproduciendo el resumen

En tres semanas aparecieron casi una decena de modelos de decisión: modelos que no escriben, que leen un estado y responden preguntas tipadas con una probabilidad por opción, por lo general en una sola pasada. Cada uno llegó con su posición en el mismo ranking, el Decision Index. El último, d1-3B de Liquid AI, salió el 7 de octubre presentado por su laboratorio como el mejor bajo 10.000 millones de parámetros en la edición 0.2.1 del índice.

Ya había medido uno, Strands Decider 2B, como juez de los planos de mi pipeline de videos, y una regla de palabras lo había empatado. Esta vez quise responder otra pregunta: si tomo los ocho que puedo correr y los pongo sobre datos míos con etiqueta real, ¿el ranking me dice cuál usar?

Con narración: ocho modelos de decisión contra el índice público y contra datos propios. d1-3B, segundo del índice, ordena al revés el fraude; JEV-9B llega a 0,966 sin ver un ejemplo, pero con el umbral de fábrica marca casi todos los pagos normales.Verlo en el visualizador de reels →

Cómo los corrí

Ocho modelos: JEV-9B de autotrust, un alumno destilado de Jev 1.13 de TypeSafe (el Jev original solo se usa por API), Clef-flash de Cloudflare, d1-3B y d1-omni-600M de Liquid AI, Decider 2B y 4B de Mapika, Strands Decider 2B de AWS y Laya de Convai Innovations. Quedaron fuera los que no puedo correr en hardware de casa ni arrendado barato, como el pplx-decider de 27.000 millones de parámetros de Perplexity.

La regla que me impuse fue no escribir ningún prompt. Cada modelo responde con su propia llamada: el motor que su laboratorio publicó para el Decision Index cuando existe (d1, JEV-9B, Clef) y, si no, la función system_one que documenta su ficha (Decider, Laya, Strands). Y las mismas reglas que aplican los motores publicados: nada se recorta, una consulta que no cabe en la ventana del modelo o en la GPU cuenta como no respondida, y no respondida cuenta como errada.

Cómo se midieron los ocho modelos de decisiónOcho modelos de decisión con su huella medida, el mismo camino y las mismas reglas para todos, y cuatro bancos con la referencia que cada modelo tiene que superar.JEV-9Bautotrust9,0B parámetros · base Qwen3.5-9BLoRA de System 1 · cabeza de 24 casillastemperatura por tipojev_engine.py (autotrust)RTX A6000 48 GB · ventana 262.144VRAM pico 15,3 GB · 94,9 ms por preguntaClef-flash 9BCloudflare9,4B parámetros · base Qwen3.5-9Buna pasada del backbone · cabeza de esquema conjuntasoftmax por preguntaclef.py (lucataco)RTX A6000 48 GB · ventana 65.536VRAM pico 17,8 GB · 101,6 ms por preguntad1-3BLiquid AI3,1B parámetros · base LFM2.5-VL-3Bdecodificador, una pasada · texto e imagensin generar tokensd1_engine.py (Liquid AI)RTX 4070 Ti SUPER 16 GB · ventana 32.768VRAM pico 5,8 GB · 14,7 ms por preguntad1-omni-600MLiquid AI587M parámetros · base LFM2.5-Encoder-350Mcodificador bidireccional · texto con imagen o audioversión experimentald1_engine.py (Liquid AI)RTX 4070 Ti SUPER 16 GB · ventana 16.384VRAM pico 1,1 GB · 7,0 ms por preguntaDecider-4bMapika4,2B parámetros · base Qwen3.5-4B-Baseetapas supervisadas y RL · lee las letras de opcióntemperatura por tipoDecider.system_oneRTX 4070 Ti SUPER 16 GB · ventana 32.768VRAM pico 8,0 GB · 19,2 ms por preguntaDecider-2bMapika1,9B parámetros · base Qwen3.5-2B-Baseetapas supervisadas y RL · lee las letras de opcióntemperatura por tipoDecider.system_oneRTX 4070 Ti SUPER 16 GB · ventana 32.768VRAM pico 3,5 GB · 7,7 ms por preguntaStrands Decider 2BStrands (AWS)1,9B parámetros · base Qwen3.5-2B-Basepuntero sobre las opciones · lee el último tokenpregunta antes que estadoSystemOneEngine.askRTX 4070 Ti SUPER 16 GB · ventana 4.096VRAM pico 3,6 GB · 30,9 ms por preguntaLayaConvai Innovations421M parámetros · base ModernBERT-largecodificador de 0,4B · agente entrenado con RLventana de 512 tokensAgent.system_one (laya 0.4.1)RTX 4070 Ti SUPER 16 GB · ventana 512VRAM pico 2,3 GB · 11,5 ms por preguntaUna consultaestado: texto o JSONpreguntas tipadas: noul(sí / no) o choiceUna pasada hacia adelantesin tokens, su propia llamadaJEV-9B: varias pasadascon más de 16 opcionesUna probabilidad por opciónnoul: P(sí)choice: una distribuciónque suma 1Las mismas reglas para todosnunca se recorta: si excede la ventana → no soportadasi no cabe en la GPU → no soportadano soportada cuenta como erradasin ejemplos ni ajuste: 0,5 de fábrica y AUCDecision Index 0.3, parte pública6.000 consultas, 43 benchmarksmuestra estratificada de la suite públicasu puntuador: índice corregido por azarreferencia: la corrida de cada laboratorio75 descripciones de planos44 fuertes, 31 genéricas«¿plano fuerte y distintivo?»AUC · regla de encuadre 0,903del post del juezRiesgo de tarjetas (Flink)10.000 eventos, 2.506 anomalías«¿sospechoso para revisar?»AUC · bosque 0,982reglas: 81,4 % atrapadasLluvia de mañana27.256 días, 7 ciudades«¿al menos 1 mm mañana?»AUC · logística 0,847solo los mm de lluvia de hoy: 0,813

Seis entran en la RTX 4070 Ti SUPER de 16 GB para mis bancos. Los dos de 9B no: JEV-9B ocupa unos 15 GB solo al cargar, así que JEV-9B y Clef-flash corrieron en una A6000 de 48 GB arrendada. En el Decision Index también pasé a la A6000 a d1-omni, los dos Decider y Strands, porque sus consultas largas no cabían en 16 GB; d1-3B y Laya lo corrieron en la 4070 Ti SUPER. Todo lo arrendado costó US$3,86, y las latencias de una máquina no se comparan con las de la otra.

Tres tropiezos de montaje, porque cada modelo trae su paquete: Laya, Decider y Strands recortan el texto en silencio cuando no cabe en su ventana, y tuve que detectarlo para no premiar al que recorta; Strands rechaza las opciones que no son texto; y el motor de Decider compila cada forma nueva de consulta con torch.compile, lo que en la suite pública lo dejaba en una consulta cada varios segundos. Su propio constructor acepta apagarlo, y eso hice.

El índice público, reproducido

El Decision Index 0.3 puntúa a un modelo de decisión sobre 37 benchmarks públicos de cinco áreas, corregidos por azar: 0 es adivinar y 100 es perfecto. Esa parte pública pesa el 20 % del puntaje que ordena el ranking del sitio; el resto sale de pruebas privadas que solo corren sus mantenedores, así que lo que reproduje es el índice público, no el ranking completo. Su suite no se redistribuye, así que la reconstruí con el kit público, que baja cada fuente fijada y verifica que los archivos queden idénticos a los oficiales; los cuatro coincidieron. Son 140.178 consultas puntuables, demasiadas para ocho modelos en mi presupuesto, así que corrí una muestra estratificada de 6.000 con el puntuador del propio kit.

Antes de creerle a la muestra, la contrasté con los laboratorios. Liquid y autotrust publican las respuestas de su corrida completa, así que las puntué sobre mis mismas 6.000 filas: d1-3B da 49,04 en la muestra y 48,99 en la suite entera. Y mis corridas reproducen las suyas: d1-3B 49,11 contra 49,04, d1-omni 14,02 contra 14,17, y JEV-9B difiere en promedio 0,25 puntos por benchmark (sin contar GSM8K, que su corrida, hecha con la edición anterior, no trae).

Decision Index 0.3, índice público, muestra de 6.000 consultasíndice · más es mejor
  1. Clef-flash 9B55,4
  2. d1-3B49,1su corrida: 49,0
  3. JEV-9B42,9
  4. Decider-4b40,9
  5. Decider-2b27,0
  6. Strands Decider 2B20,5269 consultas no le caben
  7. d1-omni-600M14,01.758 exceden su presupuesto de instrucciones y opciones
  8. Laya3,81.451 no le caben

Muestra estratificada de la suite pública, puntuada con el kit en 62d2f51 sobre las filas muestreadas (lab/decision-judge/di/score_sample.py). Las consultas no soportadas cuentan como erradas.

Clef-flash queda arriba y d1-3B segundo, por delante de JEV-9B, que le triplica el tamaño. Liquid presentó a d1-3B como el mejor bajo 10B sobre la edición 0.2.1; en la 0.3 y en esta muestra, Clef-flash, de 9.400 millones de parámetros, queda por encima. Los límites de lectura castigan a los chicos: Laya lee 512 tokens y deja 1.451 consultas sin responder; d1-omni recorta las instrucciones y las opciones de cada pregunta a un presupuesto fijo, y su motor rechaza las 1.758 que leería a medias. Todas esas cuentan como erradas.

Banco 1: los planos de mi pipeline

Los mismos 75 planos del post del juez: 44 fuertes y 31 genéricos, etiquetados antes de correr ningún juez, con la misma pregunta. La referencia es la regla que busca palabras de encuadre, que llegó a 0,903.

75 planos: AUC de P(fuerte)AUC · más es mejor
  1. Claude Opus (referencia)0,988
  2. JEV-9B0,938atrapa 8 de 31 genéricos con 0,5
  3. Decider-4b0,904
  4. Regla de palabras (referencia)0,903atrapa 25 de 31
  5. d1-3B0,886atrapa 19 de 31
  6. Clef-flash0,855
  7. Strands Decider 2B0,8190,909 con choice
  8. Decider-2b0,739
  9. d1-omni-600M0,580
  10. Laya0,331

Medido el 9 de octubre de 2026; JEV-9B y Clef-flash en una RTX A6000, el resto en una RTX 4070 Ti SUPER. Intervalos del 95 % por bootstrap en lab/decision-judge/results/summary_engines.json.

Ninguno tiene su intervalo entero por encima del de la regla. JEV-9B es el que mejor ordena, pero con el umbral de 0,5 deja pasar 23 de los 31 genéricos; d1-3B atrapa 19 a cambio de rechazar 4 planos buenos. En la otra pregunta del banco, si cinco planos repiten la misma escena, todos aciertan las 13 listas salvo d1-omni (11) y Laya (7).

El experimento de Flink del mes pasado dejó 101.668 pagos sintéticos etiquetados, con tres tipos de anomalía inyectada: montos altos, saltos de país y ráfagas de pagos seguidos. Tomé las 2.506 anomalías y 7.494 pagos normales al azar. Cada modelo ve lo mismo que ven las reglas y el bosque: el monto, el país, los segundos desde el pago anterior de la tarjeta, si cambió de país y cuántos pagos hizo la tarjeta en el último minuto. Saqué los identificadores, porque el generador nombra los pagos de las ráfagas con una marca que delata la etiqueta. La pregunta: «¿Es este pago lo bastante sospechoso para revisarlo por fraude?».

Sobre esa muestra, el bosque de corte aleatorio del post de Flink llega a un AUC de 0,982, y las reglas atrapan el 81,4 %, el mismo recall que entonces; las falsas alarmas son menos (701) porque la muestra tiene menos pagos normales que el flujo completo.

Fraude, 10.000 pagos: AUCAUC · más es mejor
  1. Bosque de corte aleatorio (referencia)0,982entrenado sobre el flujo
  2. JEV-9B0,966sin ver un ejemplo
  3. Decider-4b0,924
  4. Strands Decider 2B0,877
  5. Clef-flash0,820
  6. Laya0,730
  7. d1-omni-600M0,682
  8. Decider-2b0,662
  9. d1-3B0,314ordena al revés

Medido el 9 de octubre de 2026 sobre 2.506 anomalías y 7.494 pagos normales del experimento de Flink. lab/decision-judge/results/summary_banks.json.

JEV-9B queda a 0,016 del bosque sin haber visto un solo pago de entrenamiento, y es lo más interesante del post. Pero el AUC no es la decisión: con el umbral de 0,5, JEV-9B marca como sospechosos 7.177 de los 7.494 pagos normales. Para compararlo con el bosque en su terreno, le di a cada modelo el mismo presupuesto de falsas alarmas que tiene el bosque, 336, y busqué el umbral en sus propias probabilidades.

Dónde deja el umbral a cada modelo en el banco de riesgoJev-9B con el umbral de fábrica de 0,5 marca 7.177 de 7.494 pagos normales. Con las 336 falsas alarmas del bosque atrapa 89 % de las anomalías, contra 95 % del bosque; Decider-4b 73 %, d1-3B 11 %.0 %50 %100 %01003361.0003.0007.494falsas alarmas (pagos normales marcados, de 7.494)Jev-9BDecider-4bd1-3Bcada modelo en el 0,5 de fábricabosque: 336 falsas alarmas, 95 % atrapadas
Jev-9B con el umbral de fábrica de 0,5 marca 7.177 de 7.494 pagos normales. Con las 336 falsas alarmas del bosque atrapa 89 % de las anomalías, contra 95 % del bosque; Decider-4b 73 %, d1-3B 11 %.

Con ese presupuesto, JEV-9B atrapa el 89,5 % de las anomalías y el bosque el 94,8 %. Decider-4b, el 73 %. Esos 5,3 puntos de diferencia entre JEV-9B y el bosque no son poco en fraude, y el bosque corre en microsegundos en una CPU.

El caso de d1-3B merece aparte, porque es el segundo del índice público y aquí ordena al revés. Los montos altos los marca con una probabilidad mediana de 0,84 y los saltos de país con 0,68, bien. Pero a una ráfaga de pagos le da 0,41, menos que a un pago normal (0,56), y las ráfagas son dos tercios de las anomalías del banco. Los pocos pagos normales que caen a menos de un segundo del anterior también reciben 0,41. No aislé qué parte del texto lo mueve, pero el patrón es consistente: un pago pegado al anterior le parece menos sospechoso, no más.

Banco 3: lluvia de mañana

El banco del post de Intern-Decision: los 27.256 días de prueba de 2016 a 2026 en siete ciudades, con el mismo estado y la misma pregunta, «¿Lloverá al menos 1 mm mañana en esta estación?». La regresión logística de la serie llega a 0,847 sobre esos días, e Intern-Decision 2B a 0,823. Agregué dos referencias que no tenía entonces: usar solo los milímetros de lluvia de hoy como puntaje da 0,813, y la regla de sí o no «hoy llovió al menos 1 mm» da 0,709.

Lluvia, 27.256 días: AUCAUC · más es mejor
  1. Regresión logística (referencia)0,847
  2. Intern-Decision 2B0,823
  3. JEV-9B0,820
  4. Decider-2b0,816
  5. Clef-flash0,814
  6. Solo los mm de lluvia de hoy (referencia)0,813
  7. d1-3B0,810
  8. Decider-4b0,805
  9. Strands Decider 2B0,793
  10. d1-omni-600M0,593
  11. Laya0,577

Medido el 9 de octubre de 2026 sobre los días de prueba de la serie (NASA POWER, 7 ciudades). lab/decision-judge/results/summary_banks.json.

Ninguno alcanza a la logística, y cuatro de ellos quedan dentro del intervalo de esa sola variable. No probé qué parte del estado usan, así que no puedo decir que lean sobre todo la lluvia de hoy, aunque la cercanía lo sugiere.

El orden cambia de banco en banco

Con los cuatro bancos lado a lado, el índice público acierta en lo grueso y falla en lo fino.

El puesto de cada modelo en cuatro bancosLos ocho modelos de decisión ordenados en el Decision Index público y en tres bancos propios con etiqueta real. Un modelo que lidera un banco puede quedar al fondo de otro.Decision Indexpúblico, muestraPlanosAUCRiesgoAUCLluviaAUC42,90,9380,9660,820JEV-9B55,40,8550,8200,814Clef-flash 9B49,10,8860,3140,810d1-3B14,00,5800,6820,593d1-omni-600M40,90,9040,9240,805Decider-4b27,00,7390,6620,816Decider-2b20,50,8190,8770,793Strands Decider 2B3,80,3310,7300,577Laya

Acierta en separar a los dos más débiles: d1-omni y Laya quedan al fondo en planos y en lluvia, y por eso su orden se parece al de mis planos (correlación de rangos de Spearman de 0,76) y al de la lluvia (0,74). En fraude no dice nada (0,10). Y en fraude, el único banco donde las diferencias son claras, no anticipa el orden: d1-3B, segundo en el índice, es el último, y JEV-9B, tercero, es el mejor claro. En planos y lluvia, los de arriba quedan empatados dentro del ruido, así que ahí no había un mejor que el índice pudiera elegir.

Lo que no puedo afirmar

Es una muestra por banco y una máquina por tamaño de modelo. Los pagos son sintéticos, generados para el post de Flink, y la lluvia llega como texto, con la redacción que usó la serie; otra redacción del estado o de la pregunta puede mover los resultados de un modelo de decisión, y no probé variantes. A ninguno le di ejemplos ni ajusté nada, que es justo como llegan de fábrica y no como se usarían en producción. Del Decision Index corrí una muestra estratificada de 6.000 consultas de su parte pública, no la suite completa de 140.000 ni las pruebas privadas que completan el ranking. Y los intervalos de confianza remuestrean filas sueltas, cuando los pagos de una ráfaga y los días de lluvia de una misma ciudad no son independientes: son más angostos de lo que deberían, así que no los uso para afirmar diferencias pequeñas.

Mi opinión

Los modelos de decisión son una idea buena y la prueba está en JEV-9B: sin un ejemplo, ordena el fraude casi como un bosque entrenado sobre el flujo, y lo hace leyendo una frase. Para prototipar una decisión nueva, sin datos todavía, eso vale mucho.

Pero el índice público no reemplaza medir con tus datos. En planos y en lluvia sirvió para descartar a los dos más débiles; no sirvió para elegir entre los buenos: el mismo modelo fue segundo en el índice y ordenó al revés uno de mis bancos, y el umbral de fábrica casi nunca es el que sirve. Si ya tienes una regla, un modelo clásico o un modelo entrenado sobre tus datos, compáralos sobre el mismo conjunto antes de cambiar.

Cuándo usaría uno y cuándo no

  • Sí, para una decisión nueva sin datos etiquetados, con JEV-9B o Decider-4b, y como segunda opinión barata junto a una regla.
  • Con cuidado, calibrando el umbral con unos cientos de ejemplos propios antes de usar la probabilidad como corte.
  • No, en lugar de un modelo entrenado sobre tus datos cuando ya lo tienes, ni tomando el primer puesto del índice como garantía para tu caso.

Preguntas frecuentes

¿Qué es un modelo de decisión?

Un modelo que no genera texto: recibe un estado (texto o JSON) y preguntas tipadas, sí o no (noul) o una elección entre opciones con su criterio (choice), y devuelve una probabilidad por opción en una sola pasada (el motor de JEV-9B usa varias cuando una pregunta trae más de 16 opciones). Jev, de TypeSafe, abrió la categoría en septiembre de 2026 como servicio por API; en las semanas siguientes salieron Clef de Cloudflare, Strands Decider de AWS, Decider de Mapika, Laya, d1 de Liquid AI y otros. El JEV-9B que medí es un alumno abierto de Jev, publicado por autotrust y destilado de sus respuestas, no el Jev de TypeSafe.

¿Cuál fue el mejor en mis datos?

Depende del banco. JEV-9B fue el mejor claro en fraude (AUC 0,966, contra 0,924 del siguiente); en planos (0,938) y en lluvia (0,820) quedó empatado con otros dentro del ruido de la medición. Pero en ninguno de los tres superó con claridad a la referencia que ya uso: una regla de palabras en planos (0,903), un bosque de corte aleatorio entrenado sobre el flujo en fraude (0,982) y una regresión logística en lluvia (0,847).

¿Por qué d1-3B ordena al revés el fraude?

Porque una ráfaga de pagos le parece menos sospechosa que un pago normal: les da una probabilidad mediana de 0,41 contra 0,56. Los montos altos (0,84) y los saltos de país (0,68) los marca bien, pero las ráfagas son dos tercios de las anomalías del banco, así que el orden total queda invertido (AUC 0,31).

¿Sirve el umbral de 0,5?

No sin calibrar. En fraude, JEV-9B con 0,5 marca 7.177 de los 7.494 pagos normales. Si se le fija el mismo presupuesto de falsas alarmas que tiene el bosque (336), atrapa el 89,5 % de las anomalías, contra el 94,8 % del bosque. El umbral hay que ajustarlo con ejemplos propios.

¿Necesito una GPU grande?

Para los de 9B en bf16, más de 16 GB: JEV-9B ocupa unos 15 GB solo al cargar y se quedó sin memoria en una RTX 4070 Ti SUPER con las consultas largas, así que corrí Jev y Clef-flash en una A6000 de 48 GB arrendada. Los demás entran en 16 GB: d1-3B ocupó 5,8 GB, Decider-4b 8,0 GB, Strands 3,6 GB, Laya 2,3 GB y d1-omni 1,1 GB.

¿Puedo reproducirlo?

Sí. Los tres bancos, los motores de cada modelo, los resultados por consulta y los scripts que calculan cada cifra están publicados en un gist enlazado en las fuentes. El Decision Index se reconstruye con el kit público, que verifica que la suite quede idéntica a la oficial.

Fuentes

Medido el 9 y 10 de octubre de 2026. En mis bancos, seis modelos en una RTX 4070 Ti SUPER de 16 GB (torch 2.14.1, transformers 5.19.0) y JEV-9B y Clef-flash en una RTX A6000 de 48 GB arrendada (torch 2.8.0, transformers 5.19.0). En el Decision Index 0.3 (kit en 62d2f51), d1-3B y Laya en la RTX 4070 Ti SUPER y los otros seis en la A6000.

Comentarios

Todavía no hay comentarios. El primero es tuyo.

Se revisa antes de publicarse. El correo no se guarda ni aparece en ninguna parte.