11°

~/temas/rendimiento

Medir rendimiento sin engañarse

Los números son fáciles. Lo difícil es que signifiquen algo.

Todos los temas

La mayoría de las comparaciones de rendimiento miden otra cosa que la que dicen medir: un corpus que cabe en caché, un banco que fija mal la verdad, una diferencia del 2% presentada como victoria cuando la dispersión entre corridas es del 14%. En estas entradas el método ocupa tanto espacio como el resultado, y las mediciones que hubo que descartar también se publican.

27 entradas

Portada: Un modelo que no escribe, solo decide: puse a Intern-Decision a predecir la lluvia sin entrenarloArtículoUn modelo que no escribe, solo decide: puse a Intern-Decision a predecir la lluvia sin entrenarloIntern-Decision salió el 26 de septiembre de 2026: modelos de 0,8B a 4B que no generan texto y devuelven una probabilidad por pregunta en una sola pasada. Lo instalé el mismo día, tropecé con tres fallos al instalarlo, uno de los cuales lo hacía entre 2 y 3,2 veces más lento, y lo puse a predecir la lluvia de mañana en 27.256 días de siete ciudades chilenas sin entrenarlo. El 2B llega a un AUC de 0,823, casi lo mismo que un Naive Bayes entrenado con 74.145 filas, y queda bajo la regresión logística.#Modelos#Benchmarks#GPUPortada: AWS dice que su harness de agentes ahorra 28% de tokens. Medí 1,82x más caro en local, 88% más barato en la nubeArtículoAWS dice que su harness de agentes ahorra 28% de tokens. Medí 1,82x más caro en local, 88% más barato en la nubeProbé Strands Harness, el runtime de agentes de AWS, contra un LangGraph pelado, mismos 3 tools, mismo gatekeeper, misma conversación de 20 turnos. Contra un Qwen3.8-27B local de 16k de contexto gastó 1,82 veces más tokens. Contra el mismo trabajo en un modelo cloud, con la temperatura por fin igualada entre los dos, gastó un 88,8% menos. Y tres auditorías adversariales tuvieron que corregir mis propios errores en el camino: 11 herramientas de más, un límite de turnos que mentía, y un doble conteo de caché que inflaba el primer número 4 veces.#Agentes#LangGraph#AWSPortada: Cómo funciona hoy la compresión de archivos (y cómo le gané 2,86% a zlib con teoría de grafos)ArtículoCómo funciona hoy la compresión de archivos (y cómo le gané 2,86% a zlib con teoría de grafos)Traduje zlib de C a Rust con c2rust, probé que la traducción es bit exacta en más de 15.000 casos, y después reemplacé la heurística de zlib por un camino mínimo en grafo. Resultado: 2,86% más chico que zlib -9, verificado byte a byte contra la C real. En el camino, cómo funciona la compresión sin pérdida hoy: LZ77, Huffman, y por qué zopfli y PPMd tampoco rompen el límite de Shannon.#Compresión#Rust#CPortada: Rust Coreutils 0.12 contra GNU 9.12: casi todo funciona igual, arrancar cuesta casi el triple y mv entre discos pierde las fechasArtículoRust Coreutils 0.12 contra GNU 9.12: casi todo funciona igual, arrancar cuesta casi el triple y mv entre discos pierde las fechasMedí Rust Coreutils (uutils) 0.12 contra GNU coreutils 9.12 en contenedores con límites: la suite de pruebas de GNU, 157 comandos con la salida comparada y el arranque de proceso. uutils es más lento en 91 de 157 celdas, tarda 2,8 veces más en lanzar 5.000 procesos, y mv entre sistemas de archivos pierde las fechas.#Rust#Coreutils#GNUPortada: Dragonfly 2.0 contra Redis 8 y Valkey 9: con 2 CPU gana por mucho, con 4 depende de cómo configures a los otrosArtículoDragonfly 2.0 contra Redis 8 y Valkey 9: con 2 CPU gana por mucho, con 4 depende de cómo configures a los otrosMedí Dragonfly 2.0, Redis 8.10 y Valkey 9.1 en contenedores con 2 y 4 CPU. Con io-threads activados, Redis y Valkey alcanzan a Dragonfly sin pipeline y lo superan con pipeline 16; con 2 CPU y sin pipeline, Dragonfly gana entre 59 % y 99 % sobre Redis por defecto. Usa 8 a 15 % menos memoria por clave.#Dragonfly#Redis#ValkeyPortada: CUDA en Rust contra CUDA C++: Rust gana por 3,2 % hasta que compruebas que no calculan lo mismoArtículoCUDA en Rust contra CUDA C++: Rust gana por 3,2 % hasta que compruebas que no calculan lo mismoCompilé cuda-oxide, el backend de NVIDIA para escribir kernels CUDA en Rust, y medí el mismo kernel contra CUDA C++. En Mandelbrot Rust sale 3,2 % más rápido, pero los dos programas difieren en 27.510 píxeles; con la aritmética igualada bit a bit, Rust queda 7 % más lento.#Rust#CUDA#GPUPortada: Wild le gana a mold enlazando Rust en 20 de 20, y en release el enlazador ya no es el cuello de botellaArtículoWild le gana a mold enlazando Rust en 20 de 20, y en release el enlazador ya no es el cuello de botellaMedí Wild 0.10.0, mold 2.42.1, rust-lld y GNU ld enlazando ripgrep y cargo. Wild ganó las 20 repeticiones de cada proyecto, por 1,9 ms y unos 8 ms. Con cualquiera de los dos el enlace es cerca del 1 % del rebuild. Y por el camino casi publico números falsos dos veces.#Rust#Enlazadores#BenchmarksPortada: Red neuronal explicada: igualó al boosting con 2.177 pesos, y cambiar la semilla le movió el AUC 0,004TutorialRed neuronal explicada: igualó al boosting con 2.177 pesos, y cambiar la semilla le movió el AUC 0,004Qué es una red neuronal, qué hace cada capa y cuándo falla, medido con clima diario de siete ciudades de Chile entre 1984 y 2026. Una capa oculta de 128 unidades, 2.177 pesos y 81 KB, llegó a AUC 0,883 en la prueba de 2016-2026: la misma cifra que un boosting de 2,1 MB, con 0,40 ms por fila contra 3,09. Entrenarla costó cinco veces más, y repetir el entrenamiento cambiando solo la semilla movió el AUC de validación entre 0,881 y 0,884.#Machine learning#Algoritmos#PythonPortada: Transformer explicado: quedó bajo tres modelos más simples, y entre las candidatas de arriba la rejilla ordenó al revésTutorialTransformer explicado: quedó bajo tres modelos más simples, y entre las candidatas de arriba la rejilla ordenó al revésQué es un Transformer, qué hace la atención y cuándo falla, medido con clima diario de siete ciudades de Chile entre 1984 y 2026. La red elegida tiene 9.633 parámetros y 49 KB, y quedó por debajo del boosting, del bosque y de una red de una capa. Lo que más enseña no es el ranking: entre las seis arquitecturas que competían, el orden de la validación se invirtió en la prueba.#Machine learning#Algoritmos#PythonPortada: KNN explicado: entrenar tardó 0,007 s, predecir 5,5 s y con k = 1 memorizó lo que vioTutorialKNN explicado: entrenar tardó 0,007 s, predecir 5,5 s y con k = 1 memorizó lo que vioQué es k vecinos más cercanos, por qué hay que escalar, cómo elegir k y cuándo falla, medido con clima diario de siete ciudades de Chile entre 1984 y 2026. Ajustar con las 74.145 filas tomó 0,007 s y puntuar la prueba de 2016-2026, 5,5 s con un hilo; con k = 1 dio AUC 1,000 en sus propios días de entrenamiento y 0,69 en validación. Con k = 100 llegó a 0,870, bajo un boosting y sobre la regresión logística.#Machine learning#Algoritmos#PythonPortada: Naive Bayes explicado: entrenó en 0,008 s y pesa 1,3 KB, pero el 62 % de sus probabilidades quedó en los bordesTutorialNaive Bayes explicado: entrenó en 0,008 s y pesa 1,3 KB, pero el 62 % de sus probabilidades quedó en los bordesQué es Naive Bayes, qué significa la suposición de independencia y cuándo falla, medido con clima diario de siete ciudades de Chile entre 1984 y 2026. Ajustar con 74.145 filas tomó 0,008 s y el modelo ocupa 1,3 KB, con AUC 0,822; por tramos llegó a 0,844, sin diferencia concluyente con la regresión logística. El 62 % de sus probabilidades quedó bajo 0,01 o sobre 0,99, y calibrarlo bajó la pérdida logarítmica de 1,09 a 0,39.#Machine learning#Algoritmos#PythonPortada: SVM explicada: la presión en Pa hundió el AUC a 0,555 y el kernel exacto tardó 51 segundosTutorialSVM explicada: la presión en Pa hundió el AUC a 0,555 y el kernel exacto tardó 51 segundosQué es una máquina de vectores de soporte, qué hacen el margen, C y gamma, y cuándo falla, medido con clima diario de siete ciudades de Chile entre 1984 y 2026. Sin escalar, cambiar la presión de kPa a Pa bajó el AUC en validación de 0,835 a 0,555; con las 74.145 filas el kernel RBF tardó 51 s y, en la prueba de 2016-2026, quedó bajo un boosting que entrenó en 2,6 s.#Machine learning#Algoritmos#PythonPortada: Árbol de decisión explicado: 15 nodos que se leen, 8.524 hojas que memorizanTutorialÁrbol de decisión explicado: 15 nodos que se leen, 8.524 hojas que memorizanQué es un árbol de decisión, cómo elige sus preguntas y cuándo memoriza, medido con clima diario de siete ciudades de Chile entre 1984 y 2026. Sin límite de profundidad acertó todo lo que vio y en días nuevos bajó a AUC 0,689; con profundidad 7, elegida en validación, llegó a 0,862.#Machine learning#Algoritmos#PythonPortada: Gradient boosting explicado: 594 árboles en cadena que entrenan 9 veces más rápido que un bosqueTutorialGradient boosting explicado: 594 árboles en cadena que entrenan 9 veces más rápido que un bosqueQué es gradient boosting, cómo cada árbol corrige a los anteriores y cuándo falla, medido con clima diario de siete ciudades de Chile entre 1984 y 2026. Con tasa 1,0 se desestabilizó y a las 3.000 rondas quedó en AUC 0,681; con tasa 0,03 y 594 rondas elegidas en validación llegó a 0,883, sin diferencia concluyente con un bosque de 200 árboles.#Machine learning#Algoritmos#PythonPortada: K-Means explicado: le pedí cuatro tipos de día al clima de Chile y encontró SantiagoTutorialK-Means explicado: le pedí cuatro tipos de día al clima de Chile y encontró SantiagoQué es K-Means, cómo funciona el algoritmo de Lloyd y cuándo engaña, medido con clima diario de siete ciudades de Chile entre 1984 y 2026. Sin escalar, la humedad aporta el 76 % de la separación; con k = 8, solo el 18 % de los inicios al azar queda a menos de 0,1 % de la mejor inercia encontrada; y ningún criterio se pone de acuerdo en cuántos grupos hay.#Machine learning#Algoritmos#PythonPortada: Random Forest explicado: cómo vota un bosque de árboles, medido con 42 años de clima de ChileTutorialRandom Forest explicado: cómo vota un bosque de árboles, medido con 42 años de clima de ChileQué es Random Forest, cómo funcionan el bootstrap y el sorteo de variables, y por qué sus árboles se entrenan en paralelo y no en cadena. Lo medí prediciendo lluvia en siete ciudades de Chile: 7,5 veces más rápido con 8 CPU, meseta pasados los 100 árboles, una columna de ruido que la importancia por defecto pone por encima de variables reales y un techo al extrapolar temperaturas.#Machine learning#Algoritmos#PythonPortada: Regresión lineal explicada: la recta que midió el calor en Chile y lo que la rompeTutorialRegresión lineal explicada: la recta que midió el calor en Chile y lo que la rompeQué es la regresión lineal, cómo se calculan sus coeficientes y cuándo deja de servir, medido con datos diarios de siete ciudades de Chile. La máxima sube 0,33 °C por década en Temuco y baja en Valparaíso, el descenso de gradiente sin escalar no llega a una solución útil, un 5 % de datos con la coma corrida multiplica el error por 4,7 y la recta entrena unas 1.100 veces más rápido que un bosque aleatorio.#Machine learning#Algoritmos#PythonPortada: Regresión logística explicada: 16 números para decidir si llueve mañanaTutorialRegresión logística explicada: 16 números para decidir si llueve mañanaQué es la regresión logística, cómo convierte una suma en probabilidad y cuándo engaña, medida con clima diario de siete ciudades de Chile entre 1984 y 2026. Una recta da probabilidades negativas en el 9 % de los días; con umbral 0,5 la logística atrapa solo la mitad de las lluvias; y promete más lluvia de la que cae.#Machine learning#Algoritmos#PythonPortada: Un chat en Amazon Bedrock AgentCore para mi blog: lo rompí con 64 mensajes y lo rearmé con reglas fuera del promptArtículoUn chat en Amazon Bedrock AgentCore para mi blog: lo rompí con 64 mensajes y lo rearmé con reglas fuera del promptTutorial: chat LangGraph en Amazon Bedrock AgentCore con Knowledge Base S3 y guardrails, probado con una conversación de 64 mensajes. Costos y opción local.#IA#AWS#SeguridadPortada: Medí Pingora 0.9.0 seis veces más lento que nginx. El culpable era una línea de mi códigoArtículoMedí Pingora 0.9.0 seis veces más lento que nginx. El culpable era una línea de mi códigoEscribí un reverse proxy mínimo con Pingora 0.9.0 y en un contenedor de 2 vCPU medía 21 mil peticiones por segundo contra las 126 mil de nginx: seis veces más lento. El culpable no era Pingora sino un getaddrinfo bloqueante que mi upstream_peer ejecutaba en cada petición. Corregido, la brecha real es 1,70x, y perf la cuantifica: 1,70x en ciclos por petición, 119,4 mil contra 70,4 mil, sin decir dónde se gastan.#Rust#Benchmarks#RedesPortada: Reglas duras contra Random Cut Forest sobre el mismo stream: el modelo aporta 13 puntos de recall y cuesta 7 veces el throughputArtículoReglas duras contra Random Cut Forest sobre el mismo stream: el modelo aporta 13 puntos de recall y cuesta 7 veces el throughputMonté Apache Flink con Kafka y medí tres reglas deterministas contra el Random Cut Forest de Amazon sobre exactamente el mismo flujo de pagos, en un servidor de cuatro núcleos sin GPU. Las reglas alcanzan 0,814 de recall a 173 mil eventos por segundo; el modelo llega a 0,943 pero baja el pipeline a 23 mil; juntos suben a 0,982.#Streaming#Benchmarks#DatosPortada: Bun se reescribió de Zig a Rust en once días. Medí lo que publicaron, y lo que noArtículoBun se reescribió de Zig a Rust en once días. Medí lo que publicaron, y lo que noBun portó 535.000 líneas de Zig a Rust y publicó tres cifras concretas: arranque, peticiones por segundo y tamaño de binario. La versión 1.3.14 fue la última en Zig y la 1.4.0 la primera en Rust, así que se descargan las dos y se mide lo mismo cambiando solo el binario. El arranque la supera con holgura, el binario se queda corto, y de memoria y CPU en reposo el anuncio no da ningún número: esas dos las mido sin nada oficial con qué contrastarlas.#Rust#ArquitecturaPortada: Traduje DOOM de C a Rust sin escribir una línea, y después usé el modelo para lo que sí sirveArtículoTraduje DOOM de C a Rust sin escribir una línea, y después usé el modelo para lo que sí sirveNecesitaba pasar un programa de C a Rust y mi primera idea fue pedírselo a un modelo. Existía una herramienta que lo hace en 23 segundos. La traducción coincidió bit a bit con el original en las 11.113 tramas comparadas, salvo una que se explica por un fallo de memoria sin inicializar ya presente en el DOOM de 1993, y el modelo terminó sirviendo para otra cosa: texturas, relieve por píxel y luz continua sobre el motor original.#Rust#C#Traducción de códigoPortada: Go 1.27 trae SIMD portátil: empata con NumPy fuera de caché y pierde dentroArtículoGo 1.27 trae SIMD portátil: empata con NumPy fuera de caché y pierde dentroMedí el paquete simd experimental de Go 1.27 contra NumPy en una tarea real. Empatan cuando el corpus no cabe en caché, y NumPy gana 2.4 veces cuando sí cabe. Por el camino casi publico dos comparaciones falsas, y esas son la parte útil.#Go#Benchmarks#PythonPortada: TabPFN y TabICL contra XGBoost ajustado: el modelo que no entrena ganó en catorce de catorce tablasArtículoTabPFN y TabICL contra XGBoost ajustado: el modelo que no entrena ganó en catorce de catorce tablasLa promesa de TabPFN y TabICL es que predicen sobre una tabla sin entrenar en ella y aun así superan al boosting ajustado. La medí en catorce datasets del banco de Grinsztajn, con la misma partición y el mismo reloj para todos. Gana el que no entrena, la ventaja aguanta hasta 32 000 filas en vez de romperse, y el modelo más citado ya no se puede descargar sin cuenta.#Modelos#Benchmarks#GPUPortada: Puse el mismo agente a resolver bugs reales con tres motores locales: 284B, 27B y 27B en dos bitsArtículoPuse el mismo agente a resolver bugs reales con tres motores locales: 284B, 27B y 27B en dos bitsEl DeepSeek Harness solo se ha probado con la API oficial. Lo conecté a tres motores locales y les di instancias reales de SWE-bench Verified. Dos empatan en aciertos, uno es once veces más rápido, y el que tiene 284 mil millones de parámetros no llega ni a la salida.#Agentes#Modelos#GPUPortada: ¿Entra Qwen3.8-27B en 16 GB de VRAM? Lo medí, y de paso descubrí que mi banco de pruebas mentíaArtículo¿Entra Qwen3.8-27B en 16 GB de VRAM? Lo medí, y de paso descubrí que mi banco de pruebas mentíaTodos repiten que el nuevo modelo de Alibaba necesita unos 15 GB en 4 bits. Mi GPU tiene 16 y el archivo pesa 17. Medí tokens por segundo, VRAM real y reparto CPU/GPU en tres contextos, y el modelo terminó corrigiéndome a mí.#Modelos#GPU#Benchmarks

Todos los escritos