11°

~/temas/modelos-locales

Modelos en hardware propio

Qué entra de verdad en una tarjeta de 16 GB, y qué se pierde por el camino.

Todos los temas

Casi todo lo que se publica sobre modelos abiertos se mide en tarjetas de centro de datos. Aquí la pregunta es otra: si el archivo pesa más que la memoria disponible, ¿arranca igual, y a qué costo? Estas entradas comparten banco de pruebas —la misma GPU de 16 GB, los mismos inputs congelados— para que los números se puedan poner uno al lado del otro en vez de leerse sueltos.

11 entradas

Portada: Un modelo que no escribe, solo decide: puse a Intern-Decision a predecir la lluvia sin entrenarloArtículoUn modelo que no escribe, solo decide: puse a Intern-Decision a predecir la lluvia sin entrenarloIntern-Decision salió el 26 de septiembre de 2026: modelos de 0,8B a 4B que no generan texto y devuelven una probabilidad por pregunta en una sola pasada. Lo instalé el mismo día, tropecé con tres fallos al instalarlo, uno de los cuales lo hacía entre 2 y 3,2 veces más lento, y lo puse a predecir la lluvia de mañana en 27.256 días de siete ciudades chilenas sin entrenarlo. El 2B llega a un AUC de 0,823, casi lo mismo que un Naive Bayes entrenado con 74.145 filas, y queda bajo la regresión logística.#Modelos#Benchmarks#GPUPortada: AWS dice que su harness de agentes ahorra 28% de tokens. Medí 1,82x más caro en local, 88% más barato en la nubeArtículoAWS dice que su harness de agentes ahorra 28% de tokens. Medí 1,82x más caro en local, 88% más barato en la nubeProbé Strands Harness, el runtime de agentes de AWS, contra un LangGraph pelado, mismos 3 tools, mismo gatekeeper, misma conversación de 20 turnos. Contra un Qwen3.8-27B local de 16k de contexto gastó 1,82 veces más tokens. Contra el mismo trabajo en un modelo cloud, con la temperatura por fin igualada entre los dos, gastó un 88,8% menos. Y tres auditorías adversariales tuvieron que corregir mis propios errores en el camino: 11 herramientas de más, un límite de turnos que mentía, y un doble conteo de caché que inflaba el primer número 4 veces.#Agentes#LangGraph#AWSPortada: CUDA en Rust contra CUDA C++: Rust gana por 3,2 % hasta que compruebas que no calculan lo mismoArtículoCUDA en Rust contra CUDA C++: Rust gana por 3,2 % hasta que compruebas que no calculan lo mismoCompilé cuda-oxide, el backend de NVIDIA para escribir kernels CUDA en Rust, y medí el mismo kernel contra CUDA C++. En Mandelbrot Rust sale 3,2 % más rápido, pero los dos programas difieren en 27.510 píxeles; con la aritmética igualada bit a bit, Rust queda 7 % más lento.#Rust#CUDA#GPUPortada: ExLlamaV3 contra llama.cpp con Qwen3.8-27B en 16 GB: decodifica más rápido, pero no siempre ganaArtículoExLlamaV3 contra llama.cpp con Qwen3.8-27B en 16 GB: decodifica más rápido, pero no siempre ganaLes di a los dos motores exactamente los mismos tokens de entrada dentro de un contenedor con límites de pod. ExLlamaV3 decodifica más rápido y procesó 131 mil tokens de contexto; en archivos de 13 GB pierde menos calidad, en los de 15 GB pierde contra el GGUF. En un turno agéntico, el prefill se come casi toda la ventaja.#ExLlamaV3#llama.cpp#CuantizaciónPortada: Un chat en Amazon Bedrock AgentCore para mi blog: lo rompí con 64 mensajes y lo rearmé con reglas fuera del promptArtículoUn chat en Amazon Bedrock AgentCore para mi blog: lo rompí con 64 mensajes y lo rearmé con reglas fuera del promptTutorial: chat LangGraph en Amazon Bedrock AgentCore con Knowledge Base S3 y guardrails, probado con una conversación de 64 mensajes. Costos y opción local.#IA#AWS#SeguridadPortada: Más bits donde duele: cuanticé un Qwen3.8-27B a la medida de mi 4070 TiArtículoMás bits donde duele: cuanticé un Qwen3.8-27B a la medida de mi 4070 TiEl Q4 se pasa de 16 GB y el Q3 pierde calidad. Un parche de llama.cpp reparte los bits capa por capa: medí un Qwen3.8-27B al 94 % de una referencia de 8 bits que sí entra en una 4070 Ti.#Cuantización#llama.cpp#GGUFPortada: TabPFN y TabICL contra XGBoost ajustado: el modelo que no entrena ganó en catorce de catorce tablasArtículoTabPFN y TabICL contra XGBoost ajustado: el modelo que no entrena ganó en catorce de catorce tablasLa promesa de TabPFN y TabICL es que predicen sobre una tabla sin entrenar en ella y aun así superan al boosting ajustado. La medí en catorce datasets del banco de Grinsztajn, con la misma partición y el mismo reloj para todos. Gana el que no entrena, la ventaja aguanta hasta 32 000 filas en vez de romperse, y el modelo más citado ya no se puede descargar sin cuenta.#Modelos#Benchmarks#GPUPortada: Corrí AIFS 2.0, el modelo de clima de ECMWF, en mi tarjeta de escritorio y quedé a 0.45 °C del pronóstico oficialTutorialCorrí AIFS 2.0, el modelo de clima de ECMWF, en mi tarjeta de escritorio y quedé a 0.45 °C del pronóstico oficialECMWF publicó los pesos de su modelo de pronóstico con IA. Pesa menos de un giga y corre en una tarjeta de escritorio: 48 horas de pronóstico en 108 segundos y 5.77 GB de memoria, o 33 minutos si no tienes GPU. Lo instalé paso a paso, lo comparé contra el modelo físico operativo del mismo centro y anoté los dos tropiezos que casi me hacen publicar un disparate.#Modelos#GPU#ClimaPortada: Puse el mismo agente a resolver bugs reales con tres motores locales: 284B, 27B y 27B en dos bitsArtículoPuse el mismo agente a resolver bugs reales con tres motores locales: 284B, 27B y 27B en dos bitsEl DeepSeek Harness solo se ha probado con la API oficial. Lo conecté a tres motores locales y les di instancias reales de SWE-bench Verified. Dos empatan en aciertos, uno es once veces más rápido, y el que tiene 284 mil millones de parámetros no llega ni a la salida.#Agentes#Modelos#GPUPortada: Pocket TTS: cloné mi voz en un CPU de 2019, sin GPU y sin nubeTutorialPocket TTS: cloné mi voz en un CPU de 2019, sin GPU y sin nubeUn modelo de voz de 209 MB que corre en CPU, clona una voz con 25 segundos de referencia y permite uso comercial citando la fuente. Instalación paso a paso, métricas medidas en un i5 de 2019 y mi opinión honesta frente a ElevenLabs y compañía.#IA#AudioPortada: ¿Entra Qwen3.8-27B en 16 GB de VRAM? Lo medí, y de paso descubrí que mi banco de pruebas mentíaArtículo¿Entra Qwen3.8-27B en 16 GB de VRAM? Lo medí, y de paso descubrí que mi banco de pruebas mentíaTodos repiten que el nuevo modelo de Alibaba necesita unos 15 GB en 4 bits. Mi GPU tiene 16 y el archivo pesa 17. Medí tokens por segundo, VRAM real y reparto CPU/GPU en tres contextos, y el modelo terminó corrigiéndome a mí.#Modelos#GPU#Benchmarks

Todos los escritos