Reels · 14 de 40
Reel · 1:05
ExLlamaV3 contra llama.cpp con Qwen3.8-27B en 16 GB: decodifica más rápido, pero no siempre gana
En 65 segundos y narrado: el mismo Qwen3.8-27B en la misma GPU de 16 GB, con ExLlamaV3 y llama.cpp recibiendo los mismos tokens. Con MTP en código, 103,1 tokens por segundo contra 79,5; en un turno agéntico de 11 mil tokens la ventaja se encoge a 8,62 contra 9,29 segundos; y en calidad ExLlamaV3 gana con archivos de 13 GB y pierde con los de 15 GB. Sin sonido por defecto: actívalo en los controles.
- Duración
- 1:05
- Publicado
Este reel resume ExLlamaV3 contra llama.cpp con Qwen3.8-27B en 16 GB: decodifica más rápido, pero no siempre gana, donde están el método, las tablas y lo que no funcionó.