17°

Reels · 14 de 40

1:05

Reel · 1:05

ExLlamaV3 contra llama.cpp con Qwen3.8-27B en 16 GB: decodifica más rápido, pero no siempre gana

En 65 segundos y narrado: el mismo Qwen3.8-27B en la misma GPU de 16 GB, con ExLlamaV3 y llama.cpp recibiendo los mismos tokens. Con MTP en código, 103,1 tokens por segundo contra 79,5; en un turno agéntico de 11 mil tokens la ventaja se encoge a 8,62 contra 9,29 segundos; y en calidad ExLlamaV3 gana con archivos de 13 GB y pierde con los de 15 GB. Sin sonido por defecto: actívalo en los controles.

Duración
1:05
Publicado

ExLlamaV3llama.cppCuantizaciónGPUModelos de lenguaje

Este reel resume ExLlamaV3 contra llama.cpp con Qwen3.8-27B en 16 GB: decodifica más rápido, pero no siempre gana, donde están el método, las tablas y lo que no funcionó.

Leer el artículoAbrir en el visualizador