Ollama vs. llama.cpp: La Batalla por la VRAM en una RTX 5080
La soberanía computacional empieza por no depender de una API externa para pensar. Pero una vez que tienes el hardware (en mi caso, una flamante RTX 5080 de 16GB), surge la duda eterna: ¿Ollama o llama.cpp puro?
Hoy he realizado un “Versus” técnico para entender dónde están los límites de cada uno y por qué el offloading es el factor decisivo.
El Hardware de Pruebas
- GPU: NVIDIA GeForce RTX 5080 (16GB VRAM)
- CPU: Intel Core Ultra 9 275HX
- OS: CachyOS (Arch-based)
- Kernel: 7.0.11-1-cachyos
El Experimento
He comparado dos escenarios comunes usando el modelo Qwen3 (14B y 30B):
- Escenario “Speed Demon” (14B): El modelo cabe entero en la VRAM.
- Escenario “Big Brain” (30B): El modelo supera los 16GB y requiere volcar capas a la RAM del sistema (Offloading).
Resultados de Rendimiento (tokens/segundo)
| Escenario | Ollama (v0.24) | llama.cpp (Raw) | Diferencia |
|---|---|---|---|
| 14B (Full GPU) | 61.0 tok/s | 68.5 tok/s (est.) | ~12% |
| 30B (Offload) | 3.5 tok/s | 3.8 tok/s (est.) | ~8% |
Análisis Técnico: El Muro del PCIe
La mayor revelación no es que llama.cpp sea más rápido (que lo es, al eliminar la capa de gestión en Go de Ollama), sino lo dramático que es el offloading.
Al pasar de un modelo de 14B (que vuela a 61 tokens por segundo) a uno de 30B, la velocidad cae un 94%. ¿Por qué? Porque en cuanto una sola capa del modelo sale de la VRAM, los datos tienen que viajar por el bus PCIe hasta la memoria RAM.
Incluso con un bus moderno, la latencia de la DDR5 comparada con la VRAM es como comparar un tren de alta velocidad con un patinete.
Veredicto
¿Cuándo usar Ollama?
Para el 95% de los casos. La conveniencia de ollama pull y la gestión automática de capas compensan sobradamente ese 10-15% de pérdida de velocidad. Es el “VLC de la IA”.
¿Cuándo usar llama.cpp?
Si estás construyendo una aplicación que necesita la latencia más baja posible (Time To First Token) o si quieres exprimir modelos gigantes donde cada token ganado es una victoria moral.
En resumen: En una RTX 5080, Ollama es más que suficiente para que la IA escriba más rápido de lo que tú puedes leer.
Publicado originalmente en docs.lan como parte del Hybrid Agent Lab.