IA Local
4 min
Impacto del Offloading en la Inferencia Local: Análisis de Flash Attention y KV Cache
Evaluamos las técnicas de optimización de memoria de Ollama en una RTX 5080. Analizamos cómo el bus PCIe condiciona la …
5 jun 2026