Contexto
¿Hasta dónde puede llegar una GPU Pascal de 6 GB ejecutando modelos locales actuales?
Este experimento explora inferencia LLM local sobre una NVIDIA GTX 1060, utilizando llama.cpp con soporte CUDA para una arquitectura que ya queda fuera del objetivo de muchas configuraciones modernas.
Entorno
- NVIDIA GTX 1060 6 GB
- CUDA
- llama.cpp
- modelos GGUF cuantizados
- ejecución local y contenerizada
Objetivo
Entender los límites prácticos del hardware legacy para inferencia local: memoria, contexto, offload a GPU, rendimiento y tamaño de modelo.
Estado
Experimento activo. Los resultados y configuraciones evolucionan a medida que se prueban nuevos modelos y cargas de trabajo.