← Lab
VJML / LAB
2026.09 ACTIVE

Inferencia LLM en una GPU legacy

Local AI / Infrastructure

Contexto

¿Hasta dónde puede llegar una GPU Pascal de 6 GB ejecutando modelos locales actuales?

Este experimento explora inferencia LLM local sobre una NVIDIA GTX 1060, utilizando llama.cpp con soporte CUDA para una arquitectura que ya queda fuera del objetivo de muchas configuraciones modernas.

Entorno

  • NVIDIA GTX 1060 6 GB
  • CUDA
  • llama.cpp
  • modelos GGUF cuantizados
  • ejecución local y contenerizada

Objetivo

Entender los límites prácticos del hardware legacy para inferencia local: memoria, contexto, offload a GPU, rendimiento y tamaño de modelo.

Estado

Experimento activo. Los resultados y configuraciones evolucionan a medida que se prueban nuevos modelos y cargas de trabajo.