bolt Valebyte VPS desde $4/mes — NVMe, despliegue en 60s.

Obtener VPS arrow_forward

Cuánta VRAM necesitas para una LLM local: 7B, 13B y 70B

calendar_month 14 de septiembre de 2026 schedule 17 min de lectura visibility 9 vistas
person
Valebyte Team
Cuánta VRAM necesitas para una LLM local: 7B, 13B y 70B
summarize

TL;DR

  • Para LLMs locales, planifica 8-12GB VRAM para 7B (Q4), 16-24GB para 13B y 48-80GB para 70B.
  • La VRAM requerida depende del formato (cuantización), contexto, KV-cache y solicitudes simultáneas.
  • FP16 consume 3-4 veces más VRAM que la cuantización; Q4 es ideal para chatbots, Q8 para código.
  • La KV-cache añade VRAM; por ej., 70B puede usar 1.3-3GB por 4K tokens, multiplicándose por batch size.

Para una LLM local suelen necesitarse 8–12 GB de VRAM para 7B en Q4, 16–24 GB para 13B, 24–48 GB para 34B y 48–80 GB para 70B; FP16 aumenta el consumo de memoria aproximadamente entre 3 y 4 veces.

El requisito self hosted llm vram requirements no puede reducirse al número de parámetros del modelo: el volumen final de VRAM depende del formato de los pesos, la longitud del contexto, la KV-cache, el número de solicitudes simultáneas y la reserva que necesita el runtime. Un modelo puede caber en 24 GB de VRAM en una prueba con un contexto de 2K, pero fallar por falta de memoria con 16K tokens y cinco diálogos paralelos.

Cuánta VRAM necesita una LLM: fórmula básica de cálculo

Para calcular cuánta VRAM necesita una LLM en un servidor concreto, primero se estima la memoria destinada a los pesos y después se añaden la KV-cache, los búferes de trabajo de CUDA y una reserva mínima del 10–15 %.

Memoria necesaria para los pesos del modelo

La fórmula simplificada para los pesos es la siguiente:

VRAM para los pesos ≈ número de parámetros × bytes por parámetro × factor de datos auxiliares

Q4    ≈ 0,55–0,65 bytes por parámetro
Q8    ≈ 1,05–1,20 bytes por parámetro
FP16  = 2 bytes por parámetro
FP32  = 4 bytes por parámetro

Por ejemplo, un modelo 70B en FP16 necesita unos 140 GB únicamente para los pesos. En formato Q4_K_M, sus archivos suelen ocupar 40–45 GB; sin embargo, para ejecutarlo de forma estable junto con el runtime y el contexto, es mejor planificar al menos 48 GB de VRAM.

La cuantización no reduce la calidad de forma lineal: Q4 suele ser adecuada para chatbots, RAG, clasificación y agentes; Q8 conserva más precisión en instrucciones complejas y código; y FP16 se utiliza principalmente para entrenamiento, fine-tuning y tareas en las que no se puede asumir una degradación de los resultados. Conviene revisar los requisitos del servidor para IA self-hosted antes de contratar un servidor GPU, no después de transferir los pesos.

Por qué el contexto y la KV-cache cambian el cálculo

Después de cargar los pesos, el motor de inference reserva la KV-cache, una caché de las capas de attention que conserva el historial del diálogo. Su consumo depende de la arquitectura: número de capas, KV-heads, head dimension, tipo de caché y longitud del contexto. En los modelos modernos con GQA, la KV-cache es considerablemente más compacta que en las arquitecturas antiguas con multi-head attention completo.

  • 7B/8B con GQA: aproximadamente 0,3–0,8 GB de KV-cache por cada 4K tokens para una solicitud en FP16;
  • 13B: normalmente 0,6–1,5 GB por cada 4K tokens;
  • 34B: aproximadamente 1–3 GB por cada 4K tokens;
  • 70B: alrededor de 1,3–3 GB por cada 4K tokens y 3–6 GB por cada 8K tokens, según la arquitectura y el runtime.

Con un batch size de 8, la caché se multiplica casi por ocho. Por eso, una GPU de 48 GB puede servir sin problemas un modelo 70B Q4 con un diálogo y un contexto de 4K, pero una cola de varias solicitudes con un contexto de 16K puede requerir ya 80 GB o una configuración multi-GPU.

Requisitos de VRAM para LLM según el tamaño del modelo: 7B, 13B, 34B y 70B

Es más útil calcular los LLM VRAM requirements by model size según un volumen seguro y no según el mínimo: que el modelo arranque no garantiza una velocidad adecuada, un contexto largo ni la ausencia de errores CUDA out of memory.

Tabla de VRAM para Q4, Q8 y FP16

Tamaño del modelo Q4: pesos y runtime Q8: pesos y runtime FP16: pesos y runtime Mínimo práctico de GPU RAM para CPU-offload
7B 5–7 GB 9–11 GB 15–17 GB 8 GB para Q4, 16 GB con margen 16–32 GB
13B 9–12 GB 16–19 GB 28–32 GB 16 GB para Q4, 24 GB con contexto 32–48 GB
34B 21–25 GB 38–43 GB 72–80 GB 24 GB mínimo, 48 GB preferible 64–96 GB
70B 42–48 GB 76–86 GB 145–160 GB 48 GB mínimo, 80 GB para producción 128–192 GB

Los rangos incluyen una pequeña reserva para datos auxiliares, pero no sustituyen el cálculo de la KV-cache con el contexto real. En los modelos MoE el cálculo es distinto: el tamaño total puede ser de 47B parámetros, pero solo se activa una parte de los expertos al mismo tiempo; aun así, los pesos deben mantenerse en memoria.

Cuánta VRAM necesitan 7B, 13B y 70B en casos reales

La pregunta how much VRAM for 7B 13B 70B tiene una respuesta práctica: 7B Q4 funciona cómodamente con 12–16 GB, 13B Q4 con 16–24 GB, y para 70B Q4 conviene planificar al menos 48 GB y 80 GB para contextos largos. Una tarjeta de 24 GB es un punto de partida versátil para 7B, 13B y parte de los modelos 34B; una tarjeta de 48 GB permite ejecutar 70B Q4 con una concurrencia moderada.

Para desarrollo local, los modelos 7B/8B en 16 GB de VRAM suelen generar entre 30 y 80 tokens por segundo con contextos cortos. Los modelos 13B en 24 GB suelen ofrecer entre 20 y 50 tokens por segundo. Un modelo 70B Q4 en una sola GPU de 80 GB puede funcionar, según el motor, la cuantización y el batch size, en un rango de 10–30 tokens por segundo para un flujo.

¿Buscas un servidor fiable para tus proyectos?

VPS desde $10/mes y servidores dedicados desde $9/mes con NVMe, protección DDoS y soporte 24/7.

Ver ofertas →

Qué GPU necesitas para una LLM local 70B y para modelos más pequeños

Para el caso gpu for local llm 70b, la elección óptima comienza con 48 GB de VRAM para inference Q4 de una sola sesión, pero 80 GB sigue siendo una configuración más fiable para una API con contexto largo, RAG y varios usuarios.

Una sola GPU: cuándo es suficiente

  • 12–16 GB de VRAM: 7B/8B en Q4, embeddings, reranker y modelos de código pequeños.
  • 24 GB de VRAM: 13B Q4, 34B Q4 con una limitación estricta del contexto y Q8 para 7B/8B.
  • 48 GB de VRAM: 34B Q8 o 70B Q4 con un contexto de 4K–8K y 1–2 solicitudes activas.
  • 80 GB de VRAM: 70B Q4 con margen para la KV-cache, batching y carga de API; 34B en FP16.

Al elegir un acelerador, no te fijes únicamente en la capacidad de VRAM. En las LLM son importantes el ancho de banda de memoria, PCIe o NVLink para multi-GPU, la compatibilidad con BF16/FP16, la estabilidad de los drivers y la compatibilidad con vLLM, TensorRT-LLM, llama.cpp u Ollama. Encontrarás casos prácticos de alquiler en el artículo sobre qué GPU alquilar para inference de LLM 7B y 70B.

Cuándo necesitas multi-GPU y tensor parallelism

La configuración multi-GPU es necesaria en tres casos: cuando el modelo no cabe físicamente en una sola tarjeta, cuando se necesita aumentar la concurrencia o cuando se requiere FP16/BF16 en lugar de Q4. Un modelo 70B FP16 suele distribuirse como mínimo entre dos GPU de 80 GB, dejando margen para el runtime. La versión Q4 puede dividirse entre dos GPU de 24 GB, pero la velocidad dependerá del interconnect: NVLink es preferible, mientras que PCIe puede añadir latencia entre capas.

# Пример запуска 70B Q4 через llama.cpp с разделением на две GPU
./llama-server \
  -m /models/llama-70b-q4_k_m.gguf \
  -ngl 99 \
  -c 8192 \
  -np 2 \
  --tensor-split 0.5,0.5 \
  --host 0.0.0.0 \
  --port 8080

No hay que confundir la distribución del modelo con duplicar la velocidad. Dos tarjetas de 24 GB permiten alojar los pesos, pero sin una conexión rápida no siempre superan a una sola GPU de 48 GB. La configuración multi-GPU está justificada cuando resuelve un problema real de capacidad o de rendimiento con batches.

Elección rápida
¿Buscas un servidor que simplemente funcione?
Valebyte VPS: NVMe, soporte 24/7, despliegue en 60 segundos.
Ver planes VPS

Requisitos de VRAM según la cuantización: ¿Q4, Q8 o FP16?

Los Quantization VRAM requirements no solo determinan el precio del servidor, sino también el perfil de calidad, la velocidad de carga del modelo y el contexto admitido. Para la mayoría de las API self-hosted, un buen punto de partida es Q4_K_M o AWQ/GPTQ de 4 bits, probado específicamente con tus datos.

Cómo elegir el formato de los pesos

  1. Q4: elígelo para chatbots, búsquedas internas, RAG y despliegues económicos de modelos 7B–70B. El ahorro de VRAM frente a FP16 llega aproximadamente al 65–75 %.
  2. Q8: úsalo si 4-bit empeora de forma apreciable el SQL, el código, la generación estricta de JSON o las respuestas sobre datos especializados. La VRAM necesaria es casi el doble que con Q4.
  3. FP16/BF16: es necesario para entrenamiento, pipelines LoRA/QLoRA, inference de alta precisión y modelos sin una cuantización 4-bit validada.

La cuantización de los pesos y la KV-cache son configuraciones diferentes. Si el runtime almacena la KV-cache en FP16, un contexto largo puede convertirse en el principal consumidor de VRAM incluso con pesos Q4. La compatibilidad con KV-cache FP8 o Q8 puede ayudar a ampliar el contexto, pero debe comprobarse la calidad con documentos largos.

Cuánta RAM, CPU y almacenamiento necesita una LLM self-hosted

Además de VRAM, una LLM self-hosted necesita memoria del sistema para el cargador, la caché de archivos, los contenedores y el CPU-offload: para 7B bastan 32 GB de RAM, para 13B es mejor contar con 48–64 GB, para 34B con 64–96 GB y para 70B con al menos 128 GB.

CPU y RAM para inference

Si todas las capas están alojadas en la GPU, la CPU rara vez se convierte en un cuello de botella. Para una GPU normalmente bastan 8 vCPU modernas con una frecuencia de al menos 3,0 GHz; para dos GPU, vLLM y varias solicitudes paralelas, se recomiendan 16 vCPU. El CPU-offload ahorra VRAM, pero reduce la velocidad: transferir incluso unas pocas capas de un modelo 70B mediante PCIe puede reducir la generación de decenas de tokens por segundo a unidades.

La RAM debe cubrir como mínimo 1,5–2 veces el tamaño del archivo del modelo durante la carga, la conversión y la ejecución de los contenedores. Para 70B Q4 es razonable reservar 128 GB de RAM ECC; para 70B FP16, al menos 256 GB si los pesos se almacenan y preparan localmente.

Disco NVMe, red y margen de seguridad

El almacenamiento debe incluir los pesos, varias cuantizaciones, la caché de Hugging Face, las imágenes de Docker, los logs y los datos de RAG. Para un único 70B Q4, reserva al menos 200 GB de NVMe; para varios formatos del modelo y una base de datos vectorial, entre 500 GB y 1 TB de NVMe. Un SSD SATA sirve para almacenamiento, pero NVMe reduce notablemente la carga en frío de entre 40 y 150 GB de pesos.

Para una API externa, utiliza un puerto de al menos 1 Gbps y limita las solicitudes mediante un reverse proxy. El tráfico de texto es reducido: una respuesta de 1 000 tokens suele ocupar solo unos pocos kilobytes; sin embargo, los adjuntos de RAG, los logs y la carga de modelos pueden consumir decenas o cientos de gigabytes al mes.

Escala de carga → vCPU, RAM, disco, tráfico y precio

Para 5 usuarios simultáneos que utilicen 70B Q4, bastan 16 vCPU, 128 GB de RAM, 500 GB de disco NVMe y entre 48 y 80 GB de VRAM.

Escala de carga vCPU RAM Disco Puerto de red Tráfico GPU y VRAM Precio
1 usuario simultáneo 8 vCPU 64 GB 250 GB NVMe 1 Gbps 1 TB/mes 1 × 48 GB, 70B Q4 Aproximadamente $900–1 800/mes, marzo de 2025
5 usuarios simultáneos 16 vCPU 128 GB 500 GB NVMe 1 Gbps 3 TB/mes 1 × 80 GB o 2 × 48 GB Aproximadamente $1 800–4 000/mes, marzo de 2025
20 usuarios simultáneos 32 vCPU 256 GB 1 TB NVMe 10 Gbps 10 TB/mes 2–4 × 80 GB, tensor parallel Aproximadamente $6 000–15 000/mes, marzo de 2025

Los precios son una referencia general del mercado para infraestructura GPU en marzo de 2025 y dependen de la región, el modelo del acelerador, el tipo de interconnect, la duración del alquiler y el tráfico incluido. Para 7B y 13B, el presupuesto es considerablemente menor: una GPU con 16–24 GB de VRAM suele cubrir la mayoría de los servicios internos. Al elegir la infraestructura, conviene comparar la carga real con el cálculo de VRAM y RAM para un servidor de LLM.

Elección rápida
¿Buscas un servidor que simplemente funcione?
Valebyte VPS: NVMe, soporte 24/7, despliegue en 60 segundos.
Ver planes VPS

Cómo comprobar la VRAM antes de iniciar el modelo

Antes del despliegue, mide la memoria libre de la GPU, el tamaño del archivo GGUF/Safetensors y el consumo máximo con la longitud de contexto objetivo. No uses únicamente el tamaño del archivo como criterio: el runtime puede necesitar 2–10 GB adicionales según el modelo y el batch size.

Comandos para diagnosticar la GPU

# Состояние GPU, VRAM и активные процессы
nvidia-smi

# Обновление каждые 2 секунды
watch -n 2 nvidia-smi

# Проверка размера весов
du -sh /models/*.gguf
du -sh /models/*.safetensors

# Контроль памяти контейнера
docker stats --no-stream

Para la prueba, inicia el modelo con un contexto mínimo de 2048 y después aumenta el valor a 4096, 8192 y el límite objetivo. Incrementa también el número de solicitudes paralelas. Así podrás encontrar el límite real del motor concreto, no solo el teórico. Al elegir el acelerador, compara los resultados con las recomendaciones del análisis sobre GPU para inference local de 7B–70B.

Preguntas frecuentes

¿Se puede ejecutar un modelo 70B en una GPU con 24 GB de VRAM?

Sí, pero normalmente solo con una cuantización agresiva y CPU-offload de parte de las capas. 70B Q4 ocupa aproximadamente 42–48 GB con el runtime, por lo que una tarjeta de 24 GB no puede mantener todos los pesos en la GPU. Es posible ejecutarlo con 24 GB de VRAM y 128 GB de RAM, aunque la velocidad suele caer hasta unos pocos tokens por segundo debido al intercambio a través de PCIe.

¿Cuánta VRAM necesita un modelo 13B en Q4?

Un modelo 13B en Q4 necesita aproximadamente 9–12 GB de VRAM con un contexto corto, pero la opción práctica es una GPU de 16 GB. Este margen cubre los búferes de CUDA, la KV-cache para 4K–8K tokens y una o dos solicitudes simultáneas. Para la versión Q8 de 13B, es mejor disponer de 20–24 GB de VRAM.

¿Qué es más importante para una LLM: la VRAM o la RAM del sistema?

Para hacer inference rápidamente, la VRAM es más importante, ya que alojar todas las capas en la GPU proporciona una velocidad de generación considerablemente mayor. La RAM determina si podrás cargar los pesos, utilizar CPU-offload y ejecutar los servicios que rodean al modelo. Para 70B Q4 se recomiendan 48–80 GB de VRAM y un mínimo de 128 GB de RAM del sistema.

¿Hace falta una GPU de 80 GB para 70B Q4?

No siempre: 70B Q4 puede funcionar con 48 GB de VRAM usando un solo diálogo activo y un contexto de aproximadamente 4K tokens. Sin embargo, una GPU de 80 GB es más adecuada para API, RAG, contextos de 8K–16K y batching. Los 32 GB adicionales permiten mantener más KV-cache y reducen el riesgo de un error out of memory con solicitudes de máxima carga.

Conclusiones

Para 7B y 13B, elige una GPU con 16–24 GB de VRAM; para 34B Q4, al menos 24–48 GB; y para 70B Q4, desde 48 GB, siendo preferibles 80 GB con carga de API. Planifica la VRAM junto con la KV-cache: una configuración de servidor práctica para 70B Q4 es 16 vCPU, 128 GB de RAM, 500 GB de NVMe y una GPU de 48–80 GB.

SSD NVMe
¿Listo para poner en marcha tu VPS?

VPS NVMe activado en 60 segundos: acceso root completo, más de 20 ubicaciones y pago con tarjeta o criptomonedas.

Elegir tarifa

Compartir esta publicación:

support_agent
Valebyte Support
Usually replies within minutes
Hi there!
Send us a message and we'll reply as soon as possible.