bolt Valebyte VPS desde $4/mes — NVMe, despliegue en 60s.

Obtener VPS arrow_forward

Requisitos de servidor de Ollama: RAM, VRAM y CPU según el modelo

calendar_month 15 de septiembre de 2026 schedule 18 min de lectura visibility 23 vistas
person
Valebyte Team
Requisitos de servidor de Ollama: RAM, VRAM y CPU según el modelo
summarize

TL;DR

  • Un modelo 7B de Ollama requiere 16 GB RAM (CPU) o 8-12 GB VRAM (GPU).
  • Para un modelo 3B, Ollama necesita 8 GB RAM (CPU) o 4 GB VRAM (GPU) y 4 vCPU.
  • La RAM/VRAM real excede el tamaño del modelo por caché, contexto y búferes.
  • Los modelos Q4_K_M o Q5_K_M ofrecen el mejor equilibrio calidad/coste.

Para ejecutar Ollama con un modelo 7B necesitas un servidor con 16 GB de RAM mediante inferencia en CPU o 8–12 GB de VRAM con GPU; para un modelo 70B, necesitas desde 64 GB de RAM y 48 GB de VRAM, respectivamente.

Requisitos de servidor de Ollama según el modelo

Qué significan las etiquetas 3B, 7B, 13B y 70B

Ollama ejecuta modelos de lenguaje grandes localmente mediante llama.cpp y backends compatibles. La inferencia puede realizarse en la CPU, la GPU o en un modo mixto, en el que parte de las capas del modelo se aloja en la memoria de vídeo y el resto en la memoria RAM. Por eso, los requisitos de servidor de Ollama no dependen únicamente del nombre del modelo, sino también de la etiqueta concreta: por ejemplo, 7B Q4_K_M y 7B en FP16 requieren cantidades de memoria muy diferentes.

Los valores 3B, 7B, 13B o 70B indican aproximadamente cuántos miles de millones de parámetros tiene el modelo. La cuantización Q4, Q5 o Q8 reduce el tamaño de los pesos y los requisitos de memoria, aunque puede disminuir ligeramente la precisión. Para servidores, lo más habitual es elegir Q4_K_M o Q5_K_M: ofrecen un equilibrio razonable entre calidad de respuesta, velocidad y coste del hardware.

Por qué la RAM real necesaria supera el tamaño del archivo del modelo

El archivo del modelo no es el único consumidor de memoria. Ollama utiliza RAM o VRAM adicional para la KV-cache, el contexto, los búferes de trabajo, el tokenizador y el sistema operativo. Con un contexto de 8K–16K, la memoria se consume notablemente más rápido, especialmente en modelos 13B y 70B. En varias solicitudes simultáneas, la KV-cache aumenta casi proporcionalmente al número de usuarios concurrentes.

Los requisitos prácticos de servidor para IA y LLM self-hosted permiten calcular no solo el tamaño de los pesos, sino también la reserva necesaria para el contexto, los servicios API, la monitorización y la caché de disco.

Requisitos de hardware de Ollama: RAM y VRAM según el tamaño del modelo

Tabla comparativa para inferencia en CPU y GPU

A continuación se muestran valores orientativos para modelos cuantizados Q4_K_M con un contexto de hasta 8K y una solicitud activa. La velocidad se expresa en tokens por segundo y depende de la arquitectura del procesador, la generación de la GPU, el ancho de banda de la memoria, la longitud del contexto y la versión de Ollama.

Tamaño del modelo RAM mínima para CPU VRAM recomendada para GPU CPU recomendada Disco para los pesos Velocidad orientativa
3B 8 GB 4 GB 4 vCPU, 3,0+ GHz 8–12 GB NVMe CPU: 15–35 tokens/s; GPU: 40–100 tokens/s
7B 16 GB 8–12 GB 6–8 vCPU, 3,0+ GHz 10–16 GB NVMe CPU: 8–20 tokens/s; GPU: 35–90 tokens/s
13B 24–32 GB 16 GB 8–12 vCPU, 3,2+ GHz 18–28 GB NVMe CPU: 4–10 tokens/s; GPU: 20–55 tokens/s
70B 64–96 GB 48–80 GB 16–32 vCPU, 3,0+ GHz 45–60 GB NVMe CPU: 0,8–3 tokens/s; GPU: 8–25 tokens/s

La tabla muestra la memoria necesaria específicamente para ejecutar el modelo, no el tamaño total del VPS. En un servidor con 16 GB de RAM para un modelo 7B quedará poco margen si Nginx, la API, la base de datos y el sistema de monitorización se ejecutan al mismo tiempo. Para un despliegue estable en producción, es preferible contar con 24 GB de RAM o utilizar una GPU con 12 GB de VRAM y 16 GB de memoria del sistema.

Los modelos en FP16 requieren aproximadamente el doble de memoria que Q8 y cuatro veces más que Q4, aunque el valor exacto depende de la arquitectura. Por ejemplo, 7B FP16 puede ocupar alrededor de 14–16 GB solo para los pesos, mientras que 7B Q4 normalmente cabe en 4–6 GB.

¿Buscas un servidor fiable para tus proyectos?

VPS desde $10/mes y servidores dedicados desde $9/mes con NVMe, protección DDoS y soporte 24/7.

Ver ofertas →

Inferencia de Ollama en CPU vs GPU: cuál elegir

Cuándo compensa la inferencia en CPU

Ollama CPU vs GPU inference es una decisión entre un coste menor y una velocidad superior. La CPU es adecuada para desarrollo, pruebas de prompts, clasificación en segundo plano, generación de embeddings y solicitudes administrativas ocasionales. Un modelo 3B con 4–8 vCPU suele responder con suficiente rapidez para un asistente personal, mientras que un 7B con 8–16 vCPU resulta adecuado para un usuario con un contexto moderado.

La inferencia en CPU también tiene sentido cuando el modelo debe funcionar las 24 horas, pero las solicitudes son poco frecuentes. Un servidor con 32 GB de RAM y NVMe rápido puede ejecutar modelos 7B o 13B sin una tarjeta gráfica dedicada. La desventaja es evidente: el primer token tarda más en aparecer y la generación de modelos 13B, especialmente 70B, resulta mucho menos cómoda.

Cuándo es imprescindible una GPU

La GPU es necesaria para una API interactiva, un chatbot con varios usuarios, búsquedas RAG con una alta frecuencia de solicitudes, programación en un IDE y generación de respuestas largas. Para 7B conviene disponer de 8–12 GB de VRAM, para 13B alrededor de 16 GB y para 70B una o varias GPU que sumen entre 48–80 GB de VRAM.

La GPU no siempre tiene que contener el modelo completo. Ollama puede cargar parcialmente las capas en la memoria de vídeo y dejar el resto en la RAM, pero el modo mixto suele ser más lento debido al intercambio de datos mediante PCIe. Si la latencia estable es importante, conviene elegir una VRAM con un margen del 15–25 % respecto al tamaño del modelo y la KV-cache.

La elección de un acelerador para 7B y 70B depende en gran medida del tipo de memoria, el ancho del bus y el número de GPU; el artículo específico sobre GPU para inferencia de LLM ayuda a comparar estos escenarios.

Elección rápida
¿Buscas un servidor que simplemente funcione?
Valebyte VPS: NVMe, soporte 24/7, despliegue en 60 segundos.
Ver planes VPS

Cuánta RAM necesita Ollama con contexto y varios usuarios

KV-cache y longitud del contexto

La pregunta «cuánta RAM necesita Ollama» no puede resolverse únicamente a partir del tamaño del archivo del modelo. Durante la generación, el modelo conserva el historial de tokens en la KV-cache. Cuanto más largo sea el contexto y mayor el número de conversaciones simultáneas, más memoria se necesita. Pasar de 4K a 16K tokens puede multiplicar el consumo de memoria, mientras que cuatro solicitudes simultáneas requieren aproximadamente cuatro veces más KV-cache que una sola.

Para un usuario y un contexto de 8K, normalmente bastan las siguientes reservas:

  • 3B: 8 GB de RAM o 4 GB de VRAM;
  • 7B: 16–24 GB de RAM o 8–12 GB de VRAM;
  • 13B: 32 GB de RAM o 16–24 GB de VRAM;
  • 70B: 96 GB de RAM para CPU o 64 GB de VRAM total para trabajar cómodamente.

Si necesitas un contexto de 32K, añade margen a estos valores y, con solicitudes simultáneas, basa la planificación en el perfil real de carga. En un servidor de producción es razonable mantener libre entre el 20 y el 30 % de la RAM: Linux, la API de Ollama, el reverse proxy y los procesos en segundo plano no deben competir con el modelo por la memoria.

Solicitudes simultáneas y cola

Aumentar el número de usuarios no convierte una GPU en varios aceleradores independientes. Las solicitudes pueden procesarse en paralelo, pero cada una recibe una parte de los recursos de cálculo y de la KV-cache. Si una GPU alcanza 30 tokens por segundo con una solicitud, con cuatro diálogos activos la velocidad media por solicitud puede reducirse considerablemente.

Para una API pequeña suele ser más útil limitar el paralelismo y establecer una cola que permitir que la RAM se desborde simultáneamente. En la configuración debes definir un límite razonable de contexto, tiempos de espera y un máximo de solicitudes activas.

OLLAMA_HOST=0.0.0.0:11434
OLLAMA_NUM_PARALLEL=2
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_KEEP_ALIVE=10m

Las variables de entorno dependen de la versión de Ollama y de la forma en que se inicia el servicio. No debes publicar directamente el puerto 11434 en Internet: delante debe haber un reverse proxy, autenticación y restricciones de acceso de red.

Especificaciones del servidor Ollama según el modelo: disco, CPU y red

Qué disco necesitas para los pesos

Para Ollama se recomienda un disco NVMe local. Acelera la descarga, la descompresión y la carga del modelo en la RAM o la VRAM. El espacio mínimo debe incluir no solo los pesos de un modelo, sino también varias etiquetas, archivos temporales, logs y margen para las actualizaciones.

  • 3B: mínimo 20 GB, recomendado 40 GB NVMe;
  • 7B: mínimo 30 GB, recomendado 60 GB NVMe;
  • 13B: mínimo 50 GB, recomendado 80–100 GB NVMe;
  • 70B: mínimo 100 GB, recomendado 150–200 GB NVMe.

Si almacenas versiones Q4, Q5 y Q8 del mismo modelo, el espacio aumenta rápidamente. Un disco de 60 GB puede bastar para un único modelo 7B, pero se queda corto para varios modelos, imágenes de Docker y registros del sistema.

CPU, PCIe y puerto de red

En la inferencia en CPU son importantes los núcleos físicos, la frecuencia y el ancho de banda de la memoria RAM. Ocho vCPU rápidas suelen rendir mejor que 16 hilos virtuales lentos. En un servidor con GPU importan las líneas PCIe, el controlador correcto, una alimentación suficiente y la posibilidad de asignar la GPU sin una competencia intensa con otras tareas.

Dentro de un mismo servidor, un puerto de red de 1 Gbps suele ser suficiente: se transmiten solicitudes y respuestas, no los pesos del modelo en cada petición. Para una API remota con muchos usuarios o respuestas en streaming conviene valorar 1–10 Gbps, aunque el cuello de botella suele estar en la inferencia y no en la red.

Servidor Ollama: requisitos según la escala de carga

Escala → especificaciones para VPS y servidor dedicado

Para 10 usuarios simultáneos con un modelo 7B, son suficientes 8 vCPU, 32 GB de RAM, un disco NVMe de 100 GB y un puerto de 1 Gbps.

Escala de carga vCPU RAM Disco Puerto de red Precio
1 usuario, 3B–7B 4 16 GB 40 GB NVMe 1 Gbps aproximadamente $15–25/mes, marzo de 2026
5 usuarios simultáneos, 7B 8 32 GB 80 GB NVMe 1 Gbps aproximadamente $35–60/mes, marzo de 2026
10 usuarios simultáneos, 7B–13B 12 64 GB 120 GB NVMe 1 Gbps aproximadamente $70–120/mes, marzo de 2026
25 usuarios simultáneos, 13B con GPU 16 64 GB 200 GB NVMe 1–10 Gbps aproximadamente $180–350/mes, marzo de 2026
50 usuarios simultáneos, 70B 32 128 GB 300 GB NVMe 10 Gbps aproximadamente $500–1000/mes, marzo de 2026

Los precios de la tabla son referencias generales del mercado para marzo de 2026, no tarifas fijas de un proveedor externo: el importe final depende de la región, el tipo de GPU, la garantía de asignación de recursos, el tráfico y la duración del alquiler. Para varios usuarios con un modelo 3B–7B, un VPS suele ser más económico que un servidor dedicado, pero con modelos 13B–70B un nodo con GPU suele ofrecer una latencia más predecible.

Al elegir una configuración en Valebyte, determina con antelación si necesitas una GPU permanente, cuántos modelos se cargarán simultáneamente y cuál es el contexto máximo requerido. Para tareas en CPU, es útil comparar los recursos virtuales con un servidor físico: la diferencia en la estabilidad de la frecuencia de la CPU se explica en detalle en el artículo sobre bare-metal y VPS para inferencia de ML en CPU.

Elección rápida
¿Buscas un servidor que simplemente funcione?
Valebyte VPS: NVMe, soporte 24/7, despliegue en 60 segundos.
Ver planes VPS

Cómo instalar Ollama y comprobar el hardware disponible

Instalación y descarga del modelo

En Linux, la instalación normalmente se realiza con un único comando; después, el modelo se descarga mediante Ollama CLI. En producción, es preferible utilizar un usuario del sistema independiente, un servicio systemd y un firewall.

curl -fsSL https://ollama.com/install.sh | sh

ollama pull llama3.1:8b
ollama run llama3.1:8b

Una etiqueta concreta puede tener un tamaño distinto del esperado: antes de descargarla, comprueba la página del modelo y el espacio libre en el disco. Para probar la API:

curl http://127.0.0.1:11434/api/generate \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.1:8b","prompt":"Проверь скорость ответа","stream":false}'

Comprobar la CPU, la RAM y la GPU

lscpu
free -h
lsblk
nvidia-smi
ollama ps

El comando ollama ps muestra el modelo cargado y dónde está alojado en la memoria. Si el campo de ubicación indica una distribución parcial entre CPU y GPU, la VRAM no es suficiente para alojar el modelo completo. En Linux, comprueba también free -h durante una solicitud real y no solo en reposo: el pico de uso de RAM aparece al cargar los pesos y crear el contexto.

Cómo elegir una configuración de Valebyte para Ollama

VPS para pruebas y equipos pequeños

Un VPS con 4 vCPU y 16 GB de RAM es adecuado para modelos 3B y para la mayoría de modelos 7B en desarrollo. Una configuración con 8 vCPU y 32 GB de RAM resulta más cómoda para uno o dos usuarios, un prototipo RAG y una API con paralelismo limitado. El almacenamiento NVMe es imprescindible si los modelos cambian con frecuencia o el servidor se utiliza para pipelines automatizados.

Antes de contratar, comprueba cuatro parámetros: la proporción de CPU garantizada, el tipo de disco, el límite de tráfico saliente y la posibilidad de instalar los controladores necesarios. En un escenario solo CPU no necesitas una GPU, pero con modelos 13B y 70B el coste de la RAM y el tiempo de respuesta pueden hacer que esta opción deje de ser rentable.

Servidor con GPU para producción

Un servidor con GPU se elige en función de la VRAM y no solo de la potencia de cálculo. Para 7B bastan 8–12 GB de VRAM; para 13B es preferible disponer de 16–24 GB, y para 70B, de 48 GB o más. Con contextos largos y varios usuarios hace falta margen adicional; de lo contrario, Ollama empezará a descargar capas en la RAM.

  • para un chatbot de hasta 5 usuarios: 7B, 8–12 GB de VRAM, 32 GB de RAM;
  • para un asistente interno de 10–25 usuarios: 13B, 16–24 GB de VRAM, 64 GB de RAM;
  • para un modelo 70B de alta calidad: 48–80 GB de VRAM, 128 GB de RAM y 24–32 vCPU;
  • para alta disponibilidad: dos nodos, copias de seguridad de los modelos y una API de health-check.

Si Ollama se aloja junto a una base de datos vectorial, un reranker y un servicio de documentos, calcula su consumo de RAM por separado. Las aplicaciones independientes con OCR, búsqueda y procesamiento de archivos pueden necesitar más memoria de la que sugiere el tamaño del LLM; en el artículo sobre aplicaciones self-hosted y carga del servidor se describe un enfoque similar para elegir el hardware.

Preguntas frecuentes

¿Cuánta RAM necesita Ollama con un modelo 7B?

Para 7B Q4_K_M, el mínimo recomendado es un servidor con 16 GB de RAM, aunque para trabajar de forma realista es mejor elegir 24–32 GB. Esto deja memoria para el sistema operativo, la KV-cache, un contexto de 8K y los servicios API. Con cuatro solicitudes simultáneas o un contexto de 16K, 32 GB pueden no ser suficientes si no limitas la cola.

¿Se puede ejecutar Ollama sin tarjeta gráfica?

Sí, Ollama funciona en CPU. Los modelos 3B y 7B son adecuados para inferencia en CPU con 4–8 vCPU rápidas, mientras que 13B requiere aproximadamente 8–12 vCPU y 32 GB de RAM. Es posible ejecutar 70B en CPU con 64–96 GB de RAM, pero la velocidad suele ser de solo 0,8–3 tokens por segundo; por eso, para un uso interactivo es preferible una GPU.

¿Cuánta VRAM necesita un modelo 13B?

Un modelo 13B en Q4 suele necesitar 10–12 GB de memoria para los pesos, pero, teniendo en cuenta la KV-cache y un margen adicional, se recomienda una GPU con 16 GB de VRAM. Con un contexto de 16K o varios usuarios, es mejor utilizar 24 GB de VRAM o combinar la GPU con 32–64 GB de RAM del sistema, teniendo en cuenta que descargar parcialmente las capas en la CPU reduce la velocidad.

¿Cuánto espacio ocupa un modelo de Ollama en el disco?

Un modelo 7B cuantizado suele ocupar alrededor de 4–8 GB, uno 13B ocupa 8–15 GB y uno 70B aproximadamente 40–50 GB. Para actualizaciones, varias etiquetas y archivos temporales, se recomienda reservar como mínimo 40 GB para 3B–7B, 100 GB para 13B y 150–200 GB NVMe para 70B.

Elección rápida
¿Buscas un servidor que simplemente funcione?
Valebyte VPS: NVMe, soporte 24/7, despliegue en 60 segundos.
Ver planes VPS

Conclusiones

Para 3B–7B, un VPS con 4–8 vCPU y 16–32 GB de RAM es suficiente, mientras que para trabajar de forma interactiva con varios usuarios conviene elegir una GPU con 8–12 GB de VRAM. Los modelos 13B y 70B requieren respectivamente 16–24 GB y 48–80 GB de VRAM, o bien 32–96 GB de RAM mediante inferencia en CPU; por eso, la configuración de Valebyte debe elegirse según la etiqueta del modelo, la longitud del contexto y el número de solicitudes simultáneas.

SSD NVMe
¿Listo para lanzar tu VPS?

VPS NVMe activado en 60 segundos: acceso root completo, más de 20 ubicaciones y pago con tarjeta o criptomonedas.

Elegir tarifa

Compartir esta publicación:

support_agent
Valebyte Support
Usually replies within minutes
Hi there!
Send us a message and we'll reply as soon as possible.