Для локальной LLM обычно требуется 8–12 GB VRAM для 7B в Q4, 16–24 GB для 13B, 24–48 GB для 34B и 48–80 GB для 70B; FP16 увеличивает потребление памяти примерно в 3–4 раза.
Запрос self hosted llm vram requirements нельзя свести к количеству параметров модели: на итоговый объём видеопамяти влияют формат весов, длина контекста, KV-cache, число одновременных запросов и резерв, необходимый runtime. Модель может «влезать» в 24 GB VRAM в тесте с контекстом 2K, но завершаться ошибкой памяти при 16K токенов и пяти параллельных диалогах.
Сколько VRAM для LLM: базовая формула расчёта
Чтобы понять, сколько VRAM для LLM нужно на конкретном сервере, сначала оценивают память под веса, затем добавляют KV-cache, рабочие буферы CUDA и запас минимум 10–15%.
Память под веса модели
Упрощённая формула для весов выглядит так:
VRAM под веса ≈ число параметров × байт на параметр × коэффициент служебных данных
Q4 ≈ 0,55–0,65 байта на параметр
Q8 ≈ 1,05–1,20 байта на параметр
FP16 = 2 байта на параметр
FP32 = 4 байта на параметр
Например, 70B-модель в FP16 требует около 140 GB только на веса. В формате Q4_K_M её файлы обычно занимают 40–45 GB, однако для стабильного запуска вместе с runtime и контекстом лучше планировать от 48 GB VRAM.
Квантизация снижает качество не линейно: Q4 обычно подходит для чат-ботов, RAG, классификации и агентных сценариев, Q8 сохраняет больше точности в сложных инструкциях и коде, а FP16 нужен прежде всего для обучения, fine-tuning и задач, где нельзя рисковать деградацией результатов. Подробные требования к серверу для self-hosted ИИ полезно сверять до заказа GPU-сервера, а не после переноса весов.
Почему контекст и KV-cache меняют расчёт
После загрузки весов inference-движок выделяет KV-cache — кеш attention-слоёв для истории диалога. Его расход зависит от архитектуры: числа слоёв, KV-heads, head dimension, типа кеша и длины контекста. Для современных моделей с GQA KV-cache заметно компактнее, чем у старых архитектур с полным multi-head attention.
- 7B/8B с GQA: ориентировочно 0,3–0,8 GB KV-cache на 4K токенов для одного запроса в FP16;
- 13B: обычно 0,6–1,5 GB на 4K токенов;
- 34B: примерно 1–3 GB на 4K токенов;
- 70B: около 1,3–3 GB на 4K токенов и 3–6 GB на 8K токенов, в зависимости от архитектуры и runtime.
При batch size 8 кеш умножается почти на восемь. Поэтому GPU с 48 GB может спокойно обслуживать 70B Q4 с одним диалогом и 4K контекстом, но для очереди из нескольких запросов с контекстом 16K уже потребовать 80 GB или multi-GPU.
LLM VRAM requirements by model size: 7B, 13B, 34B и 70B
LLM VRAM requirements by model size удобно считать по безопасному, а не минимальному объёму: минимальный запуск не гарантирует нормальную скорость, длинный контекст и отсутствие CUDA out of memory.
Таблица VRAM для Q4, Q8 и FP16
| Размер модели | Q4: веса и runtime | Q8: веса и runtime | FP16: веса и runtime | Практичный минимум GPU | RAM для CPU-offload |
|---|---|---|---|---|---|
| 7B | 5–7 GB | 9–11 GB | 15–17 GB | 8 GB для Q4, 16 GB с запасом | 16–32 GB |
| 13B | 9–12 GB | 16–19 GB | 28–32 GB | 16 GB для Q4, 24 GB с контекстом | 32–48 GB |
| 34B | 21–25 GB | 38–43 GB | 72–80 GB | 24 GB минимум, 48 GB предпочтительно | 64–96 GB |
| 70B | 42–48 GB | 76–86 GB | 145–160 GB | 48 GB минимум, 80 GB для продакшена | 128–192 GB |
Диапазоны включают небольшой служебный резерв, но не заменяют расчёт KV-cache под реальный контекст. Для моделей MoE расчёт иной: общий размер параметров может быть 47B, но одновременно активируется только часть экспертов; при этом веса всё равно нужно хранить в памяти.
How much VRAM for 7B 13B 70B в реальных задачах
Вопрос how much VRAM for 7B 13B 70B имеет практичный ответ: 7B Q4 комфортно запускается на 12–16 GB, 13B Q4 — на 16–24 GB, а 70B Q4 лучше планировать под 48 GB как минимум и под 80 GB для длинного контекста. Карта на 24 GB — универсальный старт для 7B, 13B и части 34B; карта на 48 GB открывает 70B Q4 с умеренной параллельностью.
Для локальной разработки 7B/8B-модели на 16 GB VRAM обычно генерируют 30–80 токенов в секунду при коротком контексте. 13B на 24 GB чаще дают 20–50 токенов в секунду. 70B Q4 на одной 80 GB GPU в зависимости от движка, квантования и batch size может работать в диапазоне 10–30 токенов в секунду на один поток.
Ищете надёжный сервер для ваших проектов?
VPS от $10/мес и выделенные серверы от $9/мес с NVMe, DDoS-защитой и поддержкой 24/7.
Смотреть предложения →Какая GPU нужна для local LLM 70B и моделей меньшего размера?
Для запроса gpu for local llm 70b оптимальный выбор начинается с 48 GB VRAM для одиночного Q4-инференса, но 80 GB остаётся более надёжной конфигурацией для API с длинным контекстом, RAG и несколькими пользователями.
Одна GPU: когда её достаточно
- 12–16 GB VRAM: 7B/8B в Q4, эмбеддинги, reranker, небольшие кодовые модели.
- 24 GB VRAM: 13B Q4, 34B Q4 с жёстким ограничением контекста, Q8 для 7B/8B.
- 48 GB VRAM: 34B Q8 или 70B Q4 с контекстом 4K–8K и 1–2 активными запросами.
- 80 GB VRAM: 70B Q4 с запасом под KV-cache, batching и API-нагрузку; 34B в FP16.
Выбирая ускоритель, смотрите не только на объём VRAM. Для LLM важны пропускная способность памяти, PCIe или NVLink для multi-GPU, поддержка BF16/FP16, стабильность драйверов и совместимость с vLLM, TensorRT-LLM, llama.cpp или Ollama. Практические сценарии аренды разобраны в материале какую GPU арендовать для inference LLM под 7B и 70B.
Когда нужны multi-GPU и tensor parallelism
Multi-GPU нужен в трёх случаях: модель физически не помещается на одну карту, нужно увеличить параллельность или требуется FP16/BF16 вместо Q4. 70B FP16 обычно распределяют минимум на две GPU по 80 GB, оставляя запас для runtime. Q4-версию можно разделить между двумя GPU по 24 GB, но скорость будет зависеть от interconnect: NVLink предпочтительнее, а PCIe может добавить задержку между слоями.
# Пример запуска 70B Q4 через llama.cpp с разделением на две GPU
./llama-server \
-m /models/llama-70b-q4_k_m.gguf \
-ngl 99 \
-c 8192 \
-np 2 \
--tensor-split 0.5,0.5 \
--host 0.0.0.0 \
--port 8080
Не следует путать разделение модели с удвоением скорости. Две карты по 24 GB позволяют разместить веса, но без быстрой связки не всегда обгоняют одну GPU с 48 GB. Multi-GPU оправдан, когда он решает реальную проблему ёмкости или batch throughput.
Quantization VRAM requirements: Q4, Q8 или FP16?
Quantization VRAM requirements определяют не только цену сервера, но и профиль качества, скорость загрузки модели и допустимый контекст. Для большинства self-hosted API разумной отправной точкой считается Q4_K_M или AWQ/GPTQ 4-bit, протестированная именно на ваших данных.
Как выбрать формат весов
- Q4: выбирайте для чат-ботов, внутреннего поиска, RAG и экономичного запуска 7B–70B. Экономия VRAM относительно FP16 достигает примерно 65–75%.
- Q8: используйте, если 4-bit заметно ухудшает SQL, код, строгую JSON-генерацию или ответы на предметных данных. VRAM почти вдвое выше Q4.
- FP16/BF16: нужен для обучения, LoRA/QLoRA-пайплайнов, высокоточного инференса и моделей без проверенной 4-bit-квантизации.
Квантизация весов и KV-cache — разные настройки. Если runtime хранит KV-cache в FP16, длинный контекст может стать главным потребителем VRAM даже при Q4-весах. Поддержка FP8 или Q8 KV-cache иногда помогает увеличить контекст, но требует проверки качества на длинных документах.
Сколько RAM, CPU и диска нужно для self-hosted LLM?
Помимо VRAM, self-hosted LLM требует системную память под загрузчик, кеш файлов, контейнеры и CPU-offload: для 7B достаточно 32 GB RAM, для 13B лучше 48–64 GB, для 34B — 64–96 GB, а для 70B — от 128 GB.
CPU и RAM для inference
Если все слои размещены на GPU, CPU редко становится узким местом. Для одной GPU обычно достаточно 8 современных vCPU с частотой от 3,0 GHz; для двух GPU, vLLM и нескольких параллельных запросов — 16 vCPU. CPU-offload экономит видеопамять, но снижает скорость: перенос даже нескольких слоёв 70B через PCIe может уменьшить генерацию с десятков токенов в секунду до единиц.
RAM должна покрывать размер файла модели как минимум в 1,5–2 раза при загрузке, конвертации и работе контейнеров. Для 70B Q4 разумно закладывать 128 GB ECC RAM, для 70B FP16 — от 256 GB, если веса хранятся и подготавливаются локально.
NVMe-диск, сеть и резерв
На диске нужны сами веса, несколько квантизаций, кеш Hugging Face, Docker-образы, логи и данные RAG. Для одного 70B Q4 выделяйте минимум 200 GB NVMe; для нескольких форматов модели и векторной базы — 500 GB–1 TB NVMe. SATA SSD допустим для хранения, но NVMe заметно сокращает холодную загрузку 40–150 GB весов.
Для внешнего API используйте порт от 1 Gbps и ограничивайте запросы через reverse proxy. Трафик текста невелик: ответ из 1 000 токенов обычно занимает считанные килобайты, однако RAG-вложения, логи и загрузка моделей могут потреблять десятки или сотни гигабайт в месяц.
Масштаб нагрузки → vCPU, RAM, диск, трафик и цена
Для 5 одновременных пользователей 70B Q4 достаточно 16 vCPU, 128 GB RAM, 500 GB NVMe-диска и 48–80 GB VRAM.
| Масштаб нагрузки | vCPU | RAM | Диск | Сетевой порт | Трафик | GPU и VRAM | Цена |
|---|---|---|---|---|---|---|---|
| 1 одновременный пользователь | 8 vCPU | 64 GB | 250 GB NVMe | 1 Gbps | 1 TB/мес | 1 × 48 GB, 70B Q4 | Ориентировочно $900–1 800/мес, март 2025 |
| 5 одновременных пользователей | 16 vCPU | 128 GB | 500 GB NVMe | 1 Gbps | 3 TB/мес | 1 × 80 GB или 2 × 48 GB | Ориентировочно $1 800–4 000/мес, март 2025 |
| 20 одновременных пользователей | 32 vCPU | 256 GB | 1 TB NVMe | 10 Gbps | 10 TB/мес | 2–4 × 80 GB, tensor parallel | Ориентировочно $6 000–15 000/мес, март 2025 |
Цены приведены как общерыночный ориентир на март 2025 года для GPU-инфраструктуры и зависят от региона, модели ускорителя, типа межсоединения, срока аренды и включённого трафика. Для 7B и 13B бюджет значительно ниже: одна GPU с 16–24 GB VRAM обычно покрывает большинство внутренних сервисов. При выборе инфраструктуры полезно сопоставить фактическую нагрузку с расчётом VRAM и RAM для LLM-сервера.
Как проверить VRAM до запуска модели?
Перед развёртыванием измерьте свободную память GPU, размер GGUF/Safetensors-файла и пиковое потребление на целевой длине контекста. Не используйте только размер файла как критерий: runtime может дополнительно потребовать 2–10 GB в зависимости от модели и batch size.
Команды для диагностики GPU
# Состояние GPU, VRAM и активные процессы
nvidia-smi
# Обновление каждые 2 секунды
watch -n 2 nvidia-smi
# Проверка размера весов
du -sh /models/*.gguf
du -sh /models/*.safetensors
# Контроль памяти контейнера
docker stats --no-stream
Для теста запускайте модель с минимальным контекстом 2048, затем повышайте значение до 4096, 8192 и целевого лимита. Одновременно увеличивайте число параллельных запросов. Так можно найти не теоретический, а фактический предел конкретного движка. При подборе ускорителя сравните результаты с рекомендациями из обзора GPU для локального inference 7B–70B.
Часто задаваемые вопросы
Можно ли запустить 70B-модель на GPU с 24 GB VRAM?
Да, но обычно только с сильной квантизацией и CPU-offload части слоёв. 70B Q4 занимает примерно 42–48 GB с runtime, поэтому на 24 GB карта не удержит веса целиком. Запуск возможен на 24 GB VRAM и 128 GB RAM, однако скорость часто падает до нескольких токенов в секунду из-за обмена по PCIe.
Сколько VRAM нужно для 13B-модели в Q4?
Для 13B в Q4 требуется примерно 9–12 GB VRAM при коротком контексте, но практичный выбор — GPU на 16 GB. Такой запас покрывает CUDA-буферы, KV-cache для 4K–8K токенов и один-два одновременных запроса. Для Q8-версии 13B лучше иметь 20–24 GB видеопамяти.
Что важнее для LLM: VRAM или системная RAM?
Для быстрого inference важнее VRAM, потому что размещение всех слоёв на GPU даёт существенно более высокую скорость генерации. RAM определяет, сможете ли вы загрузить веса, использовать CPU-offload и запустить сервисы вокруг модели. Для 70B Q4 рекомендуются 48–80 GB VRAM и минимум 128 GB системной RAM.
Нужна ли 80 GB GPU для 70B Q4?
Не всегда: 70B Q4 может работать на 48 GB VRAM при одном активном диалоге и контексте около 4K токенов. Однако 80 GB GPU лучше подходит для API, RAG, контекста 8K–16K и batching. Дополнительные 32 GB позволяют держать больше KV-cache и уменьшают риск ошибки out of memory на пиковых запросах.
Выводы
Для 7B и 13B выбирайте GPU с 16–24 GB VRAM, для 34B Q4 — от 24–48 GB, а для 70B Q4 — от 48 GB с предпочтением 80 GB при API-нагрузке. Планируйте VRAM вместе с KV-cache: для 70B Q4 практичная серверная конфигурация — 16 vCPU, 128 GB RAM, 500 GB NVMe и GPU на 48–80 GB.
NVMe VPS с активацией за 60 секунд: полный root-доступ, 20+ локаций, оплата картой или криптой.
Выбрать тариф