bolt Valebyte VPS от $4/мес — NVMe, запуск за 60 секунд.

Получить VPS arrow_forward

Сколько VRAM нужно для локальной LLM: сайзинг под 7B, 13B и 70B

calendar_month 14 сентября 2026 schedule 14 мин. чтения visibility 11 просмотров
person
Valebyte Team
Сколько VRAM нужно для локальной LLM: сайзинг под 7B, 13B и 70B
summarize

TL;DR

  • Для 7B LLM в Q4 нужно 8–12 GB VRAM, для 13B – 16–24 GB, для 70B – 48–80 GB.
  • FP16 требует в 3–4 раза больше VRAM, чем Q4. Учитывайте контекст, KV-cache и число запросов.
  • KV-cache для 70B LLM может занимать 3–6 GB на 8K токенов, умножаясь при параллельных запросах.
  • VRAM = (вес модели + KV-cache + рабочие буферы) + 10–15% запаса для стабильной работы.

Для локальной LLM обычно требуется 8–12 GB VRAM для 7B в Q4, 16–24 GB для 13B, 24–48 GB для 34B и 48–80 GB для 70B; FP16 увеличивает потребление памяти примерно в 3–4 раза.

Запрос self hosted llm vram requirements нельзя свести к количеству параметров модели: на итоговый объём видеопамяти влияют формат весов, длина контекста, KV-cache, число одновременных запросов и резерв, необходимый runtime. Модель может «влезать» в 24 GB VRAM в тесте с контекстом 2K, но завершаться ошибкой памяти при 16K токенов и пяти параллельных диалогах.

Сколько VRAM для LLM: базовая формула расчёта

Чтобы понять, сколько VRAM для LLM нужно на конкретном сервере, сначала оценивают память под веса, затем добавляют KV-cache, рабочие буферы CUDA и запас минимум 10–15%.

Память под веса модели

Упрощённая формула для весов выглядит так:

VRAM под веса ≈ число параметров × байт на параметр × коэффициент служебных данных

Q4    ≈ 0,55–0,65 байта на параметр
Q8    ≈ 1,05–1,20 байта на параметр
FP16  = 2 байта на параметр
FP32  = 4 байта на параметр

Например, 70B-модель в FP16 требует около 140 GB только на веса. В формате Q4_K_M её файлы обычно занимают 40–45 GB, однако для стабильного запуска вместе с runtime и контекстом лучше планировать от 48 GB VRAM.

Квантизация снижает качество не линейно: Q4 обычно подходит для чат-ботов, RAG, классификации и агентных сценариев, Q8 сохраняет больше точности в сложных инструкциях и коде, а FP16 нужен прежде всего для обучения, fine-tuning и задач, где нельзя рисковать деградацией результатов. Подробные требования к серверу для self-hosted ИИ полезно сверять до заказа GPU-сервера, а не после переноса весов.

Почему контекст и KV-cache меняют расчёт

После загрузки весов inference-движок выделяет KV-cache — кеш attention-слоёв для истории диалога. Его расход зависит от архитектуры: числа слоёв, KV-heads, head dimension, типа кеша и длины контекста. Для современных моделей с GQA KV-cache заметно компактнее, чем у старых архитектур с полным multi-head attention.

  • 7B/8B с GQA: ориентировочно 0,3–0,8 GB KV-cache на 4K токенов для одного запроса в FP16;
  • 13B: обычно 0,6–1,5 GB на 4K токенов;
  • 34B: примерно 1–3 GB на 4K токенов;
  • 70B: около 1,3–3 GB на 4K токенов и 3–6 GB на 8K токенов, в зависимости от архитектуры и runtime.

При batch size 8 кеш умножается почти на восемь. Поэтому GPU с 48 GB может спокойно обслуживать 70B Q4 с одним диалогом и 4K контекстом, но для очереди из нескольких запросов с контекстом 16K уже потребовать 80 GB или multi-GPU.

LLM VRAM requirements by model size: 7B, 13B, 34B и 70B

LLM VRAM requirements by model size удобно считать по безопасному, а не минимальному объёму: минимальный запуск не гарантирует нормальную скорость, длинный контекст и отсутствие CUDA out of memory.

Таблица VRAM для Q4, Q8 и FP16

Размер модели Q4: веса и runtime Q8: веса и runtime FP16: веса и runtime Практичный минимум GPU RAM для CPU-offload
7B 5–7 GB 9–11 GB 15–17 GB 8 GB для Q4, 16 GB с запасом 16–32 GB
13B 9–12 GB 16–19 GB 28–32 GB 16 GB для Q4, 24 GB с контекстом 32–48 GB
34B 21–25 GB 38–43 GB 72–80 GB 24 GB минимум, 48 GB предпочтительно 64–96 GB
70B 42–48 GB 76–86 GB 145–160 GB 48 GB минимум, 80 GB для продакшена 128–192 GB

Диапазоны включают небольшой служебный резерв, но не заменяют расчёт KV-cache под реальный контекст. Для моделей MoE расчёт иной: общий размер параметров может быть 47B, но одновременно активируется только часть экспертов; при этом веса всё равно нужно хранить в памяти.

How much VRAM for 7B 13B 70B в реальных задачах

Вопрос how much VRAM for 7B 13B 70B имеет практичный ответ: 7B Q4 комфортно запускается на 12–16 GB, 13B Q4 — на 16–24 GB, а 70B Q4 лучше планировать под 48 GB как минимум и под 80 GB для длинного контекста. Карта на 24 GB — универсальный старт для 7B, 13B и части 34B; карта на 48 GB открывает 70B Q4 с умеренной параллельностью.

Для локальной разработки 7B/8B-модели на 16 GB VRAM обычно генерируют 30–80 токенов в секунду при коротком контексте. 13B на 24 GB чаще дают 20–50 токенов в секунду. 70B Q4 на одной 80 GB GPU в зависимости от движка, квантования и batch size может работать в диапазоне 10–30 токенов в секунду на один поток.

Ищете надёжный сервер для ваших проектов?

VPS от $10/мес и выделенные серверы от $9/мес с NVMe, DDoS-защитой и поддержкой 24/7.

Смотреть предложения →

Какая GPU нужна для local LLM 70B и моделей меньшего размера?

Для запроса gpu for local llm 70b оптимальный выбор начинается с 48 GB VRAM для одиночного Q4-инференса, но 80 GB остаётся более надёжной конфигурацией для API с длинным контекстом, RAG и несколькими пользователями.

Одна GPU: когда её достаточно

  • 12–16 GB VRAM: 7B/8B в Q4, эмбеддинги, reranker, небольшие кодовые модели.
  • 24 GB VRAM: 13B Q4, 34B Q4 с жёстким ограничением контекста, Q8 для 7B/8B.
  • 48 GB VRAM: 34B Q8 или 70B Q4 с контекстом 4K–8K и 1–2 активными запросами.
  • 80 GB VRAM: 70B Q4 с запасом под KV-cache, batching и API-нагрузку; 34B в FP16.

Выбирая ускоритель, смотрите не только на объём VRAM. Для LLM важны пропускная способность памяти, PCIe или NVLink для multi-GPU, поддержка BF16/FP16, стабильность драйверов и совместимость с vLLM, TensorRT-LLM, llama.cpp или Ollama. Практические сценарии аренды разобраны в материале какую GPU арендовать для inference LLM под 7B и 70B.

Когда нужны multi-GPU и tensor parallelism

Multi-GPU нужен в трёх случаях: модель физически не помещается на одну карту, нужно увеличить параллельность или требуется FP16/BF16 вместо Q4. 70B FP16 обычно распределяют минимум на две GPU по 80 GB, оставляя запас для runtime. Q4-версию можно разделить между двумя GPU по 24 GB, но скорость будет зависеть от interconnect: NVLink предпочтительнее, а PCIe может добавить задержку между слоями.

# Пример запуска 70B Q4 через llama.cpp с разделением на две GPU
./llama-server \
  -m /models/llama-70b-q4_k_m.gguf \
  -ngl 99 \
  -c 8192 \
  -np 2 \
  --tensor-split 0.5,0.5 \
  --host 0.0.0.0 \
  --port 8080

Не следует путать разделение модели с удвоением скорости. Две карты по 24 GB позволяют разместить веса, но без быстрой связки не всегда обгоняют одну GPU с 48 GB. Multi-GPU оправдан, когда он решает реальную проблему ёмкости или batch throughput.

Быстрый выбор
Ищете сервер, который просто работает?
Valebyte VPS — NVMe, поддержка 24/7, запуск за 60 секунд.
Тарифы VPS

Quantization VRAM requirements: Q4, Q8 или FP16?

Quantization VRAM requirements определяют не только цену сервера, но и профиль качества, скорость загрузки модели и допустимый контекст. Для большинства self-hosted API разумной отправной точкой считается Q4_K_M или AWQ/GPTQ 4-bit, протестированная именно на ваших данных.

Как выбрать формат весов

  1. Q4: выбирайте для чат-ботов, внутреннего поиска, RAG и экономичного запуска 7B–70B. Экономия VRAM относительно FP16 достигает примерно 65–75%.
  2. Q8: используйте, если 4-bit заметно ухудшает SQL, код, строгую JSON-генерацию или ответы на предметных данных. VRAM почти вдвое выше Q4.
  3. FP16/BF16: нужен для обучения, LoRA/QLoRA-пайплайнов, высокоточного инференса и моделей без проверенной 4-bit-квантизации.

Квантизация весов и KV-cache — разные настройки. Если runtime хранит KV-cache в FP16, длинный контекст может стать главным потребителем VRAM даже при Q4-весах. Поддержка FP8 или Q8 KV-cache иногда помогает увеличить контекст, но требует проверки качества на длинных документах.

Сколько RAM, CPU и диска нужно для self-hosted LLM?

Помимо VRAM, self-hosted LLM требует системную память под загрузчик, кеш файлов, контейнеры и CPU-offload: для 7B достаточно 32 GB RAM, для 13B лучше 48–64 GB, для 34B — 64–96 GB, а для 70B — от 128 GB.

CPU и RAM для inference

Если все слои размещены на GPU, CPU редко становится узким местом. Для одной GPU обычно достаточно 8 современных vCPU с частотой от 3,0 GHz; для двух GPU, vLLM и нескольких параллельных запросов — 16 vCPU. CPU-offload экономит видеопамять, но снижает скорость: перенос даже нескольких слоёв 70B через PCIe может уменьшить генерацию с десятков токенов в секунду до единиц.

RAM должна покрывать размер файла модели как минимум в 1,5–2 раза при загрузке, конвертации и работе контейнеров. Для 70B Q4 разумно закладывать 128 GB ECC RAM, для 70B FP16 — от 256 GB, если веса хранятся и подготавливаются локально.

NVMe-диск, сеть и резерв

На диске нужны сами веса, несколько квантизаций, кеш Hugging Face, Docker-образы, логи и данные RAG. Для одного 70B Q4 выделяйте минимум 200 GB NVMe; для нескольких форматов модели и векторной базы — 500 GB–1 TB NVMe. SATA SSD допустим для хранения, но NVMe заметно сокращает холодную загрузку 40–150 GB весов.

Для внешнего API используйте порт от 1 Gbps и ограничивайте запросы через reverse proxy. Трафик текста невелик: ответ из 1 000 токенов обычно занимает считанные килобайты, однако RAG-вложения, логи и загрузка моделей могут потреблять десятки или сотни гигабайт в месяц.

Масштаб нагрузки → vCPU, RAM, диск, трафик и цена

Для 5 одновременных пользователей 70B Q4 достаточно 16 vCPU, 128 GB RAM, 500 GB NVMe-диска и 48–80 GB VRAM.

Масштаб нагрузки vCPU RAM Диск Сетевой порт Трафик GPU и VRAM Цена
1 одновременный пользователь 8 vCPU 64 GB 250 GB NVMe 1 Gbps 1 TB/мес 1 × 48 GB, 70B Q4 Ориентировочно $900–1 800/мес, март 2025
5 одновременных пользователей 16 vCPU 128 GB 500 GB NVMe 1 Gbps 3 TB/мес 1 × 80 GB или 2 × 48 GB Ориентировочно $1 800–4 000/мес, март 2025
20 одновременных пользователей 32 vCPU 256 GB 1 TB NVMe 10 Gbps 10 TB/мес 2–4 × 80 GB, tensor parallel Ориентировочно $6 000–15 000/мес, март 2025

Цены приведены как общерыночный ориентир на март 2025 года для GPU-инфраструктуры и зависят от региона, модели ускорителя, типа межсоединения, срока аренды и включённого трафика. Для 7B и 13B бюджет значительно ниже: одна GPU с 16–24 GB VRAM обычно покрывает большинство внутренних сервисов. При выборе инфраструктуры полезно сопоставить фактическую нагрузку с расчётом VRAM и RAM для LLM-сервера.

Быстрый выбор
Ищете сервер, который просто работает?
Valebyte VPS — NVMe, поддержка 24/7, запуск за 60 секунд.
Тарифы VPS

Как проверить VRAM до запуска модели?

Перед развёртыванием измерьте свободную память GPU, размер GGUF/Safetensors-файла и пиковое потребление на целевой длине контекста. Не используйте только размер файла как критерий: runtime может дополнительно потребовать 2–10 GB в зависимости от модели и batch size.

Команды для диагностики GPU

# Состояние GPU, VRAM и активные процессы
nvidia-smi

# Обновление каждые 2 секунды
watch -n 2 nvidia-smi

# Проверка размера весов
du -sh /models/*.gguf
du -sh /models/*.safetensors

# Контроль памяти контейнера
docker stats --no-stream

Для теста запускайте модель с минимальным контекстом 2048, затем повышайте значение до 4096, 8192 и целевого лимита. Одновременно увеличивайте число параллельных запросов. Так можно найти не теоретический, а фактический предел конкретного движка. При подборе ускорителя сравните результаты с рекомендациями из обзора GPU для локального inference 7B–70B.

Часто задаваемые вопросы

Можно ли запустить 70B-модель на GPU с 24 GB VRAM?

Да, но обычно только с сильной квантизацией и CPU-offload части слоёв. 70B Q4 занимает примерно 42–48 GB с runtime, поэтому на 24 GB карта не удержит веса целиком. Запуск возможен на 24 GB VRAM и 128 GB RAM, однако скорость часто падает до нескольких токенов в секунду из-за обмена по PCIe.

Сколько VRAM нужно для 13B-модели в Q4?

Для 13B в Q4 требуется примерно 9–12 GB VRAM при коротком контексте, но практичный выбор — GPU на 16 GB. Такой запас покрывает CUDA-буферы, KV-cache для 4K–8K токенов и один-два одновременных запроса. Для Q8-версии 13B лучше иметь 20–24 GB видеопамяти.

Что важнее для LLM: VRAM или системная RAM?

Для быстрого inference важнее VRAM, потому что размещение всех слоёв на GPU даёт существенно более высокую скорость генерации. RAM определяет, сможете ли вы загрузить веса, использовать CPU-offload и запустить сервисы вокруг модели. Для 70B Q4 рекомендуются 48–80 GB VRAM и минимум 128 GB системной RAM.

Нужна ли 80 GB GPU для 70B Q4?

Не всегда: 70B Q4 может работать на 48 GB VRAM при одном активном диалоге и контексте около 4K токенов. Однако 80 GB GPU лучше подходит для API, RAG, контекста 8K–16K и batching. Дополнительные 32 GB позволяют держать больше KV-cache и уменьшают риск ошибки out of memory на пиковых запросах.

Выводы

Для 7B и 13B выбирайте GPU с 16–24 GB VRAM, для 34B Q4 — от 24–48 GB, а для 70B Q4 — от 48 GB с предпочтением 80 GB при API-нагрузке. Планируйте VRAM вместе с KV-cache: для 70B Q4 практичная серверная конфигурация — 16 vCPU, 128 GB RAM, 500 GB NVMe и GPU на 48–80 GB.

SSD NVMe
Готовы запустить свой VPS?

NVMe VPS с активацией за 60 секунд: полный root-доступ, 20+ локаций, оплата картой или криптой.

Выбрать тариф

Поделиться записью:

support_agent
Valebyte Support
Usually replies within minutes
Hi there!
Send us a message and we'll reply as soon as possible.