bolt Valebyte VPS від $4/міс — NVMe, запуск за 60 секунд.

Отримати VPS arrow_forward

Скільки VRAM потрібно для локальної LLM: 7B, 13B і 70B

calendar_month September 14, 2026 schedule 14 хв. читання visibility 8 переглядів
person
Valebyte Team
Скільки VRAM потрібно для локальної LLM: 7B, 13B і 70B
summarize

TL;DR

  • Для 7B/Q4 LLM плануйте 8–12 GB VRAM; для 13B/Q4 – 16–24 GB; для 70B/Q4 – 48–80 GB.
  • Потрібний VRAM залежить від формату ваг, довжини контексту, KV-cache, одночасних запитів та резерву.
  • KV-cache зростає з довжиною контексту та кількістю запитів; для 70B/4K токенів це 1.3–3 GB.
  • Q4 підходить для чат-ботів та RAG; Q8 зберігає точність для коду; FP16 – для навчання.

Для локальної LLM зазвичай потрібно 8–12 GB VRAM для 7B у Q4, 16–24 GB для 13B, 24–48 GB для 34B і 48–80 GB для 70B; FP16 збільшує споживання пам’яті приблизно у 3–4 рази.

Запит self hosted llm vram requirements не можна звести лише до кількості параметрів моделі: на потрібний обсяг відеопам’яті впливають формат ваг, довжина контексту, KV-cache, кількість одночасних запитів і резерв для runtime. Модель може «вміщатися» у 24 GB VRAM під час тесту з контекстом 2K, але завершуватися помилкою пам’яті за 16K токенів і п’яти паралельних діалогів.

Скільки VRAM потрібно для LLM: базова формула розрахунку

Щоб визначити, скільки VRAM для LLM потрібно на конкретному сервері, спочатку оцінюють пам’ять для ваг, потім додають KV-cache, робочі буфери CUDA та запас щонайменше 10–15%.

Пам’ять для ваг моделі

Спрощена формула для ваг має такий вигляд:

VRAM под веса ≈ число параметров × байт на параметр × коэффициент служебных данных

Q4    ≈ 0,55–0,65 байта на параметр
Q8    ≈ 1,05–1,20 байта на параметр
FP16  = 2 байта на параметр
FP32  = 4 байта на параметр

Наприклад, модель на 70B у FP16 потребує близько 140 GB лише для ваг. У форматі Q4_K_M її файли зазвичай займають 40–45 GB, однак для стабільного запуску разом із runtime та контекстом краще планувати від 48 GB VRAM.

Квантизація знижує якість нелінійно: Q4 зазвичай підходить для чат-ботів, RAG, класифікації та агентних сценаріїв, Q8 зберігає вищу точність у складних інструкціях і коді, а FP16 потрібен передусім для навчання, fine-tuning і завдань, де не можна ризикувати погіршенням результатів. Детальні вимоги до сервера для self-hosted ШІ варто перевірити до замовлення GPU-сервера, а не після перенесення ваг.

Чому контекст і KV-cache змінюють розрахунок

Після завантаження ваг inference-рушій виділяє KV-cache — кеш attention-шарів для історії діалогу. Його споживання залежить від архітектури: кількості шарів, KV-heads, head dimension, типу кешу та довжини контексту. Для сучасних моделей із GQA KV-cache помітно компактніший, ніж у старих архітектурах із повним multi-head attention.

  • 7B/8B з GQA: орієнтовно 0,3–0,8 GB KV-cache на 4K токенів для одного запиту у FP16;
  • 13B: зазвичай 0,6–1,5 GB на 4K токенів;
  • 34B: приблизно 1–3 GB на 4K токенів;
  • 70B: близько 1,3–3 GB на 4K токенів і 3–6 GB на 8K токенів, залежно від архітектури та runtime.

За batch size 8 кеш збільшується майже у вісім разів. Тому GPU з 48 GB може без проблем обслуговувати 70B Q4 з одним діалогом і контекстом 4K, але для черги з кількох запитів із контекстом 16K вже потребувати 80 GB або multi-GPU.

Скільки VRAM потрібно для LLM 7B, 13B, 34B і 70B

LLM VRAM requirements by model size зручно розраховувати за безпечним, а не мінімальним обсягом: мінімальний запуск не гарантує нормальну швидкість, довгий контекст і відсутність CUDA out of memory.

Таблиця VRAM для Q4, Q8 і FP16

Розмір моделі Q4: ваги та runtime Q8: ваги та runtime FP16: ваги та runtime Практичний мінімум GPU RAM для CPU-offload
7B 5–7 GB 9–11 GB 15–17 GB 8 GB для Q4, 16 GB із запасом 16–32 GB
13B 9–12 GB 16–19 GB 28–32 GB 16 GB для Q4, 24 GB із контекстом 32–48 GB
34B 21–25 GB 38–43 GB 72–80 GB 24 GB мінімум, 48 GB бажано 64–96 GB
70B 42–48 GB 76–86 GB 145–160 GB 48 GB мінімум, 80 GB для продакшену 128–192 GB

Діапазони містять невеликий службовий резерв, але не замінюють розрахунок KV-cache для реального контексту. Для моделей MoE розрахунок інший: загальний розмір параметрів може становити 47B, але одночасно активується лише частина експертів; водночас усі ваги все одно потрібно зберігати в пам’яті.

Скільки VRAM для 7B, 13B і 70B у реальних завданнях

Питання how much VRAM for 7B 13B 70B має практичну відповідь: 7B Q4 комфортно запускається на 12–16 GB, 13B Q4 — на 16–24 GB, а для 70B Q4 краще планувати щонайменше 48 GB і 80 GB для довгого контексту. Карта на 24 GB — універсальний старт для 7B, 13B і частини 34B; карта на 48 GB відкриває запуск 70B Q4 з помірною паралельністю.

Для локальної розробки моделі 7B/8B на 16 GB VRAM зазвичай генерують 30–80 токенів за секунду за короткого контексту. 13B на 24 GB частіше дають 20–50 токенів за секунду. 70B Q4 на одній 80 GB GPU залежно від рушія, квантизації та batch size може працювати в діапазоні 10–30 токенів за секунду на один потік.

Шукаєте надійний сервер для своїх проєктів?

VPS від $10/міс і виділені сервери від $9/міс з NVMe, DDoS-захистом і підтримкою 24/7.

Переглянути пропозиції →

Яка GPU потрібна для локальної LLM 70B і менших моделей?

Для запиту gpu for local llm 70b оптимальний вибір починається з 48 GB VRAM для одиночного Q4-inference, але 80 GB залишається надійнішою конфігурацією для API з довгим контекстом, RAG і кількома користувачами.

Одна GPU: коли її достатньо

  • 12–16 GB VRAM: 7B/8B у Q4, ембеддинги, reranker, невеликі моделі для коду.
  • 24 GB VRAM: 13B Q4, 34B Q4 із жорстким обмеженням контексту, Q8 для 7B/8B.
  • 48 GB VRAM: 34B Q8 або 70B Q4 з контекстом 4K–8K і 1–2 активними запитами.
  • 80 GB VRAM: 70B Q4 із запасом для KV-cache, batching та API-навантаження; 34B у FP16.

Вибираючи прискорювач, дивіться не лише на обсяг VRAM. Для LLM важливі пропускна здатність пам’яті, PCIe або NVLink для multi-GPU, підтримка BF16/FP16, стабільність драйверів і сумісність із vLLM, TensorRT-LLM, llama.cpp або Ollama. Практичні сценарії оренди розглянуто в матеріалі яку GPU орендувати для inference LLM під 7B і 70B.

Коли потрібні multi-GPU та tensor parallelism

Multi-GPU потрібен у трьох випадках: модель фізично не вміщується на одну карту, необхідно збільшити паралельність або потрібен FP16/BF16 замість Q4. 70B FP16 зазвичай розподіляють щонайменше на дві GPU по 80 GB, залишаючи запас для runtime. Версію Q4 можна розділити між двома GPU по 24 GB, але швидкість залежатиме від interconnect: NVLink кращий, а PCIe може додати затримку між шарами.

# Пример запуска 70B Q4 через llama.cpp с разделением на две GPU
./llama-server \
  -m /models/llama-70b-q4_k_m.gguf \
  -ngl 99 \
  -c 8192 \
  -np 2 \
  --tensor-split 0.5,0.5 \
  --host 0.0.0.0 \
  --port 8080

Не варто плутати розподіл моделі з подвоєнням швидкості. Дві карти по 24 GB дають змогу розмістити ваги, але без швидкого з’єднання не завжди перевершують одну GPU з 48 GB. Multi-GPU виправданий, коли він вирішує реальну проблему місткості або batch throughput.

Швидкий вибір
Шукаєте сервер, який просто працює?
Valebyte VPS — NVMe, підтримка 24/7, запуск за 60 секунд.
Тарифи VPS

Вимоги до VRAM для квантизації: Q4, Q8 чи FP16?

Quantization VRAM requirements визначають не лише ціну сервера, а й профіль якості, швидкість завантаження моделі та доступний контекст. Для більшості self-hosted API розумною відправною точкою вважається Q4_K_M або AWQ/GPTQ 4-bit, протестована саме на ваших даних.

Як вибрати формат ваг

  1. Q4: вибирайте для чат-ботів, внутрішнього пошуку, RAG та економного запуску 7B–70B. Економія VRAM порівняно з FP16 сягає приблизно 65–75%.
  2. Q8: використовуйте, якщо 4-bit помітно погіршує SQL, код, сувору JSON-генерацію або відповіді на предметних даних. VRAM майже вдвічі більше, ніж для Q4.
  3. FP16/BF16: потрібен для навчання, LoRA/QLoRA-пайплайнів, високоточного inference та моделей без перевіреної 4-bit-квантизації.

Квантизація ваг і KV-cache — це різні налаштування. Якщо runtime зберігає KV-cache у FP16, довгий контекст може стати головним споживачем VRAM навіть за Q4-ваг. Підтримка FP8 або Q8 KV-cache іноді допомагає збільшити контекст, але потребує перевірки якості на довгих документах.

Скільки RAM, CPU та диска потрібно для self-hosted LLM?

Окрім VRAM, self-hosted LLM потребує системної пам’яті для завантажувача, кешу файлів, контейнерів і CPU-offload: для 7B достатньо 32 GB RAM, для 13B краще 48–64 GB, для 34B — 64–96 GB, а для 70B — від 128 GB.

CPU та RAM для inference

Якщо всі шари розміщені на GPU, CPU рідко стає вузьким місцем. Для однієї GPU зазвичай достатньо 8 сучасних vCPU із частотою від 3,0 GHz; для двох GPU, vLLM і кількох паралельних запитів — 16 vCPU. CPU-offload заощаджує відеопам’ять, але знижує швидкість: перенесення навіть кількох шарів 70B через PCIe може зменшити генерацію з десятків токенів за секунду до одиниць.

RAM має покривати розмір файлу моделі щонайменше у 1,5–2 рази під час завантаження, конвертації та роботи контейнерів. Для 70B Q4 доцільно закладати 128 GB ECC RAM, для 70B FP16 — від 256 GB, якщо ваги зберігаються та готуються локально.

NVMe-диск, мережа та резерв

На диску потрібні самі ваги, кілька квантизацій, кеш Hugging Face, Docker-образи, логи й дані RAG. Для однієї 70B Q4 виділяйте щонайменше 200 GB NVMe; для кількох форматів моделі та векторної бази — 500 GB–1 TB NVMe. SATA SSD допустимий для зберігання, але NVMe помітно скорочує холодне завантаження 40–150 GB ваг.

Для зовнішнього API використовуйте порт від 1 Gbps та обмежуйте запити через reverse proxy. Текстовий трафік невеликий: відповідь із 1 000 токенів зазвичай займає лічені кілобайти, проте RAG-вкладення, логи та завантаження моделей можуть споживати десятки або сотні гігабайтів на місяць.

Масштаб навантаження → vCPU, RAM, диск, трафік і ціна

Для 5 одночасних користувачів 70B Q4 достатньо 16 vCPU, 128 GB RAM, 500 GB NVMe-диска та 48–80 GB VRAM.

Масштаб навантаження vCPU RAM Диск Мережевий порт Трафік GPU та VRAM Ціна
1 одночасний користувач 8 vCPU 64 GB 250 GB NVMe 1 Gbps 1 TB/міс 1 × 48 GB, 70B Q4 Орієнтовно $900–1 800/міс, березень 2025
5 одночасних користувачів 16 vCPU 128 GB 500 GB NVMe 1 Gbps 3 TB/міс 1 × 80 GB або 2 × 48 GB Орієнтовно $1 800–4 000/міс, березень 2025
20 одночасних користувачів 32 vCPU 256 GB 1 TB NVMe 10 Gbps 10 TB/міс 2–4 × 80 GB, tensor parallel Орієнтовно $6 000–15 000/міс, березень 2025

Ціни наведено як загальноринковий орієнтир на березень 2025 року для GPU-інфраструктури та залежать від регіону, моделі прискорювача, типу міжз’єднання, строку оренди й включеного трафіку. Для 7B і 13B бюджет значно нижчий: одна GPU з 16–24 GB VRAM зазвичай покриває більшість внутрішніх сервісів. Вибираючи інфраструктуру, корисно зіставити фактичне навантаження з розрахунком VRAM і RAM для LLM-сервера.

Швидкий вибір
Шукаєте сервер, який просто працює?
Valebyte VPS — NVMe, підтримка 24/7, запуск за 60 секунд.
Тарифи VPS

Як перевірити VRAM перед запуском моделі?

Перед розгортанням виміряйте вільну пам’ять GPU, розмір GGUF/Safetensors-файлу та пікове споживання на цільовій довжині контексту. Не використовуйте лише розмір файлу як критерій: runtime може додатково вимагати 2–10 GB залежно від моделі та batch size.

Команди для діагностики GPU

# Состояние GPU, VRAM и активные процессы
nvidia-smi

# Обновление каждые 2 секунды
watch -n 2 nvidia-smi

# Проверка размера весов
du -sh /models/*.gguf
du -sh /models/*.safetensors

# Контроль памяти контейнера
docker stats --no-stream

Для тесту запускайте модель із мінімальним контекстом 2048, потім збільшуйте значення до 4096, 8192 і цільового ліміту. Одночасно підвищуйте кількість паралельних запитів. Так можна знайти не теоретичну, а фактичну межу конкретного рушія. Під час вибору прискорювача порівняйте результати з рекомендаціями з огляду GPU для локального inference 7B–70B.

Часті запитання

Чи можна запустити модель 70B на GPU з 24 GB VRAM?

Так, але зазвичай лише із сильною квантизацією та CPU-offload частини шарів. 70B Q4 займає приблизно 42–48 GB разом із runtime, тому карта на 24 GB не зможе повністю утримати ваги. Запуск можливий на 24 GB VRAM і 128 GB RAM, однак швидкість часто падає до кількох токенів за секунду через обмін PCIe.

Скільки VRAM потрібно для моделі 13B у Q4?

Для 13B у Q4 потрібно приблизно 9–12 GB VRAM за короткого контексту, але практичний вибір — GPU на 16 GB. Такий запас покриває CUDA-буфери, KV-cache для 4K–8K токенів і один-два одночасних запити. Для Q8-версії 13B краще мати 20–24 GB відеопам’яті.

Що важливіше для LLM: VRAM чи системна RAM?

Для швидкого inference важливіша VRAM, оскільки розміщення всіх шарів на GPU забезпечує суттєво вищу швидкість генерації. RAM визначає, чи зможете ви завантажити ваги, використовувати CPU-offload і запустити сервіси навколо моделі. Для 70B Q4 рекомендовано 48–80 GB VRAM і щонайменше 128 GB системної RAM.

Чи потрібна GPU на 80 GB для 70B Q4?

Не завжди: 70B Q4 може працювати на 48 GB VRAM з одним активним діалогом і контекстом близько 4K токенів. Однак GPU на 80 GB краще підходить для API, RAG, контексту 8K–16K і batching. Додаткові 32 GB дають змогу зберігати більше KV-cache та знижують ризик помилки out of memory під час пікових запитів.

Висновки

Для 7B і 13B вибирайте GPU з 16–24 GB VRAM, для 34B Q4 — від 24–48 GB, а для 70B Q4 — від 48 GB із перевагою 80 GB за API-навантаження. Плануйте VRAM разом із KV-cache: для 70B Q4 практична серверна конфігурація — 16 vCPU, 128 GB RAM, 500 GB NVMe та GPU на 48–80 GB.

SSD NVMe
Готові запустити свій VPS?

NVMe VPS з активацією за 60 секунд: повний root-доступ, 20+ локацій, оплата карткою або криптовалютою.

Вибрати тариф
support_agent
Valebyte Support
Usually replies within minutes
Hi there!
Send us a message and we'll reply as soon as possible.