bolt Valebyte VPS від $4/міс — NVMe, запуск за 60 секунд.

Отримати VPS arrow_forward

Вимоги до сервера Ollama: RAM, VRAM і CPU за розміром моделі

calendar_month September 15, 2026 schedule 14 хв. читання visibility 25 переглядів
person
Valebyte Team
Вимоги до сервера Ollama: RAM, VRAM і CPU за розміром моделі
summarize

TL;DR

  • Для Ollama 7B потрібно 16 ГБ RAM (CPU) або 8-12 ГБ VRAM; для 70B — від 64 ГБ RAM або 48 ГБ VRAM.
  • Квантизація Q4_K_M або Q5_K_M є оптимальним балансом якості, швидкості та вартості для серверів.
  • Фактичні вимоги до пам'яті вищі за розмір файлу моделі через KV-cache, контекст та буфери.
  • Моделі 3B потребують 8 ГБ RAM (CPU) або 4 ГБ VRAM; 13B — 24-32 ГБ RAM або 16 ГБ VRAM.

Для Ollama з моделлю 7B потрібен сервер із 16 GB RAM у разі CPU-інференсу або 8–12 GB VRAM під час роботи на GPU, а для 70B — від 64 GB RAM і 48 GB VRAM відповідно.

Що означають ollama server requirements для різних моделей

Розмір тегів 3B, 7B, 13B і 70B

Ollama запускає великі мовні моделі локально через llama.cpp і сумісні backend-компоненти. Інференс може виконуватися на CPU, GPU або у змішаному режимі, коли частина шарів моделі розміщується у відеопам’яті, а решта — в оперативній пам’яті. Тому ollama server requirements визначаються не лише назвою моделі, а й конкретним тегом: наприклад, 7B Q4_K_M і 7B у FP16 потребують принципово різного обсягу пам’яті.

Число 3B, 7B, 13B або 70B позначає приблизну кількість мільярдів параметрів. Квантизація Q4, Q5, Q8 зменшує розмір ваг і вимоги до пам’яті, але може трохи знизити точність. Для серверного використання найчастіше обирають Q4_K_M або Q5_K_M: це розумний баланс між якістю відповіді, швидкістю та вартістю обладнання.

Чому фактичний обсяг RAM більший за розмір файлу моделі

Файл моделі — не єдиний споживач пам’яті. Ollama додатково використовує RAM або VRAM для KV-cache, контексту, робочих буферів, токенізатора та операційної системи. За контексту 8K–16K пам’ять витрачається помітно швидше, особливо для 13B і 70B. Для кількох паралельних запитів KV-cache збільшується майже пропорційно кількості одночасних користувачів.

Практичні вимоги до сервера для self-hosted ШІ та LLM допомагають оцінити не лише розмір ваг, а й запас пам’яті для контексту, API-сервісів, моніторингу та дискового кешу.

Ollama hardware requirements: RAM і VRAM залежно від розміру моделі

Зведена таблиця для CPU- та GPU-інференсу

Нижче наведено орієнтири для квантизованих моделей Q4_K_M із контекстом до 8K та одним активним запитом. Швидкість указано в токенах за секунду; вона залежить від архітектури процесора, покоління GPU, пропускної здатності пам’яті, довжини контексту та версії Ollama.

Розмір моделі Мінімальна RAM для CPU Рекомендована VRAM для GPU Рекомендований CPU Диск для ваг Орієнтовна швидкість
3B 8 GB 4 GB 4 vCPU, 3,0+ GHz 8–12 GB NVMe CPU: 15–35 ток/с; GPU: 40–100 ток/с
7B 16 GB 8–12 GB 6–8 vCPU, 3,0+ GHz 10–16 GB NVMe CPU: 8–20 ток/с; GPU: 35–90 ток/с
13B 24–32 GB 16 GB 8–12 vCPU, 3,2+ GHz 18–28 GB NVMe CPU: 4–10 ток/с; GPU: 20–55 ток/с
70B 64–96 GB 48–80 GB 16–32 vCPU, 3,0+ GHz 45–60 GB NVMe CPU: 0,8–3 ток/с; GPU: 8–25 ток/с

У таблиці вказано пам’ять саме для запуску моделі, а не повний розмір VPS. На сервері з 16 GB RAM для 7B залишиться мало запасу, якщо одночасно працюють Nginx, API, база даних і система моніторингу. Для стабільного production-розгортання краще закладати 24 GB RAM або використовувати GPU з 12 GB VRAM і 16 GB системної пам’яті.

Моделі у FP16 потребують приблизно вдвічі більше пам’яті, ніж Q8, і в чотири рази більше, ніж Q4, але точне значення залежить від архітектури. Наприклад, 7B FP16 може займати близько 14–16 GB лише під ваги, тоді як 7B Q4 зазвичай поміщається у 4–6 GB.

Шукаєте надійний сервер для своїх проєктів?

VPS від $10/міс. і виділені сервери від $9/міс. з NVMe, DDoS-захистом і підтримкою 24/7.

Переглянути пропозиції →

Ollama CPU vs GPU inference: що обрати

Коли CPU-інференс виправданий

Ollama CPU vs GPU inference — це вибір між нижчою вартістю та вищою швидкістю. CPU підходить для розробки, тестування промптів, фонової класифікації, генерації ембедингів і поодиноких адміністративних запитів. Модель 3B на 4–8 vCPU зазвичай відповідає достатньо швидко для персонального помічника, а 7B на 8–16 vCPU придатна для одного користувача за помірної довжини контексту.

CPU-інференс також доцільний, коли модель має працювати цілодобово, але запити надходять рідко. Сервер із 32 GB RAM і швидким NVMe може обслуговувати 7B або 13B без окремої відеокарти. Недолік очевидний: перший токен з’являється повільніше, а генерація 13B і особливо 70B стає помітно менш комфортною.

Коли GPU обов’язкова

GPU потрібна для інтерактивного API, чат-бота з кількома користувачами, RAG-пошуку з високою частотою запитів, програмування в IDE та генерації довгих відповідей. Для 7B доцільно мати 8–12 GB VRAM, для 13B — близько 16 GB, а для 70B — одну або кілька GPU із сумарно 48–80 GB VRAM.

GPU не обов’язково має містити модель повністю. Ollama може частково вивантажити шари у відеопам’ять, а решту залишити в RAM, але змішаний режим зазвичай повільніший через обмін даними через PCIe. Якщо важлива стабільна затримка, краще підбирати VRAM із запасом 15–25% відносно розміру моделі та KV-cache.

Вибір прискорювача для 7B і 70B значною мірою залежить від типу пам’яті, ширини шини та кількості GPU; окрема стаття про GPU для inference LLM допомагає порівняти такі сценарії.

Швидкий вибір
Шукаєте сервер, який просто працює?
Valebyte VPS — NVMe, підтримка 24/7, запуск за 60 секунд.
Тарифи VPS

Скільки RAM потрібно Ollama для контексту та кількох користувачів

KV-cache і довжина контексту

Питання «скільки RAM потрібно Ollama» не можна вирішувати лише за розміром файлу моделі. Під час генерації модель зберігає історію токенів у KV-cache. Що довший контекст і що більше паралельних діалогів, то більше пам’яті потрібно. Перехід із 4K на 16K токенів може збільшити споживання пам’яті в кілька разів, а чотири одночасні запити потребуватимуть приблизно в чотири рази більше KV-cache, ніж один.

Для одного користувача та контексту 8K зазвичай достатньо такого запасу:

  • 3B: 8 GB RAM або 4 GB VRAM;
  • 7B: 16–24 GB RAM або 8–12 GB VRAM;
  • 13B: 32 GB RAM або 16–24 GB VRAM;
  • 70B: 96 GB RAM для CPU або 64 GB сумарної VRAM для комфортної роботи.

Якщо потрібен контекст 32K, до цих значень слід додати запас, а за паралельних запитів — орієнтуватися на фактичний профіль навантаження. Для production-сервера розумно залишати 20–30% RAM вільною: Linux, Ollama API, reverse proxy та фонові процеси не повинні конкурувати з моделлю за пам’ять.

Паралельні запити та черга

Збільшення кількості користувачів не перетворює одну GPU на кілька незалежних прискорювачів. Запити можуть оброблятися паралельно, але кожен отримує частину обчислювальних ресурсів і KV-cache. Якщо GPU забезпечує 30 токенів за секунду для одного запиту, то за чотирьох активних діалогів середня швидкість для одного запиту може істотно знизитися.

Для невеликого API корисніше обмежити паралелізм і встановити чергу, ніж допустити одночасне переповнення RAM. У конфігурації слід задати розумний ліміт контексту, тайм-аути та максимальну кількість активних запитів.

OLLAMA_HOST=0.0.0.0:11434
OLLAMA_NUM_PARALLEL=2
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_KEEP_ALIVE=10m

Змінні середовища залежать від версії Ollama та способу запуску сервісу. Не слід напряму відкривати порт 11434 в інтернет: перед ним потрібні reverse proxy, авторизація та обмеження доступу на рівні мережі.

Ollama server specs model size: диск, CPU і мережа

Який диск потрібен для зберігання ваг

Для Ollama найкраще використовувати локальний NVMe-диск. Він пришвидшує завантаження, розпакування та завантаження моделі в RAM або VRAM. Мінімальний обсяг диска має враховувати не лише ваги однієї моделі, а й кілька тегів, тимчасові файли, логи та запас для оновлень.

  • 3B: мінімум 20 GB, рекомендовано 40 GB NVMe;
  • 7B: мінімум 30 GB, рекомендовано 60 GB NVMe;
  • 13B: мінімум 50 GB, рекомендовано 80–100 GB NVMe;
  • 70B: мінімум 100 GB, рекомендовано 150–200 GB NVMe.

Якщо зберігати версії Q4, Q5 і Q8 однієї моделі, обсяг швидко зростає. Диска на 60 GB може вистачити для однієї моделі 7B, але для кількох моделей, Docker-образів і системних журналів його вже буде замало.

CPU, PCIe і мережевий порт

Для CPU-інференсу важливі фізичні ядра, тактова частота та пропускна здатність оперативної пам’яті. 8 швидких vCPU часто працюють краще, ніж 16 повільних віртуальних потоків. Для GPU-сервера важливі лінії PCIe, коректний драйвер, достатня потужність живлення та можливість виділити GPU без жорсткої конкуренції з іншими завданнями.

У межах одного сервера мережевого порту 1 Gbps зазвичай достатньо: передаються запити та відповіді, а не ваги моделі під час кожного звернення. Для віддаленого API з великою кількістю користувачів або потоковою видачею варто розглянути 1–10 Gbps, але вузьким місцем частіше залишається інференс, а не мережа.

Сервер для Ollama: вимоги залежно від масштабу навантаження

Масштаб → специфікація для VPS і виділеного сервера

Для 10 одночасних користувачів із моделлю 7B достатньо 8 vCPU, 32 GB RAM, NVMe-диска на 100 GB і порту 1 Gbps.

Масштаб навантаження vCPU RAM Диск Мережевий порт Ціна
1 користувач, 3B–7B 4 16 GB 40 GB NVMe 1 Gbps орієнтовно $15–25/міс., березень 2026
5 одночасних користувачів, 7B 8 32 GB 80 GB NVMe 1 Gbps орієнтовно $35–60/міс., березень 2026
10 одночасних користувачів, 7B–13B 12 64 GB 120 GB NVMe 1 Gbps орієнтовно $70–120/міс., березень 2026
25 одночасних користувачів, 13B із GPU 16 64 GB 200 GB NVMe 1–10 Gbps орієнтовно $180–350/міс., березень 2026
50 одночасних користувачів, 70B 32 128 GB 300 GB NVMe 10 Gbps орієнтовно $500–1000/міс., березень 2026

Ціни в таблиці є загальноринковими орієнтирами на березень 2026 року, а не фіксованими тарифами стороннього провайдера: підсумкова вартість залежить від регіону, типу GPU, гарантії виділення ресурсів, трафіку та строку оренди. Для кількох користувачів із моделлю 3B–7B VPS зазвичай вигідніший за виділений сервер, але для 13B–70B GPU-вузол часто забезпечує передбачуванішу затримку.

Обираючи конфігурацію Valebyte, заздалегідь визначте, чи потрібна постійно доступна GPU, скільки моделей буде завантажено одночасно та який максимальний контекст потрібен. Для CPU-завдань корисно порівняти віртуальні ресурси з фізичним сервером: різницю у стабільності частоти CPU докладно описано в матеріалі про bare-metal і VPS для ML inference на CPU.

Швидкий вибір
Шукаєте сервер, який просто працює?
Valebyte VPS — NVMe, підтримка 24/7, запуск за 60 секунд.
Тарифи VPS

Як встановити Ollama та перевірити доступне обладнання

Встановлення та завантаження моделі

У Linux встановлення зазвичай виконується однією командою, після чого модель завантажується через Ollama CLI. Для production-середовища краще використовувати окремого системного користувача, systemd-сервіс і firewall.

curl -fsSL https://ollama.com/install.sh | sh

ollama pull llama3.1:8b
ollama run llama3.1:8b

Конкретний тег може мати розмір, відмінний від очікуваного: перед завантаженням перевірте сторінку моделі та вільне місце на диску. Для тестування API:

curl http://127.0.0.1:11434/api/generate \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.1:8b","prompt":"Проверь скорость ответа","stream":false}'

Перевірка CPU, RAM і GPU

lscpu
free -h
lsblk
nvidia-smi
ollama ps

Команда ollama ps показує завантажену модель і спосіб її розміщення в пам’яті. Якщо в полі розміщення вказано частковий розподіл між CPU і GPU, VRAM недостатньо для повного розміщення моделі. У Linux також перевіряйте free -h під час реального запиту, а не лише в режимі простою: пікове навантаження RAM виникає під час завантаження ваг і створення контексту.

Як вибрати конфігурацію Valebyte для Ollama

VPS для тестування та невеликих команд

VPS із 4 vCPU і 16 GB RAM підходить для 3B і більшості моделей 7B у режимі розробки. Конфігурація з 8 vCPU і 32 GB RAM комфортніша для одного-двох користувачів, RAG-прототипу та API з обмеженим паралелізмом. NVMe обов’язковий, якщо моделі часто змінюються або сервер використовується для автоматизованих пайплайнів.

Перед замовленням перевірте чотири параметри: гарантовану частку CPU, тип диска, ліміт вихідного трафіку та можливість встановити потрібні драйвери. Для CPU-only сценарію GPU не потрібна, але для 13B і 70B вартість RAM та час відповіді можуть зробити такий варіант невигідним.

GPU-сервер для production

GPU-сервер обирають за обсягом VRAM, а не лише за обчислювальною потужністю. Для 7B достатньо 8–12 GB VRAM, для 13B краще мати 16–24 GB, а для 70B — 48 GB і більше. За довгого контексту та кількох користувачів потрібен додатковий запас, інакше Ollama почне вивантажувати шари в RAM.

  • для чат-бота до 5 користувачів: 7B, 8–12 GB VRAM, 32 GB RAM;
  • для внутрішнього помічника на 10–25 користувачів: 13B, 16–24 GB VRAM, 64 GB RAM;
  • для якісної моделі 70B: 48–80 GB VRAM, 128 GB RAM і 24–32 vCPU;
  • для високої доступності: два вузли, резервні копії моделей і health-check API.

Якщо Ollama розміщується поруч із векторною базою, reranker і сервісом документів, враховуйте їхню RAM окремо. Власні застосунки для OCR, пошуку та обробки файлів можуть потребувати більше пам’яті, ніж здається за розміром LLM; аналогічний підхід до вибору обладнання описано в матеріалі про self-hosted застосунки та навантаження на сервер.

Поширені запитання

Скільки RAM потрібно Ollama з моделлю 7B?

Для 7B Q4_K_M мінімально підходить сервер із 16 GB RAM, але для реальної роботи краще обрати 24–32 GB. Це залишає пам’ять для операційної системи, KV-cache, контексту 8K та API-сервісів. За чотирьох паралельних запитів або контексту 16K 32 GB може виявитися недостатньо без обмеження черги.

Чи можна запускати Ollama без відеокарти?

Так, Ollama працює на CPU. Моделі 3B і 7B підходять для CPU-інференсу на 4–8 швидких vCPU, а для 13B потрібно приблизно 8–12 vCPU і 32 GB RAM. Запуск 70B на CPU можливий за наявності 64–96 GB RAM, але швидкість часто становить лише 0,8–3 токени за секунду, тому для інтерактивного використання краще GPU.

Який обсяг VRAM потрібен для моделі 13B?

Для 13B у Q4 зазвичай потрібно 10–12 GB пам’яті під ваги, але з урахуванням KV-cache і запасу рекомендується GPU на 16 GB VRAM. За контексту 16K або кількох користувачів краще використовувати 24 GB VRAM або поєднати GPU із 32–64 GB системної RAM, розуміючи, що часткове вивантаження на CPU знижує швидкість.

Скільки місця займає модель Ollama на диску?

Квантизована модель 7B зазвичай займає близько 4–8 GB, 13B — 8–15 GB, а 70B — приблизно 40–50 GB. Для оновлень, кількох тегів і тимчасових файлів рекомендується закладати щонайменше 40 GB для 3B–7B, 100 GB для 13B і 150–200 GB NVMe для 70B.

Швидкий вибір
Шукаєте сервер, який просто працює?
Valebyte VPS — NVMe, підтримка 24/7, запуск за 60 секунд.
Тарифи VPS

Висновки

Для 3B–7B підійде VPS із 4–8 vCPU та 16–32 GB RAM, а для інтерактивної роботи кількох користувачів краще обрати GPU на 8–12 GB VRAM. Моделі 13B і 70B потребують відповідно 16–24 GB і 48–80 GB VRAM або 32–96 GB RAM у разі CPU-інференсу, тому конфігурацію Valebyte слід підбирати за тегом моделі, довжиною контексту та кількістю паралельних запитів.

SSD NVMe
Готові запустити власний VPS?

NVMe VPS з активацією за 60 секунд: повний root-доступ, 20+ локацій, оплата карткою або криптовалютою.

Обрати тариф
support_agent
Valebyte Support
Usually replies within minutes
Hi there!
Send us a message and we'll reply as soon as possible.