Для Ollama з моделлю 7B потрібен сервер із 16 GB RAM у разі CPU-інференсу або 8–12 GB VRAM під час роботи на GPU, а для 70B — від 64 GB RAM і 48 GB VRAM відповідно.
Що означають ollama server requirements для різних моделей
Розмір тегів 3B, 7B, 13B і 70B
Ollama запускає великі мовні моделі локально через llama.cpp і сумісні backend-компоненти. Інференс може виконуватися на CPU, GPU або у змішаному режимі, коли частина шарів моделі розміщується у відеопам’яті, а решта — в оперативній пам’яті. Тому ollama server requirements визначаються не лише назвою моделі, а й конкретним тегом: наприклад, 7B Q4_K_M і 7B у FP16 потребують принципово різного обсягу пам’яті.
Число 3B, 7B, 13B або 70B позначає приблизну кількість мільярдів параметрів. Квантизація Q4, Q5, Q8 зменшує розмір ваг і вимоги до пам’яті, але може трохи знизити точність. Для серверного використання найчастіше обирають Q4_K_M або Q5_K_M: це розумний баланс між якістю відповіді, швидкістю та вартістю обладнання.
Чому фактичний обсяг RAM більший за розмір файлу моделі
Файл моделі — не єдиний споживач пам’яті. Ollama додатково використовує RAM або VRAM для KV-cache, контексту, робочих буферів, токенізатора та операційної системи. За контексту 8K–16K пам’ять витрачається помітно швидше, особливо для 13B і 70B. Для кількох паралельних запитів KV-cache збільшується майже пропорційно кількості одночасних користувачів.
Практичні вимоги до сервера для self-hosted ШІ та LLM допомагають оцінити не лише розмір ваг, а й запас пам’яті для контексту, API-сервісів, моніторингу та дискового кешу.
Ollama hardware requirements: RAM і VRAM залежно від розміру моделі
Зведена таблиця для CPU- та GPU-інференсу
Нижче наведено орієнтири для квантизованих моделей Q4_K_M із контекстом до 8K та одним активним запитом. Швидкість указано в токенах за секунду; вона залежить від архітектури процесора, покоління GPU, пропускної здатності пам’яті, довжини контексту та версії Ollama.
| Розмір моделі | Мінімальна RAM для CPU | Рекомендована VRAM для GPU | Рекомендований CPU | Диск для ваг | Орієнтовна швидкість |
|---|---|---|---|---|---|
| 3B | 8 GB | 4 GB | 4 vCPU, 3,0+ GHz | 8–12 GB NVMe | CPU: 15–35 ток/с; GPU: 40–100 ток/с |
| 7B | 16 GB | 8–12 GB | 6–8 vCPU, 3,0+ GHz | 10–16 GB NVMe | CPU: 8–20 ток/с; GPU: 35–90 ток/с |
| 13B | 24–32 GB | 16 GB | 8–12 vCPU, 3,2+ GHz | 18–28 GB NVMe | CPU: 4–10 ток/с; GPU: 20–55 ток/с |
| 70B | 64–96 GB | 48–80 GB | 16–32 vCPU, 3,0+ GHz | 45–60 GB NVMe | CPU: 0,8–3 ток/с; GPU: 8–25 ток/с |
У таблиці вказано пам’ять саме для запуску моделі, а не повний розмір VPS. На сервері з 16 GB RAM для 7B залишиться мало запасу, якщо одночасно працюють Nginx, API, база даних і система моніторингу. Для стабільного production-розгортання краще закладати 24 GB RAM або використовувати GPU з 12 GB VRAM і 16 GB системної пам’яті.
Моделі у FP16 потребують приблизно вдвічі більше пам’яті, ніж Q8, і в чотири рази більше, ніж Q4, але точне значення залежить від архітектури. Наприклад, 7B FP16 може займати близько 14–16 GB лише під ваги, тоді як 7B Q4 зазвичай поміщається у 4–6 GB.
Шукаєте надійний сервер для своїх проєктів?
VPS від $10/міс. і виділені сервери від $9/міс. з NVMe, DDoS-захистом і підтримкою 24/7.
Переглянути пропозиції →Ollama CPU vs GPU inference: що обрати
Коли CPU-інференс виправданий
Ollama CPU vs GPU inference — це вибір між нижчою вартістю та вищою швидкістю. CPU підходить для розробки, тестування промптів, фонової класифікації, генерації ембедингів і поодиноких адміністративних запитів. Модель 3B на 4–8 vCPU зазвичай відповідає достатньо швидко для персонального помічника, а 7B на 8–16 vCPU придатна для одного користувача за помірної довжини контексту.
CPU-інференс також доцільний, коли модель має працювати цілодобово, але запити надходять рідко. Сервер із 32 GB RAM і швидким NVMe може обслуговувати 7B або 13B без окремої відеокарти. Недолік очевидний: перший токен з’являється повільніше, а генерація 13B і особливо 70B стає помітно менш комфортною.
Коли GPU обов’язкова
GPU потрібна для інтерактивного API, чат-бота з кількома користувачами, RAG-пошуку з високою частотою запитів, програмування в IDE та генерації довгих відповідей. Для 7B доцільно мати 8–12 GB VRAM, для 13B — близько 16 GB, а для 70B — одну або кілька GPU із сумарно 48–80 GB VRAM.
GPU не обов’язково має містити модель повністю. Ollama може частково вивантажити шари у відеопам’ять, а решту залишити в RAM, але змішаний режим зазвичай повільніший через обмін даними через PCIe. Якщо важлива стабільна затримка, краще підбирати VRAM із запасом 15–25% відносно розміру моделі та KV-cache.
Вибір прискорювача для 7B і 70B значною мірою залежить від типу пам’яті, ширини шини та кількості GPU; окрема стаття про GPU для inference LLM допомагає порівняти такі сценарії.
Скільки RAM потрібно Ollama для контексту та кількох користувачів
KV-cache і довжина контексту
Питання «скільки RAM потрібно Ollama» не можна вирішувати лише за розміром файлу моделі. Під час генерації модель зберігає історію токенів у KV-cache. Що довший контекст і що більше паралельних діалогів, то більше пам’яті потрібно. Перехід із 4K на 16K токенів може збільшити споживання пам’яті в кілька разів, а чотири одночасні запити потребуватимуть приблизно в чотири рази більше KV-cache, ніж один.
Для одного користувача та контексту 8K зазвичай достатньо такого запасу:
- 3B: 8 GB RAM або 4 GB VRAM;
- 7B: 16–24 GB RAM або 8–12 GB VRAM;
- 13B: 32 GB RAM або 16–24 GB VRAM;
- 70B: 96 GB RAM для CPU або 64 GB сумарної VRAM для комфортної роботи.
Якщо потрібен контекст 32K, до цих значень слід додати запас, а за паралельних запитів — орієнтуватися на фактичний профіль навантаження. Для production-сервера розумно залишати 20–30% RAM вільною: Linux, Ollama API, reverse proxy та фонові процеси не повинні конкурувати з моделлю за пам’ять.
Паралельні запити та черга
Збільшення кількості користувачів не перетворює одну GPU на кілька незалежних прискорювачів. Запити можуть оброблятися паралельно, але кожен отримує частину обчислювальних ресурсів і KV-cache. Якщо GPU забезпечує 30 токенів за секунду для одного запиту, то за чотирьох активних діалогів середня швидкість для одного запиту може істотно знизитися.
Для невеликого API корисніше обмежити паралелізм і встановити чергу, ніж допустити одночасне переповнення RAM. У конфігурації слід задати розумний ліміт контексту, тайм-аути та максимальну кількість активних запитів.
OLLAMA_HOST=0.0.0.0:11434
OLLAMA_NUM_PARALLEL=2
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_KEEP_ALIVE=10m
Змінні середовища залежать від версії Ollama та способу запуску сервісу. Не слід напряму відкривати порт 11434 в інтернет: перед ним потрібні reverse proxy, авторизація та обмеження доступу на рівні мережі.
Ollama server specs model size: диск, CPU і мережа
Який диск потрібен для зберігання ваг
Для Ollama найкраще використовувати локальний NVMe-диск. Він пришвидшує завантаження, розпакування та завантаження моделі в RAM або VRAM. Мінімальний обсяг диска має враховувати не лише ваги однієї моделі, а й кілька тегів, тимчасові файли, логи та запас для оновлень.
- 3B: мінімум 20 GB, рекомендовано 40 GB NVMe;
- 7B: мінімум 30 GB, рекомендовано 60 GB NVMe;
- 13B: мінімум 50 GB, рекомендовано 80–100 GB NVMe;
- 70B: мінімум 100 GB, рекомендовано 150–200 GB NVMe.
Якщо зберігати версії Q4, Q5 і Q8 однієї моделі, обсяг швидко зростає. Диска на 60 GB може вистачити для однієї моделі 7B, але для кількох моделей, Docker-образів і системних журналів його вже буде замало.
CPU, PCIe і мережевий порт
Для CPU-інференсу важливі фізичні ядра, тактова частота та пропускна здатність оперативної пам’яті. 8 швидких vCPU часто працюють краще, ніж 16 повільних віртуальних потоків. Для GPU-сервера важливі лінії PCIe, коректний драйвер, достатня потужність живлення та можливість виділити GPU без жорсткої конкуренції з іншими завданнями.
У межах одного сервера мережевого порту 1 Gbps зазвичай достатньо: передаються запити та відповіді, а не ваги моделі під час кожного звернення. Для віддаленого API з великою кількістю користувачів або потоковою видачею варто розглянути 1–10 Gbps, але вузьким місцем частіше залишається інференс, а не мережа.
Сервер для Ollama: вимоги залежно від масштабу навантаження
Масштаб → специфікація для VPS і виділеного сервера
Для 10 одночасних користувачів із моделлю 7B достатньо 8 vCPU, 32 GB RAM, NVMe-диска на 100 GB і порту 1 Gbps.
| Масштаб навантаження | vCPU | RAM | Диск | Мережевий порт | Ціна |
|---|---|---|---|---|---|
| 1 користувач, 3B–7B | 4 | 16 GB | 40 GB NVMe | 1 Gbps | орієнтовно $15–25/міс., березень 2026 |
| 5 одночасних користувачів, 7B | 8 | 32 GB | 80 GB NVMe | 1 Gbps | орієнтовно $35–60/міс., березень 2026 |
| 10 одночасних користувачів, 7B–13B | 12 | 64 GB | 120 GB NVMe | 1 Gbps | орієнтовно $70–120/міс., березень 2026 |
| 25 одночасних користувачів, 13B із GPU | 16 | 64 GB | 200 GB NVMe | 1–10 Gbps | орієнтовно $180–350/міс., березень 2026 |
| 50 одночасних користувачів, 70B | 32 | 128 GB | 300 GB NVMe | 10 Gbps | орієнтовно $500–1000/міс., березень 2026 |
Ціни в таблиці є загальноринковими орієнтирами на березень 2026 року, а не фіксованими тарифами стороннього провайдера: підсумкова вартість залежить від регіону, типу GPU, гарантії виділення ресурсів, трафіку та строку оренди. Для кількох користувачів із моделлю 3B–7B VPS зазвичай вигідніший за виділений сервер, але для 13B–70B GPU-вузол часто забезпечує передбачуванішу затримку.
Обираючи конфігурацію Valebyte, заздалегідь визначте, чи потрібна постійно доступна GPU, скільки моделей буде завантажено одночасно та який максимальний контекст потрібен. Для CPU-завдань корисно порівняти віртуальні ресурси з фізичним сервером: різницю у стабільності частоти CPU докладно описано в матеріалі про bare-metal і VPS для ML inference на CPU.
Як встановити Ollama та перевірити доступне обладнання
Встановлення та завантаження моделі
У Linux встановлення зазвичай виконується однією командою, після чого модель завантажується через Ollama CLI. Для production-середовища краще використовувати окремого системного користувача, systemd-сервіс і firewall.
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.1:8b
ollama run llama3.1:8b
Конкретний тег може мати розмір, відмінний від очікуваного: перед завантаженням перевірте сторінку моделі та вільне місце на диску. Для тестування API:
curl http://127.0.0.1:11434/api/generate \
-H "Content-Type: application/json" \
-d '{"model":"llama3.1:8b","prompt":"Проверь скорость ответа","stream":false}'
Перевірка CPU, RAM і GPU
lscpu
free -h
lsblk
nvidia-smi
ollama ps
Команда ollama ps показує завантажену модель і спосіб її розміщення в пам’яті. Якщо в полі розміщення вказано частковий розподіл між CPU і GPU, VRAM недостатньо для повного розміщення моделі. У Linux також перевіряйте free -h під час реального запиту, а не лише в режимі простою: пікове навантаження RAM виникає під час завантаження ваг і створення контексту.
Як вибрати конфігурацію Valebyte для Ollama
VPS для тестування та невеликих команд
VPS із 4 vCPU і 16 GB RAM підходить для 3B і більшості моделей 7B у режимі розробки. Конфігурація з 8 vCPU і 32 GB RAM комфортніша для одного-двох користувачів, RAG-прототипу та API з обмеженим паралелізмом. NVMe обов’язковий, якщо моделі часто змінюються або сервер використовується для автоматизованих пайплайнів.
Перед замовленням перевірте чотири параметри: гарантовану частку CPU, тип диска, ліміт вихідного трафіку та можливість встановити потрібні драйвери. Для CPU-only сценарію GPU не потрібна, але для 13B і 70B вартість RAM та час відповіді можуть зробити такий варіант невигідним.
GPU-сервер для production
GPU-сервер обирають за обсягом VRAM, а не лише за обчислювальною потужністю. Для 7B достатньо 8–12 GB VRAM, для 13B краще мати 16–24 GB, а для 70B — 48 GB і більше. За довгого контексту та кількох користувачів потрібен додатковий запас, інакше Ollama почне вивантажувати шари в RAM.
- для чат-бота до 5 користувачів: 7B, 8–12 GB VRAM, 32 GB RAM;
- для внутрішнього помічника на 10–25 користувачів: 13B, 16–24 GB VRAM, 64 GB RAM;
- для якісної моделі 70B: 48–80 GB VRAM, 128 GB RAM і 24–32 vCPU;
- для високої доступності: два вузли, резервні копії моделей і health-check API.
Якщо Ollama розміщується поруч із векторною базою, reranker і сервісом документів, враховуйте їхню RAM окремо. Власні застосунки для OCR, пошуку та обробки файлів можуть потребувати більше пам’яті, ніж здається за розміром LLM; аналогічний підхід до вибору обладнання описано в матеріалі про self-hosted застосунки та навантаження на сервер.
Поширені запитання
Скільки RAM потрібно Ollama з моделлю 7B?
Для 7B Q4_K_M мінімально підходить сервер із 16 GB RAM, але для реальної роботи краще обрати 24–32 GB. Це залишає пам’ять для операційної системи, KV-cache, контексту 8K та API-сервісів. За чотирьох паралельних запитів або контексту 16K 32 GB може виявитися недостатньо без обмеження черги.
Чи можна запускати Ollama без відеокарти?
Так, Ollama працює на CPU. Моделі 3B і 7B підходять для CPU-інференсу на 4–8 швидких vCPU, а для 13B потрібно приблизно 8–12 vCPU і 32 GB RAM. Запуск 70B на CPU можливий за наявності 64–96 GB RAM, але швидкість часто становить лише 0,8–3 токени за секунду, тому для інтерактивного використання краще GPU.
Який обсяг VRAM потрібен для моделі 13B?
Для 13B у Q4 зазвичай потрібно 10–12 GB пам’яті під ваги, але з урахуванням KV-cache і запасу рекомендується GPU на 16 GB VRAM. За контексту 16K або кількох користувачів краще використовувати 24 GB VRAM або поєднати GPU із 32–64 GB системної RAM, розуміючи, що часткове вивантаження на CPU знижує швидкість.
Скільки місця займає модель Ollama на диску?
Квантизована модель 7B зазвичай займає близько 4–8 GB, 13B — 8–15 GB, а 70B — приблизно 40–50 GB. Для оновлень, кількох тегів і тимчасових файлів рекомендується закладати щонайменше 40 GB для 3B–7B, 100 GB для 13B і 150–200 GB NVMe для 70B.
Висновки
Для 3B–7B підійде VPS із 4–8 vCPU та 16–32 GB RAM, а для інтерактивної роботи кількох користувачів краще обрати GPU на 8–12 GB VRAM. Моделі 13B і 70B потребують відповідно 16–24 GB і 48–80 GB VRAM або 32–96 GB RAM у разі CPU-інференсу, тому конфігурацію Valebyte слід підбирати за тегом моделі, довжиною контексту та кількістю паралельних запитів.
NVMe VPS з активацією за 60 секунд: повний root-доступ, 20+ локацій, оплата карткою або криптовалютою.
Обрати тариф