bolt Valebyte VPS от $4/мес — NVMe, запуск за 60 секунд.

Получить VPS arrow_forward

Требования к серверу Ollama: подбор RAM, VRAM и CPU под размер модели

calendar_month 15 сентября 2026 schedule 14 мин. чтения visibility 20 просмотров
person
Valebyte Team
Требования к серверу Ollama: подбор RAM, VRAM и CPU под размер модели
summarize

TL;DR

  • Для Ollama с 7B моделью нужно 16 GB RAM (CPU) или 8–12 GB VRAM (GPU).
  • Для 70B модели Ollama требуется 64–96 GB RAM (CPU) или 48–80 GB VRAM (GPU).
  • Помимо весов модели, Ollama использует RAM/VRAM для KV-cache, контекста и буферов.
  • Квантизация Q4_K_M или Q5_K_M снижает требования к памяти, балансируя качество и скорость.

Для Ollama с моделью 7B нужен сервер с 16 GB RAM при CPU-инференсе или 8–12 GB VRAM при работе на GPU, а для 70B — от 64 GB RAM и 48 GB VRAM соответственно.

Что означают ollama server requirements для разных моделей

Размер тегов 3B, 7B, 13B и 70B

Ollama запускает большие языковые модели локально через llama.cpp и совместимые backend-компоненты. Инференс может выполняться на CPU, GPU или в смешанном режиме, когда часть слоёв модели размещается в видеопамяти, а остальные — в оперативной памяти. Поэтому ollama server requirements определяются не только названием модели, но и конкретным тегом: например, 7B Q4_K_M и 7B в FP16 требуют принципиально разный объём памяти.

Число 3B, 7B, 13B или 70B обозначает приблизительное количество миллиардов параметров. Квантизация Q4, Q5, Q8 уменьшает размер весов и требования к памяти, но может немного снизить точность. Для серверного использования чаще всего выбирают Q4_K_M или Q5_K_M: это разумный баланс между качеством ответа, скоростью и стоимостью железа.

Почему фактическая RAM выше размера файла модели

Файл модели — не единственный потребитель памяти. Ollama дополнительно использует RAM или VRAM под KV-cache, контекст, рабочие буферы, токенизатор и операционную систему. При контексте 8K–16K память расходуется заметно быстрее, особенно у 13B и 70B. Для нескольких параллельных запросов KV-cache увеличивается почти пропорционально числу одновременных пользователей.

Практические требования к серверу для self-hosted ИИ и LLM помогают оценить не только размер весов, но и запас под контекст, сервисы API, мониторинг и дисковый кэш.

Ollama hardware requirements: RAM и VRAM по размеру модели

Сводная таблица для CPU- и GPU-инференса

Ниже приведены ориентиры для квантизированных моделей Q4_K_M с контекстом до 8K и одним активным запросом. Скорость указана в токенах в секунду и зависит от архитектуры процессора, поколения GPU, пропускной способности памяти, длины контекста и версии Ollama.

Размер модели Минимальная RAM для CPU Рекомендуемая VRAM для GPU Рекомендуемый CPU Диск под веса Ориентир скорости
3B 8 GB 4 GB 4 vCPU, 3,0+ GHz 8–12 GB NVMe CPU: 15–35 ток/с; GPU: 40–100 ток/с
7B 16 GB 8–12 GB 6–8 vCPU, 3,0+ GHz 10–16 GB NVMe CPU: 8–20 ток/с; GPU: 35–90 ток/с
13B 24–32 GB 16 GB 8–12 vCPU, 3,2+ GHz 18–28 GB NVMe CPU: 4–10 ток/с; GPU: 20–55 ток/с
70B 64–96 GB 48–80 GB 16–32 vCPU, 3,0+ GHz 45–60 GB NVMe CPU: 0,8–3 ток/с; GPU: 8–25 ток/с

В таблице указана память именно для запуска модели, а не полный размер VPS. Для 7B на сервере с 16 GB RAM останется мало запаса, если одновременно работают Nginx, API, база данных и система мониторинга. Для стабильного production-развёртывания лучше закладывать 24 GB RAM или использовать GPU с 12 GB VRAM и 16 GB системной памяти.

Модели в FP16 требуют примерно вдвое больше памяти, чем Q8, и в четыре раза больше, чем Q4, но точное значение зависит от архитектуры. Например, 7B FP16 может занять около 14–16 GB только под веса, тогда как 7B Q4 обычно помещается в 4–6 GB.

Ищете надёжный сервер для ваших проектов?

VPS от $10/мес и выделенные серверы от $9/мес с NVMe, DDoS-защитой и поддержкой 24/7.

Смотреть предложения →

Ollama CPU vs GPU inference: что выбрать

Когда CPU-инференс оправдан

Ollama CPU vs GPU inference — это выбор между меньшей стоимостью и большей скоростью. CPU подходит для разработки, тестирования промптов, фоновой классификации, генерации эмбеддингов и редких административных запросов. Модель 3B на 4–8 vCPU обычно отвечает достаточно быстро для личного помощника, а 7B на 8–16 vCPU пригодна для одного пользователя при умеренном контексте.

CPU-инференс также разумен, когда модель должна работать круглосуточно, но запросы поступают редко. Сервер с 32 GB RAM и быстрым NVMe может обслуживать 7B или 13B без отдельной видеокарты. Недостаток очевиден: первый токен появляется медленнее, а генерация 13B и особенно 70B становится заметно менее комфортной.

Когда GPU обязателен

GPU нужен для интерактивного API, чат-бота с несколькими пользователями, RAG-поиска с высокой частотой запросов, программирования в IDE и генерации длинных ответов. Для 7B целесообразно иметь 8–12 GB VRAM, для 13B — около 16 GB, а для 70B — одну или несколько GPU суммарно на 48–80 GB VRAM.

GPU не всегда должен содержать модель целиком. Ollama может частично выгрузить слои в видеопамять и оставить остаток в RAM, но смешанный режим обычно медленнее из-за обмена данными через PCIe. Если важна стабильная задержка, лучше подбирать VRAM с запасом 15–25% относительно размера модели и KV-cache.

Подбор ускорителя для 7B и 70B подробно зависит от типа памяти, ширины шины и числа GPU; отдельная статья о GPU для inference LLM помогает сравнить такие сценарии.

Быстрый выбор
Ищете сервер, который просто работает?
Valebyte VPS — NVMe, поддержка 24/7, запуск за 60 секунд.
Тарифы VPS

Сколько RAM для Ollama с контекстом и несколькими пользователями

KV-cache и длина контекста

Вопрос «сколько RAM для Ollama» нельзя решать только по размеру файла модели. При генерации модель хранит историю токенов в KV-cache. Чем длиннее контекст и чем больше параллельных диалогов, тем больше памяти требуется. Переход с 4K на 16K токенов может увеличить расход памяти в несколько раз, а четыре одновременных запроса потребуют приблизительно в четыре раза больше KV-cache, чем один.

Для одного пользователя и 8K контекста обычно достаточно следующих запасов:

  • 3B: 8 GB RAM или 4 GB VRAM;
  • 7B: 16–24 GB RAM или 8–12 GB VRAM;
  • 13B: 32 GB RAM или 16–24 GB VRAM;
  • 70B: 96 GB RAM для CPU либо 64 GB суммарной VRAM для комфортной работы.

Если требуется контекст 32K, к этим значениям следует добавить запас, а при параллельных запросах — ориентироваться на фактический профиль нагрузки. Для production-сервера разумно оставить 20–30% RAM свободной: Linux, Ollama API, reverse proxy и фоновые процессы не должны конкурировать с моделью за память.

Параллельные запросы и очередь

Увеличение числа пользователей не превращает один GPU в несколько независимых ускорителей. Запросы могут обрабатываться параллельно, но каждый получает часть вычислительных ресурсов и KV-cache. Если GPU рассчитана на 30 токенов в секунду для одного запроса, при четырёх активных диалогах средняя скорость на запрос может существенно снизиться.

Для небольшого API полезнее ограничить параллелизм и поставить очередь, чем допустить одновременное переполнение RAM. В конфигурации следует задать разумный предел контекста, таймауты и лимит активных запросов.

OLLAMA_HOST=0.0.0.0:11434
OLLAMA_NUM_PARALLEL=2
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_KEEP_ALIVE=10m

Переменные окружения зависят от версии Ollama и способа запуска сервиса. Публиковать порт 11434 напрямую в интернет не следует: перед ним нужен reverse proxy, авторизация и ограничение доступа по сети.

Ollama server specs model size: диск, CPU и сеть

Какой диск нужен для весов

Для Ollama предпочтителен локальный NVMe-диск. Он ускоряет скачивание, распаковку и загрузку модели в RAM или VRAM. Минимальный объём диска должен включать не только веса одной модели, но и несколько тегов, временные файлы, логи и запас для обновлений.

  • 3B: минимум 20 GB, рекомендуется 40 GB NVMe;
  • 7B: минимум 30 GB, рекомендуется 60 GB NVMe;
  • 13B: минимум 50 GB, рекомендуется 80–100 GB NVMe;
  • 70B: минимум 100 GB, рекомендуется 150–200 GB NVMe.

Если хранятся версии Q4, Q5 и Q8 одной модели, объём быстро увеличивается. Диск на 60 GB может быть достаточен для одной 7B-модели, но уже тесен для нескольких моделей, Docker-образов и системных журналов.

CPU, PCIe и сетевой порт

Для CPU-инференса важны физические ядра, частота и пропускная способность оперативной памяти. 8 быстрых vCPU часто работают лучше, чем 16 медленных виртуальных потоков. Для GPU-сервера важны PCIe-линии, корректный драйвер, достаточное питание и возможность выделить GPU без жёсткой конкуренции с другими задачами.

Внутри одного сервера сетевой порт 1 Gbps обычно достаточен: передаются запросы и ответы, а не веса модели при каждом обращении. Для удалённого API с большим количеством пользователей или потоковой выдачей стоит рассматривать 1–10 Gbps, но узким местом чаще остаётся инференс, а не сеть.

Сервер Ollama: требования под масштаб нагрузки

Масштаб → спека для VPS и выделенного сервера

Для 10 одновременных пользователей с моделью 7B достаточно 8 vCPU, 32 GB RAM, NVMe-диска на 100 GB и порта 1 Gbps.

Масштаб нагрузки vCPU RAM Диск Сетевой порт Цена
1 пользователь, 3B–7B 4 16 GB 40 GB NVMe 1 Gbps ориентировочно $15–25/мес., март 2026
5 одновременных пользователей, 7B 8 32 GB 80 GB NVMe 1 Gbps ориентировочно $35–60/мес., март 2026
10 одновременных пользователей, 7B–13B 12 64 GB 120 GB NVMe 1 Gbps ориентировочно $70–120/мес., март 2026
25 одновременных пользователей, 13B с GPU 16 64 GB 200 GB NVMe 1–10 Gbps ориентировочно $180–350/мес., март 2026
50 одновременных пользователей, 70B 32 128 GB 300 GB NVMe 10 Gbps ориентировочно $500–1000/мес., март 2026

Цены в таблице являются общерыночными ориентирами на март 2026 года, а не фиксированными тарифами стороннего провайдера: итог зависит от региона, типа GPU, гарантии выделения ресурсов, трафика и срока аренды. Для нескольких пользователей с моделью 3B–7B VPS обычно экономичнее выделенного сервера, но при 13B–70B GPU-узел часто становится более предсказуемым по задержке.

При выборе конфигурации Valebyte важно заранее определить, нужна ли постоянная GPU, сколько моделей будет загружено одновременно и какой максимум контекста требуется. Для CPU-задач полезно сравнить виртуальные ресурсы с физическим сервером: разница в стабильности частоты CPU подробно описана в материале bare-metal и VPS для ML inference на CPU.

Быстрый выбор
Ищете сервер, который просто работает?
Valebyte VPS — NVMe, поддержка 24/7, запуск за 60 секунд.
Тарифы VPS

Как установить Ollama и проверить доступное железо

Установка и загрузка модели

На Linux установка обычно выполняется одной командой, после чего модель скачивается через Ollama CLI. Для production-среды лучше использовать отдельного системного пользователя, systemd-сервис и firewall.

curl -fsSL https://ollama.com/install.sh | sh

ollama pull llama3.1:8b
ollama run llama3.1:8b

Конкретный тег может иметь размер, отличный от ожидаемого: перед загрузкой проверяйте страницу модели и свободное место на диске. Для тестирования API:

curl http://127.0.0.1:11434/api/generate \
  -H "Content-Type: application/json" \
  -d '{"model":"llama3.1:8b","prompt":"Проверь скорость ответа","stream":false}'

Проверка CPU, RAM и GPU

lscpu
free -h
lsblk
nvidia-smi
ollama ps

Команда ollama ps показывает загруженную модель и размещение в памяти. Если в поле размещения указано частичное распределение между CPU и GPU, VRAM недостаточно для полного размещения модели. В Linux также проверяйте free -h во время реального запроса, а не только в простое: пиковая загрузка RAM появляется при загрузке весов и создании контекста.

Как выбрать конфигурацию Valebyte под Ollama

VPS для тестов и небольших команд

VPS с 4 vCPU и 16 GB RAM подходит для 3B и большинства 7B-моделей в режиме разработки. Конфигурация 8 vCPU и 32 GB RAM комфортнее для одного-двух пользователей, RAG-прототипа и API с ограниченным параллелизмом. NVMe обязателен, если модели часто меняются или сервер используется для автоматических пайплайнов.

Перед заказом проверьте четыре параметра: гарантированную долю CPU, тип диска, лимит исходящего трафика и возможность установить нужные драйверы. Для CPU-only сценария GPU не нужна, но для 13B и 70B стоимость RAM и время ответа могут сделать такой вариант невыгодным.

GPU-сервер для production

GPU-сервер выбирают по VRAM, а не только по вычислительной мощности. Для 7B достаточно 8–12 GB VRAM, для 13B лучше иметь 16–24 GB, а для 70B — 48 GB и более. При длинном контексте и нескольких пользователях нужен дополнительный запас, иначе Ollama начнёт выгружать слои в RAM.

  • для чат-бота до 5 пользователей: 7B, 8–12 GB VRAM, 32 GB RAM;
  • для внутреннего помощника на 10–25 пользователей: 13B, 16–24 GB VRAM, 64 GB RAM;
  • для качественной 70B-модели: 48–80 GB VRAM, 128 GB RAM и 24–32 vCPU;
  • для высокой доступности: два узла, резервные копии моделей и health-check API.

Если Ollama размещается рядом с векторной базой, reranker и сервисом документов, учитывайте их RAM отдельно. Самостоятельные приложения с OCR, поиском и обработкой файлов могут потребовать больше памяти, чем кажется по размеру LLM; аналогичный подход к подбору железа описан в материале о self-hosted приложениях и нагрузке на сервер.

Часто задаваемые вопросы

Сколько RAM нужно для Ollama с моделью 7B?

Для 7B Q4_K_M минимально подходит сервер с 16 GB RAM, но для реальной работы лучше выбрать 24–32 GB. Это оставляет память под операционную систему, KV-cache, контекст 8K и API-сервисы. При четырёх параллельных запросах или контексте 16K 32 GB может оказаться недостаточно без ограничения очереди.

Можно ли запускать Ollama без видеокарты?

Да, Ollama работает на CPU. Модели 3B и 7B подходят для CPU-инференса на 4–8 быстрых vCPU, а 13B требует примерно 8–12 vCPU и 32 GB RAM. Для 70B CPU-запуск возможен при 64–96 GB RAM, но скорость часто составляет всего 0,8–3 токена в секунду, поэтому для интерактивного использования лучше GPU.

Какая VRAM нужна для модели 13B?

Для 13B в Q4 обычно требуется 10–12 GB памяти под веса, но с KV-cache и запасом рекомендуется GPU на 16 GB VRAM. При контексте 16K или нескольких пользователях лучше использовать 24 GB VRAM либо комбинировать GPU с 32–64 GB системной RAM, понимая, что частичная выгрузка на CPU снижает скорость.

Сколько места занимает модель Ollama на диске?

Квантизированная 7B-модель обычно занимает около 4–8 GB, 13B — 8–15 GB, а 70B — примерно 40–50 GB. Для обновлений, нескольких тегов и временных файлов рекомендуется закладывать минимум 40 GB под 3B–7B, 100 GB под 13B и 150–200 GB NVMe под 70B.

Быстрый выбор
Ищете сервер, который просто работает?
Valebyte VPS — NVMe, поддержка 24/7, запуск за 60 секунд.
Тарифы VPS

Выводы

Для 3B–7B подойдёт VPS с 4–8 vCPU и 16–32 GB RAM, а для интерактивной работы нескольких пользователей лучше выбрать GPU на 8–12 GB VRAM. Модели 13B и 70B требуют соответственно 16–24 GB и 48–80 GB VRAM либо 32–96 GB RAM при CPU-инференсе, поэтому конфигурацию Valebyte следует подбирать по тегу модели, длине контекста и числу параллельных запросов.

SSD NVMe
Готовы запустить свой VPS?

NVMe VPS с активацией за 60 секунд: полный root-доступ, 20+ локаций, оплата картой или криптой.

Выбрать тариф

Поделиться записью:

support_agent
Valebyte Support
Usually replies within minutes
Hi there!
Send us a message and we'll reply as soon as possible.