Для Ollama с моделью 7B нужен сервер с 16 GB RAM при CPU-инференсе или 8–12 GB VRAM при работе на GPU, а для 70B — от 64 GB RAM и 48 GB VRAM соответственно.
Что означают ollama server requirements для разных моделей
Размер тегов 3B, 7B, 13B и 70B
Ollama запускает большие языковые модели локально через llama.cpp и совместимые backend-компоненты. Инференс может выполняться на CPU, GPU или в смешанном режиме, когда часть слоёв модели размещается в видеопамяти, а остальные — в оперативной памяти. Поэтому ollama server requirements определяются не только названием модели, но и конкретным тегом: например, 7B Q4_K_M и 7B в FP16 требуют принципиально разный объём памяти.
Число 3B, 7B, 13B или 70B обозначает приблизительное количество миллиардов параметров. Квантизация Q4, Q5, Q8 уменьшает размер весов и требования к памяти, но может немного снизить точность. Для серверного использования чаще всего выбирают Q4_K_M или Q5_K_M: это разумный баланс между качеством ответа, скоростью и стоимостью железа.
Почему фактическая RAM выше размера файла модели
Файл модели — не единственный потребитель памяти. Ollama дополнительно использует RAM или VRAM под KV-cache, контекст, рабочие буферы, токенизатор и операционную систему. При контексте 8K–16K память расходуется заметно быстрее, особенно у 13B и 70B. Для нескольких параллельных запросов KV-cache увеличивается почти пропорционально числу одновременных пользователей.
Практические требования к серверу для self-hosted ИИ и LLM помогают оценить не только размер весов, но и запас под контекст, сервисы API, мониторинг и дисковый кэш.
Ollama hardware requirements: RAM и VRAM по размеру модели
Сводная таблица для CPU- и GPU-инференса
Ниже приведены ориентиры для квантизированных моделей Q4_K_M с контекстом до 8K и одним активным запросом. Скорость указана в токенах в секунду и зависит от архитектуры процессора, поколения GPU, пропускной способности памяти, длины контекста и версии Ollama.
| Размер модели | Минимальная RAM для CPU | Рекомендуемая VRAM для GPU | Рекомендуемый CPU | Диск под веса | Ориентир скорости |
|---|---|---|---|---|---|
| 3B | 8 GB | 4 GB | 4 vCPU, 3,0+ GHz | 8–12 GB NVMe | CPU: 15–35 ток/с; GPU: 40–100 ток/с |
| 7B | 16 GB | 8–12 GB | 6–8 vCPU, 3,0+ GHz | 10–16 GB NVMe | CPU: 8–20 ток/с; GPU: 35–90 ток/с |
| 13B | 24–32 GB | 16 GB | 8–12 vCPU, 3,2+ GHz | 18–28 GB NVMe | CPU: 4–10 ток/с; GPU: 20–55 ток/с |
| 70B | 64–96 GB | 48–80 GB | 16–32 vCPU, 3,0+ GHz | 45–60 GB NVMe | CPU: 0,8–3 ток/с; GPU: 8–25 ток/с |
В таблице указана память именно для запуска модели, а не полный размер VPS. Для 7B на сервере с 16 GB RAM останется мало запаса, если одновременно работают Nginx, API, база данных и система мониторинга. Для стабильного production-развёртывания лучше закладывать 24 GB RAM или использовать GPU с 12 GB VRAM и 16 GB системной памяти.
Модели в FP16 требуют примерно вдвое больше памяти, чем Q8, и в четыре раза больше, чем Q4, но точное значение зависит от архитектуры. Например, 7B FP16 может занять около 14–16 GB только под веса, тогда как 7B Q4 обычно помещается в 4–6 GB.
Ищете надёжный сервер для ваших проектов?
VPS от $10/мес и выделенные серверы от $9/мес с NVMe, DDoS-защитой и поддержкой 24/7.
Смотреть предложения →Ollama CPU vs GPU inference: что выбрать
Когда CPU-инференс оправдан
Ollama CPU vs GPU inference — это выбор между меньшей стоимостью и большей скоростью. CPU подходит для разработки, тестирования промптов, фоновой классификации, генерации эмбеддингов и редких административных запросов. Модель 3B на 4–8 vCPU обычно отвечает достаточно быстро для личного помощника, а 7B на 8–16 vCPU пригодна для одного пользователя при умеренном контексте.
CPU-инференс также разумен, когда модель должна работать круглосуточно, но запросы поступают редко. Сервер с 32 GB RAM и быстрым NVMe может обслуживать 7B или 13B без отдельной видеокарты. Недостаток очевиден: первый токен появляется медленнее, а генерация 13B и особенно 70B становится заметно менее комфортной.
Когда GPU обязателен
GPU нужен для интерактивного API, чат-бота с несколькими пользователями, RAG-поиска с высокой частотой запросов, программирования в IDE и генерации длинных ответов. Для 7B целесообразно иметь 8–12 GB VRAM, для 13B — около 16 GB, а для 70B — одну или несколько GPU суммарно на 48–80 GB VRAM.
GPU не всегда должен содержать модель целиком. Ollama может частично выгрузить слои в видеопамять и оставить остаток в RAM, но смешанный режим обычно медленнее из-за обмена данными через PCIe. Если важна стабильная задержка, лучше подбирать VRAM с запасом 15–25% относительно размера модели и KV-cache.
Подбор ускорителя для 7B и 70B подробно зависит от типа памяти, ширины шины и числа GPU; отдельная статья о GPU для inference LLM помогает сравнить такие сценарии.
Сколько RAM для Ollama с контекстом и несколькими пользователями
KV-cache и длина контекста
Вопрос «сколько RAM для Ollama» нельзя решать только по размеру файла модели. При генерации модель хранит историю токенов в KV-cache. Чем длиннее контекст и чем больше параллельных диалогов, тем больше памяти требуется. Переход с 4K на 16K токенов может увеличить расход памяти в несколько раз, а четыре одновременных запроса потребуют приблизительно в четыре раза больше KV-cache, чем один.
Для одного пользователя и 8K контекста обычно достаточно следующих запасов:
- 3B: 8 GB RAM или 4 GB VRAM;
- 7B: 16–24 GB RAM или 8–12 GB VRAM;
- 13B: 32 GB RAM или 16–24 GB VRAM;
- 70B: 96 GB RAM для CPU либо 64 GB суммарной VRAM для комфортной работы.
Если требуется контекст 32K, к этим значениям следует добавить запас, а при параллельных запросах — ориентироваться на фактический профиль нагрузки. Для production-сервера разумно оставить 20–30% RAM свободной: Linux, Ollama API, reverse proxy и фоновые процессы не должны конкурировать с моделью за память.
Параллельные запросы и очередь
Увеличение числа пользователей не превращает один GPU в несколько независимых ускорителей. Запросы могут обрабатываться параллельно, но каждый получает часть вычислительных ресурсов и KV-cache. Если GPU рассчитана на 30 токенов в секунду для одного запроса, при четырёх активных диалогах средняя скорость на запрос может существенно снизиться.
Для небольшого API полезнее ограничить параллелизм и поставить очередь, чем допустить одновременное переполнение RAM. В конфигурации следует задать разумный предел контекста, таймауты и лимит активных запросов.
OLLAMA_HOST=0.0.0.0:11434
OLLAMA_NUM_PARALLEL=2
OLLAMA_MAX_LOADED_MODELS=1
OLLAMA_KEEP_ALIVE=10m
Переменные окружения зависят от версии Ollama и способа запуска сервиса. Публиковать порт 11434 напрямую в интернет не следует: перед ним нужен reverse proxy, авторизация и ограничение доступа по сети.
Ollama server specs model size: диск, CPU и сеть
Какой диск нужен для весов
Для Ollama предпочтителен локальный NVMe-диск. Он ускоряет скачивание, распаковку и загрузку модели в RAM или VRAM. Минимальный объём диска должен включать не только веса одной модели, но и несколько тегов, временные файлы, логи и запас для обновлений.
- 3B: минимум 20 GB, рекомендуется 40 GB NVMe;
- 7B: минимум 30 GB, рекомендуется 60 GB NVMe;
- 13B: минимум 50 GB, рекомендуется 80–100 GB NVMe;
- 70B: минимум 100 GB, рекомендуется 150–200 GB NVMe.
Если хранятся версии Q4, Q5 и Q8 одной модели, объём быстро увеличивается. Диск на 60 GB может быть достаточен для одной 7B-модели, но уже тесен для нескольких моделей, Docker-образов и системных журналов.
CPU, PCIe и сетевой порт
Для CPU-инференса важны физические ядра, частота и пропускная способность оперативной памяти. 8 быстрых vCPU часто работают лучше, чем 16 медленных виртуальных потоков. Для GPU-сервера важны PCIe-линии, корректный драйвер, достаточное питание и возможность выделить GPU без жёсткой конкуренции с другими задачами.
Внутри одного сервера сетевой порт 1 Gbps обычно достаточен: передаются запросы и ответы, а не веса модели при каждом обращении. Для удалённого API с большим количеством пользователей или потоковой выдачей стоит рассматривать 1–10 Gbps, но узким местом чаще остаётся инференс, а не сеть.
Сервер Ollama: требования под масштаб нагрузки
Масштаб → спека для VPS и выделенного сервера
Для 10 одновременных пользователей с моделью 7B достаточно 8 vCPU, 32 GB RAM, NVMe-диска на 100 GB и порта 1 Gbps.
| Масштаб нагрузки | vCPU | RAM | Диск | Сетевой порт | Цена |
|---|---|---|---|---|---|
| 1 пользователь, 3B–7B | 4 | 16 GB | 40 GB NVMe | 1 Gbps | ориентировочно $15–25/мес., март 2026 |
| 5 одновременных пользователей, 7B | 8 | 32 GB | 80 GB NVMe | 1 Gbps | ориентировочно $35–60/мес., март 2026 |
| 10 одновременных пользователей, 7B–13B | 12 | 64 GB | 120 GB NVMe | 1 Gbps | ориентировочно $70–120/мес., март 2026 |
| 25 одновременных пользователей, 13B с GPU | 16 | 64 GB | 200 GB NVMe | 1–10 Gbps | ориентировочно $180–350/мес., март 2026 |
| 50 одновременных пользователей, 70B | 32 | 128 GB | 300 GB NVMe | 10 Gbps | ориентировочно $500–1000/мес., март 2026 |
Цены в таблице являются общерыночными ориентирами на март 2026 года, а не фиксированными тарифами стороннего провайдера: итог зависит от региона, типа GPU, гарантии выделения ресурсов, трафика и срока аренды. Для нескольких пользователей с моделью 3B–7B VPS обычно экономичнее выделенного сервера, но при 13B–70B GPU-узел часто становится более предсказуемым по задержке.
При выборе конфигурации Valebyte важно заранее определить, нужна ли постоянная GPU, сколько моделей будет загружено одновременно и какой максимум контекста требуется. Для CPU-задач полезно сравнить виртуальные ресурсы с физическим сервером: разница в стабильности частоты CPU подробно описана в материале bare-metal и VPS для ML inference на CPU.
Как установить Ollama и проверить доступное железо
Установка и загрузка модели
На Linux установка обычно выполняется одной командой, после чего модель скачивается через Ollama CLI. Для production-среды лучше использовать отдельного системного пользователя, systemd-сервис и firewall.
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.1:8b
ollama run llama3.1:8b
Конкретный тег может иметь размер, отличный от ожидаемого: перед загрузкой проверяйте страницу модели и свободное место на диске. Для тестирования API:
curl http://127.0.0.1:11434/api/generate \
-H "Content-Type: application/json" \
-d '{"model":"llama3.1:8b","prompt":"Проверь скорость ответа","stream":false}'
Проверка CPU, RAM и GPU
lscpu
free -h
lsblk
nvidia-smi
ollama ps
Команда ollama ps показывает загруженную модель и размещение в памяти. Если в поле размещения указано частичное распределение между CPU и GPU, VRAM недостаточно для полного размещения модели. В Linux также проверяйте free -h во время реального запроса, а не только в простое: пиковая загрузка RAM появляется при загрузке весов и создании контекста.
Как выбрать конфигурацию Valebyte под Ollama
VPS для тестов и небольших команд
VPS с 4 vCPU и 16 GB RAM подходит для 3B и большинства 7B-моделей в режиме разработки. Конфигурация 8 vCPU и 32 GB RAM комфортнее для одного-двух пользователей, RAG-прототипа и API с ограниченным параллелизмом. NVMe обязателен, если модели часто меняются или сервер используется для автоматических пайплайнов.
Перед заказом проверьте четыре параметра: гарантированную долю CPU, тип диска, лимит исходящего трафика и возможность установить нужные драйверы. Для CPU-only сценария GPU не нужна, но для 13B и 70B стоимость RAM и время ответа могут сделать такой вариант невыгодным.
GPU-сервер для production
GPU-сервер выбирают по VRAM, а не только по вычислительной мощности. Для 7B достаточно 8–12 GB VRAM, для 13B лучше иметь 16–24 GB, а для 70B — 48 GB и более. При длинном контексте и нескольких пользователях нужен дополнительный запас, иначе Ollama начнёт выгружать слои в RAM.
- для чат-бота до 5 пользователей: 7B, 8–12 GB VRAM, 32 GB RAM;
- для внутреннего помощника на 10–25 пользователей: 13B, 16–24 GB VRAM, 64 GB RAM;
- для качественной 70B-модели: 48–80 GB VRAM, 128 GB RAM и 24–32 vCPU;
- для высокой доступности: два узла, резервные копии моделей и health-check API.
Если Ollama размещается рядом с векторной базой, reranker и сервисом документов, учитывайте их RAM отдельно. Самостоятельные приложения с OCR, поиском и обработкой файлов могут потребовать больше памяти, чем кажется по размеру LLM; аналогичный подход к подбору железа описан в материале о self-hosted приложениях и нагрузке на сервер.
Часто задаваемые вопросы
Сколько RAM нужно для Ollama с моделью 7B?
Для 7B Q4_K_M минимально подходит сервер с 16 GB RAM, но для реальной работы лучше выбрать 24–32 GB. Это оставляет память под операционную систему, KV-cache, контекст 8K и API-сервисы. При четырёх параллельных запросах или контексте 16K 32 GB может оказаться недостаточно без ограничения очереди.
Можно ли запускать Ollama без видеокарты?
Да, Ollama работает на CPU. Модели 3B и 7B подходят для CPU-инференса на 4–8 быстрых vCPU, а 13B требует примерно 8–12 vCPU и 32 GB RAM. Для 70B CPU-запуск возможен при 64–96 GB RAM, но скорость часто составляет всего 0,8–3 токена в секунду, поэтому для интерактивного использования лучше GPU.
Какая VRAM нужна для модели 13B?
Для 13B в Q4 обычно требуется 10–12 GB памяти под веса, но с KV-cache и запасом рекомендуется GPU на 16 GB VRAM. При контексте 16K или нескольких пользователях лучше использовать 24 GB VRAM либо комбинировать GPU с 32–64 GB системной RAM, понимая, что частичная выгрузка на CPU снижает скорость.
Сколько места занимает модель Ollama на диске?
Квантизированная 7B-модель обычно занимает около 4–8 GB, 13B — 8–15 GB, а 70B — примерно 40–50 GB. Для обновлений, нескольких тегов и временных файлов рекомендуется закладывать минимум 40 GB под 3B–7B, 100 GB под 13B и 150–200 GB NVMe под 70B.
Выводы
Для 3B–7B подойдёт VPS с 4–8 vCPU и 16–32 GB RAM, а для интерактивной работы нескольких пользователей лучше выбрать GPU на 8–12 GB VRAM. Модели 13B и 70B требуют соответственно 16–24 GB и 48–80 GB VRAM либо 32–96 GB RAM при CPU-инференсе, поэтому конфигурацию Valebyte следует подбирать по тегу модели, длине контекста и числу параллельных запросов.
NVMe VPS с активацией за 60 секунд: полный root-доступ, 20+ локаций, оплата картой или криптой.
Выбрать тариф