bolt Valebyte VPS от $4/мес — NVMe, запуск за 60 секунд.

Получить VPS arrow_forward

Требования к серверу для self-hosted Whisper: распознавание речи и железо

calendar_month 15 сентября 2026 schedule 15 мин. чтения visibility 14 просмотров
person
Valebyte Team
Требования к серверу для self-hosted Whisper: распознавание речи и железо
summarize

TL;DR

  • Оптимальный сервер для Whisper: 4-8 vCPU, 16 GB RAM, GPU 8-16 GB VRAM.
  • Для потокового распознавания речи с large-v3 обычно нужен GPU (CUDA-ускоритель).
  • Требования зависят от длины аудио, числа задач, языка и задержки.
  • Для продакшена выбирайте faster-whisper (CTranslate2) с int8/float16 для скорости и экономии.
  • Оставляйте 20-30% VRAM/RAM свободными для ОС, декодирования и API.

Для self-hosted Whisper оптимален сервер с 4–8 vCPU, 16 GB RAM и GPU на 8–16 GB VRAM: модель large-v3 на CPU работает, но для потокового распознавания речи обычно нужен CUDA-ускоритель.

Что означает self hosted whisper server requirements

Из чего складываются требования к Whisper

Self hosted Whisper — это локально размещённый сервис распознавания речи, который принимает аудиофайлы или поток с микрофона, запускает модель OpenAI Whisper либо faster-whisper и возвращает текст. В отличие от облачного API, сервер самостоятельно хранит модели, обрабатывает звук и отвечает за масштабирование, безопасность и стоимость инфраструктуры.

Ключевые self hosted whisper server requirements зависят не только от размера модели. На конфигурацию влияют длительность записей, количество одновременных задач, язык, требование к задержке и формат результата. Разовая расшифровка архива из 100 часов аудио допускает очередь и медленный CPU-режим. Колл-центр, субтитры в реальном времени и голосовой интерфейс требуют запаса производительности.

Если Whisper разворачивается вместе с LLM, векторной базой или другим AI-сервисом, учитывайте суммарное потребление памяти; методику оценки можно сверить в материале о требованиях к серверу для self-hosted ИИ, VRAM и RAM под LLM.

Whisper или faster-whisper

Оригинальный Whisper на PyTorch удобен для экспериментов, но faster-whisper обычно экономнее по памяти и быстрее благодаря реализации CTranslate2. Для продакшена часто выбирают faster-whisper с вычислительным типом int8, int8_float16 или float16. Качество определяется прежде всего моделью и языком, а скорость — моделью, GPU, типом квантования, длиной аудио и размером batch.

pip install faster-whisper

from faster_whisper import WhisperModel

model = WhisperModel(
    "large-v3",
    device="cuda",
    compute_type="float16"
)
segments, info = model.transcribe("audio.mp3", language="ru")

for segment in segments:
    print(f"[{segment.start:.2f}–{segment.end:.2f}] {segment.text}")

Какие whisper hardware requirements у моделей tiny–large-v3

Память и скорость по размерам моделей

В таблице ниже приведены практические ориентиры для faster-whisper. Это не жёсткие минимальные требования: пиковая память меняется из-за batch size, длины сегмента, beam search и выбранного compute type. Для стабильной работы оставляйте 20–30% свободной VRAM или RAM под ОС, декодирование и API.

  • tiny — примерно 1 GB VRAM в режиме float16 или около 1–2 GB RAM при CPU-инференсе; подходит для черновой расшифровки и устройств с ограниченными ресурсами.
  • base — ориентировочно 1–2 GB VRAM и 2–4 GB RAM; разумный компромисс для простых голосовых заметок.
  • small — около 2–4 GB VRAM и 4–8 GB RAM; заметно лучше распознаёт речь, чем tiny и base.
  • medium — примерно 5–8 GB VRAM и 8–12 GB RAM; подходит для качественной многоязычной транскрибации.
  • large-v3 — обычно требуется 10–16 GB VRAM в зависимости от режима и batch; на CPU желательно 16–32 GB RAM, а для параллельных задач — больше.

Ответ на вопрос «сколько vram для whisper» нельзя свести к одному числу. Для large-v3 с float16 безопаснее планировать GPU от 16 GB VRAM, тогда как quantized int8 может работать на меньшем объёме, но с компромиссом по скорости и иногда по совместимости. При batch size 1 потребление ниже; несколько одновременных потоков увеличивают расход памяти.

Ориентир скорости относительно реального времени

Показатель RTF (real-time factor) показывает, сколько аудио сервер обрабатывает за единицу времени. Значение 1x означает, что 60 минут записи расшифровываются примерно за 60 минут; 5x — за 12 минут. Реальные результаты зависят от процессора и GPU, но для планирования можно использовать такие диапазоны:

  • tiny/base на 4 современных vCPU: примерно 1–5x от реального времени;
  • small на 4–8 vCPU: около 0,5–2x;
  • medium на 8 vCPU: около 0,2–1x;
  • large-v3 на 8 vCPU: часто 0,05–0,3x, то есть медленнее реального времени;
  • large-v3 на GPU с 12–16 GB VRAM: ориентировочно 3–10x при последовательной обработке.

Эти цифры — инженерный ориентир, а не гарантия бенчмарка конкретного сервера. Для русского аудио с паузами скорость может отличаться от тестов на английской речи; VAD, diarization и word timestamps также добавляют нагрузку.

Ищете надёжный сервер для ваших проектов?

VPS от $10/мес и выделенные серверы от $9/мес с NVMe, DDoS-защитой и поддержкой 24/7.

Смотреть предложения →

Сервер Whisper: требования к CPU, GPU и RAM

Whisper server CPU vs GPU

В выборе whisper server cpu vs gpu главный критерий — допустимая задержка. CPU подходит для пакетной обработки, редких запросов и небольшого числа пользователей. GPU оправдан, когда нужно получить результат быстрее длины записи, обслуживать несколько запросов одновременно или использовать medium/large-v3 без длинной очереди.

Для CPU выбирайте современные x86-64 ядра с высокой производительностью на ядро и AVX2. Четыре vCPU достаточны для tiny, base и части задач small; 8–16 vCPU дают больший запас для medium и параллельных файлов. Однако добавление vCPU не компенсирует полностью отсутствие GPU у large-v3: инференс остаётся вычислительно тяжёлым и может занять часы на длинных записях.

GPU нужен не только ради максимальной скорости. Он снижает задержку каждого задания и позволяет держать очередь под контролем. Для faster-whisper предпочтительна NVIDIA с поддержкой CUDA и достаточным объёмом VRAM. Если сервер одновременно запускает LLM, видеопамять нужно распределить между сервисами: GPU на 16 GB может оказаться тесным для large-v3 плюс крупной языковой модели.

Сколько RAM закладывать на сервер

RAM хранит модель в CPU-режиме, буферы декодирования, загруженное аудио и процессы приложения. Для минимального VPS с tiny/base достаточно 4 GB. Практичная конфигурация для small или medium — 8–16 GB. Для large-v3 на CPU рекомендуется от 16 GB, а при нескольких workers, длинных WAV-файлах и постобработке — 32 GB.

Не загружайте целиком многогигабайтные записи в память без необходимости. Принимайте аудио потоково, конвертируйте его в mono 16 kHz и ограничивайте длительность задания. Для API полезны лимиты размера файла, таймаут, очередь Redis или RabbitMQ и отдельный worker-инференс.

Быстрый выбор
Ищете сервер, который просто работает?
Valebyte VPS — NVMe, поддержка 24/7, запуск за 60 секунд.
Тарифы VPS

Как подобрать сервер Whisper под нагрузку

Разовая расшифровка и архив аудио

Для личных заметок, интервью и периодической обработки достаточно VPS на 2–4 vCPU, 4–8 GB RAM и NVMe на 30–60 GB. Модель tiny или base будет удобной по скорости; small подойдёт, если важнее качество. При большом архиве можно запускать задания ночью, поэтому GPU необязателен.

Если нужно обработать 100 часов аудио за 10 часов, средняя производительность должна быть не ниже 10x. CPU-сервер с large-v3 обычно не соответствует такому требованию, тогда как GPU-узел с несколькими последовательными worker-процессами может справиться. Перед арендой протестируйте 20–30 минут типичной записи и умножьте результат на планируемый объём.

Потоковое распознавание и API

Для субтитров, диктовки и телефонных звонков важна не только общая скорость, но и задержка первого результата. Поток обычно режут на фрагменты по 2–10 секунд; слишком короткие сегменты повышают накладные расходы, слишком длинные увеличивают latency.

Один одновременный поток с tiny/base может работать на 2–4 vCPU. Для small или medium безопаснее использовать 4–8 vCPU и 8–16 GB RAM. Несколько параллельных потоков рациональнее направить на GPU: один ускоритель с 12–16 GB VRAM способен обслуживать несколько workers, если batch и модель помещаются в память.

Сетевой трафик для речи обычно невелик по сравнению с видео. Сжатый Opus-поток может занимать десятки килобайт в секунду, но запас канала необходим для загрузки файлов, скачивания результатов, резервных копий и служебного трафика. Для публичного API выбирайте порт от 100 Mbps, а при массовой загрузке — 1 Gbps.

Масштаб → спека

Для 10 одновременных пользователей достаточно 4 vCPU, 8 GB RAM и 80 GB NVMe-диска при трафике 1 TB в месяц.

Масштаб нагрузки vCPU RAM Диск Сетевой порт Цена
1 пользователь, разовые файлы 2 4 GB 40 GB NVMe 100 Mbps ориентировочно $6–10/мес, март 2026
10 одновременных пользователей, tiny/base 4 8 GB 80 GB NVMe 1 Gbps ориентировочно $12–25/мес, март 2026
25 пользователей, small/medium 8 16 GB 120 GB NVMe 1 Gbps ориентировочно $25–60/мес, март 2026
50 потоков, large-v3 на GPU 8 32 GB 160 GB NVMe 1 Gbps ориентировочно $120–250/мес, март 2026
100+ потоков, несколько GPU workers 16 64 GB 320 GB NVMe 1–10 Gbps ориентировочно $300–700/мес, март 2026

Цены в таблице являются ориентировочными для рынка на март 2026 года; итоговая стоимость Valebyte зависит от региона, типа GPU, гарантированных ресурсов, диска, трафика и срока аренды. Для точного расчёта учитывайте не число зарегистрированных пользователей, а максимальное количество одновременно обрабатываемых аудиозаписей.

Диск, сеть и операционная система для self-hosted speech to text hardware

Место под модели и аудио

Файлы моделей занимают меньше места, чем видеоданные, но под каждую версию и формат нужен отдельный запас. Выделите минимум 20–30 GB под tiny–medium, 30–60 GB под large-v3, окружение Python, контейнеры, кэш и логи. Для production-сервера с архивом используйте NVMe от 80–160 GB, а долговременные записи переносите в отдельное объектное хранилище.

NVMe влияет на время запуска контейнера, чтение больших файлов и параллельную обработку, но после загрузки модели в VRAM разница между SSD и NVMe для самого инференса меньше, чем разница между CPU и GPU. Не храните персональные записи без шифрования и политики удаления: речь может содержать персональные, коммерческие или медицинские сведения.

Сеть и окружение

Для Linux обычно выбирают Ubuntu 22.04/24.04 LTS или Debian 12. GPU-узлу нужны совместимые драйвер NVIDIA, CUDA и версия faster-whisper/CTranslate2. Стабильность важнее новейшего релиза: сначала зафиксируйте версии в Docker-образе, затем обновляйте их на тестовом сервере.

docker run --gpus all --rm \
  -v "$PWD/models:/models" \
  -v "$PWD/audio:/audio" \
  nvidia/cuda:12.4.1-runtime-ubuntu22.04 \
  nvidia-smi

ffmpeg -i input.mp3 -ac 1 -ar 16000 -c:a pcm_s16le input.wav

Открывайте наружу только HTTPS API, а worker и очередь держите во внутренней сети. Ограничьте размер запроса, применяйте авторизацию, rate limit и автоматическое удаление временных файлов. Для сервисов, где нужна высокая доступность, отдельные CPU и GPU-ноды позволяют обновлять API без остановки инференса.

Как оптимизировать faster-whisper и снизить стоимость

Выбор модели и параметров

Не начинайте с large-v3, если бизнес-требование — только черновая расшифровка. Проверьте tiny, base, small и medium на собственном наборе из 30–60 минут речи. Сравнивайте не только WER, но и задержку, ошибки в именах, пунктуацию, устойчивость к шуму и стоимость часа аудио.

  1. Для заметок и внутренних черновиков используйте base или small.
  2. Для качественной многоязычной транскрибации протестируйте medium.
  3. Для сложной речи, шума и высокой точности выбирайте large-v3 при наличии GPU.
  4. Включайте VAD, чтобы пропускать длинные периоды тишины.
  5. Подбирайте beam_size, batch_size и compute type по результатам тестов, а не по максимальным значениям.
  6. Разделяйте интерактивные запросы и пакетные задания отдельными очередями.

Мониторинг и масштабирование

Собирайте длительность аудио, время обработки, RTF, длину очереди, ошибки CUDA, загрузку VRAM и долю запросов с превышенным таймаутом. Если GPU простаивает, причиной может быть медленная загрузка файлов или слишком маленькие задания; если VRAM заполнена, уменьшите batch либо запустите дополнительные GPU-ноды.

Для одного проекта достаточно Docker Compose и одного worker. При росте нагрузки используйте Kubernetes, Nomad или простой autoscaling по длине очереди. Общие требования к самостоятельному размещению приложений и подбору ресурсов разобраны в руководстве по подбору железа для self-hosted приложений под нагрузку.

Если Whisper является частью AI-платформы, заранее разделите GPU между распознаванием и LLM. Для сценария с Ollama полезно учитывать отдельные требования к CPU, RAM и VRAM в статье о сервере Ollama под размер модели. Для видеопотоков с детекцией объектов и транскрибацией также может понадобиться отдельный расчёт ресурсов, аналогичный подбору сервера для Frigate, CPU, GPU и Coral.

Быстрый выбор
Ищете сервер, который просто работает?
Valebyte VPS — NVMe, поддержка 24/7, запуск за 60 секунд.
Тарифы VPS

Когда выбрать VPS, а когда выделенный сервер

VPS для небольшого проекта

VPS подходит для личного сервиса, внутреннего API и пакетной транскрибации, если доступен нужный объём RAM и стабильные vCPU. Конфигурация 4 vCPU, 8 GB RAM и 80 GB NVMe закрывает многие задачи на base/small. GPU VPS имеет смысл, когда модель medium или large-v3 должна отвечать быстро, а аренда выделенного узла для проекта избыточна.

Проверяйте, являются ли vCPU гарантированными, есть ли ограничения CPU steal, какой лимит дисковых IOPS и разрешён ли Docker с GPU. Дешёвый VPS с перегруженным процессором может давать непредсказуемый RTF, поэтому важны тестовая нагрузка и возможность увеличить конфигурацию без миграции.

Выделенный сервер для постоянной нагрузки

Выделенный GPU-сервер оправдан при десятках параллельных потоков, круглосуточном API, строгом SLA или необходимости держать несколько моделей в памяти. Он даёт фиксированный CPU, RAM, NVMe и VRAM, а также снижает влияние соседей. Для 50 потоков large-v3 ориентиром может быть 8–16 vCPU, 32–64 GB RAM, NVMe от 160 GB и GPU от 16 GB VRAM, но точное число потоков определяется latency и batch.

При выборе GPU уточняйте не только объём памяти, но и пропускную способность, поддержку CUDA, энергопотребление и доступность драйверов. Две карты по 8 GB не всегда равноценны одной карте на 16 GB: модель и worker могут не уметь эффективно распределять один запрос между устройствами.

Часто задаваемые вопросы

Можно ли запустить Whisper без GPU?

Да, Whisper и faster-whisper работают на CPU. Для tiny, base и части задач small достаточно 2–4 vCPU и 4–8 GB RAM, особенно при пакетной обработке. large-v3 на CPU также запускается, но скорость часто ниже 1x real-time, поэтому час аудио может обрабатываться дольше часа. Для потокового API с малой задержкой лучше использовать GPU.

Сколько VRAM нужно для Whisper large-v3?

Для large-v3 планируйте 10–16 GB VRAM: точное потребление зависит от float16, int8, batch size и версии faster-whisper. GPU на 16 GB оставляет более безопасный запас для CUDA и параллельных задач. При использовании quantization модель может поместиться в меньший объём, но следует проверить скорость, качество и совместимость на тестовом аудио.

Какая модель Whisper лучше для русского языка?

Для русского языка выбор зависит от качества записи и задачи. Base или small подходят для быстрых черновиков, medium даёт более высокую точность, а large-v3 полезна для сложной речи, шума и смешанных языков. Сравните модели на 30–60 минутах собственных записей: разница в ошибках имён и терминов важнее синтетического теста.

Сколько RAM нужно для self-hosted Whisper?

Минимально разумный сервер — 4 GB RAM для tiny/base. Для small или medium рекомендуется 8–16 GB, а для large-v3 на CPU — 16–32 GB. Дополнительная память нужна при нескольких worker-процессах, длинных WAV-файлах, diarization, API и очереди заданий. Оставляйте не менее 20% RAM свободной, чтобы избежать swap и скачков задержки.

Выводы

Для разовой расшифровки начните с VPS на 4 vCPU и 8 GB RAM с моделью small, а для потокового large-v3 закладывайте GPU от 16 GB VRAM, 8–16 vCPU и 32 GB RAM. Перед заказом сервера Valebyte измерьте RTF на собственном аудио и добавьте 20–30% запаса по памяти и параллельным запросам.

SSD NVMe
Готовы запустить свой VPS?

NVMe VPS с активацией за 60 секунд: полный root-доступ, 20+ локаций, оплата картой или криптой.

Выбрать тариф

Поделиться записью:

support_agent
Valebyte Support
Usually replies within minutes
Hi there!
Send us a message and we'll reply as soon as possible.