bolt Valebyte VPS від $4/міс — NVMe, запуск за 60 секунд.

Отримати VPS arrow_forward

Self-hosted Whisper: вимоги до сервера для розпізнавання мовлення

calendar_month September 15, 2026 schedule 15 хв. читання visibility 15 переглядів
person
Valebyte Team
Self-hosted Whisper: вимоги до сервера для розпізнавання мовлення
summarize

TL;DR

  • Для self-hosted Whisper потрібно 4–8 vCPU, 16 GB RAM і GPU 8–16 GB VRAM.
  • Для потокового розпізнавання мовлення в реальному часі потрібне GPU з CUDA-прискоренням.
  • Для production обирайте faster-whisper: він швидший та економніше використовує пам'ять.
  • Моделі Whisper вимагають від 1 GB VRAM (tiny) до 8–16 GB VRAM (large-v3).

Для self-hosted Whisper оптимально обрати сервер із 4–8 vCPU, 16 GB RAM і GPU на 8–16 GB VRAM: модель large-v3 працює на CPU, але для потокового розпізнавання мовлення зазвичай потрібне CUDA-прискорення.

Вимоги до сервера для self-hosted Whisper

Від чого залежать вимоги Whisper

Self-hosted Whisper — це локально розгорнутий сервіс розпізнавання мовлення, який приймає аудіофайли або потік із мікрофона, запускає модель OpenAI Whisper чи faster-whisper і повертає текст. На відміну від хмарного API, сервер самостійно зберігає моделі, обробляє аудіо та відповідає за масштабування, безпеку й вартість інфраструктури.

Основні self hosted whisper server requirements залежать не лише від розміру моделі. На конфігурацію впливають тривалість записів, кількість одночасних завдань, мова, вимоги до затримки та формат результату. Разове розшифрування архіву зі 100 годин аудіо допускає чергу й повільний CPU-режим. Кол-центр, субтитри в реальному часі та голосовий інтерфейс потребують запасу продуктивності.

Якщо Whisper розгортається разом із LLM, векторною базою чи іншим AI-сервісом, враховуйте сумарне споживання пам’яті; методику оцінювання можна переглянути в матеріалі про вимоги до сервера для self-hosted AI, VRAM і RAM для LLM.

Whisper чи faster-whisper

Оригінальний Whisper на PyTorch зручний для експериментів, але faster-whisper зазвичай економніше використовує пам’ять і працює швидше завдяки реалізації CTranslate2. Для production часто обирають faster-whisper з типом обчислень int8, int8_float16 або float16. Якість насамперед визначають модель і мова, а швидкість — модель, GPU, тип квантування, тривалість аудіо та розмір batch.

pip install faster-whisper

from faster_whisper import WhisperModel

model = WhisperModel(
    "large-v3",
    device="cuda",
    compute_type="float16"
)
segments, info = model.transcribe("audio.mp3", language="ru")

for segment in segments:
    print(f"[{segment.start:.2f}–{segment.end:.2f}] {segment.text}")

Апаратні вимоги Whisper для моделей tiny–large-v3

Пам’ять і швидкість моделей різного розміру

У таблиці нижче наведено практичні орієнтири для faster-whisper. Це не жорсткі мінімальні вимоги: пікове споживання пам’яті змінюється через batch size, тривалість сегмента, beam search і вибраний compute type. Для стабільної роботи залишайте 20–30% вільної VRAM або RAM для ОС, декодування та API.

  • tiny — приблизно 1 GB VRAM у режимі float16 або близько 1–2 GB RAM під час CPU-інференсу; підходить для чернеткової транскрибації та пристроїв з обмеженими ресурсами.
  • base — орієнтовно 1–2 GB VRAM і 2–4 GB RAM; розумний компроміс для простих голосових нотаток.
  • small — близько 2–4 GB VRAM і 4–8 GB RAM; помітно краще розпізнає мовлення, ніж tiny і base.
  • medium — приблизно 5–8 GB VRAM і 8–12 GB RAM; підходить для якісної багатомовної транскрибації.
  • large-v3 — зазвичай потребує 10–16 GB VRAM залежно від режиму та batch; для CPU бажано 16–32 GB RAM, а для паралельних завдань — більше.

Відповідь на запит «скільки vram для whisper» не можна звести до одного числа. Для large-v3 з float16 безпечніше планувати GPU від 16 GB VRAM, тоді як квантизований int8 може працювати з меншим обсягом, але з компромісом у швидкості та іноді сумісності. За batch size 1 споживання нижче; кілька одночасних потоків збільшують витрати пам’яті.

Орієнтовна швидкість відносно реального часу

Показник RTF (real-time factor) демонструє, скільки аудіо сервер обробляє за одиницю часу. Значення 1x означає, що 60 хвилин запису транскрибуються приблизно за 60 хвилин; 5x — за 12 хвилин. Фактичні результати залежать від процесора та GPU, але для планування можна використовувати такі діапазони:

  • tiny/base на 4 сучасних vCPU: приблизно 1–5x від реального часу;
  • small на 4–8 vCPU: близько 0,5–2x;
  • medium на 8 vCPU: близько 0,2–1x;
  • large-v3 на 8 vCPU: часто 0,05–0,3x, тобто повільніше за реальний час;
  • large-v3 на GPU з 12–16 GB VRAM: орієнтовно 3–10x за послідовної обробки.

Ці цифри є інженерним орієнтиром, а не гарантією бенчмарку конкретного сервера. Для українського аудіо з паузами швидкість може відрізнятися від тестів на англійському мовленні; VAD, diarization і word timestamps також додають навантаження.

Шукаєте надійний сервер для своїх проєктів?

VPS від $10/міс і виділені сервери від $9/міс з NVMe, DDoS-захистом і підтримкою 24/7.

Переглянути пропозиції →

Сервер для Whisper: вимоги до CPU, GPU та RAM

Whisper server: CPU чи GPU

У виборі whisper server cpu vs gpu головний критерій — допустима затримка. CPU підходить для пакетної обробки, нечастих запитів і невеликої кількості користувачів. GPU виправданий, коли результат потрібно отримати швидше за тривалість запису, обслуговувати кілька запитів одночасно або використовувати medium/large-v3 без довгої черги.

Для CPU обирайте сучасні ядра x86-64 із високою продуктивністю на ядро та AVX2. Чотирьох vCPU достатньо для tiny, base і частини завдань small; 8–16 vCPU дають більший запас для medium і паралельних файлів. Водночас додавання vCPU не компенсує повністю відсутність GPU для large-v3: інференс залишається обчислювально важким і може займати години на довгих записах.

GPU потрібен не лише для максимальної швидкості. Він знижує затримку кожного завдання та допомагає контролювати чергу. Для faster-whisper бажана NVIDIA з підтримкою CUDA й достатнім обсягом VRAM. Якщо сервер одночасно запускає LLM, відеопам’ять потрібно розподіляти між сервісами: GPU на 16 GB може виявитися замалим для large-v3 разом із великою мовною моделлю.

Скільки RAM потрібно для сервера

RAM зберігає модель у CPU-режимі, буфери декодування, завантажене аудіо та процеси застосунку. Для мінімального VPS із tiny/base достатньо 4 GB. Практична конфігурація для small або medium — 8–16 GB. Для large-v3 на CPU рекомендується від 16 GB, а за кількох workers, довгих WAV-файлів і постобробки — 32 GB.

Не завантажуйте багатогігабайтні записи цілком у пам’ять без потреби. Приймайте аудіо потоково, конвертуйте його в mono 16 kHz і обмежуйте тривалість завдання. Для API корисні ліміти розміру файлу, таймаут, черга Redis або RabbitMQ та окремий worker для інференсу.

Швидкий вибір
Шукаєте сервер, який просто працює?
Valebyte VPS — NVMe, підтримка 24/7, запуск за 60 секунд.
Тарифи VPS

Як підібрати сервер для Whisper під навантаження

Разова транскрибація та архів аудіо

Для особистих нотаток, інтерв’ю та періодичної обробки достатньо VPS на 2–4 vCPU, 4–8 GB RAM і NVMe на 30–60 GB. Модель tiny або base буде зручною за швидкістю; small підійде, якщо важливіша якість. За великого архіву можна запускати завдання вночі, тому GPU не обов’язковий.

Якщо потрібно обробити 100 годин аудіо за 10 годин, середня продуктивність має бути не нижче 10x. CPU-сервер із large-v3 зазвичай не відповідає такій вимозі, тоді як GPU-вузол із кількома послідовними worker-процесами може впоратися. Перед орендою протестуйте 20–30 хвилин типового запису та помножте результат на запланований обсяг.

Потокове розпізнавання та API

Для субтитрів, диктування та телефонних дзвінків важлива не тільки загальна швидкість, а й затримка до першого результату. Потік зазвичай ділять на фрагменти по 2–10 секунд; надто короткі сегменти підвищують накладні витрати, а надто довгі збільшують latency.

Один одночасний потік із tiny/base може працювати на 2–4 vCPU. Для small або medium безпечніше використовувати 4–8 vCPU та 8–16 GB RAM. Кілька паралельних потоків доцільніше спрямувати на GPU: один прискорювач із 12–16 GB VRAM здатний обслуговувати кілька workers, якщо batch і модель уміщуються в пам’яті.

Мережевий трафік для мовлення зазвичай невеликий порівняно з відео. Стиснений Opus-потік може займати десятки кілобайтів за секунду, але запас пропускної здатності потрібен для завантаження файлів, отримання результатів, резервних копій і службового трафіку. Для публічного API обирайте порт від 100 Mbps, а для масового завантаження — 1 Gbps.

Масштаб → специфікація

Для 10 одночасних користувачів достатньо 4 vCPU, 8 GB RAM і 80 GB NVMe-диска за трафіку 1 TB на місяць.

Масштаб навантаження vCPU RAM Диск Мережевий порт Ціна
1 користувач, разові файли 2 4 GB 40 GB NVMe 100 Mbps орієнтовно $6–10/міс, березень 2026
10 одночасних користувачів, tiny/base 4 8 GB 80 GB NVMe 1 Gbps орієнтовно $12–25/міс, березень 2026
25 користувачів, small/medium 8 16 GB 120 GB NVMe 1 Gbps орієнтовно $25–60/міс, березень 2026
50 потоків, large-v3 на GPU 8 32 GB 160 GB NVMe 1 Gbps орієнтовно $120–250/міс, березень 2026
100+ потоків, кілька GPU workers 16 64 GB 320 GB NVMe 1–10 Gbps орієнтовно $300–700/міс, березень 2026

Ціни в таблиці є орієнтовними для ринку станом на березень 2026 року; підсумкова вартість Valebyte залежить від регіону, типу GPU, гарантованих ресурсів, диска, трафіку та строку оренди. Для точного розрахунку враховуйте не кількість зареєстрованих користувачів, а максимальну кількість аудіозаписів, що обробляються одночасно.

Диск, мережа й ОС для self-hosted speech to text

Місце для моделей і аудіо

Файли моделей займають менше місця, ніж відеодані, але для кожної версії та формату потрібен окремий запас. Виділіть щонайменше 20–30 GB для tiny–medium, 30–60 GB для large-v3, середовища Python, контейнерів, кешу та логів. Для production-сервера з архівом використовуйте NVMe від 80–160 GB, а довготривалі записи переносьте в окреме об’єктне сховище.

NVMe впливає на час запуску контейнера, читання великих файлів і паралельну обробку, але після завантаження моделі у VRAM різниця між SSD і NVMe для самого інференсу менша, ніж різниця між CPU та GPU. Не зберігайте персональні записи без шифрування та політики видалення: мовлення може містити персональні, комерційні або медичні дані.

Мережа та середовище

Для Linux зазвичай обирають Ubuntu 22.04/24.04 LTS або Debian 12. GPU-вузлу потрібні сумісні драйвер NVIDIA, CUDA та версія faster-whisper/CTranslate2. Стабільність важливіша за найновіший реліз: спочатку зафіксуйте версії в Docker-образі, потім оновлюйте їх на тестовому сервері.

docker run --gpus all --rm \
  -v "$PWD/models:/models" \
  -v "$PWD/audio:/audio" \
  nvidia/cuda:12.4.1-runtime-ubuntu22.04 \
  nvidia-smi

ffmpeg -i input.mp3 -ac 1 -ar 16000 -c:a pcm_s16le input.wav

Відкривайте назовні лише HTTPS API, а worker і чергу тримайте у внутрішній мережі. Обмежуйте розмір запиту, застосовуйте авторизацію, rate limit і автоматичне видалення тимчасових файлів. Для сервісів, де потрібна висока доступність, окремі CPU- та GPU-ноди дають змогу оновлювати API без зупинки інференсу.

Як оптимізувати faster-whisper і зменшити витрати

Вибір моделі та параметрів

Не починайте з large-v3, якщо бізнес-вимога — лише чернеткова транскрибація. Перевірте tiny, base, small і medium на власному наборі з 30–60 хвилин мовлення. Порівнюйте не тільки WER, а й затримку, помилки в іменах, пунктуацію, стійкість до шуму та вартість години аудіо.

  1. Для нотаток і внутрішніх чернеток використовуйте base або small.
  2. Для якісної багатомовної транскрибації протестуйте medium.
  3. Для складного мовлення, шуму та високої точності обирайте large-v3 за наявності GPU.
  4. Увімкніть VAD, щоб пропускати тривалі періоди тиші.
  5. Добирайте beam_size, batch_size і compute type за результатами тестів, а не за максимальними значеннями.
  6. Розділяйте інтерактивні запити та пакетні завдання в окремі черги.

Моніторинг і масштабування

Збирайте тривалість аудіо, час обробки, RTF, довжину черги, помилки CUDA, завантаження VRAM і частку запитів із перевищеним таймаутом. Якщо GPU простоює, причиною може бути повільне завантаження файлів або надто малі завдання; якщо VRAM заповнена, зменште batch або запустіть додаткові GPU-ноди.

Для одного проєкту достатньо Docker Compose та одного worker. Зі зростанням навантаження використовуйте Kubernetes, Nomad або простий autoscaling за довжиною черги. Загальні вимоги до самостійного розміщення застосунків і підбору ресурсів розглянуто в посібнику з підбору обладнання для self-hosted застосунків під навантаженням.

Якщо Whisper є частиною AI-платформи, заздалегідь розподіліть GPU між розпізнаванням і LLM. Для сценарію з Ollama корисно враховувати окремі вимоги до CPU, RAM і VRAM у статті про сервер Ollama залежно від розміру моделі. Для відеопотоків із детекцією об’єктів і транскрибацією також може знадобитися окремий розрахунок ресурсів, аналогічний вибору сервера для Frigate, CPU, GPU та Coral.

Швидкий вибір
Шукаєте сервер, який просто працює?
Valebyte VPS — NVMe, підтримка 24/7, запуск за 60 секунд.
Тарифи VPS

Коли обрати VPS, а коли виділений сервер

VPS для невеликого проєкту

VPS підходить для персонального сервісу, внутрішнього API та пакетної транскрибації, якщо доступний потрібний обсяг RAM і стабільні vCPU. Конфігурація 4 vCPU, 8 GB RAM і 80 GB NVMe закриває багато завдань на base/small. GPU VPS має сенс, коли модель medium або large-v3 повинна швидко відповідати, а оренда виділеного вузла для проєкту надмірна.

Перевіряйте, чи є vCPU гарантованими, чи існують обмеження CPU steal, який ліміт дискових IOPS і чи дозволено Docker із GPU. Дешевий VPS із перевантаженим процесором може давати непередбачуваний RTF, тому важливі тестове навантаження та можливість збільшити конфігурацію без міграції.

Виділений сервер для постійного навантаження

Виділений GPU-сервер виправданий за десятків паралельних потоків, цілодобового API, суворого SLA або потреби тримати кілька моделей у пам’яті. Він забезпечує фіксовані CPU, RAM, NVMe та VRAM, а також зменшує вплив сусідніх клієнтів. Для 50 потоків large-v3 орієнтиром можуть бути 8–16 vCPU, 32–64 GB RAM, NVMe від 160 GB і GPU від 16 GB VRAM, але точна кількість потоків визначається latency та batch.

Під час вибору GPU уточнюйте не тільки обсяг пам’яті, а й пропускну здатність, підтримку CUDA, енергоспоживання та доступність драйверів. Дві карти по 8 GB не завжди рівноцінні одній карті на 16 GB: модель і worker можуть не вміти ефективно розподіляти один запит між пристроями.

Часті запитання

Чи можна запустити Whisper без GPU?

Так, Whisper і faster-whisper працюють на CPU. Для tiny, base та частини завдань small достатньо 2–4 vCPU і 4–8 GB RAM, особливо для пакетної обробки. large-v3 на CPU також запускається, але швидкість часто нижча за 1x real-time, тому година аудіо може оброблятися довше години. Для потокового API з малою затримкою краще використовувати GPU.

Скільки VRAM потрібно для Whisper large-v3?

Для large-v3 плануйте 10–16 GB VRAM: точне споживання залежить від float16, int8, batch size і версії faster-whisper. GPU на 16 GB залишає безпечніший запас для CUDA та паралельних завдань. У разі використання quantization модель може вміститися в менший обсяг, але варто перевірити швидкість, якість і сумісність на тестовому аудіо.

Яка модель Whisper найкраща для української мови?

Для української мови вибір залежить від якості запису та завдання. Base або small підходять для швидких чернеток, medium забезпечує вищу точність, а large-v3 корисна для складного мовлення, шуму та змішаних мов. Порівняйте моделі на 30–60 хвилинах власних записів: різниця в помилках імен і термінів важливіша за синтетичний тест.

Скільки RAM потрібно для self-hosted Whisper?

Мінімально розумний сервер — 4 GB RAM для tiny/base. Для small або medium рекомендується 8–16 GB, а для large-v3 на CPU — 16–32 GB. Додаткова пам’ять потрібна за кількох worker-процесів, довгих WAV-файлів, diarization, API та черги завдань. Залишайте щонайменше 20% RAM вільною, щоб уникнути swap і стрибків затримки.

Висновки

Для разової транскрибації почніть із VPS на 4 vCPU та 8 GB RAM із моделлю small, а для потокового large-v3 плануйте GPU від 16 GB VRAM, 8–16 vCPU і 32 GB RAM. Перед замовленням сервера Valebyte виміряйте RTF на власному аудіо та додайте 20–30% запасу пам’яті й ресурсів для паралельних запитів.

SSD NVMe
Готові запустити власний VPS?

NVMe VPS з активацією за 60 секунд: повний root-доступ, 20+ локацій, оплата карткою або криптовалютою.

Обрати тариф
support_agent
Valebyte Support
Usually replies within minutes
Hi there!
Send us a message and we'll reply as soon as possible.