Para un servidor Whisper self-hosted, la configuración óptima es de 4–8 vCPU, 16 GB de RAM y una GPU con 8–16 GB de VRAM: el modelo large-v3 funciona en CPU, pero el reconocimiento de voz en streaming normalmente requiere aceleración CUDA.
Qué significan los requisitos de un servidor Whisper self-hosted
Qué recursos necesita Whisper
Whisper self-hosted es un servicio de reconocimiento de voz alojado localmente que recibe archivos de audio o una transmisión desde un micrófono, ejecuta el modelo OpenAI Whisper o faster-whisper y devuelve el texto. A diferencia de una API en la nube, el servidor almacena los modelos, procesa el audio y se encarga del escalado, la seguridad y el coste de la infraestructura.
Los requisitos de un servidor Whisper self-hosted no dependen únicamente del tamaño del modelo. La configuración también está condicionada por la duración de las grabaciones, el número de tareas simultáneas, el idioma, la latencia permitida y el formato del resultado. Transcribir una vez un archivo de 100 horas de audio permite usar una cola y un modo CPU más lento. En cambio, un centro de llamadas, los subtítulos en tiempo real y una interfaz de voz requieren un margen de rendimiento mayor.
Si Whisper se despliega junto con una LLM, una base de datos vectorial u otro servicio de IA, hay que tener en cuenta el consumo total de memoria. Puedes consultar el método de estimación en este material sobre los requisitos de servidor para IA self-hosted, VRAM y RAM para LLM.
Whisper o faster-whisper
El Whisper original basado en PyTorch resulta cómodo para experimentar, pero faster-whisper suele consumir menos memoria y ser más rápido gracias a su implementación con CTranslate2. En producción, es habitual elegir faster-whisper con el tipo de cálculo int8, int8_float16 o float16. La calidad depende principalmente del modelo y del idioma, mientras que la velocidad depende del modelo, la GPU, el tipo de cuantización, la duración del audio y el tamaño del batch.
pip install faster-whisper
from faster_whisper import WhisperModel
model = WhisperModel(
"large-v3",
device="cuda",
compute_type="float16"
)
segments, info = model.transcribe("audio.mp3", language="ru")
for segment in segments:
print(f"[{segment.start:.2f}–{segment.end:.2f}] {segment.text}")
Requisitos de hardware de Whisper para los modelos tiny–large-v3
Memoria y velocidad según el tamaño del modelo
La tabla siguiente muestra referencias prácticas para faster-whisper. No son requisitos mínimos estrictos: la memoria máxima cambia según el batch size, la duración del segmento, la búsqueda beam search y el tipo de cálculo elegido. Para trabajar de forma estable, reserva un 20–30% de VRAM o RAM para el sistema operativo, la decodificación y la API.
- tiny — aproximadamente 1 GB de VRAM en modo float16 o alrededor de 1–2 GB de RAM mediante inferencia en CPU; es adecuado para transcripciones preliminares y dispositivos con recursos limitados.
- base — aproximadamente 1–2 GB de VRAM y 2–4 GB de RAM; ofrece un equilibrio razonable para notas de voz sencillas.
- small — alrededor de 2–4 GB de VRAM y 4–8 GB de RAM; reconoce el habla notablemente mejor que tiny y base.
- medium — aproximadamente 5–8 GB de VRAM y 8–12 GB de RAM; es adecuado para transcripción multilingüe de mayor calidad.
- large-v3 — normalmente requiere 10–16 GB de VRAM, según el modo y el batch; en CPU se recomiendan 16–32 GB de RAM y, para tareas paralelas, más memoria.
La respuesta a «cuánta VRAM necesita Whisper» no puede reducirse a una única cifra. Para large-v3 con float16, es más seguro planificar una GPU con 16 GB de VRAM, mientras que quantized int8 puede funcionar con menos memoria, aunque con un compromiso en velocidad y, en ocasiones, compatibilidad. Con batch size 1 el consumo es menor; varios flujos simultáneos aumentan el uso de memoria.
Velocidad aproximada respecto al tiempo real
El indicador RTF (real-time factor) muestra cuánto audio procesa el servidor por unidad de tiempo. Un valor de 1x significa que 60 minutos de grabación se transcriben aproximadamente en 60 minutos; 5x significa que se procesan en 12 minutos. Los resultados reales dependen de la CPU y la GPU, pero para planificar puedes utilizar estos rangos:
- tiny/base en 4 vCPU modernos: aproximadamente 1–5x respecto al tiempo real;
- small en 4–8 vCPU: alrededor de 0,5–2x;
- medium en 8 vCPU: alrededor de 0,2–1x;
- large-v3 en 8 vCPU: normalmente 0,05–0,3x, es decir, más lento que el tiempo real;
- large-v3 en una GPU con 12–16 GB de VRAM: aproximadamente 3–10x con procesamiento secuencial.
Estas cifras son una referencia de ingeniería, no una garantía del benchmark de un servidor concreto. En audio en ruso con pausas, la velocidad puede diferir de las pruebas con voz en inglés; VAD, diarization y word timestamps también añaden carga.
¿Buscas un servidor fiable para tus proyectos?
VPS desde 10 $/mes y servidores dedicados desde 9 $/mes con NVMe, protección DDoS y soporte 24/7.
Ver ofertas →Servidor Whisper: requisitos de CPU, GPU y RAM
Whisper server: CPU frente a GPU
Al elegir entre CPU y GPU para un servidor Whisper, el criterio principal es la latencia aceptable. La CPU es adecuada para el procesamiento por lotes, las solicitudes ocasionales y un número reducido de usuarios. La GPU merece la pena cuando necesitas obtener el resultado antes de que termine la grabación, atender varias solicitudes simultáneas o utilizar medium/large-v3 sin mantener una cola larga.
Para CPU, elige núcleos x86-64 modernos con un alto rendimiento por núcleo y AVX2. Cuatro vCPU son suficientes para tiny, base y parte de las tareas con small; 8–16 vCPU proporcionan más margen para medium y archivos en paralelo. Sin embargo, añadir vCPU no compensa por completo la ausencia de GPU en large-v3: la inferencia sigue siendo exigente y puede tardar horas con grabaciones largas.
La GPU no se necesita únicamente para lograr la máxima velocidad. Reduce la latencia de cada tarea y permite mantener la cola bajo control. Para faster-whisper, es preferible una NVIDIA compatible con CUDA y con suficiente VRAM. Si el servidor también ejecuta una LLM, hay que repartir la memoria de vídeo entre los servicios: una GPU de 16 GB puede quedarse corta para large-v3 más un modelo de lenguaje grande.
Cuánta RAM necesita el servidor
La RAM almacena el modelo en modo CPU, los búferes de decodificación, el audio cargado y los procesos de la aplicación. Para un VPS mínimo con tiny/base bastan 4 GB. Una configuración práctica para small o medium es de 8–16 GB. Para large-v3 en CPU se recomiendan al menos 16 GB, y con varios workers, archivos WAV largos y posprocesamiento, 32 GB.
No cargues en memoria grabaciones de varios gigabytes completas si no es necesario. Recibe el audio en streaming, conviértelo a mono 16 kHz y limita la duración de cada tarea. Para una API resultan útiles los límites de tamaño de archivo, el timeout, una cola Redis o RabbitMQ y un worker de inferencia independiente.
Cómo elegir un servidor Whisper según la carga
Transcripción puntual y archivo de audio
Para notas personales, entrevistas y procesamiento ocasional, basta con un VPS de 2–4 vCPU, 4–8 GB de RAM y 30–60 GB de NVMe. El modelo tiny o base ofrecerá una velocidad cómoda; small es adecuado si priorizas la calidad. Con un archivo grande puedes ejecutar las tareas por la noche, por lo que la GPU no es imprescindible.
Si necesitas procesar 100 horas de audio en 10 horas, el rendimiento medio debe ser de al menos 10x. Un servidor CPU con large-v3 normalmente no cumple este requisito, mientras que un nodo GPU con varios procesos worker secuenciales puede lograrlo. Antes de contratarlo, prueba entre 20 y 30 minutos de una grabación representativa y multiplica el resultado por el volumen previsto.
Reconocimiento en streaming y API
Para subtítulos, dictado y llamadas telefónicas, no solo importa la velocidad total, sino también la latencia hasta el primer resultado. Normalmente, el flujo se divide en fragmentos de 2–10 segundos; los segmentos demasiado cortos aumentan la sobrecarga y los demasiado largos elevan la latencia.
Un único flujo simultáneo con tiny/base puede funcionar con 2–4 vCPU. Para small o medium, es más seguro utilizar 4–8 vCPU y 8–16 GB de RAM. Varios flujos en paralelo conviene dirigirlos a una GPU: un acelerador con 12–16 GB de VRAM puede atender varios workers si el batch y el modelo caben en la memoria.
El tráfico de red de la voz suele ser reducido frente al vídeo. Un flujo Opus comprimido puede ocupar decenas de kilobytes por segundo, pero necesitas margen de red para cargar archivos, descargar resultados, realizar copias de seguridad y gestionar el tráfico de servicio. Para una API pública, elige un puerto de 100 Mbps como mínimo y, con cargas masivas, 1 Gbps.
Escala → especificaciones
Para 10 usuarios simultáneos son suficientes 4 vCPU, 8 GB de RAM y un disco NVMe de 80 GB con un tráfico de 1 TB al mes.
| Escala de carga | vCPU | RAM | Disco | Puerto de red | Precio |
|---|---|---|---|---|---|
| 1 usuario, archivos puntuales | 2 | 4 GB | 40 GB NVMe | 100 Mbps | aproximadamente 6–10 $/mes, marzo de 2026 |
| 10 usuarios simultáneos, tiny/base | 4 | 8 GB | 80 GB NVMe | 1 Gbps | aproximadamente 12–25 $/mes, marzo de 2026 |
| 25 usuarios, small/medium | 8 | 16 GB | 120 GB NVMe | 1 Gbps | aproximadamente 25–60 $/mes, marzo de 2026 |
| 50 flujos, large-v3 en GPU | 8 | 32 GB | 160 GB NVMe | 1 Gbps | aproximadamente 120–250 $/mes, marzo de 2026 |
| 100+ flujos, varios workers GPU | 16 | 64 GB | 320 GB NVMe | 1–10 Gbps | aproximadamente 300–700 $/mes, marzo de 2026 |
Los precios de la tabla son orientativos para el mercado en marzo de 2026; el coste final de Valebyte depende de la región, el tipo de GPU, los recursos garantizados, el disco, el tráfico y el periodo de contratación. Para calcularlo con precisión, ten en cuenta no el número de usuarios registrados, sino el número máximo de grabaciones que se procesan simultáneamente.
Disco, red y sistema operativo para hardware de speech to text self-hosted
Espacio para modelos y audio
Los archivos de los modelos ocupan menos espacio que los vídeos, pero cada versión y formato requiere margen adicional. Reserva como mínimo 20–30 GB para tiny–medium, 30–60 GB para large-v3, el entorno de Python, los contenedores, la caché y los logs. En un servidor de producción con archivo de grabaciones, utiliza NVMe de 80–160 GB como mínimo y transfiere las grabaciones de larga duración a un almacenamiento de objetos independiente.
El NVMe influye en el tiempo de inicio del contenedor, la lectura de archivos grandes y el procesamiento en paralelo, pero una vez cargado el modelo en la VRAM, la diferencia entre SSD y NVMe para la inferencia es menor que la diferencia entre CPU y GPU. No almacenes grabaciones personales sin cifrado ni una política de eliminación: el audio puede contener datos personales, comerciales o médicos.
Red y entorno
Para Linux, normalmente se elige Ubuntu 22.04/24.04 LTS o Debian 12. Un nodo GPU necesita controladores NVIDIA, CUDA y versiones compatibles de faster-whisper/CTranslate2. La estabilidad es más importante que utilizar la versión más reciente: fija primero las versiones en la imagen Docker y actualízalas después en un servidor de pruebas.
docker run --gpus all --rm \
-v "$PWD/models:/models" \
-v "$PWD/audio:/audio" \
nvidia/cuda:12.4.1-runtime-ubuntu22.04 \
nvidia-smi
ffmpeg -i input.mp3 -ac 1 -ar 16000 -c:a pcm_s16le input.wav
Expón al exterior únicamente la API HTTPS y mantén el worker y la cola en la red interna. Limita el tamaño de las solicitudes, utiliza autenticación, rate limit y elimina automáticamente los archivos temporales. En servicios que requieren alta disponibilidad, los nodos CPU y GPU independientes permiten actualizar la API sin detener la inferencia.
Cómo optimizar faster-whisper y reducir costes
Elección del modelo y los parámetros
No empieces con large-v3 si el requisito del negocio es únicamente una transcripción preliminar. Prueba tiny, base, small y medium con tu propio conjunto de 30–60 minutos de voz. Compara no solo el WER, sino también la latencia, los errores en nombres, la puntuación, la resistencia al ruido y el coste por hora de audio.
- Para notas y borradores internos, utiliza base o small.
- Para transcripción multilingüe de alta calidad, prueba medium.
- Para habla compleja, ruido y máxima precisión, elige large-v3 si tienes una GPU.
- Activa VAD para omitir los periodos largos de silencio.
- Ajusta
beam_size,batch_sizey el tipo de cálculo según los resultados de las pruebas, no según los valores máximos. - Separa las solicitudes interactivas y las tareas por lotes en colas independientes.
Monitorización y escalado
Recopila la duración del audio, el tiempo de procesamiento, el RTF, la longitud de la cola, los errores de CUDA, el uso de VRAM y el porcentaje de solicitudes que superan el timeout. Si la GPU está inactiva, la causa puede ser una carga lenta de archivos o tareas demasiado pequeñas; si la VRAM está llena, reduce el batch o añade nodos GPU.
Para un proyecto, Docker Compose y un único worker suelen ser suficientes. Cuando aumente la carga, puedes utilizar Kubernetes, Nomad o un autoscaling sencillo basado en la longitud de la cola. Los requisitos generales para alojar aplicaciones por cuenta propia y elegir recursos se explican en esta guía sobre cómo elegir hardware para aplicaciones self-hosted según la carga.
Si Whisper forma parte de una plataforma de IA, separa de antemano la GPU destinada al reconocimiento de la que utiliza la LLM. En un escenario con Ollama, conviene tener en cuenta los requisitos independientes de CPU, RAM y VRAM en el artículo sobre servidores Ollama según el tamaño del modelo. Para flujos de vídeo con detección de objetos y transcripción, también puede ser necesario calcular los recursos por separado, de forma similar a la elección de un servidor para Frigate, CPU, GPU y Coral.
Cuándo elegir un VPS y cuándo un servidor dedicado
VPS para un proyecto pequeño
Un VPS es adecuado para un servicio personal, una API interna y la transcripción por lotes, siempre que ofrezca la cantidad necesaria de RAM y vCPU estables. Una configuración de 4 vCPU, 8 GB de RAM y 80 GB de NVMe cubre muchas tareas con base/small. Un VPS con GPU tiene sentido cuando medium o large-v3 debe responder rápidamente y contratar un nodo dedicado sería excesivo para el proyecto.
Comprueba si las vCPU están garantizadas, si existen límites de CPU steal, cuál es el límite de IOPS del disco y si se permite Docker con GPU. Un VPS económico con un procesador sobrecargado puede ofrecer un RTF impredecible, por lo que son importantes las pruebas de carga y la posibilidad de ampliar la configuración sin migrar.
Servidor dedicado para una carga constante
Un servidor dedicado con GPU está justificado con decenas de flujos simultáneos, una API operativa 24/7, un SLA estricto o la necesidad de mantener varios modelos en memoria. Proporciona CPU, RAM, NVMe y VRAM fijos, además de reducir la influencia de otros usuarios. Para 50 flujos con large-v3, una referencia puede ser 8–16 vCPU, 32–64 GB de RAM, al menos 160 GB de NVMe y una GPU de 16 GB de VRAM o más, aunque el número exacto de flujos depende de la latencia y el batch.
Al elegir una GPU, comprueba no solo la cantidad de memoria, sino también el ancho de banda, la compatibilidad con CUDA, el consumo energético y la disponibilidad de controladores. Dos tarjetas de 8 GB no siempre equivalen a una tarjeta de 16 GB: el modelo y el worker pueden no ser capaces de repartir una solicitud de forma eficiente entre varios dispositivos.
Preguntas frecuentes
¿Se puede ejecutar Whisper sin GPU?
Sí, Whisper y faster-whisper funcionan en CPU. Para tiny, base y parte de las tareas con small bastan 2–4 vCPU y 4–8 GB de RAM, especialmente durante el procesamiento por lotes. large-v3 también se ejecuta en CPU, pero su velocidad suele ser inferior a 1x en tiempo real, por lo que una hora de audio puede tardar más de una hora en procesarse. Para una API en streaming con baja latencia, es preferible utilizar una GPU.
¿Cuánta VRAM necesita Whisper large-v3?
Para large-v3, planifica 10–16 GB de VRAM: el consumo exacto depende de float16, int8, batch size y la versión de faster-whisper. Una GPU de 16 GB deja un margen más seguro para CUDA y las tareas paralelas. Con quantization, el modelo puede caber en menos memoria, pero debes comprobar la velocidad, la calidad y la compatibilidad con audio de prueba.
¿Qué modelo de Whisper es mejor para español?
Para el español, la elección depende de la calidad de la grabación y del objetivo. Base o small son adecuados para borradores rápidos, medium ofrece mayor precisión y large-v3 resulta útil para habla compleja, ruido e idiomas mezclados. Compara los modelos con 30–60 minutos de tus propias grabaciones: la diferencia en los errores de nombres y términos es más importante que una prueba sintética.
¿Cuánta RAM necesita Whisper self-hosted?
Un servidor mínimamente razonable necesita 4 GB de RAM para tiny/base. Para small o medium se recomiendan 8–16 GB, mientras que large-v3 en CPU requiere 16–32 GB. Se necesita memoria adicional con varios procesos worker, archivos WAV largos, diarization, la API y la cola de tareas. Deja al menos un 20% de RAM libre para evitar el uso de swap y los picos de latencia.
Conclusiones
Para una transcripción puntual, empieza con un VPS de 4 vCPU y 8 GB de RAM con el modelo small; para large-v3 en streaming, planifica una GPU con al menos 16 GB de VRAM, 8–16 vCPU y 32 GB de RAM. Antes de contratar un servidor de Valebyte, mide el RTF con tus propios audios y añade un margen del 20–30% para la memoria y las solicitudes simultáneas.
VPS NVMe activado en 60 segundos: acceso root completo, más de 20 ubicaciones y pago con tarjeta o criptomonedas.
Elegir tarifa