Whisper es el modelo de reconocimiento de voz de código abierto de OpenAI, desplegado aquí como API REST autoalojada mediante el motor faster-whisper CTranslate2. Alojado en su VPS, transcribe archivos de audio en 99 idiomas, traduce al inglés y devuelve marcas de tiempo a nivel de palabra — sin enviar un solo byte a un servicio de terceros. El modelo `base` funciona con holgura en un VPS de 1 vCPU con 1 GB de RAM; `small` mejora la precisión con 2 GB. Úselo para alimentar el subtitulado, la indexación de búsqueda, las actas de reunión, el procesamiento de podcasts o cualquier flujo de trabajo que convierta la voz en texto.
Envíe sus grabaciones confidenciales directamente a su endpoint privado y obtenga un texto con marcas de tiempo. Ningún dato de recursos humanos ni legal sale de su infraestructura.
Procese las subidas de audio del lado del servidor y reciba archivos de subtítulos SRT. Conecte el endpoint a su CMS o a su pipeline de medios para automatizar la generación de subtítulos con un costo marginal nulo.
Integre la API REST en su CRM, en sus tickets de soporte o en sus herramientas de toma de notas. Deje que los agentes dicten y que la API transcriba — con un costo mensual fijo en lugar de una facturación por minuto.
Guía optimizada para los VPS Cloud ServOrbit.
Abra el panel de control de ServOrbit, vaya a Marketplace → Inteligencia Artificial → Whisper y haga clic en Desplegar. Docker descarga la imagen y arranca el contenedor en menos de dos minutos. El primer arranque descarga además los pesos del modelo de transcripción (~270 MB para base); la descarga se guarda en caché para que los reinicios posteriores sean instantáneos.
Después de la instalación, utilice la dirección que aparece en su área de cliente. La Swagger UI está disponible en /docs para pruebas interactivas. El endpoint principal es POST /asr: adjunte su archivo de audio y defina el parámetro output como txt, json, srt, vtt o tsv según el formato deseado.
Desde un terminal o desde su aplicación, envíe una solicitud:
`
curl -F "[email protected]" "https://votre-adresse/asr?output=txt"
Obtendrá la transcripción completa en texto plano. Para segmentos con marcas de tiempo, añada output=json`.
El modelo predeterminado es base (rápido, ~140 MB). Para mejorar la precisión, cambie a small (mejor para los audios con ruido, ~500 MB) actualizando la variable de entorno ASR_MODEL. Un VPS con 2 GB de RAM gestiona small con holgura. Póngase en contacto con el soporte para redimensionar su VPS.
El endpoint es compatible con OpenAI Whisper: cualquier biblioteca o herramienta capaz de llamar a la API de transcripción de OpenAI puede redirigirse a su instancia privada. Actualice la URL base y elimine cualquier clave de API — la autenticación la gestiona ServOrbit a nivel del reverse proxy.
task (transcribe o translate).¿Mantiene un proyecto que utiliza Whisper? Este botón permite a sus lectores desplegarlo en un VPS con un clic, sin leer documentación de Docker.
[](https://servorbit.com/vps-cloud?template=whisper&utm_source=deploy-badge&utm_medium=referral&utm_campaign=whisper)<a href="https://servorbit.com/vps-cloud?template=whisper&utm_source=deploy-badge&utm_medium=referral&utm_campaign=whisper"><img src="https://servorbit.com/brand/deploy/button.svg" alt="Deploy Whisper on ServOrbit" height="40"></a>El botón lleva al pedido de un VPS con la plantilla preseleccionada. La imagen se sirve desde servorbit.com: no tiene que alojar nada por su parte.
Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.
Escribir por WhatsAppse abre en una pestaña nueva