Créer, héberger et exploiter des solutions IA.

Whisper

API privée de transcription audio sur votre VPS — multilingue, rapide, compatible OpenAI.

1 Go minimum (modèle base), 2 Go recommandé (modèle small) RAM 1 vCPU En validation

En validation

L'installation automatique de cette solution est prête et passe actuellement nos tests sur serveur réel. La commande ouvrira dès que la validation sera terminée.

Whisper est le modèle de reconnaissance vocale open source d'OpenAI, déployé ici comme API REST self-hosted via le moteur faster-whisper CTranslate2. Hébergé sur votre VPS, il transcrit des fichiers audio en 99 langues, traduit vers l'anglais et restitue des horodatages au niveau du mot — sans envoyer un seul octet à un service tiers. Le modèle `base` tourne confortablement sur un VPS 1 vCPU avec 1 Go de RAM ; `small` améliore la précision avec 2 Go. Utilisez-le pour alimenter le sous-titrage, l'indexation de recherche, les comptes-rendus de réunion, le traitement de podcasts ou tout workflow qui convertit la voix en texte.

Fonctionnalités clés

API REST compatible OpenAI : POST /asr, sortie en txt, json, srt, vtt ou tsv.
Moteur faster-whisper CTranslate2 : jusqu'à 4× plus rapide que Whisper original sur CPU.
99 langues supportées — arabe, français, anglais, darija et bien d'autres — dans un seul modèle.
Horodatages au niveau du mot et du segment, prêts pour la génération de sous-titres.
Aucune facturation à la minute et aucune donnée ne quitte votre VPS.
Choix du modèle via la variable ASR_MODEL : tiny, base, small, medium, large-v3.

Quand utiliser cette solution ?

1

Transcription de réunions et d'entretiens

2

Sous-titrage de podcasts et de médias

3

Voix vers texte dans vos outils internes

Déployer Whisper sur votre VPS

Guide optimisé pour les VPS Cloud ServOrbit.

01

Déployer depuis la Marketplace

Ouvrez le tableau de bord ServOrbit, rendez-vous dans Marketplace → Intelligence Artificielle → Whisper, et cliquez sur Déployer. Docker tire l'image et démarre le conteneur en moins de deux minutes. Le premier démarrage télécharge également les poids du modèle de transcription (~270 Mo pour base) ; le téléchargement est mis en cache pour que les redémarrages suivants soient instantanés.

02

Accéder à l'API

Après l'installation, utilisez l'adresse affichée dans votre espace client. La Swagger UI est disponible sur /docs pour des tests interactifs. L'endpoint principal est POST /asr : joignez votre fichier audio et définissez le paramètre output sur txt, json, srt, vtt ou tsv selon le format voulu.

03

Transcrire son premier fichier

Depuis un terminal ou votre application, envoyez une requête : ` curl -F "[email protected]" "https://votre-adresse/asr?output=txt" Vous récupérez la transcription complète en texte brut. Pour des segments horodatés, ajoutez output=json`.

04

Changer de modèle si nécessaire

Le modèle par défaut est base (rapide, ~140 Mo). Pour améliorer la précision, basculez sur small (meilleur pour les audios bruités, ~500 Mo) en mettant à jour la variable d'environnement ASR_MODEL. Un VPS avec 2 Go de RAM gère small confortablement. Contactez le support pour redimensionner votre VPS.

05

Intégrer dans votre pipeline

L'endpoint est compatible OpenAI Whisper : toute bibliothèque ou outil capable d'appeler l'API OpenAI de transcription peut être redirigé vers votre instance privée. Mettez à jour l'URL de base et retirez toute clé API — l'authentification est gérée au niveau du reverse proxy par ServOrbit.

Questions fréquentes

Le modèle reconnaît 99 langues dont l'arabe, le français, l'anglais, l'espagnol et la darija. La transcription et la traduction vers l'anglais sont gérées par le même modèle, sélectionnées via le paramètre task (transcribe ou translate).

Créer, héberger et exploiter des solutions IA.

Whisper n'est pas encore commandable.

L'installation automatique de cette solution est prête et passe actuellement nos tests sur serveur réel. La commande ouvrira dès que la validation sera terminée.

Besoin d'aide ?

Parcourez notre centre d'aide et notre FAQ, ou écrivez à notre équipe — support en français, anglais et arabe.