Guide Whisper : transcription audio gratuite par OpenAI
Whisper est le modèle de reconnaissance vocale open-source développé par OpenAI. Entraîné sur 680 000 heures de données audio multilingues, Whisper transcrit la parole en texte avec une précision remarquable dans plus de 99 langues. Contrairement à de nombreux services de transcription payants, Whisper est entièrement gratuit lorsqu'il est exécuté localement, et disponible via l'API OpenAI à un coût très bas. En 2026, avec la sortie de Whisper V4 et les modèles basés sur GPT-4o, la précision et les fonctionnalités ont atteint un niveau professionnel.
Comment commencer avec Whisper
Il existe plusieurs façons d'utiliser Whisper, selon vos compétences techniques :
Option 1 : Via l'API OpenAI (le plus simple)
- Créez un compte sur platform.openai.com et obtenez une clé API.
- Envoyez votre fichier audio à l'endpoint de transcription.
- Recevez la transcription en texte, avec timestamps optionnels.
Les formats supportés sont : MP3, MP4, MPEG, MPGA, M4A, WAV et WebM. La taille maximale est de 25 Mo par fichier.
Option 2 : Installation locale (gratuit)
- Installez Python 3.8+ sur votre machine.
- Installez Whisper avec la commande :
pip install openai-whisper - Lancez la transcription :
whisper fichier_audio.mp3 --language fr
L'exécution locale est gratuite et ne nécessite pas de connexion Internet. Un GPU NVIDIA est recommandé pour les modèles les plus grands, mais les modèles small et base fonctionnent sur un processeur standard.
Option 3 : Via Hugging Face
Le modèle Whisper est disponible sur Hugging Face, où vous pouvez le tester gratuitement dans votre navigateur ou l'intégrer dans vos propres applications via l'API Hugging Face.
Fonctions principales de Whisper
Transcription multilingue
Whisper transcrit la parole dans plus de 99 langues avec une précision qui dépasse souvent 95 % pour les langues principales (anglais, français, espagnol, allemand, etc.). Le modèle est particulièrement robuste face aux accents, au bruit de fond et au jargon technique — un avantage direct de son entraînement sur 680 000 heures de données web diversifiées.
Tailles de modèle
Whisper propose six tailles de modèle pour s'adapter à différents besoins de précision et de vitesse :
| Modèle | Paramètres | Usage recommandé |
|---|---|---|
| Tiny | 39 M | Tests rapides, appareils mobiles |
| Base | 74 M | Transcriptions simples, CPU |
| Small | 244 M | Bon compromis qualité/vitesse |
| Medium | 769 M | Haute qualité, GPU recommandé |
| Large | 1,55 B | Meilleure qualité, GPU nécessaire |
| Turbo | 809 M | Équilibre optimal : 8x plus rapide que Large, qualité proche |
Le modèle Turbo est souvent le meilleur choix : il tourne 8 fois plus vite que le modèle Large tout en conservant une qualité très proche.
Whisper V4 : diarisation et streaming
Whisper V4, sorti fin 2025, introduit deux fonctionnalités majeures : la diarisation native (identification automatique des différents locuteurs) et le streaming en temps réel. Auparavant, ces fonctionnalités nécessitaient des outils tiers. Whisper V4 rivalise désormais avec les solutions spécialisées comme Deepgram et AssemblyAI.
Modèles basés sur GPT-4o
En mars 2025, OpenAI a lancé de nouveaux modèles de transcription basés sur GPT-4o et GPT-4o mini. Ces modèles atteignent des taux d'erreur encore plus bas que toutes les versions de Whisper, avec une meilleure compréhension du contexte et une ponctuation plus précise.
Traduction automatique
Whisper peut non seulement transcrire mais aussi traduire : il transcrit un audio dans une langue et produit directement une traduction en anglais. C'est idéal pour rendre accessible du contenu multilingue.
Astuces pour obtenir les meilleures transcriptions avec Whisper
- Utilisez le modèle Turbo pour la plupart des usages : il offre le meilleur compromis entre vitesse (8x plus rapide que Large) et précision (qualité quasi identique).
- Spécifiez la langue : ajoutez
--language frpour forcer la langue française. Sans cette option, Whisper détecte automatiquement la langue, ce qui peut entraîner des erreurs pour les langues minoritaires. - Découpez les fichiers volumineux : pour les fichiers de plus de 25 Mo (API) ou très longs, divisez-les en segments de 10 à 15 minutes pour de meilleurs résultats.
- Améliorez la qualité audio en amont : supprimez le bruit de fond avec un outil comme Audacity avant de transcrire. Whisper est robuste au bruit, mais un audio propre donne toujours de meilleurs résultats.
- Utilisez les timestamps pour le sous-titrage : ajoutez
--output_format srtpour obtenir un fichier de sous-titres prêt à l'emploi pour vos vidéos. - GPU pour les fichiers longs : si vous transcrivez régulièrement des fichiers de plus de 30 minutes, un GPU NVIDIA (même un RTX 3060) accélérera considérablement le processus.
Prix de Whisper en 2026
| Mode d'utilisation | Prix | Détails |
|---|---|---|
| Local (open-source) | Gratuit | Exécution sur votre propre machine, aucune limite |
| API OpenAI (whisper-1) | 0,006 $/min | 25 Mo max par fichier, résultats quasi instantanés |
| API OpenAI (GPT-4o) | ~0,01 $/min | Meilleure précision, compréhension contextuelle |
| Hugging Face | Gratuit (limité) | Utilisation en ligne ou via API gratuite avec quotas |
L'exécution locale est entièrement gratuite, ce qui fait de Whisper l'une des solutions de transcription les plus économiques du marché. L'API OpenAI à 0,006 $/minute (soit 0,36 $ par heure) est également très abordable comparée aux alternatives commerciales qui facturent souvent 1 à 2 $/heure.
Alternatives à Whisper
- ElevenLabs : pour la synthèse vocale (texte-vers-audio), l'opération inverse de Whisper. Ensemble, ils forment un pipeline audio complet.
- Claude AI : pour analyser et résumer le texte transcrit par Whisper. Un workflow puissant : Whisper transcrit, Claude analyse.
- Notion AI : pour organiser et structurer vos transcriptions dans un espace de travail collaboratif.
- GitHub Copilot : pour les développeurs qui veulent intégrer Whisper dans leurs applications, Copilot peut aider à écrire le code d'intégration.
- Suno AI : Whisper transcrit la parole, tandis que Suno génère de la musique. Deux usages complémentaires de l'audio IA.
Questions fréquentes sur Whisper
Whisper est-il vraiment gratuit ?
Oui, le modèle Whisper est open-source et peut être installé et exécuté gratuitement sur votre propre machine. L'API OpenAI est payante (0,006 $/minute), mais l'exécution locale ne coûte rien, hormis l'électricité et le matériel.
Whisper fonctionne-t-il bien en français ?
Oui, le français est l'une des langues les mieux supportées par Whisper. La précision atteint régulièrement 95 à 98 % pour un discours clair en français. Le modèle gère bien les accents régionaux français, bien que les accents très prononcés puissent réduire légèrement la précision.
Ai-je besoin d'un GPU puissant ?
Non, les modèles Tiny, Base et Small fonctionnent sur un CPU standard. Le modèle Turbo (le meilleur compromis) est utilisable avec un GPU d'entrée de gamme (GTX 1060 ou supérieur). Seul le modèle Large nécessite un GPU performant (RTX 3080+) pour des transcriptions en temps raisonnable.
Whisper peut-il identifier les différents locuteurs ?
Oui, depuis Whisper V4 (fin 2025), la diarisation (identification des locuteurs) est intégrée nativement. Les versions précédentes nécessitaient des outils tiers comme pyannote pour cette fonctionnalité.
Quelle est la différence entre Whisper et les modèles GPT-4o de transcription ?
Les modèles de transcription basés sur GPT-4o, lancés en mars 2025, offrent une meilleure précision que Whisper grâce à leur compréhension contextuelle avancée. Ils sont cependant plus coûteux via l'API. Whisper reste le meilleur choix pour l'exécution locale gratuite.
Puis-je utiliser Whisper pour sous-titrer mes vidéos YouTube ?
Absolument. Whisper peut générer des fichiers SRT (sous-titres) directement utilisables dans YouTube, Premiere Pro ou n'importe quel éditeur vidéo. Utilisez la commande whisper video.mp4 --output_format srt --language fr pour obtenir un fichier de sous-titres français.
Whisper respecte-t-il la confidentialité de mes données ?
En exécution locale, oui : vos fichiers audio ne quittent jamais votre machine. Via l'API OpenAI, les fichiers sont transmis aux serveurs d'OpenAI pour traitement. OpenAI indique ne pas utiliser les données API pour entraîner ses modèles, mais si la confidentialité est critique, l'exécution locale est recommandée.