Whisper
GRATUITLe modèle de reconnaissance vocale open source d'OpenAI : transcription dans une centaine de langues, gratuite en local, robuste sur l'audio réel.
Note de la rédaction, basée sur l'analyse des avis utilisateurs et de la documentation disponible.

À quoi sert Whisper ?
Whisper est le modèle de reconnaissance vocale publié en open source par OpenAI en septembre 2022. Entraîné sur 680 000 heures d'audio multilingue collecté sur le web, il transcrit la parole en texte dans près d'une centaine de langues — et peut aussi la traduire vers l'anglais. Sa marque de fabrique : une robustesse rare sur l'audio réel, celui des réunions bruyantes, des accents marqués et du jargon technique.
Ce n'est pas une application mais une brique logicielle, sous licence MIT : n'importe qui peut l'utiliser, la modifier et l'intégrer gratuitement. C'est précisément ce qui en a fait le standard de fait de la transcription — une bonne partie des outils de sous-titrage et de dictée du marché reposent sur lui, souvent sans le dire.
Whisper est-il vraiment gratuit ?
Oui : le code et les poids du modèle sont publiés sous licence MIT, et l'exécuter sur votre propre machine ne coûte rien. La nuance : si vous passez par l'API officielle d'OpenAI plutôt que d'installer le modèle, la transcription est facturée à l'usage — 0,006 $ par minute d'audio pour `whisper-1`, et OpenAI propose désormais des modèles plus récents (`gpt-4o-transcribe` au même prix, sa version mini à 0,003 $/min).
En local ou via l'API : comment l'utiliser ?
En local, Whisper s'installe en quelques commandes (Python) et se décline en plusieurs tailles, du plus léger au plus précis :
| Modèle | Paramètres | Mémoire vidéo | Vitesse relative |
|---|---|---|---|
| tiny | 39 M | ~1 Go | ~10× |
| small | 244 M | ~2 Go | ~4× |
| medium | 769 M | ~5 Go | ~2× |
| large (v3) | 1 550 M | ~10 Go | 1× |
| turbo | 809 M | ~6 Go | ~8× |
L'atout du local : la confidentialité — l'audio ne quitte jamais votre machine, un vrai argument pour le juridique, le médical ou le RH. L'API, elle, évite tout le côté technique : un appel, un fichier audio, un texte en retour.
Pas envie de coder du tout ? De nombreux services embarquent Whisper : des versions optimisées comme whisper.cpp ou faster-whisper, des applications de bureau comme MacWhisper, la démo officielle sur Hugging Face, ou encore des offres hébergées (Microsoft Azure, Groq…). Et OpenAI s'en est longtemps servi lui-même pour la dictée vocale de ChatGPT.
Whisper en pratique, notamment en français
Sur le français, Whisper fait partie des langues les mieux servies : la transcription reste fiable même avec du bruit de fond ou des accents régionaux. Prévoyez tout de même une relecture des noms propres et de la ponctuation, comme pour tout outil de transcription. Deux vraies limites : il ne distingue pas les locuteurs nativement (qui a dit quoi), et sur les silences ou les passages inaudibles, il peut « halluciner » des phrases jamais prononcées — un défaut documenté, rédhibitoire sans relecture pour les usages sensibles. Pour l'opération inverse — donner une voix à un texte — voyez plutôt ElevenLabs.
Questions fréquentes
Whisper est-il gratuit ?
Oui, le modèle est open source sous licence MIT et gratuit à exécuter en local ; seule l'API officielle d'OpenAI est facturée à l'usage (0,006 $/min). Il figure en bonne place parmi les outils d'IA gratuits.
Comment utiliser Whisper sans coder ?
En passant par une application ou un service qui l'embarque : la démo officielle sur Hugging Face, des applications de bureau comme MacWhisper, ou des services de transcription hébergés.
Whisper fonctionne-t-il bien en français ?
Oui, le français fait partie des langues les mieux transcrites, y compris sur de l'audio bruité ou accentué ; relisez tout de même les noms propres et la ponctuation.
ChatGPT utilise-t-il Whisper ?
Oui, OpenAI a longtemps utilisé Whisper pour la dictée vocale de ChatGPT, et les points d'accès de transcription de son API reposaient historiquement sur lui.
Whisper a-t-il été racheté par OpenAI ?
Non : Whisper a été développé en interne par OpenAI, puis publié en open source en septembre 2022. Ne le confondez pas avec des services tiers au nom proche.
Points forts & limites
Sur une machine récente, choisissez le modèle « turbo » : presque la précision du grand modèle pour ~6 Go de mémoire vidéo et une vitesse environ 8 fois supérieure.