Outils Intelligence Artificielle
Accueil/ Annuaire/ Audio/ Whisper
Whisper

Whisper

GRATUIT

Le modèle de reconnaissance vocale open source d'OpenAI : transcription dans une centaine de langues, gratuite en local, robuste sur l'audio réel.

4,6 · Note de la rédaction : 4,6 sur 5 OpenAI Local · API

Note de la rédaction, basée sur l'analyse des avis utilisateurs et de la documentation disponible.

Aperçu de l'interface

À quoi sert Whisper ?

Whisper est le modèle de reconnaissance vocale publié en open source par OpenAI en septembre 2022. Entraîné sur 680 000 heures d'audio multilingue collecté sur le web, il transcrit la parole en texte dans près d'une centaine de langues — et peut aussi la traduire vers l'anglais. Sa marque de fabrique : une robustesse rare sur l'audio réel, celui des réunions bruyantes, des accents marqués et du jargon technique.

Ce n'est pas une application mais une brique logicielle, sous licence MIT : n'importe qui peut l'utiliser, la modifier et l'intégrer gratuitement. C'est précisément ce qui en a fait le standard de fait de la transcription — une bonne partie des outils de sous-titrage et de dictée du marché reposent sur lui, souvent sans le dire.

Whisper en chiffres
680 000 h
d'audio multilingue pour l'entraînement
~99
langues reconnues, dont le français
0,006 $
par minute via l'API officielle d'OpenAI

Whisper est-il vraiment gratuit ?

Oui : le code et les poids du modèle sont publiés sous licence MIT, et l'exécuter sur votre propre machine ne coûte rien. La nuance : si vous passez par l'API officielle d'OpenAI plutôt que d'installer le modèle, la transcription est facturée à l'usage — 0,006 $ par minute d'audio pour `whisper-1`, et OpenAI propose désormais des modèles plus récents (`gpt-4o-transcribe` au même prix, sa version mini à 0,003 $/min).

En local ou via l'API : comment l'utiliser ?

En local, Whisper s'installe en quelques commandes (Python) et se décline en plusieurs tailles, du plus léger au plus précis :

ModèleParamètresMémoire vidéoVitesse relative
tiny39 M~1 Go~10×
small244 M~2 Go~4×
medium769 M~5 Go~2×
large (v3)1 550 M~10 Go
turbo809 M~6 Go~8×

L'atout du local : la confidentialité — l'audio ne quitte jamais votre machine, un vrai argument pour le juridique, le médical ou le RH. L'API, elle, évite tout le côté technique : un appel, un fichier audio, un texte en retour.

Pas envie de coder du tout ? De nombreux services embarquent Whisper : des versions optimisées comme whisper.cpp ou faster-whisper, des applications de bureau comme MacWhisper, la démo officielle sur Hugging Face, ou encore des offres hébergées (Microsoft Azure, Groq…). Et OpenAI s'en est longtemps servi lui-même pour la dictée vocale de ChatGPT.

Whisper en pratique, notamment en français

Sur le français, Whisper fait partie des langues les mieux servies : la transcription reste fiable même avec du bruit de fond ou des accents régionaux. Prévoyez tout de même une relecture des noms propres et de la ponctuation, comme pour tout outil de transcription. Deux vraies limites : il ne distingue pas les locuteurs nativement (qui a dit quoi), et sur les silences ou les passages inaudibles, il peut « halluciner » des phrases jamais prononcées — un défaut documenté, rédhibitoire sans relecture pour les usages sensibles. Pour l'opération inverse — donner une voix à un texte — voyez plutôt ElevenLabs.

À retenir
Idéal pourLa transcription multilingue robuste et confidentielle, sans frais de licence.
TarifGratuit en open source (MIT) ; l'API officielle est facturée 0,006 $/min.
LimitePas d'interface officielle grand public : prévoir une application ou un service qui l'embarque.

Questions fréquentes

Whisper est-il gratuit ?

Oui, le modèle est open source sous licence MIT et gratuit à exécuter en local ; seule l'API officielle d'OpenAI est facturée à l'usage (0,006 $/min). Il figure en bonne place parmi les outils d'IA gratuits.

Comment utiliser Whisper sans coder ?

En passant par une application ou un service qui l'embarque : la démo officielle sur Hugging Face, des applications de bureau comme MacWhisper, ou des services de transcription hébergés.

Whisper fonctionne-t-il bien en français ?

Oui, le français fait partie des langues les mieux transcrites, y compris sur de l'audio bruité ou accentué ; relisez tout de même les noms propres et la ponctuation.

ChatGPT utilise-t-il Whisper ?

Oui, OpenAI a longtemps utilisé Whisper pour la dictée vocale de ChatGPT, et les points d'accès de transcription de son API reposaient historiquement sur lui.

Whisper a-t-il été racheté par OpenAI ?

Non : Whisper a été développé en interne par OpenAI, puis publié en open source en septembre 2022. Ne le confondez pas avec des services tiers au nom proche.

Points forts & limites

On aime
+ Open source (licence MIT), gratuit en local+ Robuste sur l'audio réel (bruit, accents, jargon)+ Très bon en multilingue, dont le français+ Immense écosystème d'outils qui l'embarquent
On aime moins
- Pas d'interface officielle grand public- Ne distingue pas les locuteurs nativement- Peut « halluciner » sur les silences ou l'audio très dégradé
Astuce

Sur une machine récente, choisissez le modèle « turbo » : presque la précision du grand modèle pour ~6 Go de mémoire vidéo et une vitesse environ 8 fois supérieure.

Cas d'usage typiques

01
Sous-titrer une vidéo
Générer des sous-titres dans une centaine de langues, ou les traduire vers l'anglais.
02
Transcrire réunions et interviews
Convertir un enregistrement en compte rendu écrit, sans envoyer l'audio dans le cloud.
03
Indexer un podcast
Rendre des heures d'audio cherchables en les transformant en texte.