Outils Intelligence Artificielle
Accueil/ Comparatifs/ Whisper vs Gemini 3.5 Transcribe
Comparatif · Audio · 7 min de lecture

Whisper vs Gemini 3.5 Transcribe : la référence libre face au nouveau modèle de Google

Whisper l'open source face à Gemini 3.5 Transcribe : précision mesurée, prix à la minute, français, confidentialité et temps réel, le duel critère par critère.

Whisper vs G
Le résumé en 20 secondes
Whisper
Whisper
LA BRIQUE LIBRE · GRATUITE
4,6
Avantages
+ Gratuit en local (licence MIT), l'audio ne quitte jamais votre machine+ ~98 langues, traduction vers l'anglais, sorties SRT et VTT pour les sous-titres+ Écosystème immense : whisper.cpp, faster-whisper, Hugging Face, hébergeurs
Inconvénients
- Pas de temps réel natif ni de diarisation native- Erreur mesurée plus élevée que le champion du moment (4,1 % à 4,6 % contre 2,6 % sur AA-WER)- Mise en place technique (installation locale ou hébergeur tiers)
G
Gemini 3.5 Transcribe
LE PLUS PRÉCIS · CLOUD
4,7
Avantages
+ Meilleure précision mesurée : 2,6 % d'erreur sur l'index AA-WER, 4,0 % en streaming+ Temps réel natif (Live API), diarisation et horodatage au mot près+ Mode « smart » : un texte déjà formaté, sans « euh » ni corrections à refaire
Inconvénients
- Votre audio part dans le cloud, aucun usage local possible- Pas de tarif grand public, et les applis ne couvrent pas encore la France- Le mode « smart » reformule au lieu de transcrire mot à mot

Whisper est la brique de transcription que beaucoup d'outils utilisent sans le dire ; Gemini 3.5 Transcribe est le nouveau modèle que Google veut mettre dans tous ses produits. Le premier est libre, gratuit et tourne chez vous ; le second, annoncé le 26 août 2026, est plus précis et sait nettoyer la parole, mais exige de lui confier votre audio. Le bon choix dépend moins de la qualité brute que de ce que vous acceptez de faire de vos enregistrements.

Critère
WhisperWhisper
GGemini 3.5 Transcribe
Note de la rédaction
4,6
4,7
Prix
Gratuit en local (licence MIT) ; API à l'usage
À l'usage : ~0,005 $/min, ~0,009 $/min en streaming
Temps réel
Pas de mode natif (transcription par segments)
Oui, Live API, latence inférieure à la seconde
Multilingue
~98 langues, traduction vers l'anglais incluse
85+ langues et locales, détection automatique
Français
Très bonne, écosystème francophone fourni
fr-FR pris en charge côté modèle ; applis non confirmées
Locuteurs
Pas de diarisation native
Jusqu'à 8 locuteurs, attribution au-delà de 3 expérimentale
Sous-titres (SRT, VTT)
Formats proposés par l'API de transcription d'OpenAI et les outils CLI du dépôt
Texte et horodatage au mot près, sans format sous-titre
Confidentialité
Local possible, l'audio ne quitte pas la machine
Cloud Google obligatoire
Intégrations
whisper.cpp, faster-whisper, Hugging Face, Azure, Groq
LiveKit, Agora, Pipecat, Vercel, Gboard Rambler, Chrome bientôt
Open source
Oui, licence MIT
Non, modèle propriétaire

AvantageEn retrait

Les deux interfaces en un coup d'œil

Aperçu de l'interface de Whisper
L'interface de Whisper · voir la fiche

Deux philosophies : la brique libre contre le texte déjà poli

Whisper est le modèle de reconnaissance vocale publié en open source par OpenAI en septembre 2022, entraîné sur 680 000 heures d'audio multilingue. Vous le téléchargez sous licence MIT, il tourne chez vous, et personne ne réécrit votre transcription : ce qui a été dit est ce qui est écrit. Gemini 3.5 Transcribe, présenté par Google le 26 août 2026 (notre article sur l'annonce), joue une autre partition : transformer la parole brute en texte « juste, soigné et formaté », pour reprendre le blog officiel. En mode Smart, il supprime les mots de remplissage, intègre vos corrections (dictez « mardi, non, mercredi », il écrit mercredi) et met en forme listes, dates et montants ; le mode Verbatim, par défaut, restitue le mot pour mot. Il équipe déjà la dictée de l'appli Gemini sur macOS et Rambler sur Android, et il arrive dans Chrome.

La démo officielle Whisper Large v3 sur Hugging Face Spaces : déposez un fichier audio, choisissez transcribe ou translate, la transcription sort à droite.
La démo officielle Whisper Large v3 sur Hugging Face Spaces : déposez un fichier audio, choisissez transcribe ou translate, la transcription sort à droite.
La page « Audio transcription » de la documentation Gemini API : le modèle gemini-3.5-transcribe s'utilise en une requête, avec vocabulaire personnalisé, diarisation et horodatage.
La page « Audio transcription » de la documentation Gemini API : le modèle gemini-3.5-transcribe s'utilise en une requête, avec vocabulaire personnalisé, diarisation et horodatage.

La ligne de partage n'est donc pas la précision brute, mais le rapport à votre audio. Whisper vous laisse propriétaire de toute la chaîne ; Gemini transforme votre voix en texte prêt à l'emploi, contre le passage par le cloud de Google. Ne confondez pas ce modèle avec Gemini, l'assistant conversationnel : la fiche de l'annuaire décrit ce dernier.

Précision : ce que dit l'index AA-WER

L'un des rares bancs publics comparant les deux familles sur une même échelle est l'index AA-WER d'Artificial Analysis, qui mesure la part de mots mal transcrits (plus bas vaut mieux). Relevé le 27 août 2026 :

Modèle (source : Artificial Analysis, 27 août 2026)AA-WER sur fichiers
Gemini 3.5 Transcribe (Google)2,6 %
Whisper Large v3 (fal.ai)4,1 %
Whisper Large v3 (Together AI)4,5 %
Whisper Large v3 Turbo (Groq)4,6 %
Whisper Large v3 (Replicate)10,1 %

Google revendique lui-même ces 2,6 % pour l'audio préenregistré (4,0 % en streaming) dans son billet, « mesurés par Artificial Analysis ». Deux réserves de lecture s'imposent. D'abord, Whisper est un modèle multiplié par des hébergeurs : son score varie de 4,1 % à 10,1 % selon qui l'héberge. Ensuite, l'index pondère trois corpus, AA-AgentTalk (50 %), VoxPopuli-Cleaned (25 %) et Earnings22-Cleaned (25 %), une huitaine d'heures d'audio à dominante anglaise : il parle surtout de l'anglais difficile ; aucune mesure du français directement comparable ne figure dans le tableau consulté.

Google annonce par ailleurs un gain de 70 % sur le temps jusqu'à la transcription finale par rapport à Chirp 3, et 5,50 % d'erreur en streaming sur le benchmark multilingue FLEURS (5,04 % sur fichiers), contre 7,32 % pour Chirp 3, chiffre relayé par Ars Technica. En temps réel, le seul des deux à exister comme modèle dédié est Gemini 3.5 Transcribe Live : côté OpenAI, la transcription live repose sur d'autres modèles (gpt-live-transcribe, 0,017 $/min), et whisper-1 ne streame pas.

Ce que chacun restitue : verbatim ou texte fini

La nuance que les comparatifs rapides laissent de côté : Gemini 3.5 Transcribe sait faire les deux. La documentation API décrit deux modes. Par défaut, `verbatim` restitue le mot pour mot, « euh », répétitions et faux départs compris, et c'est le seul mode qui accepte la diarisation et l'horodatage au mot près. Le mode `smart` ressort un texte nettoyé, corrigé et structuré, mais il ne se combine ni avec l'horodatage ni avec la diarisation.

« Il reformule » est donc un choix de mode, pas une fatalité. Le modèle Whisper original, lui, ne propose pas nativement de nettoyage : il rend le flux brut, fidèle jusqu'aux bégaiements (une intégration comme WhisperX peut ajouter un post-traitement), et c'est exactement ce qu'on attend d'un verbatim de travail.

L'IA change techniquement la formulation de ce que vous avez dit, et cela peut ne pas convenir à toutes les situations. Ryan Whitwam, Ars Technica
Ars Technica · 26 août 2026 · traduit de l'anglais
!
Les limites à assumer des deux côtés

Gemini 3.5 Transcribe est un modèle de fondation : sa fiche modèle publiée le 26 août 2026 mentionne le risque d'hallucinations, comme pour toute la famille Gemini. En mode « smart », le texte peut être raccourci ou réorganisé : c'est le contrat, à assumer pour un e-mail, à proscrire pour un compte rendu juridique. Whisper présente le défaut inverse, documenté de longue date : sur les silences ou l'audio très dégradé, il peut écrire des mots jamais prononcés. Les deux exigent une relecture.

Prix, confidentialité et intégrations : la question pratique

WhisperGemini 3.5 Transcribe
GratuitéLicence MIT, usage local illimitéPas de tarif grand public ; free tier API pour l'essai
Coût à l'usage (relevé le 27 août 2026)API OpenAI : 0,003 à 0,006 $/min (gpt-4o-mini-transcribe, gpt-4o-transcribe) ; hébergeurs Whisper : 0,67 à 4,23 $ les 1 000 minutes~0,005 $/min en préenregistré (2 $ d'entrée, 12 $ de sortie par million de tokens) ; ~0,009 $/min en streaming (3,50 $ et 21 $)
Longueur d'audio25 Mo par fichier via l'API, illimité en local1 h par requête, 30 min dès qu'on active diarisation ou horodatage
LocuteursPas de diarisation nativeJusqu'à 8 locuteurs, l'attribution au-delà de 3 restant expérimentale
Sous-titresSRT, VTT, JSON, texte via l'API de transcription d'OpenAITexte et annotations au mot près, aucun format sous-titre
FrançaisTrès bonne, éprouvé sur le terrainfr-FR listé dans la doc du modèle ; applis en anglais et pays sélectionnés

Côté intégrations, Whisper vit dans tout l'écosystème libre (whisper.cpp, faster-whisper, Hugging Face, Azure, Groq, une nuée d'applications de sous-titrage), tandis que Gemini 3.5 Transcribe s'adosse à la Live API et à ses partenaires officiels (LiveKit, Agora, Pipecat, Vercel), sans compter Gboard Rambler et Chrome. Le premier se branche partout, le second arrive déjà équipé dans les produits Google.

Ce que chaque camp gagne
WhisperLe libre, le gratuit et le confidentiel : sous-titres multilingues, gros volumes, audio qui ne quitte pas la machine.
Gemini 3.5 TranscribeLe plus précis mesuré (2,6 % AA-WER), le temps réel, la diarisation et le texte déjà propre.
Le point communAucun des deux n'est dispensé de relecture : hallucinations assumées d'un côté, mots inventés sur les silences de l'autre.
Astuce

Le duo qui limite le mieux les défauts : Whisper en local pour les enregistrements sensibles et les gros volumes, à zéro euro et sans que l'audio sorte de la machine ; Gemini 3.5 Transcribe Live pour la dictée et les interfaces vocales, où sa latence et son mode « smart » font gagner du temps. Le premier archive fidèlement, le second répond pendant que vous parlez.

Le verdict : lequel choisir ?

Deux philosophies, pas de vainqueur universel : le badge « choix » serait un faux verdict, même si, sur les scores observés à cette date, Google mène.

Choisissez Whisper si vous sous-titrez ou indexez des contenus existants, traitez de gros volumes avec un budget nul, ou devez garantir que l'audio reste chez vous (juridique, santé, RH). Acceptez la mise en place technique, l'absence de diarisation native et la relecture des noms propres.

Choisissez Gemini 3.5 Transcribe si vous construisez une interface vocale ou un agent, dictez pendant que vous pensez, et voulez le meilleur score observé sur ce banc à cette date, avec un texte déjà propre. Acceptez le cloud, l'absence de tarif grand public et un déploiement encore limité en France.

Et si vous ne voulez pas choisir ? Utilisez les deux là où ils sont bons. Côté Google, la feuille de route (Chrome, français des applis, tarifs) reste en mouvement ; côté Whisper, la brique libre ne disparaîtra pas, et c'est souvent le meilleur argument pour commencer par elle.

Questions fréquentes

Gemini 3.5 Transcribe est-il meilleur que Whisper ?

Sur la précision mesurée par Artificial Analysis le 27 août 2026, oui : 2,6 % d'erreur contre 4,1 % à 4,6 % pour Whisper Large v3 selon l'hébergeur. Mais il est propriétaire, dans le cloud, et son mode « smart » reformule : pour un verbatim fidèle, Whisper reste la brique de référence.

Gemini 3.5 Transcribe est-il gratuit ?

Aucun tarif grand public n'est annoncé. Côté API, en aperçu public : environ 0,005 $ par minute d'audio en préenregistré et 0,009 $ en streaming. Whisper, lui, est gratuit en local (licence MIT).

Lequel est le moins cher ?

Whisper en local : zéro euro, quelle que soit la durée. Via une API, les hébergeurs Whisper (0,67 à 4,23 $ les 1 000 minutes) restent sous le tarif Gemini (environ 5 $ les 1 000 minutes en préenregistré).

Gemini 3.5 Transcribe fonctionne-t-il en français ?

Côté modèle, oui : la documentation liste fr-FR parmi les langues prises en charge, avec détection automatique. Côté applis, la dictée macOS démarre en anglais et Rambler est déployé dans des pays et langues sélectionnés : la France n'est pas confirmée.

Whisper est-il obsolète en 2026 ?

Non : la licence MIT, le fonctionnement local et l'écosystème en font encore le standard des sous-titres et de l'auto-hébergement. Côté API, OpenAI recommande désormais gpt-transcribe et gpt-4o-transcribe, moins chers et plus récents que l'historique whisper-1.

Peut-on utiliser les deux ensemble ?

Oui : Whisper en local pour les fichiers sensibles (zéro coût, audio chez vous), et Gemini 3.5 Transcribe Live pour le temps réel et les agents vocaux.

Autres comparatifs