Whisper est la brique de transcription que beaucoup d'outils utilisent sans le dire ; Gemini 3.5 Transcribe est le nouveau modèle que Google veut mettre dans tous ses produits. Le premier est libre, gratuit et tourne chez vous ; le second, annoncé le 26 août 2026, est plus précis et sait nettoyer la parole, mais exige de lui confier votre audio. Le bon choix dépend moins de la qualité brute que de ce que vous acceptez de faire de vos enregistrements.
AvantageEn retrait
Les deux interfaces en un coup d'œil
Deux philosophies : la brique libre contre le texte déjà poli
Whisper est le modèle de reconnaissance vocale publié en open source par OpenAI en septembre 2022, entraîné sur 680 000 heures d'audio multilingue. Vous le téléchargez sous licence MIT, il tourne chez vous, et personne ne réécrit votre transcription : ce qui a été dit est ce qui est écrit. Gemini 3.5 Transcribe, présenté par Google le 26 août 2026 (notre article sur l'annonce), joue une autre partition : transformer la parole brute en texte « juste, soigné et formaté », pour reprendre le blog officiel. En mode Smart, il supprime les mots de remplissage, intègre vos corrections (dictez « mardi, non, mercredi », il écrit mercredi) et met en forme listes, dates et montants ; le mode Verbatim, par défaut, restitue le mot pour mot. Il équipe déjà la dictée de l'appli Gemini sur macOS et Rambler sur Android, et il arrive dans Chrome.


La ligne de partage n'est donc pas la précision brute, mais le rapport à votre audio. Whisper vous laisse propriétaire de toute la chaîne ; Gemini transforme votre voix en texte prêt à l'emploi, contre le passage par le cloud de Google. Ne confondez pas ce modèle avec Gemini, l'assistant conversationnel : la fiche de l'annuaire décrit ce dernier.
Précision : ce que dit l'index AA-WER
L'un des rares bancs publics comparant les deux familles sur une même échelle est l'index AA-WER d'Artificial Analysis, qui mesure la part de mots mal transcrits (plus bas vaut mieux). Relevé le 27 août 2026 :
| Modèle (source : Artificial Analysis, 27 août 2026) | AA-WER sur fichiers |
|---|---|
| Gemini 3.5 Transcribe (Google) | 2,6 % |
| Whisper Large v3 (fal.ai) | 4,1 % |
| Whisper Large v3 (Together AI) | 4,5 % |
| Whisper Large v3 Turbo (Groq) | 4,6 % |
| Whisper Large v3 (Replicate) | 10,1 % |
Google revendique lui-même ces 2,6 % pour l'audio préenregistré (4,0 % en streaming) dans son billet, « mesurés par Artificial Analysis ». Deux réserves de lecture s'imposent. D'abord, Whisper est un modèle multiplié par des hébergeurs : son score varie de 4,1 % à 10,1 % selon qui l'héberge. Ensuite, l'index pondère trois corpus, AA-AgentTalk (50 %), VoxPopuli-Cleaned (25 %) et Earnings22-Cleaned (25 %), une huitaine d'heures d'audio à dominante anglaise : il parle surtout de l'anglais difficile ; aucune mesure du français directement comparable ne figure dans le tableau consulté.
Google annonce par ailleurs un gain de 70 % sur le temps jusqu'à la transcription finale par rapport à Chirp 3, et 5,50 % d'erreur en streaming sur le benchmark multilingue FLEURS (5,04 % sur fichiers), contre 7,32 % pour Chirp 3, chiffre relayé par Ars Technica. En temps réel, le seul des deux à exister comme modèle dédié est Gemini 3.5 Transcribe Live : côté OpenAI, la transcription live repose sur d'autres modèles (gpt-live-transcribe, 0,017 $/min), et whisper-1 ne streame pas.
Ce que chacun restitue : verbatim ou texte fini
La nuance que les comparatifs rapides laissent de côté : Gemini 3.5 Transcribe sait faire les deux. La documentation API décrit deux modes. Par défaut, `verbatim` restitue le mot pour mot, « euh », répétitions et faux départs compris, et c'est le seul mode qui accepte la diarisation et l'horodatage au mot près. Le mode `smart` ressort un texte nettoyé, corrigé et structuré, mais il ne se combine ni avec l'horodatage ni avec la diarisation.
« Il reformule » est donc un choix de mode, pas une fatalité. Le modèle Whisper original, lui, ne propose pas nativement de nettoyage : il rend le flux brut, fidèle jusqu'aux bégaiements (une intégration comme WhisperX peut ajouter un post-traitement), et c'est exactement ce qu'on attend d'un verbatim de travail.
L'IA change techniquement la formulation de ce que vous avez dit, et cela peut ne pas convenir à toutes les situations. Ryan Whitwam, Ars TechnicaArs Technica · 26 août 2026 · traduit de l'anglais
Gemini 3.5 Transcribe est un modèle de fondation : sa fiche modèle publiée le 26 août 2026 mentionne le risque d'hallucinations, comme pour toute la famille Gemini. En mode « smart », le texte peut être raccourci ou réorganisé : c'est le contrat, à assumer pour un e-mail, à proscrire pour un compte rendu juridique. Whisper présente le défaut inverse, documenté de longue date : sur les silences ou l'audio très dégradé, il peut écrire des mots jamais prononcés. Les deux exigent une relecture.
Prix, confidentialité et intégrations : la question pratique
| Whisper | Gemini 3.5 Transcribe | |
|---|---|---|
| Gratuité | Licence MIT, usage local illimité | Pas de tarif grand public ; free tier API pour l'essai |
| Coût à l'usage (relevé le 27 août 2026) | API OpenAI : 0,003 à 0,006 $/min (gpt-4o-mini-transcribe, gpt-4o-transcribe) ; hébergeurs Whisper : 0,67 à 4,23 $ les 1 000 minutes | ~0,005 $/min en préenregistré (2 $ d'entrée, 12 $ de sortie par million de tokens) ; ~0,009 $/min en streaming (3,50 $ et 21 $) |
| Longueur d'audio | 25 Mo par fichier via l'API, illimité en local | 1 h par requête, 30 min dès qu'on active diarisation ou horodatage |
| Locuteurs | Pas de diarisation native | Jusqu'à 8 locuteurs, l'attribution au-delà de 3 restant expérimentale |
| Sous-titres | SRT, VTT, JSON, texte via l'API de transcription d'OpenAI | Texte et annotations au mot près, aucun format sous-titre |
| Français | Très bonne, éprouvé sur le terrain | fr-FR listé dans la doc du modèle ; applis en anglais et pays sélectionnés |
Côté intégrations, Whisper vit dans tout l'écosystème libre (whisper.cpp, faster-whisper, Hugging Face, Azure, Groq, une nuée d'applications de sous-titrage), tandis que Gemini 3.5 Transcribe s'adosse à la Live API et à ses partenaires officiels (LiveKit, Agora, Pipecat, Vercel), sans compter Gboard Rambler et Chrome. Le premier se branche partout, le second arrive déjà équipé dans les produits Google.
Le duo qui limite le mieux les défauts : Whisper en local pour les enregistrements sensibles et les gros volumes, à zéro euro et sans que l'audio sorte de la machine ; Gemini 3.5 Transcribe Live pour la dictée et les interfaces vocales, où sa latence et son mode « smart » font gagner du temps. Le premier archive fidèlement, le second répond pendant que vous parlez.
Le verdict : lequel choisir ?
Deux philosophies, pas de vainqueur universel : le badge « choix » serait un faux verdict, même si, sur les scores observés à cette date, Google mène.
Choisissez Whisper si vous sous-titrez ou indexez des contenus existants, traitez de gros volumes avec un budget nul, ou devez garantir que l'audio reste chez vous (juridique, santé, RH). Acceptez la mise en place technique, l'absence de diarisation native et la relecture des noms propres.
Choisissez Gemini 3.5 Transcribe si vous construisez une interface vocale ou un agent, dictez pendant que vous pensez, et voulez le meilleur score observé sur ce banc à cette date, avec un texte déjà propre. Acceptez le cloud, l'absence de tarif grand public et un déploiement encore limité en France.
Et si vous ne voulez pas choisir ? Utilisez les deux là où ils sont bons. Côté Google, la feuille de route (Chrome, français des applis, tarifs) reste en mouvement ; côté Whisper, la brique libre ne disparaîtra pas, et c'est souvent le meilleur argument pour commencer par elle.
Questions fréquentes
Gemini 3.5 Transcribe est-il meilleur que Whisper ?
Sur la précision mesurée par Artificial Analysis le 27 août 2026, oui : 2,6 % d'erreur contre 4,1 % à 4,6 % pour Whisper Large v3 selon l'hébergeur. Mais il est propriétaire, dans le cloud, et son mode « smart » reformule : pour un verbatim fidèle, Whisper reste la brique de référence.
Gemini 3.5 Transcribe est-il gratuit ?
Aucun tarif grand public n'est annoncé. Côté API, en aperçu public : environ 0,005 $ par minute d'audio en préenregistré et 0,009 $ en streaming. Whisper, lui, est gratuit en local (licence MIT).
Lequel est le moins cher ?
Whisper en local : zéro euro, quelle que soit la durée. Via une API, les hébergeurs Whisper (0,67 à 4,23 $ les 1 000 minutes) restent sous le tarif Gemini (environ 5 $ les 1 000 minutes en préenregistré).
Gemini 3.5 Transcribe fonctionne-t-il en français ?
Côté modèle, oui : la documentation liste fr-FR parmi les langues prises en charge, avec détection automatique. Côté applis, la dictée macOS démarre en anglais et Rambler est déployé dans des pays et langues sélectionnés : la France n'est pas confirmée.
Whisper est-il obsolète en 2026 ?
Non : la licence MIT, le fonctionnement local et l'écosystème en font encore le standard des sous-titres et de l'auto-hébergement. Côté API, OpenAI recommande désormais gpt-transcribe et gpt-4o-transcribe, moins chers et plus récents que l'historique whisper-1.
Peut-on utiliser les deux ensemble ?
Oui : Whisper en local pour les fichiers sensibles (zéro coût, audio chez vous), et Gemini 3.5 Transcribe Live pour le temps réel et les agents vocaux.



