Gemini 3.5 Transcribe : Google lance un modèle vocal avec un mode Smart de nettoyage automatique
Google lance Gemini 3.5 Transcribe, le modèle voix-texte qui supprime les « euh » : déjà dans Gboard et l'appli Gemini, bientôt dans Chrome. Prix API publiés.

Le 26 août 2026, Google a présenté Gemini 3.5 Transcribe, son modèle de reconnaissance vocale le plus précis, qui transforme la parole hésitante en texte net : il efface les « euh », suit vos corrections et formate la sortie. Le modèle est déjà en service dans Rambler sur les Pixel 11 et dans la dictée de l'appli Gemini sur macOS. Il arrivera dans Chrome.
Nous présentons Gemini 3.5 Transcribe, notre modèle de reconnaissance vocale le plus précis à ce jour. Il transforme l'audio en transcription précise dans plus de 85 langues, en retirant les mots de remplissage comme « ums » et « ahs », tout en gérant les autocorrections et en capturant votre intention.Voir le post sur X
Qu'est-ce que Gemini 3.5 Transcribe ?
C'est un modèle de reconnaissance vocale, pas une application : il reçoit de l'audio et renvoie un texte qui ne ressemble pas à une transcription brute. Google résume : « contrairement aux modèles classiques, qui peinent avec le bruit et le jargon, Gemini 3.5 Transcribe convertit la parole brute directement en texte juste, soigné et formaté ».

Trois comportements le distinguent. En mode Smart, il supprime les mots de remplissage et gère vos reprises : dictez « on se voit mardi, non, mercredi », il écrit mercredi. Il apprend le mot rare grâce à un vocabulaire personnalisé, jargon métier et orthographes comprises. Côté application, l'orchestration Gemini peut aussi déléguer à d'autres modèles, comme générer une image ou résumer un fichier, capacité active pour l'instant dans l'appli macOS.
Deux API : la Live API (gemini-3.5-transcribe-live) pour le temps réel, latence inférieure à la seconde, changement de langue en cours de phrase, sans diarisation ni horodatage mot à mot ; la Interactions API (gemini-3.5-transcribe) pour l'audio préenregistré jusqu'à 60 minutes, avec locuteur et horodatage au mot près, pour jusqu'à huit locuteurs, l'attribution fine restant expérimentale au-delà de trois.
Chirp 3, Whisper : où se situe le modèle ?
Gemini 3.5 Transcribe succède à Chirp 3, avec un « progrès majeur » en précision et latence : le temps jusqu'à la transcription finale s'améliore de 70 %, et le taux d'erreur tombe à 5,50 % en streaming sur FLEURS (5,04 % hors streaming), contre 7,32 % pour Chirp 3 cité par Ars Technica.
La comparaison utile reste Whisper, la référence open source : notre fiche. Sur l'indice AA-WER d'Artificial Analysis consulté le 27 août 2026, le modèle de Google est à 2,60 % d'erreurs, cinquième des douze modèles affichés ce jour-là (le classement varie selon le fournisseur, le jeu de données et la pagination de la page), devant Whisper Large v3. La nuance tient à la mesure : l'indice pondère trois corpus (AA-AgentTalk, VoxPopuli-Cleaned, Earnings22) à dominante anglaise, il ne dit donc rien de précis sur le français.
Les docs montrent un mode verbatim par défaut et un mode « smart » optionnel, qui nettoie, reformule et réorganise : c'est lui qui intéresse pour un e-mail ou un brouillon. Pour un verbatim, un compte rendu juridique ou médical, c'est une différence à assumer. Ars Technica, qui a pu tester Rambler, le dit ainsi : « l'IA change techniquement la formulation de ce que vous avez dit ».
Où le modèle arrive : Rambler, macOS, Antigravity, Chrome
Gboard Rambler est déjà en production, comme le notait notre article sur Made by Google 2026 : la saisie vocale présentée le 12 août sur les Pixel 11 reprend un propos hésitant et en fait un texte net.
| Surface | Ce que ça apporte | Disponibilité au 27 août 2026 |
|---|---|---|
| Gboard Rambler (Android) | Dictée sans « euh », édition par la voix | En service sur Pixel 11 ; extension annoncée dans l'année |
| Appli Gemini (macOS) | Dictée, commandes vocales, appels de fonction | Oui, en anglais |
| Chrome | Dicter dans n'importe quel champ web | « Bientôt », sans date |
| API Gemini (AI Studio, Antigravity) | Streaming en temps réel, audios préenregistrés | Aperçu public |
| Gemini Enterprise Agent Platform | Transcription pour entreprises | Aperçu public ; « bientôt » pour Customer Experience |
Le français et le prix : ce qui reste à confirmer
Le français ? Pour le modèle, oui : sa page produit liste, parmi les plus de 85 langues, l'anglais, l'espagnol, le français, le turc, le mandarin et le japonais. Pour les applis, c'est moins net : la dictée macOS démarre en anglais, Rambler sur Android est déployé dans des pays et des langues sélectionnés, sans liste. La France n'est pas confirmée pour Rambler, et aucune date n'est avancée pour Chrome.
Le prix est publié pour les développeurs, en dollars : en streaming, 3,50 $ le million de tokens d'entrée et 21 $ le million de tokens de sortie, soit environ 0,009 $ par minute d'audio ; pour l'audio préenregistré, 2 $ et 12 $, soit environ 0,005 $ par minute. Ces montants par minute sont des estimations fondées sur le volume de tokens audio et texte, pas un tarif forfaitaire. En streaming, seuls les tokens finalement retenus sont facturés. Aucun tarif grand public n'est annoncé : Gemini reste en freemium, et notre article sur les versions remet de l'ordre dans la famille.
Questions fréquentes
Gemini 3.5 Transcribe, c'est quoi ?
Le modèle voix-texte de Google annoncé le 26 août 2026 : la parole devient un texte net, sans mots de remplissage.
Est-ce disponible en français ?
Le modèle reconnaît plus de 85 langues, dont le français. Les applis démarrent en anglais sur macOS et dans des pays sélectionnés : la France n'est pas confirmée.
Est-ce gratuit ?
Aucun tarif grand public n'est annoncé. Côté API, environ 0,009 $ par minute en streaming et 0,005 $ pour l'audio préenregistré.
Mieux que Whisper ?
Sur l'indice AA-WER du 27 août 2026, oui : 2,6 % contre 4,1 % pour Whisper Large v3. Mais en mode Smart il reformule au lieu de transcrire mot à mot (le mode Verbatim, par défaut, restitue le brut), et n'est pas open source : Whisper reste la brique libre.
Là où chaque mot compte, vérifiez la sortie.


