Outils Intelligence Artificielle
Accueil/ Actualités/ Modèles/ Gemini 3.5 Transcribe : Google lance un modèle vocal avec un mode Smart de nettoyage automatique
Modèles · 6 min de lecture

Gemini 3.5 Transcribe : Google lance un modèle vocal avec un mode Smart de nettoyage automatique

Google lance Gemini 3.5 Transcribe, le modèle voix-texte qui supprime les « euh » : déjà dans Gboard et l'appli Gemini, bientôt dans Chrome. Prix API publiés.

Illustration

Le 26 août 2026, Google a présenté Gemini 3.5 Transcribe, son modèle de reconnaissance vocale le plus précis, qui transforme la parole hésitante en texte net : il efface les « euh », suit vos corrections et formate la sortie. Le modèle est déjà en service dans Rambler sur les Pixel 11 et dans la dictée de l'appli Gemini sur macOS. Il arrivera dans Chrome.

À retenir · l'essentiel
Le faitGemini 3.5 Transcribe, présenté le 26 août 2026, est le modèle voix-texte le plus précis de Google.
Le mode SmartSuppression des « euh », corrections à la volée, formatage automatique ; le mode Verbatim, par défaut, conserve hésitations et répétitions.
Où il est déjàRambler sur Gboard (Pixel 11), appli Gemini sur macOS en anglais, aperçu public dans l'API Gemini.
Ce qui resteChrome (« bientôt »), la disponibilité en français, et le texte reformulé, pas seulement transcrit.
𝕏Google (@Google) · 26 août 2026 · traduit de l'anglais
Nous présentons Gemini 3.5 Transcribe, notre modèle de reconnaissance vocale le plus précis à ce jour. Il transforme l'audio en transcription précise dans plus de 85 langues, en retirant les mots de remplissage comme « ums » et « ahs », tout en gérant les autocorrections et en capturant votre intention.
Voir le post sur X

Qu'est-ce que Gemini 3.5 Transcribe ?

C'est un modèle de reconnaissance vocale, pas une application : il reçoit de l'audio et renvoie un texte qui ne ressemble pas à une transcription brute. Google résume : « contrairement aux modèles classiques, qui peinent avec le bruit et le jargon, Gemini 3.5 Transcribe convertit la parole brute directement en texte juste, soigné et formaté ».

L'annonce de Gemini 3.5 Transcribe sur le blog de Google, le 26 août 2026.
L'annonce de Gemini 3.5 Transcribe sur le blog de Google, le 26 août 2026.

Trois comportements le distinguent. En mode Smart, il supprime les mots de remplissage et gère vos reprises : dictez « on se voit mardi, non, mercredi », il écrit mercredi. Il apprend le mot rare grâce à un vocabulaire personnalisé, jargon métier et orthographes comprises. Côté application, l'orchestration Gemini peut aussi déléguer à d'autres modèles, comme générer une image ou résumer un fichier, capacité active pour l'instant dans l'appli macOS.

Deux API : la Live API (gemini-3.5-transcribe-live) pour le temps réel, latence inférieure à la seconde, changement de langue en cours de phrase, sans diarisation ni horodatage mot à mot ; la Interactions API (gemini-3.5-transcribe) pour l'audio préenregistré jusqu'à 60 minutes, avec locuteur et horodatage au mot près, pour jusqu'à huit locuteurs, l'attribution fine restant expérimentale au-delà de trois.

Gemini 3.5 Transcribe en chiffres
70 %
de gain sur le temps jusqu'à la transcription finale, par rapport à Chirp 3
2,6 %
d'erreur hors streaming, mesuré par Artificial Analysis (4,0 % en streaming)
5,50 %
d'erreur en streaming sur le benchmark multilingue FLEURS
85+
langues détectées automatiquement
8
locuteurs maximum, en fichier uniquement (attribution expérimentale au-delà de 3, pas de diarisation en Live)

Chirp 3, Whisper : où se situe le modèle ?

Gemini 3.5 Transcribe succède à Chirp 3, avec un « progrès majeur » en précision et latence : le temps jusqu'à la transcription finale s'améliore de 70 %, et le taux d'erreur tombe à 5,50 % en streaming sur FLEURS (5,04 % hors streaming), contre 7,32 % pour Chirp 3 cité par Ars Technica.

La comparaison utile reste Whisper, la référence open source : notre fiche. Sur l'indice AA-WER d'Artificial Analysis consulté le 27 août 2026, le modèle de Google est à 2,60 % d'erreurs, cinquième des douze modèles affichés ce jour-là (le classement varie selon le fournisseur, le jeu de données et la pagination de la page), devant Whisper Large v3. La nuance tient à la mesure : l'indice pondère trois corpus (AA-AgentTalk, VoxPopuli-Cleaned, Earnings22) à dominante anglaise, il ne dit donc rien de précis sur le français.

!
Ce que le modèle change fondamentalement

Les docs montrent un mode verbatim par défaut et un mode « smart » optionnel, qui nettoie, reformule et réorganise : c'est lui qui intéresse pour un e-mail ou un brouillon. Pour un verbatim, un compte rendu juridique ou médical, c'est une différence à assumer. Ars Technica, qui a pu tester Rambler, le dit ainsi : « l'IA change techniquement la formulation de ce que vous avez dit ».

Où le modèle arrive : Rambler, macOS, Antigravity, Chrome

Gboard Rambler est déjà en production, comme le notait notre article sur Made by Google 2026 : la saisie vocale présentée le 12 août sur les Pixel 11 reprend un propos hésitant et en fait un texte net.

Le déploiement
12 août 2026Rambler est présenté avec les Pixel 11, dans Gemini Intelligence.
26 août 2026Google dévoile Gemini 3.5 Transcribe : dictée macOS, aperçu API, Rambler comme vitrine.
« Bientôt »Chrome permettra de dicter du texte dans n'importe quel champ d'une page web.
SurfaceCe que ça apporteDisponibilité au 27 août 2026
Gboard Rambler (Android)Dictée sans « euh », édition par la voixEn service sur Pixel 11 ; extension annoncée dans l'année
Appli Gemini (macOS)Dictée, commandes vocales, appels de fonctionOui, en anglais
ChromeDicter dans n'importe quel champ web« Bientôt », sans date
API Gemini (AI Studio, Antigravity)Streaming en temps réel, audios préenregistrésAperçu public
Gemini Enterprise Agent PlatformTranscription pour entreprisesAperçu public ; « bientôt » pour Customer Experience

Le français et le prix : ce qui reste à confirmer

Le français ? Pour le modèle, oui : sa page produit liste, parmi les plus de 85 langues, l'anglais, l'espagnol, le français, le turc, le mandarin et le japonais. Pour les applis, c'est moins net : la dictée macOS démarre en anglais, Rambler sur Android est déployé dans des pays et des langues sélectionnés, sans liste. La France n'est pas confirmée pour Rambler, et aucune date n'est avancée pour Chrome.

Le prix est publié pour les développeurs, en dollars : en streaming, 3,50 $ le million de tokens d'entrée et 21 $ le million de tokens de sortie, soit environ 0,009 $ par minute d'audio ; pour l'audio préenregistré, 2 $ et 12 $, soit environ 0,005 $ par minute. Ces montants par minute sont des estimations fondées sur le volume de tokens audio et texte, pas un tarif forfaitaire. En streaming, seuls les tokens finalement retenus sont facturés. Aucun tarif grand public n'est annoncé : Gemini reste en freemium, et notre article sur les versions remet de l'ordre dans la famille.

Questions fréquentes

Gemini 3.5 Transcribe, c'est quoi ?

Le modèle voix-texte de Google annoncé le 26 août 2026 : la parole devient un texte net, sans mots de remplissage.

Est-ce disponible en français ?

Le modèle reconnaît plus de 85 langues, dont le français. Les applis démarrent en anglais sur macOS et dans des pays sélectionnés : la France n'est pas confirmée.

Est-ce gratuit ?

Aucun tarif grand public n'est annoncé. Côté API, environ 0,009 $ par minute en streaming et 0,005 $ pour l'audio préenregistré.

Mieux que Whisper ?

Sur l'indice AA-WER du 27 août 2026, oui : 2,6 % contre 4,1 % pour Whisper Large v3. Mais en mode Smart il reformule au lieu de transcrire mot à mot (le mode Verbatim, par défaut, restitue le brut), et n'est pas open source : Whisper reste la brique libre.

Là où chaque mot compte, vérifiez la sortie.