Suno Speech : le générateur de musique IA se met à la voix parlée
Suno lance Speech en bêta publique : voix parlée et musique de fond générées ensemble dans une même piste, sur web et mobile, jusqu'à environ huit minutes.

Le générateur de chansons veut devenir un studio audio complet. Jeudi 1er octobre au soir, Suno a publié « Introducing Speech (beta) », un billet signé Jack Brody, son chief product officer. Speech y est présenté comme « le premier modèle audio qui génère la voix et la musique ensemble, dans une seule piste cohérente ». Après un mois de test en petit comité, la bêta est ouverte à tous, et le compte officiel de l'entreprise a relayé l'annonce dans la nuit.
Le lendemain, vendredi 2 octobre, The Verge a détaillé la fonction dans un article de Jess Weatherbed : Speech est disponible en bêta publique sur le web et dans l'application mobile. Le timing n'est pas anodin. La veille même, ElevenLabs, la référence de la voix générée, doublait sa valorisation à 22 milliards de dollars, pendant que la musique générative de Suno reste engluée dans les procès. Avec Speech, la plateforme de génération de musique empiète sur un terrain voisin, et très rentable.

Speech est désormais en bêta. Essayez le tout premier modèle qui crée de l'audio parlé avec une musique de fond assortie. Mettez votre application à jour pour disposer de la dernière version. En savoir plus ici : suno.com/blog/introducing-speech-betaVoir le post sur X
Comment fonctionne Suno Speech
D'après The Verge, la fonction s'atteint depuis l'onglet de création. Deux modes y sont décrits : le mode Simple, où l'on décrit l'idée en une phrase (l'exemple donné : « un capitaine pirate haranguant son équipage »), et le mode Avancé, où l'on fournit son propre script et règle le genre de la voix, le style de parole et la variabilité d'une génération à l'autre. La musique de fond peut être coupée d'une simple bascule pour n'obtenir que la voix nue. Une génération atteint environ huit minutes au maximum.
Le billet d'annonce donne le ton avec les expériences de l'équipe pendant le développement : des SMS d'amis transformés en lectures dramatiques surproduites, des messages vocaux gratifiés de musiques épiques imméritées, des méditations, des poèmes et des histoires du soir pour les enfants. Le visuel du billet illustre l'amplitude des styles proposés, de la méditation à la voix douce au banter écossais de pub avec cornemuses, en passant par une liste de courses lue en anglais victorien sur fond de clavecin.
Le tableau ci-dessous résume ce que la fonction fait aujourd'hui, et ce qu'elle ne fait pas encore, tel que l'annoncent Suno et The Verge.
| Ce que Speech fait | Ce que Speech ne fait pas (encore) |
|---|---|
| Génère voix parlée et musique de fond en une seule piste | Stabiliser l'accent : les accents britanniques peuvent dériver jusqu'à l'australien |
| Se pilote en mode Simple ou Avancé (script, genre, style, variabilité) | Mesurer ses pauses : elles « peuvent être très dramatiques », reconnaît Suno |
| Permet de couper la musique de fond pour ne garder que la voix | Préciser l'offre requise ou la disponibilité géographique : le billet n'en dit rien |
| Produit des pistes d'environ huit minutes maximum | S'appuyer sur un test indépendant : aucun n'a encore été publié |
Une bêta qui assume ses défauts
Le chief product officer ne cherche pas à vendre la perfection. La citation vaut d'être lue en entier, car ce type d'aveu reste rare dans une annonce de produit.
La bêta est vraiment une bêta. Parfois, les accents britanniques partent en Australie avant de revenir. Les pauses dramatiques peuvent être très dramatiques. Vous découvrirez presque certainement des usages auxquels nous n'avions jamais pensé.Jack Brody, chief product officer de Suno (billet du 1er octobre 2026)
Suno promet d'améliorer la fonction au fil des retours des utilisateurs, en apprenant « ce que la communauté aime, ce qui ne fonctionne pas encore et ce qu'elle veut faire ensuite ». Le billet ne précise ni date de sortie de bêta, ni modèle technique sous-jacent.
Une diversification pendant la pression judiciaire
Speech arrive au terme d'un automne défensif pour Suno. La plateforme reste poursuivie aux États-Unis par Universal et Sony depuis la plainte déposée en juin 2024, et le tribunal de Munich lui a donné majoritairement tort face à la GEMA le 31 juillet 2026, sans fixer de dommages. Une guerre juridique qui dépasse Suno : fin août, 35 éditeurs musicaux ont aussi attaqué Anthropic pour ses paroles piratées.
En parallèle, l'entreprise a enchaîné les gestes d'apaisement : filigrane audio sur ses morceaux en août, puis familles de modèles v6 entraînées sous licence avec Warner, BMG et Believe en septembre. Speech ouvre un second front, la voix, là où son concurrent direct Udio n'est pas allé. Le signal économique est passé dans la même interview : Suno revendique « bien au-delà » de ses deux millions d'abonnés et 300 millions de dollars de revenus annuels annoncés en dernier chiffre officiel.
Que change Speech dans la guerre de la voix ?
Sur la voix seule, Suno débarque tard : The Verge rappelle que DeepMind explore la synthèse vocale par apprentissage profond depuis une décennie, qu'Adobe propose son propre outil de texte vers parole et qu'ElevenLabs s'est imposé comme la plateforme la plus visible depuis 2023. L'argument de Suno n'est donc pas la qualité brute de la voix, mais la cohésion : une narration et son habillage musical générés ensemble, dans le même mouvement, plutôt que collés l'un à l'autre en postproduction.
Pour de la narration pure, un générateur de voix dédié reste la voie raisonnable : notre guide du jour sur les meilleurs générateurs de voix IA détaille quel outil choisir selon l'usage, de la voix off au doublage. Pour croiser les options musicales, nos face-à-face Suno vs Udio et AIVA vs Suno restent la référence.
Le post officiel le dit lui-même : « mettez votre application à jour » pour voir apparaître Speech sur mobile.
Questions fréquentes
Suno Speech est-il gratuit ?
L'offre requise n'est pas précisée. La bêta est ouverte « à tous » selon le billet ; les forfaits relevés le 2 octobre sur la page de tarifs affichent Free à 0 €, Pro à 9 € par mois (7,20 € en facturation annuelle) et Premier à 28 € par mois (22 € en annuel).
Suno Speech est-il disponible en France ?
Aucune restriction géographique n'est annoncée dans le billet ni dans l'article de The Verge ; Suno lui-même est utilisable depuis la France, comme le documente notre fiche.
Quelle différence entre les modes Simple et Avancé ?
Simple génère à partir d'une description en une phrase ; Avancé prend un script et permet de régler le genre de la voix, le style et la variabilité, détaille The Verge.
Suno Speech remplace-t-il ElevenLabs ?
Non, les deux se chevauchent désormais : Speech ajoute la musique à la voix, ElevenLabs reste spécialisé sur la voix seule. Notre guide des générateurs de voix IA aide à choisir selon l'usage.
Combien de temps dure une piste Speech ?
Environ huit minutes maximum, selon The Verge.


