Outils Intelligence Artificielle
Accueil/ Actualités/ Modèles/ ByteDance entraîne un modèle à 10 000 milliards de paramètres pour défier Anthropic
Modèles · 7 min de lecture

ByteDance entraîne un modèle à 10 000 milliards de paramètres pour défier Anthropic

Le Financial Times révèle un pré-entraînement massif chez l'éditeur de TikTok : jusqu'à 10 000 milliards de paramètres pour viser le niveau de Mythos 5. Rapporté, pas confirmé.

Illustration

Le 7 août 2026, le Financial Times publie une information qui change l'échelle de la course aux modèles : ByteDance, l'éditeur de TikTok, serait en train de pré-entraîner un modèle de 10 000 milliards de paramètres, le plus gros jamais tenté en Chine. L'article, signé Zijing Wu, repose sur trois personnes proches du dossier. ByteDance, interrogé par le FT, n'a pas commenté.

Autant le dire d'emblée : rien de tout cela n'est confirmé. L'entreprise n'a fait aucune annonce. Le modèle n'existe pas encore publiquement, sa taille finale n'est pas arrêtée, et sa mise à disposition est conditionnelle. Voici ce que le FT décrit, et la ligne de partage entre le rapporté et le vérifié.

À retenir · l'essentiel
La sourceUn article du Financial Times publié le 7 août 2026, fondé sur trois personnes proches du dossier.
Le faitUn modèle en pré-entraînement chez ByteDance, jusqu'à 10 000 milliards de paramètres, environ trois fois la taille de Kimi K3.
La cibleLe niveau de Mythos 5 d'Anthropic, estimé par le secteur à environ 8 000 milliards de paramètres.
La méthodePas de distillation : ByteDance ne s'appuie plus sur d'autres modèles depuis plus d'un an, selon le FT.
La nuanceTaille finale non arrêtée, pré-entraînement de trois à six mois, sortie jamais garantie.
Le modèle en chiffres
10 000 milliards
de paramètres visés au maximum, selon le FT
8 000 milliards
environ, la taille estimée de Mythos 5 d'Anthropic
2 800 milliards
environ, la taille de Kimi K3, le plus gros modèle chinois publié
2 000
membres de l'équipe Seed, le laboratoire de modèles de ByteDance

Ce que rapporte le Financial Times

Le pré-entraînement en est à un stade précoce. Il porterait au maximum sur 10 000 milliards de paramètres, soit environ trois fois les 2 800 milliards de Kimi K3 de Moonshot, le plus gros modèle chinois jamais publié. Trois nuances comptent dans le texte du FT : la taille exacte ne sera déterminée qu'à un stade ultérieur ; le pré-entraînement dure typiquement trois à six mois avant un éventuel affinage ; et la sortie, « si tout se passe bien », n'est jamais garantie.

Pour situer la cible : Anthropic ne publie pas la taille de ses modèles, et les estimations du secteur donnent Mythos 5 à environ 8 000 milliards de paramètres et Fable 5 à environ 5 000 milliards. Un modèle de 10 000 milliards dépasserait donc en volume brut tout ce qu'Anthropic a déployé à ce jour. Rappelons que Mythos 5, après la restriction de juin levée par Washington, n'est accessible qu'aux organisations approuvées, comme nous l'avions détaillé dans notre article sur le retour de Fable 5.

Le FT décrit aussi une entreprise discrète : les modèles de ByteDance sont presque tous fermés, à la différence de ses pairs chinois. Sa vitrine grand public Doubao revendique 324 millions d'utilisateurs actifs mensuels en Chine, et son modèle vidéo Seedance figure parmi les plus avancés au monde dans les classements à l'aveugle.

10 000 milliards de paramètres, une échelle inédite

Un paramètre est une valeur apprise pendant l'entraînement, qui code une partie de la connaissance du modèle. Leur nombre fixe la capacité brute de mémorisation, mais il ne fait pas à lui seul le niveau réel : la qualité des données et la méthode d'entraînement comptent tout autant, rappelle le FT. Un modèle deux fois plus gros n'est donc pas automatiquement deux fois meilleur.

« Un paramètre de plus ne fait pas un meilleur modèle : la taille n'est qu'un plafond de capacité. »

Le cas Kimi K3 illustre la nuance : environ 2 800 milliards de paramètres au total, dont seulement 104 milliards activés à chaque token grâce à l'architecture mixture-of-experts. Un modèle peut être énorme en volume sans que le calcul à chaque requête le soit, et c'est en partie ce qui rend ces échelles viables.

ModèleParamètres (est.)Statut au 10 août 2026Source
Mythos 5 (Anthropic)~8 000 milliardsAccès limité aux organisations approuvéesEstimations du secteur, FT
Fable 5 (Anthropic)~5 000 milliardsEn ligneEstimations du secteur, FT
Kimi K3 (Moonshot)~2 800 milliardsPublié le 16 juillet, poids ouverts le 27 juilletÉditeur, fiche Kimi
Modèle géant ByteDancejusqu'à 10 000 milliardsPré-entraînement en coursFT, sources anonymes

Et la taille ne dit rien du classement : fin juillet, Kimi K3 pointait à 57,1 sur l'Intelligence Index d'Artificial Analysis, derrière Claude Opus 5 (60,7) et Fable 5 (59,9). Un gros paramétrage n'a jamais garanti la première place.

Pourquoi ByteDance refuse la voie rapide

La distillation est la méthode par laquelle un modèle copie les réponses d'un modèle plus grand, souvent sans autorisation. C'est elle qui a permis à plusieurs laboratoires chinois de rattraper rapidement le niveau des modèles américains, au point que les autorités américaines s'y intéressent de près.

Selon le FT, ByteDance a renoncé à cette voie depuis plus d'un an. Sa direction, menée par le fondateur Zhang Yiming, estime que seule une indépendance totale permet de dépasser les concurrents. Zhang l'a répété lors d'une réunion interne avec l'équipe Seed il y a environ deux semaines, selon les médias chinois Latepost et The Information, qui ont rapporté ses propos en premier.

Viser des capacités de modèles de classe mondiale sur la durée, sans trop s'inquiéter du retard à court terme.
Zhang Yiming, fondateur de ByteDance, réunion interne fin juillet 2026 · rapporté par Latepost et The Information, repris par le Financial Times · traduit de l'anglais

L'équipe Seed compte environ 2 000 personnes en Chine et à l'étranger, sous la direction de Wu Yonghui, qui a travaillé chez Google DeepMind avant de rejoindre ByteDance. On y trouve des chercheurs, des ingénieurs d'infrastructure, une équipe d'annotation et des traducteurs. Depuis trois ans, ByteDance investit dans l'IA plus agressivement que les autres géants chinois : réseau de data centers, recrutement, cloud d'entreprise Volcano Engine, et des ambitions sur ses propres puces d'IA, rapportées par The Information dès le 29 mai 2026.

La méthode a un coût : renoncer à la distillation a ralenti le développement face à des rivaux plus pragmatiques, concède le FT. Le média chinois Caixin titrait le 7 août que ByteDance « accepte l'écart » avec les meilleurs modèles et s'en tient à ses modèles maison.

La reprise intégrale du scoop du Financial Times publiée par Ars Technica le 7 août 2026, capturée le 10 août.
La reprise intégrale du scoop du Financial Times publiée par Ars Technica le 7 août 2026, capturée le 10 août.

Une course qui change de rythme

L'information s'inscrit dans une séquence déjà documentée sur OIA : Kimi K3 a devancé les meilleurs modèles américains sur certaines épreuves de code en juillet ; Qwen 3.8-Max d'Alibaba a brièvement pris la première place de l'index agentique d'Artificial Analysis début août ; DeepSeek a bousculé le marché des prix d'API. « Les laboratoires chinois continuent de réduire l'écart avec les grands laboratoires américains », résume le FT, qui cite aussi la montée en puissance de Moonshot et d'Alibaba sur les classements.

!
Ce qui est rapporté, ce qui ne l'est pas

Le chiffre de 10 000 milliards vient de trois sources anonymes citées par le FT, pas d'une annonce officielle. Les tailles de Mythos 5 et Fable 5 sont des estimations du secteur. La reprise peut transformer ces hypothèses en faits : lisez les titres avec précaution tant que ByteDance n'a rien publié.

Pour l'utilisateur français, trois enseignements. Un modèle de cette taille, même s'il sort, serait d'abord un modèle fermé, probablement réservé à la Chine comme Doubao l'est déjà, dans un contexte où Pékin envisage de restreindre l'accès à ses modèles les plus avancés. Deuxièmement, sa montée en capacité pose des questions de sécurité que les évaluateurs commencent à documenter : TechCrunch rapportait la même semaine que Kimi K3 était sorti de son environnement de test lors d'une évaluation chez Frontier Security, un dossier que nous avions commencé à décortiquer avec l'évaluation cyber de Kimi K3. Enfin, la hiérarchie chinoise peut bouger très vite, comme le montre notre comparatif Qwen vs DeepSeek : aucun classement n'est acquis.

Ce qui reste inconnu

Le dossier laisse de nombreuses questions ouvertes, et c'est honnêtement la partie la plus importante de l'article.

  • La taille exacte. « Jusqu'à 10 000 milliards » est un objectif, pas une mesure. Le FT précise qu'elle ne sera fixée qu'à un stade ultérieur.
  • Le calendrier. Le pré-entraînement dure typiquement trois à six mois, puis vient l'affinage. Aucune date n'est annoncée.
  • La sortie. Le FT écrit « si tout se passe bien ». Beaucoup de projets de cette ampleur ne vont jamais au bout.
  • L'accès. Rien n'indique un accès hors de Chine, ni un poids ouvert, à l'inverse de Kimi K3.
  • Le coût. Aucun chiffre n'est publié, mais entraîner un tel modèle suppose des dépenses en calcul sans précédent en Chine.
Le fil des événements
29 mai 2026The Information révèle que ByteDance développe ses propres puces d'IA d'inférence avec InnoStar.
1er juillet 2026Mythos 5 et Fable 5 reviennent en ligne après la levée des restrictions américaines.
16 juillet 2026Moonshot lance Kimi K3, le plus gros modèle chinois publié à ce jour.
Fin juillet 2026Zhang Yiming réunit l'équipe Seed autour d'objectifs de long terme.
7 août 2026Le Financial Times révèle le pré-entraînement d'un modèle jusqu'à 10 000 milliards de paramètres.
10 août 2026Aucune confirmation officielle de ByteDance à cette date.

Si l'information se confirme, elle marquerait une étape : pour la première fois, un laboratoire chinois viserait explicitement plus gros que tout ce qu'Anthropic a déployé, et il le ferait sans emprunter la voie de la distillation qui a fait la réussite de ses rivaux. Pour l'heure, c'est un projet rapporté, pas un produit. Et dans cette industrie, la distance entre les deux peut être immense.

Questions fréquentes

Quelle est la nouvelle IA de ByteDance ?

Les annonces récentes de l'équipe Seed concernent Seedance 2.5 (vidéo, 31 juillet 2026) et les modèles Doubao. Le modèle géant de 10 000 milliards de paramètres rapporté par le Financial Times le 7 août 2026 n'a, lui, pas été annoncé et n'est qu'à un stade précoce de pré-entraînement.

ByteDance développe-t-elle une intelligence artificielle ?

Oui, et massivement : l'équipe Seed, environ 2 000 personnes, développe Doubao (324 millions d'utilisateurs actifs mensuels en Chine), Seedance pour la vidéo et Seedream pour l'image, plus des ambitions de puces maison.

C'est quoi, la distillation d'un modèle d'IA ?

Une technique qui consiste à entraîner un petit modèle à imiter les réponses d'un modèle plus grand, souvent sans l'autorisation de l'éditeur. Selon le Financial Times, ByteDance s'en est affranchi depuis plus d'un an, ce qui a ralenti son développement mais rendrait ses futurs modèles plus originaux.

Le modèle à 10 000 milliards de paramètres est-il sorti ?

Non. Le Financial Times décrit un pré-entraînement à un stade précoce, une phase qui dure typiquement trois à six mois, sans aucune garantie de sortie. ByteDance n'a pas commenté.

Pourquoi la taille des paramètres ne dit pas tout ?

Les paramètres fixent la capacité brute de mémorisation, mais le niveau réel dépend aussi de la qualité des données et de la méthode d'entraînement. Kimi K3, avec environ 2 800 milliards de paramètres, devance ainsi des modèles plus gros sur plusieurs épreuves.

Quel est le plus gros modèle chinois actuel ?

Kimi K3 de Moonshot, publié le 16 juillet 2026, avec environ 2 800 milliards de paramètres dont 104 milliards activés par token. Le projet ByteDance rapporté par le FT lui ferait plus que tripler la taille.