ByteDance entraîne un modèle à 10 000 milliards de paramètres pour défier Anthropic
Le Financial Times révèle un pré-entraînement massif chez l'éditeur de TikTok : jusqu'à 10 000 milliards de paramètres pour viser le niveau de Mythos 5. Rapporté, pas confirmé.

Le 7 août 2026, le Financial Times publie une information qui change l'échelle de la course aux modèles : ByteDance, l'éditeur de TikTok, serait en train de pré-entraîner un modèle de 10 000 milliards de paramètres, le plus gros jamais tenté en Chine. L'article, signé Zijing Wu, repose sur trois personnes proches du dossier. ByteDance, interrogé par le FT, n'a pas commenté.
Autant le dire d'emblée : rien de tout cela n'est confirmé. L'entreprise n'a fait aucune annonce. Le modèle n'existe pas encore publiquement, sa taille finale n'est pas arrêtée, et sa mise à disposition est conditionnelle. Voici ce que le FT décrit, et la ligne de partage entre le rapporté et le vérifié.
Ce que rapporte le Financial Times
Le pré-entraînement en est à un stade précoce. Il porterait au maximum sur 10 000 milliards de paramètres, soit environ trois fois les 2 800 milliards de Kimi K3 de Moonshot, le plus gros modèle chinois jamais publié. Trois nuances comptent dans le texte du FT : la taille exacte ne sera déterminée qu'à un stade ultérieur ; le pré-entraînement dure typiquement trois à six mois avant un éventuel affinage ; et la sortie, « si tout se passe bien », n'est jamais garantie.
Pour situer la cible : Anthropic ne publie pas la taille de ses modèles, et les estimations du secteur donnent Mythos 5 à environ 8 000 milliards de paramètres et Fable 5 à environ 5 000 milliards. Un modèle de 10 000 milliards dépasserait donc en volume brut tout ce qu'Anthropic a déployé à ce jour. Rappelons que Mythos 5, après la restriction de juin levée par Washington, n'est accessible qu'aux organisations approuvées, comme nous l'avions détaillé dans notre article sur le retour de Fable 5.
Le FT décrit aussi une entreprise discrète : les modèles de ByteDance sont presque tous fermés, à la différence de ses pairs chinois. Sa vitrine grand public Doubao revendique 324 millions d'utilisateurs actifs mensuels en Chine, et son modèle vidéo Seedance figure parmi les plus avancés au monde dans les classements à l'aveugle.
10 000 milliards de paramètres, une échelle inédite
Un paramètre est une valeur apprise pendant l'entraînement, qui code une partie de la connaissance du modèle. Leur nombre fixe la capacité brute de mémorisation, mais il ne fait pas à lui seul le niveau réel : la qualité des données et la méthode d'entraînement comptent tout autant, rappelle le FT. Un modèle deux fois plus gros n'est donc pas automatiquement deux fois meilleur.
« Un paramètre de plus ne fait pas un meilleur modèle : la taille n'est qu'un plafond de capacité. »
Le cas Kimi K3 illustre la nuance : environ 2 800 milliards de paramètres au total, dont seulement 104 milliards activés à chaque token grâce à l'architecture mixture-of-experts. Un modèle peut être énorme en volume sans que le calcul à chaque requête le soit, et c'est en partie ce qui rend ces échelles viables.
| Modèle | Paramètres (est.) | Statut au 10 août 2026 | Source |
|---|---|---|---|
| Mythos 5 (Anthropic) | ~8 000 milliards | Accès limité aux organisations approuvées | Estimations du secteur, FT |
| Fable 5 (Anthropic) | ~5 000 milliards | En ligne | Estimations du secteur, FT |
| Kimi K3 (Moonshot) | ~2 800 milliards | Publié le 16 juillet, poids ouverts le 27 juillet | Éditeur, fiche Kimi |
| Modèle géant ByteDance | jusqu'à 10 000 milliards | Pré-entraînement en cours | FT, sources anonymes |
Et la taille ne dit rien du classement : fin juillet, Kimi K3 pointait à 57,1 sur l'Intelligence Index d'Artificial Analysis, derrière Claude Opus 5 (60,7) et Fable 5 (59,9). Un gros paramétrage n'a jamais garanti la première place.
Pourquoi ByteDance refuse la voie rapide
La distillation est la méthode par laquelle un modèle copie les réponses d'un modèle plus grand, souvent sans autorisation. C'est elle qui a permis à plusieurs laboratoires chinois de rattraper rapidement le niveau des modèles américains, au point que les autorités américaines s'y intéressent de près.
Selon le FT, ByteDance a renoncé à cette voie depuis plus d'un an. Sa direction, menée par le fondateur Zhang Yiming, estime que seule une indépendance totale permet de dépasser les concurrents. Zhang l'a répété lors d'une réunion interne avec l'équipe Seed il y a environ deux semaines, selon les médias chinois Latepost et The Information, qui ont rapporté ses propos en premier.
Viser des capacités de modèles de classe mondiale sur la durée, sans trop s'inquiéter du retard à court terme.Zhang Yiming, fondateur de ByteDance, réunion interne fin juillet 2026 · rapporté par Latepost et The Information, repris par le Financial Times · traduit de l'anglais
L'équipe Seed compte environ 2 000 personnes en Chine et à l'étranger, sous la direction de Wu Yonghui, qui a travaillé chez Google DeepMind avant de rejoindre ByteDance. On y trouve des chercheurs, des ingénieurs d'infrastructure, une équipe d'annotation et des traducteurs. Depuis trois ans, ByteDance investit dans l'IA plus agressivement que les autres géants chinois : réseau de data centers, recrutement, cloud d'entreprise Volcano Engine, et des ambitions sur ses propres puces d'IA, rapportées par The Information dès le 29 mai 2026.
La méthode a un coût : renoncer à la distillation a ralenti le développement face à des rivaux plus pragmatiques, concède le FT. Le média chinois Caixin titrait le 7 août que ByteDance « accepte l'écart » avec les meilleurs modèles et s'en tient à ses modèles maison.

Une course qui change de rythme
L'information s'inscrit dans une séquence déjà documentée sur OIA : Kimi K3 a devancé les meilleurs modèles américains sur certaines épreuves de code en juillet ; Qwen 3.8-Max d'Alibaba a brièvement pris la première place de l'index agentique d'Artificial Analysis début août ; DeepSeek a bousculé le marché des prix d'API. « Les laboratoires chinois continuent de réduire l'écart avec les grands laboratoires américains », résume le FT, qui cite aussi la montée en puissance de Moonshot et d'Alibaba sur les classements.
Le chiffre de 10 000 milliards vient de trois sources anonymes citées par le FT, pas d'une annonce officielle. Les tailles de Mythos 5 et Fable 5 sont des estimations du secteur. La reprise peut transformer ces hypothèses en faits : lisez les titres avec précaution tant que ByteDance n'a rien publié.
Pour l'utilisateur français, trois enseignements. Un modèle de cette taille, même s'il sort, serait d'abord un modèle fermé, probablement réservé à la Chine comme Doubao l'est déjà, dans un contexte où Pékin envisage de restreindre l'accès à ses modèles les plus avancés. Deuxièmement, sa montée en capacité pose des questions de sécurité que les évaluateurs commencent à documenter : TechCrunch rapportait la même semaine que Kimi K3 était sorti de son environnement de test lors d'une évaluation chez Frontier Security, un dossier que nous avions commencé à décortiquer avec l'évaluation cyber de Kimi K3. Enfin, la hiérarchie chinoise peut bouger très vite, comme le montre notre comparatif Qwen vs DeepSeek : aucun classement n'est acquis.
Ce qui reste inconnu
Le dossier laisse de nombreuses questions ouvertes, et c'est honnêtement la partie la plus importante de l'article.
- La taille exacte. « Jusqu'à 10 000 milliards » est un objectif, pas une mesure. Le FT précise qu'elle ne sera fixée qu'à un stade ultérieur.
- Le calendrier. Le pré-entraînement dure typiquement trois à six mois, puis vient l'affinage. Aucune date n'est annoncée.
- La sortie. Le FT écrit « si tout se passe bien ». Beaucoup de projets de cette ampleur ne vont jamais au bout.
- L'accès. Rien n'indique un accès hors de Chine, ni un poids ouvert, à l'inverse de Kimi K3.
- Le coût. Aucun chiffre n'est publié, mais entraîner un tel modèle suppose des dépenses en calcul sans précédent en Chine.
Si l'information se confirme, elle marquerait une étape : pour la première fois, un laboratoire chinois viserait explicitement plus gros que tout ce qu'Anthropic a déployé, et il le ferait sans emprunter la voie de la distillation qui a fait la réussite de ses rivaux. Pour l'heure, c'est un projet rapporté, pas un produit. Et dans cette industrie, la distance entre les deux peut être immense.
Questions fréquentes
Quelle est la nouvelle IA de ByteDance ?
Les annonces récentes de l'équipe Seed concernent Seedance 2.5 (vidéo, 31 juillet 2026) et les modèles Doubao. Le modèle géant de 10 000 milliards de paramètres rapporté par le Financial Times le 7 août 2026 n'a, lui, pas été annoncé et n'est qu'à un stade précoce de pré-entraînement.
ByteDance développe-t-elle une intelligence artificielle ?
Oui, et massivement : l'équipe Seed, environ 2 000 personnes, développe Doubao (324 millions d'utilisateurs actifs mensuels en Chine), Seedance pour la vidéo et Seedream pour l'image, plus des ambitions de puces maison.
C'est quoi, la distillation d'un modèle d'IA ?
Une technique qui consiste à entraîner un petit modèle à imiter les réponses d'un modèle plus grand, souvent sans l'autorisation de l'éditeur. Selon le Financial Times, ByteDance s'en est affranchi depuis plus d'un an, ce qui a ralenti son développement mais rendrait ses futurs modèles plus originaux.
Le modèle à 10 000 milliards de paramètres est-il sorti ?
Non. Le Financial Times décrit un pré-entraînement à un stade précoce, une phase qui dure typiquement trois à six mois, sans aucune garantie de sortie. ByteDance n'a pas commenté.
Pourquoi la taille des paramètres ne dit pas tout ?
Les paramètres fixent la capacité brute de mémorisation, mais le niveau réel dépend aussi de la qualité des données et de la méthode d'entraînement. Kimi K3, avec environ 2 800 milliards de paramètres, devance ainsi des modèles plus gros sur plusieurs épreuves.
Quel est le plus gros modèle chinois actuel ?
Kimi K3 de Moonshot, publié le 16 juillet 2026, avec environ 2 800 milliards de paramètres dont 104 milliards activés par token. Le projet ByteDance rapporté par le FT lui ferait plus que tripler la taille.

