Outils Intelligence Artificielle
Accueil/ Actualités/ Agents IA/ Agents IA : depuis février 2026, ils consomment plus de tokens que les humains
Agents IA · 6 min de lecture

Agents IA : depuis février 2026, ils consomment plus de tokens que les humains

Sur OpenRouter, les agents IA consomment désormais près de 5 fois plus de tokens que les humains, après un bond de 14 fois depuis février 2026. Une hausse à lire avec nuance.

Illustration

L'IA devient son propre plus gros client. Sur OpenRouter, la passerelle qui réunit plus de 400 modèles derrière une seule clé d'API, les agents consomment désormais près de 5 fois plus de tokens que les humains, et leur consommation a été multipliée par environ 14 depuis février 2026. L'analyse, menée par l'analyste d'OpenRouter Peter Walker, a été publiée le 21 août 2026 dans la newsletter Charts of the Week d'a16z, puis relayée le 23 août par TheDecoder. Notre fiche OpenRouter explique comment fonctionne la passerelle ; ici, nous faisons le point sur les chiffres et sur leurs limites.

À retenir · l'essentiel
Le pivotLe 6 février 2026 aurait été le dernier jour où les humains consommaient plus de tokens que les agents sur OpenRouter.
Les volumes0,51 à 7,3 billions de tokens pour les agents, soit environ 14 fois plus ; les humains ont progressé de 2,8 fois.
La nuancePrès de 70 % des tokens des agents proviennent de prompts servis depuis le cache, facturés bien moins chers.
La portéeOpenRouter penche vers les modèles à poids ouverts : ces chiffres décrivent sa plateforme, pas toute l'industrie.

Le 6 février 2026, le jour du basculement

C'est la date que retient TheDecoder dans son article du 23 août 2026, signé Matthias Bastian : le 6 février 2026 « aurait pu être le dernier jour » où les humains consommaient plus de tokens que les agents sur OpenRouter. À cette date, la consommation des agents était de 0,51 billion de tokens ; dans les derniers chiffres relayés par TheDecoder, elle atteint 7,3 billions de tokens, soit environ 14 fois plus en six mois. Les humains plafonnent à 2,8 fois : leur courbe monte, mais loin derrière.

La newsletter Charts of the Week d'a16z, édition du 21 août 2026, qui a publié les chiffres d'OpenRouter avec des graphiques réalisés par l'analyste Peter Walker.
La newsletter Charts of the Week d'a16z, édition du 21 août 2026, qui a publié les chiffres d'OpenRouter avec des graphiques réalisés par l'analyste Peter Walker.
𝕏a16z (@a16z) · 22 août 2026 · traduit de l'anglais
Les humains sont devenus la minorité parmi les utilisateurs de l'IA. Les agents brûlent près de 5 fois plus de tokens que les gens, en hausse de 14 fois depuis février. Charts of the Week : https://www.a16z.news/p/charts-of-the-week-winds-of-thematic
Voir le post sur X

Le graphique publié par OpenRouter porte lui-même l'annotation « Feb 6, 2026 » au point où la courbe des agents croise celle des humains. TheDecoder reste prudent : un possible dernier jour, pas une date certifiée.

Pourquoi les agents consomment autant de tokens

La raison tient à la définition même d'un agent. Là où un humain échange une question, une réponse, puis s'arrête, un agent agit : il décompose un objectif, convoque ses outils, vérifie, recommence, et peut lancer d'autres processus d'IA en cours de route, comme le rappelle notre dossier sur les agents IA au bureau. Chaque tour transporte un contexte lourd : prompt système, définitions d'outils, configuration du serveur MCP, consignes de la tâche, historique de raisonnement.

Le blog Insights d'OpenRouter (juin 2026) estime qu'une requête d'agent typique consomme environ 15 fois plus de tokens qu'un échange humain ; une mission autonome de codage peut avaler l'équivalent de centaines d'échanges.

S'y ajoute un mouvement qui a commencé avant même les agents : les modèles de raisonnement.

L'inflation de tokens a commencé avec les modèles de raisonnement, qui réfléchissent plus longtemps avant de répondre, même quand ils n'en auraient pas besoin.
TheDecoder · 23 août 2026 · traduit de l'anglais

Multiplication par 14, oui ; facture multipliée par 14, non

C'est le point que la manchette efface, et le plus utile à retenir. Près de 70 % des tokens consommés par les agents proviennent de prompts servis depuis le cache, selon TheDecoder ; l'analyse d'a16z va plus loin et attribue au prompt en cache plus de 85 % de la « combustion » agentique de tokens. Or les tokens servis depuis le cache sont facturés à un tarif nettement réduit. Le coût réel monte donc bien moins vite que le compteur.

ChiffreSourceCe qu'il veut dire
0,51 à 7,3 billions de tokensTheDecoder, d'après OpenRouterLe volume agentique dans les derniers chiffres relayés
Environ 14 foisTheDecoder, d'après OpenRouterLa croissance du volume agentique depuis le 6 février 2026
2,8 foisTheDecoder, d'après OpenRouterLa croissance de la consommation humaine sur la même période
Près de 70 %TheDecoder, d'après OpenRouterLa part des tokens agents servis depuis le cache, facturés moins chers
Plus de 85 %a16z, Charts of the Week (21 août 2026)La part du token « brûlé » agentique qui vient d'un prompt en cache
Les agents n'utilisent pas seulement beaucoup plus de tokens que les gens : ils les utilisent très différemment.
a16z · Charts of the Week · 21 août 2026 · traduit de l'anglais

La mécanique est bien documentée par a16z. Le premier tour d'un agent embarque un « pre-fill » coûteux, tout le contexte de l'objectif : consignes, procédures, repères de code. Ensuite, l'agent lit et écrit de façon incrémentale, en ajoutant progressivement au cache. Plus il travaille longtemps sur un même contexte, plus sa consommation se déplace vers le cache. Ces tokens sont aussi, par définition, gourmands en mémoire : l'une des raisons, souligne a16z, de la tension sur la mémoire à haute bande passante.

!
Volume et facture ne suivent pas la même courbe

Un volume multiplié par 14 ne signifie pas une dépense multipliée par 14. Si près de 70 % des tokens des agents sont servis depuis le cache à tarif réduit, la facture épouse une pente bien plus douce que le compteur. À l'inverse, chaque variation du prompt système ou des définitions d'outils recompose le contexte au tarif plein. La mesure qui compte pour un budget, c'est le coût par tâche utile, pas le nombre de tokens.

Ce que cela change pour le coût réel de vos agents

Trois réflexes découlent directement de ces chiffres.

  • Budgétez par tâche, pas par token. Le volume est un indicateur d'activité ; la dépense utile se mesure au résultat produit, sur une période donnée.
  • Stabilisez votre préfixe de contexte. Un prompt système et des définitions d'outils constants sont rejoués depuis le cache à chaque tour. Les changer à chaque itération coûte cher, deux fois : perte de cache, et tarif plein sur l'ensemble.
  • Regardez votre part de cache. C'est elle qui explique pourquoi deux équipes avec des volumes semblables ont des factures très différentes.
Concrètement

Un agent qui rejoue les mêmes consignes et les mêmes définitions d'outils ne refacture le contexte complet qu'une fois : les tours suivants sont servis depuis le cache. Un agent dont le prompt change à chaque étape repart de zéro, au tarif plein.

Astuce

Dans votre tableau de bord d'usage, ajoutez la colonne des tokens servis depuis le cache. Si elle monte, votre facture décroche du compteur : c'est voulu, et c'est le signe d'un agent bien structuré.

Un observatoire qui penche vers les modèles ouverts

OpenRouter penche vers les modèles à poids ouverts : leur part d'usage y est plus forte que sur les API des grands laboratoires, et ils ont la réputation d'être moins économes en tokens que les modèles fermés d'OpenAI ou d'Anthropic. Les chiffres décrivent donc la plateforme, pas l'industrie entière. TheDecoder note toutefois que la tendance est probablement semblable chez les grands laboratoires, même si aucune donnée publique équivalente n'existe aujourd'hui. C'est aussi ce qui rend OpenRouter précieux : le volume y est observé, mesuré et publié.

Le rachat par Stripe, entre-temps, est devenu officiel

Ces chiffres tombent quelques jours après un changement de propriétaire. Le 16 août 2026, Bloomberg rapportait un accord à plus de 7 milliards de dollars, que nous décortiquions dans notre précédent dossier ; le 19 août, OpenRouter a publié son annonce officielle, « OpenRouter is Joining Stripe ». Le texte promet le maintien du nom, du produit et de la feuille de route, et publie au passage un ordre de grandeur : plus de 10 billions de tokens traités par jour pour plus de 10 millions de développeurs, et une croissance du volume d'inférence d'au moins 10 fois par an depuis la fondation.

Le fil des événements
6 février 2026Dernier jour où les humains ont consommé plus de tokens que les agents sur OpenRouter, d'après les données de la plateforme.
19 août 2026OpenRouter annonce officiellement rejoindre Stripe et publie son volume : plus de 10 billions de tokens par jour.
21 août 2026La newsletter Charts of the Week d'a16z publie les chiffres, avec des graphiques de Peter Walker (OpenRouter).
22 août 2026a16z résume le tout sur X : les agents brûlent près de 5 fois plus de tokens que les humains.
23 août 2026TheDecoder date le basculement au 6 février 2026 et rappelle la part du prompt en cache.

Questions fréquentes

Pourquoi les agents IA consomment-ils plus de tokens que les humains ?

Un agent enchaîne plusieurs étapes vers un objectif, convoque ses outils, relit son contexte et lance parfois d'autres processus d'IA en cours de route. Le blog Insights d'OpenRouter (juin 2026) évalue une requête d'agent à environ 15 fois les tokens d'un échange humain.

Le 6 février 2026 est-il vraiment la date du basculement ?

C'est la lecture que TheDecoder fait des données d'OpenRouter, et le graphique de la plateforme porte lui-même l'annotation « Feb 6, 2026 ». Le blog Insights d'OpenRouter (juin 2026) situait le basculement « autour du 1er février » : un repère solide, pas une date certifiée.

Un volume de tokens multiplié par 14 signifie-t-il une facture multipliée par 14 ?

Non. Près de 70 % des tokens des agents sont servis depuis le cache et facturés à tarif réduit selon TheDecoder ; l'analyse d'a16z parle même de plus de 85 %. Le coût à suivre reste le coût par tâche.

Ces chiffres valent-ils pour toute l'industrie ?

Ils décrivent OpenRouter, une plateforme penchant vers les modèles à poids ouverts, moins économes en tokens d'après TheDecoder. La tendance est probablement semblable chez les grands laboratoires, sans données publiques équivalentes à ce jour.

Qu'est-ce qu'un token ?

L'unité de facturation des modèles de langage, un découpage du texte d'environ trois quarts de mot en français. Plus une requête est longue, plus elle raisonne, plus elle consomme de tokens.