Combien coûte un agent IA ? La facture se compte en jetons

Deux tas de jetons métalliques de tailles très inégales : la facture d'un agent ne dépend pas du nombre de tâches, mais de tout ce qu'il relit à chaque tour.

Un document PDF de 500 ko lu par un agent représente environ 125 000 jetons d’entrée. Une page web ordinaire de 10 ko, environ 2 500. Ces ordres de grandeur sont publiés par Anthropic dans sa documentation tarifaire, consultée le 18 août 2026.

Retenez la disproportion. C’est elle qui explique pourquoi les factures d’agents surprennent.

Deux prix, pas un

Un modèle de langage se facture au jeton, avec deux tarifs distincts : ce qui entre, et ce qui sort. Chez Anthropic, au 18 août 2026, Claude Sonnet 5 est affiché à 2 dollars le million de jetons en entrée et 10 dollars en sortie ; Claude Opus 5, à 5 et 25 dollars. La sortie coûte cinq fois l’entrée.

Prix hors taxes, en dollars. Les autres fournisseurs ont leurs propres grilles, et toutes bougent : celle-ci a d’ailleurs changé cet été, l’augmentation prévue au 1er septembre 2026 sur Sonnet 5 ayant été annulée.

L’intuition qu’on en tire est fausse. On imagine que le coût dépend de la longueur des réponses, alors qu’un agent dépense surtout à l’entrée.

Pourquoi un agent coûte plus qu’un chatbot

Parce qu’un agent recommence. À chaque tour, l’historique complet de la conversation repart en entrée : la consigne initiale, les documents lus, les résultats des outils appelés, ses propres réponses précédentes. Dix étapes ne coûtent pas dix fois la première. Elles coûtent davantage, parce que la dixième transporte les neuf autres.

S’ajoutent des postes qu’on ne voit pas dans les démonstrations :

  • La définition des outils est renvoyée à chaque requête. Anthropic chiffre le préambule système lié aux outils entre 286 et 406 jetons pour Opus 5 ; un outil de ligne de commande ajoute 325 jetons, un outil d’édition de fichiers 700. Individuellement négligeable, multiplié par des milliers d’appels, non.
  • Les recherches web sont facturées à part : 10 dollars pour 1 000 recherches, en plus des jetons du contenu rapporté.
  • Le contenu rapporté, justement, devient de l’entrée à tous les tours suivants.

Il existe un correctif sérieux, le cache de contexte : une lecture en cache est facturée un dixième du tarif d’entrée normal, l’écriture coûtant 1,25 fois ce tarif pour cinq minutes de validité. Bien posé, il change l’ordre de grandeur d’une facture. Mal posé, il ne sert à rien.

Deux exemples chiffrés, publiés par le fournisseur

Ce ne sont pas nos mesures, et nous ne les présentons pas comme telles. Ce sont les exemples qu’Anthropic publie dans sa propre documentation, ce qui leur donne au moins le mérite d’être vérifiables.

Traiter 10 000 tickets de support, à environ 3 700 jetons par conversation, avec le modèle Haiku 4.5 : environ 37 dollars.

Une session de travail d’une heure avec Opus 5, consommant 50 000 jetons d’entrée et 15 000 en sortie : 0,705 dollar, dont 0,08 de temps de session. Avec 40 000 des jetons d’entrée servis par le cache, la même session tombe à 0,525 dollar.

L’écart entre ces deux exemples n’est pas une anomalie. C’est toute la question : le prix dépend du modèle choisi, de la longueur du contexte et du nombre de tours, bien plus que du nombre de tâches.

Le piège qui ne se voit pas sur la grille tarifaire

Un détail de la documentation d’Anthropic mérite d’être signalé aux dirigeants : les modèles Claude 4.7 et suivants utilisent un nouveau découpage du texte, qui produit environ 30 % de jetons en plus pour un texte identique.

Autrement dit, un changement de modèle peut faire monter votre facture sans qu’aucun prix affiché n’ait bougé. Si vous suivez votre consommation en dollars sans suivre le modèle utilisé, vous ne comprendrez pas la variation.

Ce que vous pouvez raisonnablement demander

Nous ne publions pas ici notre propre consommation : nous ne l’avons pas mesurée sur une durée suffisante pour en tirer une moyenne honnête, et une estimation présentée comme un relevé n’aiderait personne.

Ce que nous pouvons affirmer, en revanche : un prestataire qui vous annonce un coût mensuel avant d’avoir fait tourner l’agent sur vos données devine. La seule méthode qui tienne est de faire fonctionner le prototype deux semaines sur des cas réels, de relever la consommation, et de multiplier. C’est court, c’est peu coûteux, et ça remplace une négociation par un chiffre.

Le périmètre que vous accordez à l’agent pèse directement sur ce chiffre, puisqu’un agent autorisé à lire tout un espace documentaire finira par le lire : c’est l’objet de notre article sur les droits à donner à un agent IA. Et si vous voulez voir la mécanique de près plutôt que sur le papier, nos agents IA sur mesure partent toujours d’un cas d’usage unique, précisément pour rendre la mesure possible.

Une question à garder pour la prochaine démonstration commerciale : combien de jetons d’entrée cette démonstration a-t-elle consommés ?

Partager cet article

← Tous les articles