Qu'est-ce qui a baissé, exactement ?
Les tarifs des modèles, au million de jetons, et de beaucoup. Selon la grille publiée par Simon Willison le 22 septembre 2026, GPT-6 Sol tombe à la moitié du tarif de GPT-5.6 Sol, en entrée comme en sortie, et GPT-6 Luna fait de même face à la génération précédente. Claude Opus 5.5, sorti le même jour, passe un cinquième sous Opus 5.
Deux précisions comptent pour un dirigeant. D'abord, un porte-parole d'OpenAI a indiqué à The New Stack qu'il s'agit du prix par défaut, pas d'une promotion de lancement. Ensuite, le même jour, OpenAI a revu la mise en cache des invites : selon The New Stack, la remise sur les jetons d'entrée déjà vus atteint désormais l'essentiel de leur prix, et le cache ne se perd plus quand on change d'outil ou de niveau de raisonnement. Toujours selon The New Stack, Anthropic a réduit de plus de moitié le coût de lecture du cache. Autrement dit, le prix affiché baisse, et le prix réellement payé sur un agent bavard baisse encore davantage.
Pourquoi votre facture peut quand même grimper ?
Parce qu'un agent ne pose pas une question : il en pose dix pour finir une tâche, et il se relit à chaque fois. C'est la différence entre une conversation dans ChatGPT et un agent qui travaille dans vos outils.
L'équipe de Blent a détaillé le calcul en juin 2026 sur une demande de recherche traitée par un agent en quatre cycles : 12 800 jetons d'entrée pour 1 650 jetons de sortie. Le contexte s'accumule, l'agent doit se souvenir de ce qu'il a déjà fait, et l'entrée grossit à chaque tour. Ils notent que la consommation réelle dépasse fréquemment l'estimation initiale d'un facteur 5 à 10 au passage en production.
Retenez le mécanisme, pas les chiffres : vous payez surtout pour renvoyer du contexte au modèle, et le nombre d'allers-retours dépend de la difficulté de la tâche, pas du tarif affiché. Une tâche mal bornée coûte cher sur un modèle bon marché.
Où part l'argent dans un agent qui travaille tous les jours ?
Quatre postes, dont un seul est le prix du modèle.
| Poste | Ce qui le fait grossir | Ce qui le tient |
|---|---|---|
| Le contexte relu à chaque tour | Des consignes longues, un historique qu'on traîne, des documents entiers envoyés « au cas où » | La mise en cache, et surtout un contexte rangé : l'agent reçoit ce qui sert à cette tâche |
| Le nombre de tours | Une tâche floue, un agent qui cherche parce qu'il n'a pas la bonne information | Une tâche bornée, et une limite de tours au-delà de laquelle il rend la main |
| Les reprises | Un appel qui échoue et qu'on relance, un résultat inexploitable qu'on refait | Le comptage des échecs, pas seulement des succès |
| Le prix du modèle | Un modèle haut de gamme employé pour trier du courrier | Le bon modèle par étape : trier et classer ne demandent pas le même que rédiger |
C'est le sens de ce qu'on répète en audit de découverte : la vraie question est « combien de fois cet agent va-t-il relire quoi, et pour quel résultat », pas « quel modèle est le meilleur ».
Alors, combien coûte un agent IA pour une PME ?
Personne ne peut vous le dire avant d'avoir regardé votre tâche, et les pages françaises qui promettent une réponse chiffrée le montrent bien : d'une page à l'autre, les fourchettes publiées vont du simple au décuple. Ces pages sont honnêtes ; elles ne décrivent simplement pas la même chose. Stema Partners chiffre le développement d'un cas simple, RedArrow la mise en place d'un agent en entreprise, Smartpoint un agent en production chez un grand compte. Trois périmètres différents, trois réponses différentes, et aucune des trois ne porte sur votre entreprise.
Une fourchette trouvée sur Internet ne vous sert donc à rien pour arbitrer. Un ordre de grandeur utile se construit sur votre volume : combien de demandes arrivent par semaine, combien de devis en sortent, combien de temps y passe aujourd'hui une personne de votre équipe. C'est le chiffre à poser en premier, et c'est le vôtre. Le reste en découle, y compris la réponse « il n'y a rien d'utile à construire ici ».
Comment budgéter une tâche plutôt qu'un abonnement ?
Quatre choses à demander par écrit avant de signer quoi que ce soit, à votre prestataire comme à vous-même.
- Le coût d'une exécution complète, mesuré, pas estimé : faites tourner l'agent cinquante fois sur des cas réels et regardez la facture, échecs compris.
- Le volume mensuel attendu, en tâches et non en « utilisateurs » : trente demandes par semaine ou trois cents ne donnent pas le même projet.
- Un plafond par tâche et par jour, qui refuse l'appel au-delà au lieu de découvrir le dépassement sur la facture du mois.
- Ce qui reste humain : chaque validation retire une boucle à l'agent, donc du coût, en plus de protéger votre relation client.
Nous fonctionnons comme ça chez nous. Équipage IA est une entreprise d'un humain et d'agents : chaque appel payant à un service extérieur (recherche, données, génération d'images) est journalisé avec son coût, les postes qui en passent ont un plafond, et le programme refuse l'appel avant de le passer quand il dépasse. C'est ce qui permet de dire à un client ce que son système coûte réellement, et de le dire avant lui. C'est la même logique qu'on installe dans nos agents de prospection et nos agents demandes et devis.
Faut-il changer de modèle maintenant ?
Pas dans l'urgence, et pas sans mesure. Un modèle moins cher ne rend pas un agent moins cher s'il se trompe plus souvent : chaque reprise, c'est un tour de plus. À notre connaissance, aucun test indépendant ne compare encore GPT-6 Sol et Claude Opus 5.5, et les résultats publiés le 22 septembre sont ceux des éditeurs.
Ce qui se décide sans attendre, en revanche : ranger ce que l'agent doit savoir, pour qu'il cesse de tout relire, et vérifier que vos invites longues sont bien mises en cache. Ce travail-là vaut sur tous les modèles, y compris ceux qui sortiront le mois prochain. C'est par là qu'on commence une automatisation qui tient dans la durée.
FAQ
Le prix de l'IA va-t-il continuer à baisser ?
Les deux annonces du 22 septembre 2026 vont dans ce sens. Mais la baisse porte sur le prix au jeton, pas sur le coût d'une tâche : à mesure que les prix baissent, on confie aux agents des travaux plus longs, qui consomment davantage. Ne bâtissez pas votre calcul sur une baisse future.
Un modèle moins cher suffit-il pour une PME ?
Souvent oui, pour trier, classer, extraire ou préparer. Les tâches qui demandent un modèle haut de gamme sont plus rares qu'on ne le croit, et rien n'oblige à employer le même modèle à toutes les étapes. Ce choix se fait par étape, avec une mesure à l'appui.
Comment éviter les mauvaises surprises sur la facture ?
Trois exigences : un plafond qui bloque avant de dépenser, un journal qui montre ce que chaque exécution a coûté, et une mesure sur des cas réels avant de brancher l'agent sur tout le flux. Sans ces trois-là, vous découvrirez le coût de votre système en même temps que votre comptable.
On examine une tâche, vos outils, et les décisions qui doivent rester humaines. Verdict écrit à la fin : automatisation simple, agent IA, ou rien d'utile à construire.
Réserver un audit de découverte gratuit
Sources : grille de prix des modèles et baisse du cache, « Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war », Simon Willison, 22 septembre 2026 (simonwillison.net) · prix par défaut confirmé par un porte-parole d'OpenAI et détail de la mise en cache, « OpenAI releases GPT-6 Sol and Luna, and cuts token prices in half », Frederic Lardinois, The New Stack, 22 septembre 2026 (thenewstack.io) · consommation de jetons d'un agent en plusieurs cycles, « Coût des agents IA : optimiser le budget tokens », Blent, 12 juin 2026 (blent.ai) · fourchettes de prix citées, Stema Partners, 2 juin 2026 (stemapartners.com), RedArrow, 6 avril 2026 (redarrow.fr), Smartpoint, 28 janvier 2026 (smartpoint.fr). Les pages d'annonce d'openai.com n'ont pas pu être ouvertes depuis nos serveurs (erreur 403) : les faits attribués à OpenAI viennent des deux sources indépendantes ci-dessus. Aucun chiffre de résultat obtenu chez nous ou chez un client n'est cité dans cet article.