Combien coûte vraiment l'IA en entreprise : abonnement, API ou machine à soi
Une PME de cinquante personnes qui veut équiper ses équipes d'un assistant d'IA reçoit trois propositions qui ne se comparent pas : un prix par salarié et par mois, un prix par million de tokens, un prix de machine. Cet article remet ces trois factures dans la même unité, à partir des grilles publiques en vigueur le 1er octobre 2026.
Trois façons de payer la même réponse
Le premier modèle est l'abonnement par utilisateur, qu'on appelle aussi licence par siège. L'entreprise paie un montant fixe pour chaque personne autorisée à utiliser l'outil, qu'elle s'en serve dix fois par jour ou une fois par mois. C'est le modèle des offres d'équipe des grands assistants conversationnels et des copilotes intégrés aux suites bureautiques.
Le deuxième modèle est le paiement à l'usage par API. Une API, ou interface de programmation, permet à un logiciel d'envoyer une demande au modèle d'un fournisseur et de recevoir la réponse. Le fournisseur facture alors la quantité de texte traitée, mesurée en tokens. Il n'y a pas d'abonnement par personne : la facture suit le volume.
Le troisième modèle consiste à posséder la machine. L'entreprise achète un ordinateur capable de faire tourner un modèle de langage à poids ouverts, c'est-à-dire un modèle dont les paramètres sont publiés et peuvent être installés chez soi. Le coût devient un investissement amorti sur plusieurs années, auquel s'ajoutent l'électricité et l'entretien. Le nombre de requêtes ne change plus la facture ; il change seulement la charge de la machine.
Ces trois modèles ne répondent pas à la même question. L'abonnement achète un service prêt à l'emploi. L'API achète de la capacité de calcul brute qu'il faut intégrer à ses propres outils. La machine achète une capacité fixe, disponible sans limite de volume, mais bornée par sa puissance. Les comparer exige de ramener chaque offre à un coût par mois pour un usage donné.
Le token, unité de compte des modèles de langage
Un token est un fragment de texte, souvent un morceau de mot, que le modèle lit et produit un par un. La documentation tarifaire d'Anthropic donne un ordre de grandeur : en anglais, un token représente environ quatre caractères, soit à peu près les trois quarts d'un mot. Elle précise que le décompte exact varie selon la langue et le type de contenu. Un texte en français, un tableau de chiffres ou du code source ne produisent pas le même nombre de tokens pour une longueur identique.
Les fournisseurs distinguent deux catégories. Les tokens d'entrée correspondent à tout ce que le modèle reçoit : la question, les consignes, l'historique de la conversation, les documents joints. Les tokens de sortie correspondent à ce qu'il écrit. Les seconds coûtent nettement plus cher. Sur les grilles relevées le 1er octobre 2026, le token de sortie vaut cinq fois le token d'entrée pour les modèles actuels d'Anthropic comme pour la génération gpt-6 d'OpenAI.
Le token n'est pas une unité stable d'un fournisseur à l'autre, ni même d'une génération de modèles à la suivante. Anthropic indique que ses modèles à partir de Claude 4.7 utilisent un nouveau découpeur de texte qui produit environ 30 % de tokens en plus pour un même texte. À prix affiché égal, la même tâche peut donc coûter davantage après un changement de modèle. Comparer des prix au million de tokens entre deux fournisseurs revient à comparer des prix au kilo sans savoir si les deux balances sont étalonnées de la même façon.
Ce qu'affichent les grilles au 1er octobre 2026
Côté abonnements, la page de prix de Claude, consultée le 1er octobre 2026, affiche une offre Team à 25 dollars par siège et par mois en facturation mensuelle, ou 20 dollars en engagement annuel, pour le siège standard. Un siège dit premium coûte 125 dollars par mois, ou 100 dollars à l'année. L'offre Enterprise combine un socle de 20 dollars par siège et par mois, facturé à l'année, et une consommation facturée aux tarifs de l'API. Ce dernier point mérite attention : à ce niveau, l'abonnement ne plafonne plus la dépense.
Microsoft a lancé le 1er décembre 2025 Microsoft 365 Copilot Business, à 21 dollars par utilisateur et par mois, destiné aux organisations de 300 utilisateurs au plus et vendu avec un engagement annuel. Cette licence s'ajoute à un abonnement Microsoft 365 Business existant, qu'elle ne remplace pas. L'offre destinée aux grandes entreprises est affichée à 30 dollars par utilisateur et par mois.
Côté API, la page de tarifs d'OpenAI, consultée à la même date, affiche pour sa génération la plus récente des modèles allant de gpt-6-luna, à 0,10 dollar le million de tokens d'entrée et 0,50 dollar en sortie, à gpt-6-astra, à 10 dollars et 50 dollars, en passant par gpt-6.1-sol, à 2 dollars et 10 dollars. Chez Anthropic, Claude Haiku 4.5 coûte 1 dollar en entrée et 5 dollars en sortie, Claude Sonnet 5.5 2 dollars et 10 dollars, Claude Opus 5.5 4 dollars et 20 dollars. Au sein de la seule génération gpt-6, l'écart de prix atteint un facteur cent.
Deux mécanismes réduisent ces prix. Le traitement par lots, qui accepte un délai de réponse, divise la facture par deux chez les deux fournisseurs. La mise en cache des consignes répétées facture les relectures à une fraction du prix d'entrée : 10 % du tarif de base pour la plupart des modèles d'Anthropic. Tous ces montants sont exprimés en dollars, hors taxes, et les fournisseurs précisent qu'ils peuvent les modifier.
Comment la facture suit l'usage
Prenons une hypothèse volontairement simple. Cinquante salariés envoient chacun trente demandes par jour ouvré, sur vingt et un jours par mois, soit 31 500 demandes. Chaque demande transporte 3 000 tokens d'entrée, ce qui couvre une consigne, un peu d'historique et un court document, et produit 600 tokens de réponse. Le mois totalise 94,5 millions de tokens d'entrée et 18,9 millions de tokens de sortie.
Avec Claude Sonnet 5.5, ce volume coûte 189 dollars en entrée et 189 dollars en sortie, soit 378 dollars par mois. Avec Claude Opus 5.5, le double : 756 dollars. Avec gpt-6-astra, 1 890 dollars. Avec gpt-6-luna, 18,90 dollars. En face, cinquante sièges Claude Team en facturation mensuelle représentent 1 250 dollars, et cinquante licences Copilot Business 1 050 dollars, avant la licence Microsoft 365 qu'elles supposent.
Ce calcul montre que, pour un usage modéré et régulier, l'API d'un modèle intermédiaire peut coûter moins cher que les abonnements. Il ne dit pas tout. L'API seule ne fournit ni interface, ni gestion des comptes, ni connexion aux documents de l'entreprise : il faut les construire ou les acheter. Et l'hypothèse de 3 000 tokens par demande est fragile.
La documentation d'Anthropic estime qu'une page web moyenne représente environ 2 500 tokens et qu'un article de recherche de 500 kilo-octets en PDF en représente environ 125 000. Si un assistant relit ce document à chacun des dix échanges d'une conversation, il consomme 1,25 million de tokens d'entrée, soit 2,50 dollars sur Claude Sonnet 5.5 pour une seule analyse. Avec la mise en cache, la même conversation descend autour de 0,54 dollar, à condition que les échanges s'enchaînent avant l'expiration du cache. Les agents, ces programmes qui enchaînent plusieurs appels au modèle pour accomplir une tâche, multiplient ce phénomène : chaque étape renvoie le contexte accumulé. Sur une API, la facture dépend moins du nombre d'utilisateurs que de la quantité de texte que l'on fait relire au modèle.
Les coûts qui n'apparaissent pas sur la grille
Le premier poste caché est l'intégration. Relier un modèle aux messageries, aux dossiers partagés, au logiciel de gestion ou à la base clients demande du temps de développement, des tests et une maintenance continue. Ce coût ne figure sur aucune page de prix et dépend entièrement du système d'information de chaque entreprise.
Le deuxième poste tient à la localisation du traitement. OpenAI facture une majoration de 10 % sur ses points d'accès à traitement régional, ceux qui garantissent que les données restent dans une zone géographique, pour les modèles publiés à partir du 5 mars 2026. Anthropic applique un coefficient de 1,1 lorsque le client impose un traitement aux seuls États-Unis. Choisir où ses données sont traitées a un prix explicite.
Le troisième poste est le renouvellement des modèles. La page des retraits de modèles d'OpenAI montre que GPT-4.5 preview, dont l'arrêt a été annoncé le 14 avril 2025, a cessé de fonctionner le 14 juillet 2025, trois mois plus tard. Chaque remplacement impose de vérifier que les consignes, les formats de sortie et la qualité des réponses tiennent toujours. Ce travail de requalification revient à chaque génération.
Le quatrième poste est l'instabilité tarifaire, dans un sens comme dans l'autre. Anthropic avait annoncé pour Claude Sonnet 5 un prix de lancement de 2 et 10 dollars valable jusqu'au 31 août 2026, suivi d'une hausse à 3 et 15 dollars le 1er septembre. La hausse a finalement été annulée et le prix de lancement est devenu le prix standard. L'issue a été favorable aux clients, mais la décision ne leur appartenait pas. Un budget construit sur une grille d'API reste suspendu à une décision du fournisseur.
Le cinquième poste concerne la sortie. Récupérer ses données, ses historiques de conversation et ses configurations pour changer de prestataire a longtemps été facturé. Le règlement européen sur les données, applicable depuis le 12 septembre 2025, autorise jusqu'au 12 janvier 2027 des frais de changement limités aux coûts réels, puis les interdit, frais de sortie de données compris. Il ne règle pas la dépendance technique : des consignes écrites et réglées pour un modèle précis ne se transposent pas toujours sans retouches sur un autre.
Posséder la machine : prix d'achat, amortissement et électricité
Pour raisonner sur un cas réel, prenons le NVIDIA DGX Spark, un ordinateur compact conçu pour exécuter des modèles de langage, avec 128 Go de mémoire unifiée. Il s'agit d'un exemple de référence publique, pas d'une recommandation. Selon un revendeur européen qui suit ses prix, il a été lancé en octobre 2025 à 3 999 dollars, puis NVIDIA a relevé son prix de 700 dollars en février 2026 en invoquant la pénurie mondiale de mémoire. En septembre 2026, selon les prix relevés chez un revendeur européen (pi3g), les versions vendues en Europe démarraient autour de 5 038 euros hors taxes. Le matériel connaît lui aussi des hausses que l'acheteur ne maîtrise pas, mais il les subit une fois, à l'achat.
En France, le matériel informatique s'amortit couramment sur trois ans en mode linéaire, soit un tiers de sa valeur chaque année. Les équipements de moins de 500 euros hors taxes peuvent être passés directement en charges. Amortis sur trente-six mois, 5 038 euros représentent environ 140 euros par mois.
L'électricité se calcule à partir de la puissance. La documentation de NVIDIA indique une alimentation externe de 240 watts pour cette machine. Si elle fonctionnait en permanence à ce maximum, ce qui surestime la réalité puisque la consommation baisse au repos, elle consommerait 2 102 kilowattheures par an. Au tarif bleu professionnel en option base, fixé à 0,1624 euro le kilowattheure hors TVA, accise incluse, depuis le 1er août 2026 à la suite de la délibération de la Commission de régulation de l'énergie du 15 juillet 2026, la facture annuelle plafonne à environ 341 euros, soit 28 euros par mois.
Le plafond du coût mensuel de possession de cette machine s'établit donc autour de 168 euros, avant l'entretien, les mises à jour, la sauvegarde et le temps de la personne qui s'en occupe. En contrepartie, le nombre de requêtes ne change pas la facture. La limite est ailleurs : une machine donnée sert un nombre limité de demandes simultanées, d'autant plus faible que le modèle est gros, et les modèles à poids ouverts qu'elle peut faire tourner ne donnent pas les mêmes résultats que les plus grands modèles commerciaux sur toutes les tâches. Seul un essai sur les tâches réelles de l'entreprise permet de trancher.
Un raisonnement prudent pour comparer
La comparaison se fait sur trente-six mois, la durée d'amortissement du matériel, et en distinguant les monnaies : les API et les abonnements sont facturés en dollars, l'électricité et le matériel acheté en Europe en euros. Convertir à un taux du jour donnerait une précision illusoire sur trois ans.
La première étape consiste à mesurer. Un pilote de quelques semaines sur une API, avec un petit groupe, fournit le nombre réel de tokens par demande, que les consoles des fournisseurs affichent. Cette mesure vaut mieux que n'importe quelle hypothèse, y compris celle de cet article.
La deuxième étape consiste à séparer les usages. Les utilisateurs occasionnels coûtent peu en API et cher en abonnement. Les utilisateurs intensifs, ou les traitements automatiques qui relisent de gros volumes de documents, renversent la proportion. Une machine possédée devient intéressante quand le volume est élevé et régulier, ou quand une partie des données ne doit pas sortir de l'entreprise, quel que soit le prix de l'alternative.
La troisième étape consiste à chiffrer la sortie dès l'entrée. Combien coûterait un changement de fournisseur, de modèle ou de grille tarifaire dans dix-huit mois ? Avec les chiffres de notre exemple, une machine dont le coût plafonne autour de 168 euros par mois se compare à une API qui coûterait 378 dollars avec un modèle intermédiaire ou moins de 20 dollars avec le plus petit modèle. Le calcul ne désigne pas de gagnant universel. Il dépend du volume, de la nature des données et de la qualité exigée, trois paramètres que seule l'entreprise connaît.
Ce que la grille ne dit pas
Les trois modèles économiques ne s'excluent pas. Beaucoup d'organisations combinent un abonnement pour les usages bureautiques, une API pour quelques traitements ponctuels qui demandent un très grand modèle, et une capacité possédée pour le volume régulier et les données qui ne doivent pas quitter les locaux. L'important est de savoir, pour chaque flux, ce qu'il coûte et qui fixe son prix.
C'est la grille que nous appliquons chez HOMN : un coût fixe connu à l'avance pour le traitement local, et un recours au cloud décidé flux par flux, avec son coût mesuré. Les chiffres de cet article sont datés du 1er octobre 2026 ; les pages de prix citées en source permettent de les mettre à jour.
Qu'est-ce qu'un token et combien de mots représente-t-il ?
Un token est un fragment de texte que le modèle lit ou écrit, souvent un morceau de mot. Anthropic estime qu'en anglais un token correspond à environ quatre caractères, soit trois quarts de mot. Le décompte varie selon la langue, le contenu et le découpeur de texte du modèle.
L'API est-elle moins chère qu'un abonnement par utilisateur ?
Pour un usage modéré, souvent oui : dans notre hypothèse de 50 salariés, l'API d'un modèle intermédiaire coûte 378 dollars par mois contre plus de 1 000 dollars en abonnements. Mais l'API ne fournit ni interface ni intégration, et sa facture grimpe vite avec les documents longs et les agents.
Combien consomme en électricité une machine d'IA locale ?
Cela dépend de sa puissance. Une machine dotée d'une alimentation de 240 watts consommerait au plus 2 102 kWh par an en fonctionnement permanent à pleine charge, soit environ 341 euros au tarif bleu professionnel base en vigueur depuis le 1er août 2026.
Sur combien d'années amortir un serveur d'IA ?
En France, le matériel informatique s'amortit couramment sur trois ans en linéaire. Les équipements de moins de 500 euros hors taxes peuvent être passés en charges. Votre expert-comptable confirmera la durée adaptée à votre situation.