Le prix d'un token IA va de moins de 0,10 € à plus de 20 € par million de tokens, selon le modèle et le sens de facturation. Les tokens de sortie (le texte produit) coûtent en général 3 à 8 fois plus cher que les tokens d'entrée (ce que vous envoyez au modèle). Pour une PME technique, le chiffre utile est le coût par document : un compte rendu de chantier revient entre 0,001 € et 0,08 € par passe, un mémoire technique entre 0,01 € et 0,60 €, selon le modèle. La grille ci-dessous donne les prix par modèle et leur traduction en coût par livrable.
Qu'est-ce qu'un token et comment est-il facturé
Un token est l'unité de texte que le modèle lit et écrit : un mot court, un fragment de mot long, un signe de ponctuation, un chiffre. En français, comptez environ 1,5 token par mot. Une page de rapport de 500 mots représente donc autour de 750 tokens. Les tableaux, les références normatives, les codes et les nombres en consomment davantage que la prose.
Les fournisseurs facturent deux flux séparément :
- les tokens d'entrée : tout ce que vous envoyez au modèle. Consignes, notes de visite, extraits du CCTP, compte rendu précédent, modèle de document.
- les tokens de sortie : le texte que le modèle rédige.
La sortie coûte plus cher parce que le modèle la calcule token par token, alors qu'il traite l'entrée en bloc. Les modèles dits « de raisonnement » ajoutent des tokens de réflexion intermédiaire. Vous ne les lisez pas, mais ils sont facturés au prix de la sortie.
Le prix s'exprime en dollars par million de tokens. Cette tarification à l'usage concerne les API, c'est-à-dire l'accès programmatique utilisé quand on construit un outil. Les abonnements comme ChatGPT, Claude ou Microsoft 365 Copilot sont facturés par utilisateur et par mois, sans décompte de tokens pour l'utilisateur.
Grille de prix par modèle en 2026 (€/M tokens)
Les pages tarifaires des fournisseurs s'arrêtent au prix par million de tokens. Les deux dernières colonnes de la grille le traduisent en coût par document, pour une passe unique : 8 000 tokens en entrée pour le compte rendu, 60 000 pour le mémoire.
| Modèle | Fournisseur | Gamme | Entrée €/M ($) | Sortie €/M ($) | Compte rendu (2 000 tokens produits) | Mémoire technique (15 000 tokens produits) |
|---|---|---|---|---|---|---|
| Mistral Small | Mistral AI | Économique | 0,09 (0,10) | 0,26 (0,30) | 0,001 € | 0,01 € |
| Grok 4 Fast | xAI | Économique | 0,17 (0,20) | 0,43 (0,50) | 0,002 € | 0,02 € |
| DeepSeek V3.2 | DeepSeek | Économique | 0,24 (0,28) | 0,36 (0,42) | 0,003 € | 0,02 € |
| GPT-5 mini | OpenAI | Économique | 0,22 (0,25) | 1,72 (2,00) | 0,005 € | 0,04 € |
| Gemini 2.5 Flash | Économique | 0,26 (0,30) | 2,15 (2,50) | 0,006 € | 0,05 € | |
| Mistral Medium 3 | Mistral AI | Intermédiaire | 0,34 (0,40) | 1,72 (2,00) | 0,006 € | 0,05 € |
| Claude Haiku 4.5 | Anthropic | Intermédiaire | 0,86 (1,00) | 4,30 (5,00) | 0,015 € | 0,12 € |
| GPT-5 | OpenAI | Frontière | 1,08 (1,25) | 8,60 (10,00) | 0,026 € | 0,19 € |
| Gemini 2.5 Pro | Frontière | 1,08 (1,25) | 8,60 (10,00) | 0,026 € | 0,19 € | |
| Claude Sonnet 4.5 | Anthropic | Frontière | 2,58 (3,00) | 12,90 (15,00) | 0,046 € | 0,35 € |
| Grok 4 | xAI | Frontière | 2,58 (3,00) | 12,90 (15,00) | 0,046 € | 0,35 € |
| Claude Opus 4.5 | Anthropic | Frontière haut de gamme | 4,30 (5,00) | 21,50 (25,00) | 0,077 € | 0,58 € |
Grille rédigée en septembre 2026. Tarifs publics des API standard pour les modèles listés, hors remise, convertis au taux indicatif de 0,86 € pour 1 $. Sources : page Pricing de la plateforme API d'OpenAI, page Pricing de la documentation Claude d'Anthropic, page Gemini API Pricing de Google AI for Developers, page Pricing de Mistral AI, page Models & Pricing de la documentation API de DeepSeek, page Models and Pricing de la documentation xAI. Les fournisseurs modifient prix et gammes plusieurs fois par an : vérifiez la ligne qui vous concerne avant de chiffrer un budget.
Les deux dernières colonnes ne comptent pas les tokens de raisonnement. GPT-5, Gemini 2.5 Pro et les modèles Claude en mode réflexion en produisent, facturés au prix de la sortie. Sur un document qui demande de l'analyse, ils peuvent multiplier le volume facturé. Google et xAI appliquent aussi un tarif plus élevé au-delà d'un seuil de tokens d'entrée par requête, qu'un gros dossier envoyé en une fois peut franchir.
La grille ne couvre pas les générations les plus récentes, comme Claude 5 chez Anthropic. Une nouvelle version ne reprend pas toujours le prix de sa gamme : Claude Opus 4.5 a été lancé à un tiers du prix d'Opus 4.1 (15 $ en entrée, 75 $ en sortie). Pour un modèle absent de la grille, relevez son tarif sur la page du fournisseur, situez-le par rapport aux lignes ci-dessus et vérifiez la version exacte appelée par votre outil.
Combien coûte un token en euros concrètement
Divisez le prix par un million. En sortie, Claude Sonnet 4.5 coûte 12,90 € par million, soit 0,0000129 € par token. En entrée, Mistral Small coûte 0,00000009 € par token.
Prenons une phrase de compte rendu : « Le coffrage du voile R+1 a été réceptionné sans réserve par le bureau de contrôle. » Elle compte environ 20 tokens. Rédigée par Claude Sonnet 4.5, elle coûte 0,00026 €. Rédigée par GPT-5 mini, 0,000034 €.
100 tokens, soit environ 65 mots, valent entre 0,000009 € (entrée Mistral Small) et 0,0022 € (sortie Claude Opus 4.5). Pour dépenser 1 € avec GPT-5 mini en sortie, il faut produire environ 580 000 tokens, l'équivalent de près de 290 comptes rendus de 2 000 tokens.
Le prix unitaire ne sert pas à décider. L'écart entre modèles est plus parlant : la sortie de Claude Opus 4.5 coûte plus de 80 fois celle de Mistral Small.
Coût réel par document technique produit
Les hypothèses ci-dessous décrivent une passe de génération. Les volumes d'entrée varient beaucoup d'un cabinet à l'autre : mesurez-les sur un document réel avant de budgéter.
Compte rendu de chantier. En entrée : notes de visite dictées ou saisies sur tablette, liste des présents, compte rendu précédent avec ses points ouverts, consignes et modèle, soit environ 8 000 tokens. En sortie : 2 000 tokens, environ 1 300 mots. La méthode pour générer un compte rendu de chantier avec l'IA détaille les étapes.
Note de calcul. Le modèle ne calcule pas. Les calculs restent dans votre logiciel (Robot Structural Analysis, Advance Design, un tableur maison). Le modèle rédige les hypothèses, la description des charges, la méthode et la synthèse des résultats exportés. Environ 15 000 tokens en entrée, 4 000 en sortie.
Rapport de diagnostic. Les parties calculées ou réglementées restent dans le logiciel métier. Le modèle met en forme les observations, les descriptions de locaux et les recommandations à partir des relevés. Environ 20 000 tokens en entrée, 6 000 en sortie. Chaque photo transmise ajoute plusieurs centaines à quelques milliers de tokens.
Mémoire technique. En entrée : règlement de consultation, extraits du CCTP, références, CV, mémoires antérieurs, soit environ 60 000 tokens. En sortie : 15 000 tokens, une vingtaine de pages. Pour un ordre d'idée du résultat, voir un mémoire technique généré automatiquement sur un marché public réel.
Le compte rendu et le mémoire figurent dans la grille. Pour les deux autres documents :
| Modèle | Note de calcul (15 000 / 4 000) | Rapport de diagnostic (20 000 / 6 000) |
|---|---|---|
| Mistral Small | 0,002 € | 0,003 € |
| GPT-5 mini | 0,010 € | 0,015 € |
| Claude Sonnet 4.5 | 0,090 € | 0,13 € |
| Claude Opus 4.5 | 0,15 € | 0,22 € |
Même en multipliant les passes par dix, un mémoire rédigé avec le modèle le plus cher de la grille coûte moins que quelques minutes de temps d'ingénieur. Le poste principal reste la relecture. La note de calcul est signée par un ingénieur, le rapport de diagnostic engage le diagnostiqueur certifié, le mémoire technique peut devenir pièce contractuelle du marché. Aucun de ces documents ne part sans relecture par la personne qui en porte la responsabilité.
Comparatif prix token IA : quel modèle choisir selon l'usage
Partez du type de tâche, pas du prix.
Extraction et recopie de données. Reprendre les valeurs d'un PV d'essai dans le rapport, les références cadastrales d'un acte, les quantités d'un devis. Un modèle économique suffit. Le risque est l'erreur de recopie, et il se traite par un contrôle automatique qui compare la valeur source et la valeur recopiée, pas par un modèle plus cher.
Rédaction structurée à partir d'un modèle. Compte rendu, rapport type, courrier, note de synthèse. Un modèle économique ou intermédiaire convient dans la plupart des cas. La qualité dépend surtout du modèle de document, des exemples fournis et des consignes.
Raisonnement sur un dossier. Analyser un DCE pour repérer les exigences et les critères de notation, vérifier la cohérence entre le CCTP et le mémoire, synthétiser un dossier contradictoire. Un modèle frontière se justifie ici.
La majorité des tâches documentaires répétitives relèvent des deux premières catégories. Choisir le modèle le plus cher par défaut revient à payer 5 à 60 fois plus par document, sur des milliers d'appels, sans gain mesurable. Pour trancher, faites passer 10 à 20 documents réels dans deux modèles et comptez les corrections nécessaires après relecture. Un même outil peut aussi confier l'extraction à un modèle économique et l'analyse à un modèle frontière.
Pour des données clients (plans, rapports, pièces de marché), le lieu d'hébergement et les conditions d'utilisation des données pèsent plus que quelques centimes d'écart. Le dossier intelligence artificielle de la CNIL donne les points à vérifier. Certains modèles, dont Mistral Small et DeepSeek, sont publiés en poids ouverts et peuvent tourner sur vos propres serveurs. Le coût devient alors celui de la machine, pas du token.
Pourquoi le prix du token ne suffit pas à budgéter l'IA
Le volume réellement facturé dépasse largement le document produit. Ce qui s'ajoute à chaque appel :
- le prompt système : consignes, charte, exemples. Plusieurs milliers de tokens renvoyés à chaque fois.
- l'historique : dans une conversation, tout l'échange est renvoyé à chaque message. Le vingtième échange paie les dix-neuf précédents.
- la recherche dans les archives (RAG) : les passages retrouvés s'ajoutent à l'entrée. Dix extraits de 500 tokens ajoutent 5 000 tokens par question.
- les appels d'outils : chaque consultation d'une base ou d'un fichier est un nouvel aller-retour avec le contexte complet.
- les passes successives : plan, rédaction section par section, relecture automatique, correction. La méthode en 5 étapes pour automatiser un mémoire technique en compte plusieurs.
Deux mécanismes réduisent la facture. Le cache facture les entrées répétées à une fraction du prix normal. Le traitement par lots, proposé par OpenAI, Anthropic et Google, coûte environ moitié prix, avec un résultat rendu en quelques heures.
Le calcul se fait donc ainsi : documents par mois × tokens par document, toutes passes comprises × prix du modèle. Exemple : un bureau d'études qui produit 60 comptes rendus par mois, avec cinq appels de la taille indiquée plus haut par compte rendu, dépense environ 14 € par mois sur Claude Sonnet 4.5.
Les tokens sont rarement le premier poste. La construction de l'outil, son intégration à vos modèles et à vos archives, sa maintenance et le temps de relecture pèsent davantage. Le guide complet coût et ROI de l'IA en PME détaille l'ensemble des postes.
Prochaine étape
Pour obtenir votre propre coût par document :
- choisissez deux ou trois types de documents que vous produisez en volume ;
- comptez combien vous en sortez par mois ;
- faites générer un exemplaire réel et relevez le nombre de tokens consommés, que l'API indique à chaque appel ;
- appliquez la grille, après avoir vérifié le tarif du modèle sur la page du fournisseur.
Pour intégrer les abonnements, le développement, la maintenance et le temps de relecture, vous pouvez calculer le coût mensuel complet de l'IA pour votre PME. Le temps de relecture compte aussi chez nous : pour nos propres decks, propositions et comptes rendus, nous utilisons une chaîne qui régénère chaque document à la demande, et chaque document à enjeu y passe par une relecture à plusieurs regards distincts avant envoi. Si vous souhaitez ce chiffrage sur vos propres livrables, c'est l'objet du diagnostic que nous réalisons avant toute construction d'outil.
Article rédigé par Loïc Mabilon, Co-fondateur chez Lumivi.


