Modèle de coût · mis à jour 2026
Le coût des API IA va-t-il exploser votre budget ?
Les fournisseurs d'API cloud brûlent une part énorme de leurs revenus. Voici le calcul pour savoir si leur prochaine hausse de prix va aussi faire exploser votre budget.
coût_mensuel_2026 = R × (T_in × P_in + (T_out + T_raisonnement) × P_out)coût_mensuel_2027 = coût_mensuel_2026 × (1 + r)^Δmois
La hausse cachée que personne n'annonce
Les prix affichés au token ont globalement baissé depuis 2023. Mais deux choses ont changé en coulisses : les tokens de raisonnement sont facturés comme des tokens de sortie, et brûlent 4 à 12× plus de tokens par réponse visible que les générations précédentes ; le routage par défaut bascule silencieusement les requêtes « difficiles » vers des modèles de raisonnement plus chers. Résultat mesuré sur des charges de travail identiques à un an d'écart : une hausse de prix effective d'environ 4× malgré des baisses de prix catalogue.
Une facture réaliste en 2026
| Charge de travail | Tokens visibles/req | Tokens raisonnement/req | Coût/req (frontière) |
|---|---|---|---|
| Classifieur support client | 120 in / 40 out | 180 | 0,0028 € |
| Agent de revue de code (1 fichier) | 2 400 in / 600 out | 4 800 | 0,061 € |
| Agent de recherche multi-étapes | 8 000 in / 1 200 out | 22 000 | 0,244 € |
| RAG juridique long contexte | 62 000 in / 1 500 out | 9 000 | 0,198 € |
À 50 000 exécutions d'agent par mois — un déploiement mid-market modeste — la ligne « agent de recherche » à elle seule atteint 12 200 €/mois.
Seuil de rentabilité face au déploiement local
La vraie question n'est pas « un modèle local égale-t-il l'API frontière sur MMLU ? » mais « peut-il traiter 70 % de mon trafic de façon acceptable, et combien coûte la migration ? ». Trois déploiements de référence, amortis sur 24 mois électricité incluse (0,20 €/kWh, 60 % d'utilisation) :
| Configuration | Modèle | Coût matériel | €/MTok sortie | Rentable dès |
|---|---|---|---|---|
| 1 GPU haut de gamme 32 Go | 32B Q4_K_M | 2 400 € | 0,31 € | ~38M tok sortie/mois |
| 2 GPU haut de gamme NVLink | 72B Q5_K_M | 5 100 € | 0,48 € | ~62M tok sortie/mois |
| Mac Studio Ultra 192 Go | 109B Q4 | 6 200 € | 0,61 € | ~74M tok sortie/mois |
Pour l'exemple ci-dessus (~324M tokens sortie+raisonnement/mois), la config mono-GPU se rembourse en moins de 4 semaines de dépense API évitée.
Le routeur hybride : le meilleur des deux mondes
- Niveau 1 (local, 60-75 % du trafic) : classification, extraction, complétion de code, synthèse RAG sous 32K de contexte.
- Niveau 2 (API milieu de gamme, 15-25 %) : modèles légers pour un raisonnement modéré, à coût contenu.
- Niveau 3 (API frontière, 5-15 %) : uniquement les requêtes qui exigent vraiment un raisonnement de pointe, filtrées par un classifieur bon marché.
Ce routage réduit la dépense effective de 62 à 78 % tout en gardant une qualité perçue stable en A/B.
Verdict
| Dépense API mensuelle actuelle | Recommandation | Pourquoi |
|---|---|---|
| < 400 € | Rester sur l'API | L'ingénierie de migration dépasse l'économie sur 24 mois |
| 400 - 1 800 € | Optimiser les prompts, plafonner le raisonnement | 30-50 % de réduction possible sans quitter l'API |
| 1 800 - 8 000 € | Hybride : niveau 1 local + niveau 3 API | Un GPU haut de gamme se rembourse en <90 jours |
| > 8 000 € | Migrer agressivement | La trajectoire de coût n'est plus soutenable au-delà de 12 mois |
Questions fréquentes
Les prix des API vont-ils vraiment augmenter, ou continuer à baisser ?
Les prix affichés peuvent continuer à baisser sur les modèles phares pour des raisons marketing. Les prix effectifs — ce que vous payez par réponse utile — ont augmenté d'environ 4× en 12 mois à cause de l'expansion des tokens de raisonnement et des changements de routage. Budgétez sur le chiffre effectif, pas sur le prix catalogue.
Un seul GPU haut de gamme (32 Go) suffit-il à remplacer une API frontière ?
Pour 60-75 % du trafic agent typique (code, classification, RAG sous 32K de contexte), oui — en faisant tourner un modèle 32B quantifié Q4_K_M à ~45 tok/s. Pour le raisonnement de pointe et le contexte très long, un routeur hybride qui bascule vers une API frontière reste nécessaire.
Quel taux d’inflation utiliser dans le modèle ?
Notre base de référence est r = 0,06 par mois (composé), dérivé des observations de prix effectifs 2024→2026. Utilisez r = 0,045 pour un scénario optimiste et r = 0,085 pour un scénario pessimiste.
Le fine-tuning est-il une alternative au passage en local ?
Le fine-tuning chez un fournisseur cloud baisse le coût par token du modèle ajusté, mais augmente souvent la dépense totale car les équipes utilisent ce coût unitaire plus bas pour justifier plus d'appels. Il verrouille aussi le fournisseur. Le fine-tuning LoRA d'un modèle local (Qwen3 ou Llama) apporte des économies durables.