Le prix au million de tokens ne te dit pas combien coûte un utilisateur. Une action peut déclencher plusieurs appels, lire un long historique et recommencer après une erreur. C’est ce parcours complet qu’il faut compter avant de vendre une fonctionnalité IA.
Les tarifs évoluent vite. OpenAI a par exemple annoncé un ajustement de prix de Sol le 21 août 2026. Plutôt que de figer un comparatif qui vieillit, je préfère garder les tarifs séparés du calcul et les dater quand je prépare un budget.
Partir de l’usage retourné par l’API
Additionne tous les appels d’une même tâche. Sépare les entrées ordinaires, les entrées réellement facturées au tarif cache et les sorties. Ne suppose pas qu’un prompt répété bénéficie du cache. Utilise les compteurs et les catégories de facturation du fournisseur, y compris pour le raisonnement.
Le calcul ci-dessous prend un total d’entrée qui inclut les tokens en cache. Il les soustrait avant d’appliquer le tarif normal, pour éviter de les compter deux fois. Les tarifs sont exprimés dans la même devise, par million de tokens.
type Usage = {
input: number;
cachedInput: number;
output: number;
};
type Rates = {
input: number;
cachedInput: number;
output: number;
};
export function tokenCost(usage: Usage, rates: Rates) {
const values = [...Object.values(usage), ...Object.values(rates)];
if (values.some((n) => !Number.isFinite(n) || n < 0)) {
throw new Error("Usage and rates must be finite and non-negative");
}
if (usage.cachedInput > usage.input) {
throw new Error("Cached input exceeds total input");
}
return (
(usage.input - usage.cachedInput) * rates.input +
usage.cachedInput * rates.cachedInput +
usage.output * rates.output
) / 1_000_000;
}
Ramener le calcul à une action utile
Avec des tarifs fictifs de 2 pour l’entrée, 0,5 pour l’entrée en cache et 8 pour la sortie, un appel de 10 000 tokens d’entrée dont 4 000 en cache, puis 1 000 de sortie, coûte 0,022 unité monétaire. Mille appels identiques donnent 22. Ce ne sont les tarifs d’aucun modèle précis.
Si une action nécessite trois appels, ce montant triple avant même les outils payants. Ajoute séparément la recherche web, le stockage, le VPS et les reprises facturées. Pour comparer deux modèles, regarde aussi le nombre d’actions réellement terminées, pas seulement le nombre de réponses reçues.
Mettre les limites avant les premières inscriptions
Prévois des quotas par utilisateur, une taille maximale de requête et une limite de travail simultané. Un budget affiché dans un tableau de bord peut n’être qu’une alerte. Vérifie ce qui bloque réellement les nouveaux appels, chez le fournisseur et dans ton serveur.
Je garderais un identifiant de tâche, le modèle, l’usage et le coût estimé pour comprendre les écarts. Pas besoin de stocker chaque conversation complète pour suivre la dépense. Réconcilie ensuite l’estimation avec la facture, surtout si tu actives de nouveaux outils.