Blog

Prix de l'IA : la remise que vous payez avec vos données

Trois modèles en trois jours. Meta réduit son prix de plus de 90 % si elle peut entraîner ses modèles avec vos données, et Anthropic baisse le cache de 75 %.

05 septembre 2026 · Agência Primeira Página

Prix de l'IA : la remise que vous payez avec vos données

En trois jours, trois laboratoires ont lancé un modèle de pointe : GPT-6 Astra, Claude Fable 5.1 et Muse Spark 1.3, de Meta. Ce qui a vraiment changé, ce n'est l'intelligence d'aucun des trois. C'est l'endroit où la facture est réglée.

Jusqu'à présent, comparer des modèles revenait à comparer deux lignes : le prix par million de tokens en entrée et en sortie. Ces deux lignes ne suffisent plus à dire combien vous allez payer.

Ce que chacun facture aujourd'hui

  • GPT-6 Astra (OpenAI) : 10 $ US par million de tokens en entrée et 50 $ US en sortie, avec une entrée mise en cache à 1 $ US.
  • Claude Fable 5.1 (Anthropic) : les mêmes 10 $ US et 50 $ US au tarif standard. Ce qui a changé, c'est le cache, passé de 1 $ US à 0,25 $ US par million, soit une réduction de 75 %.
  • Muse Spark 1.3 (Meta) : 1,25 $ US en entrée et 4,25 $ US en sortie, une fraction des deux autres. Et il existe un second prix, bien plus bas, expliqué plus loin.

En ne regardant que le tarif, la conclusion serait simple : Meta est dix fois moins cher. La conclusion réelle dépend de deux éléments que ce tarif ne montre pas.

Le cache est 75 % moins cher, mais uniquement pour ceux qui ont bien construit leur système

Le cache, ici, désigne le morceau de texte que vous envoyez de façon répétée à chaque appel : l'instruction système, le manuel du produit, le catalogue, l'historique de la conversation. Le modèle conserve ce passage déjà traité et facture bien moins cher pour le relire.

Avec la baisse d'Anthropic, lire depuis le cache coûte désormais 2,5 % du prix de l'entrée normale. L'effet pratique annoncé est une baisse d'environ 25 % du coût d'une charge de travail typique, et jusqu'à 45 % pour les tâches très agentiques — celles où le modèle enchaîne de nombreux appels, en relisant le même contexte à chaque étape.

Le détail qui décide si vous allez bénéficier de cette remise : le cache n'est utilisé que lorsque le début de ce que vous envoyez est identique d'un appel à l'autre. Si votre système compose le texte avec la date et l'heure en tête, ou mélange l'ordre des instructions, ou insère le nom du client avant le manuel, le passage change à chaque appel et il n'y a alors aucun cache. Vous payez le plein tarif sans même comprendre pourquoi.

Autrement dit : cette baisse de prix n'est pas une remise qui s'applique automatiquement sur votre facture. C'est une remise pour ceux qui organisent le texte d'une façon précise — le contenu fixe en premier, le contenu variable à la fin.

La remise de plus de 90 % qui se paie avec des données

Meta a fait le choix le plus agressif, et le plus intéressant à analyser. Au-delà du tarif standard, l'entreprise a créé un palier pour ceux qui l'autorisent à utiliser leurs questions et les réponses du modèle pour entraîner ses futurs modèles.

Dans ce palier, le million de tokens en entrée revient à 0,10 $ US et celui en sortie à 0,20 $ US. Comparé au tarif standard de Meta elle-même, c'est une baisse d'environ 92 % en entrée et 95 % en sortie. Face aux 10 $ US et 50 $ US des concurrents, l'écart dépasse cent fois.

Ce n'est ni de la charité ni une guerre des prix au sens habituel. C'est Meta qui met un prix sur vos données et vous laisse décider si vous voulez les vendre. L'entreprise a également indiqué qu'elle prévoyait de publier les poids du modèle — ce qui reste une promesse, pas un fait acquis, et doit être traité comme tel.

Pourquoi cette remise peut vous être interdite

Ici, la décision quitte le terrain financier pour passer au terrain juridique. Si ce que vous envoyez au modèle inclut des données de clients, la remise revient à autoriser un tiers à entraîner ses modèles avec ces données. Trois questions règlent le cas dans la plupart des entreprises :

  1. Disposez-vous d'une base légale pour cela ? La LGPD en exige une. Le client a-t-il consenti au traitement de ses données pour entraîner le modèle d'une autre entreprise ? La réponse est presque toujours non.
  2. Votre contrat le permet-il ? Un contrat avec un client professionnel comporte généralement une clause de confidentialité qui l'interdit déjà, sans même qu'il soit besoin d'invoquer la LGPD.
  3. Qu'est-ce qui part exactement avec la requête ? Ce n'est pas seulement la question. Cela inclut le document que vous avez joint, le passage du système que l'agent a lu, le nom apparu au milieu de la conversation.

Il existe un usage pour lequel le palier bon marché convient parfaitement : du contenu déjà public ou qui n'identifie personne — générer la description d'un produit de catalogue, résumer un texte que vous avez vous-même publié, tester un prompt sur des données fictives. L'erreur consiste à adopter ce palier par défaut et à découvrir seulement après ce qui y est passé.

Comment choisir maintenant

Avec trois variables en jeu — le tarif standard, le cache et les données —, la comparaison par prix du token est devenue inutile. Ce qui fonctionne :

  1. Mesurez le coût par tâche accomplie, sur votre propre tâche, avec votre propre texte. C'est la seule mesure qui réunit les trois variables.
  2. Séparez vos charges de travail en deux. Celles qui transmettent des données sensibles et celles qui n'en transmettent pas. Elles peuvent, et devraient probablement, tourner sur des modèles différents.
  3. Avant de changer de fournisseur à cause du cache, regardez votre code. Si le début du texte change à chaque appel, la remise n'existe pas pour vous — et réorganiser le texte coûte moins cher que changer de modèle.
  4. Traitez une promesse de poids ouverts comme une promesse. Planifier une migration sur la base de quelque chose qui n'est pas encore sorti revient à signer un contrat avec une date en blanc.

C'est ce type d'analyse que nous menons en implémentation d'IA pour les entreprises : mesurer votre tâche avant de choisir le modèle, et séparer ce qui peut et ce qui ne peut pas sortir de chez vous. Sur le lancement d'OpenAI en détail, voir ce qui change avec GPT-6 Astra ; sur le coût de faire tourner un modèle ouvert sur sa propre machine, combien coûte l'exécution d'un modèle ouvert. Et le repère de ce qu'il faut laisser l'IA consulter se trouve dans le repère de permission.

Sources

Annonce de Claude Fable 5.1 et de Mythos 5.1 et documentation tarifaire d'Anthropic ; page de GPT-6 Astra et documentation des modèles d'OpenAI ; documentation tarifaire de Muse Spark 1.3 de Meta et couverture de VentureBeat, DataCamp et MindStudio sur les deux changements de prix. Les chiffres de remise par palier ont été vérifiés en dehors de la newsletter à l'origine de cet article.

Questions fréquentes

Combien coûte Claude Fable 5.1 ?

10 $ par million de tokens en entrée et 50 $ par million en sortie, soit les mêmes tarifs que la génération précédente. Ce qui a changé, c'est la lecture du cache, passée de 1 $ à 0,25 $ par million, une baisse de 75 %. L'effet annoncé est une réduction d'environ 25 % du coût d'une charge de travail type, et jusqu'à 45 % pour les tâches très agentiques.

Qu'est-ce que le cache dans la facturation d'un modèle d'IA ?

C'est le segment de texte qui se répète à chaque appel — instruction système, manuel, catalogue, historique — et que le modèle garde déjà traité, en facturant beaucoup moins cher pour le relire. Avec Claude Fable 5.1, cette relecture ne coûte plus que 2,5 % du prix de l'entrée normale.

Pourquoi la remise de cache peut-elle ne pas apparaître sur mon compte ?

Parce que le cache n'est exploité que lorsque le début du texte envoyé est identique d'un appel à l'autre. Si votre système insère la date, l'heure ou le nom du client avant le contenu fixe, ce segment change à chaque appel et il n'y a pas de correspondance de cache. Vous payez alors le plein tarif sans en être averti.

Comment fonctionne la remise de Muse Spark de Meta ?

En plus du tarif standard, de 1,25 $ par million de tokens en entrée et 4,25 $ en sortie, Meta a créé un palier pour les utilisateurs qui autorisent l'utilisation de leurs propres questions et des réponses du modèle dans l'entraînement de ses futurs modèles. Dans ce palier, l'entrée revient à 0,10 $ et la sortie à 0,20 $, soit des baisses d'environ 92 % et 95 %.

Puis-je utiliser le palier économique si je traite des données de clients ?

Probablement pas. Autoriser l'entraînement avec ce contenu exige une base légale au regard de la LGPD, et il est rare qu'un client ait consenti à ce que ses données servent à entraîner le modèle d'une autre entreprise. Les contrats d'entreprise comportent généralement une clause de confidentialité qui l'interdit déjà en amont. Le palier économique convient bien au contenu public ou qui n'identifie personne.

Quel modèle d'IA est le moins cher aujourd'hui ?

Cette question n'a plus de réponse simple dans le tableau des tarifs. Avec trois variables en jeu — prix par token, remise de cache et remise en échange de données —, le seul chiffre comparable est le coût par tâche accomplie, mesuré sur votre propre tâche et avec votre propre texte.