ÉCONOMIE DE L’IA
FIELD NOTE 07 / 15Les modèles de pointe ne sont pas bon marché. Les démonstrations, si.
Quelques centimes peuvent produire une réponse impressionnante. Un système de revenus fiable peut nécessiter un contexte long, du raisonnement, de la recherche d’informations, des outils, de nouvelles tentatives, de l’évaluation et de l’attention humaine. Le prix de la démonstration n’est pas le coût d’exploitation.
Mesurez le coût du travail utile, pas le prix d’une réponse de modèle.
PARTAGER CETTE FIELD NOTE
Transmettez le signal utile.
Le système d’IA le moins cher est celui qui ne doit fonctionner qu’une fois.
Un prompt propre entre. Une réponse soignée sort. Quelqu’un consulte le tableau d’utilisation et découvre que l’appel au modèle a coûté moins qu’un déjeuner. La conclusion s’écrit toute seule : l’intelligence est désormais presque gratuite.
Ce que le reçu ne montre pas, c’est le soin apporté à la préparation de la démonstration. Les sources ont été sélectionnées, la tâche était favorable, le résultat a été inspecté par une personne et les tentatives gênantes ont disparu avant la réunion. On chiffre une réponse réussie comme s’il s’agissait d’un système de production.
Le vrai travail commercial n’arrive pas sous forme d’une seule demande propre. Il arrive sous forme de fiches CRM incomplètes, de preuves clients contradictoires, de noms d’entreprises ambigus, d’offres changeantes, de permissions, d’exceptions et de délais. Le système doit faire plus que générer. Il doit trouver, interpréter, décider, agir et montrer pourquoi son travail mérite confiance.
Une réponse bon marché et un système bon marché ne sont pas la même chose.
Le modèle relit le contexte chaque fois que le système réfléchit.
Les tarifs des modèles sont généralement présentés comme un prix par unité d’entrée et de sortie. Le calcul semble ainsi merveilleusement faible. Mais un système agentique peut lire un long ensemble d’instructions, rechercher du contexte métier, appeler un outil, examiner le résultat, réviser son plan et réessayer. Chaque tour ajoute du travail. Un contexte plus long et un raisonnement plus profond peuvent transformer une seule tâche métier en de nombreux appels au modèle plutôt qu’un seul.
Puis les services environnants s’ajoutent à la facture : recherche, enrichissement, récupération d’informations, transcription, génération d’images, déplacement des données, stockage et logiciel qui les coordonne. Un appel d’outil échoué peut nécessiter une récupération. Une réponse incertaine peut nécessiter un deuxième modèle ou une revue humaine. Une action à fortes conséquences peut nécessiter les deux.
Cela ne rend pas l’intelligence de pointe non rentable. Cela signifie que l’unité achetée n’est pas un token. L’unité utile est une tâche terminée avec succès à un niveau acceptable de qualité, de rapidité et de risque.
- Contexte consommé à chaque tour du modèle.
- Raisonnement, nouvelles tentatives et parcours alternatifs.
- Récupération d’informations, recherche et appels aux outils tiers.
- Évaluation, revue et gestion des exceptions.
- Surveillance, maintenance et amélioration après le lancement.
Le modèle le moins cher peut produire le résultat le plus coûteux.
Un modèle plus petit, moins cher par appel, peut nécessiter davantage de nouvelles tentatives, des instructions plus élaborées et plus de corrections humaines. S’il manque un signal d’achat, invente une affirmation sur un client ou oriente mal un compte, l’économie sur le modèle devient insignifiante face à la conséquence commerciale.
L’erreur inverse consiste à utiliser le modèle le plus puissant à chaque étape. Un modèle de pointe ne devrait pas classer un champ qu’une règle peut valider ni réécrire un texte qu’un modèle plus petit traite de façon fiable. La capacité doit suivre la conséquence. Utilisez le logiciel ordinaire pour les règles fixes, des modèles économiques pour le travail délimité et les modèles de pointe là où une interprétation difficile change le résultat.
C’est l’orientation vers les modèles comme décision métier. La question n’est pas : « Quel modèle est le moins cher ? » C’est : « Quel est le système le moins coûteux qui accomplit cette catégorie de travail de façon fiable ? »
Chiffrez le parcours vers un travail accepté.
Un modèle de coût utile suit la tâche de la demande à l’acceptation. Il inclut ce qui se passe lorsque la première tentative est faible, que le cas est inhabituel ou que le système doit apprendre. Cela transforme une facture technologique imprévisible en question opérationnelle que l’entreprise peut gérer.
Demande → Exécution → Vérification → Récupération → Amélioration
- 01Demande
Estimez le volume réel de tâches, les pics d’utilisation, la taille du contexte et la répartition des cas ordinaires et difficiles.
- 02Exécuter
Comptez les tours du modèle, le raisonnement, la récupération d’informations, les appels aux outils, le traitement des données et les autres services utilisés par parcours.
- 03Vérifier
Incluez l’évaluation automatisée, l’échantillonnage, les validations et l’attention humaine nécessaires pour accepter le travail.
- 04Récupérer
Chiffrez les nouvelles tentatives, les solutions de repli, les actions échouées, les escalades et le coût de correction des erreurs importantes.
- 05Améliorer
Financez la surveillance, les mises à jour du contexte, les tests et les changements du système à mesure que l’entreprise et les modèles évoluent.
Une fois le coût complet visible, la valeur revendiquée a besoin d’une chaîne causale tout aussi honnête.
Si 100 € d’IA vous rapportent 1 million d’euros de revenus, fuyez.Budgétez le résultat avant d’optimiser la facture de tokens.
Choisissez une tâche commerciale récurrente et établissez son coût actuel, sa qualité, son temps de cycle et son taux d’échec. Faites ensuite passer des cas représentatifs dans le système proposé. Incluez le travail facile, le travail désordonné et les exceptions porteuses de risque commercial. Divisez le coût total d’exploitation par le nombre de résultats que l’équipe accepterait et utiliserait réellement.
Optimisez seulement ensuite. Mettez en cache le contexte répété. Orientez les étapes plus simples vers des modèles plus petits. Remplacez l’interprétation par des règles lorsque la réponse est fixe. Réduisez les tours inutiles. Améliorez les preuves pour éviter que le système dépense de l’argent à raisonner autour d’informations manquantes.
Les modèles de pointe peuvent produire un effet de levier extraordinaire. Prétendre qu’ils sont gratuits rend cet effet plus difficile à exploiter, à chiffrer et à croire. Les acheteurs sérieux n’ont pas besoin du coût de démonstration le plus bas. Ils ont besoin d’une économie honnête du travail utile à grande échelle.
Ne demandez pas ce qu’a coûté la réponse. Demandez ce qu’a coûté la production d’un travail utilisable par l’entreprise.
Sources et lectures complémentaires.
Tarifs actuels des modèles, des tokens, des outils et du traitement, montrant comment les choix de capacité, de contexte et de services influencent le coût d’utilisation.
02Tarifs des modèles AnthropicIndications tarifaires sur les entrées et sorties des modèles, la mise en cache, le traitement par lots et les autres modes d’utilisation.
03OpenAI : un tableau de bord pour l’ère de l’IAUn argument en faveur de la mesure du coût par tâche réussie, de la fiabilité et de la valeur plutôt que du seul coût par token.