FinOps IA 

Douze mois de budget IA engloutis en quatre, le coût caché du passage à l’échelle 

Au Salon de la Data et de l’IA, à Nantes, Arnaud De Temmerman, CTO de Treez, a posé le coût comme nouveau test de maturité des projets d’IA générative. 

Publié et mis à jour le 5 octobre 2026
5 min.
Douze mois de budget IA engloutis en quatre, le coût caché du passage à l’échelle

Pour Arnaud De Temmerman, CTO et cofondateur de Treez, les économies s’évaporent dès que les erreurs imposent une reprise humaine, dégradent un processus métier ou rendent le service inutilisable : "une mauvaise réponse pas chère coûte plus cher"

Fiona Slous / Alliancy

Uber avait prévu douze mois de budget IA. Quatre ont suffi pour le consumer. Au printemps 2026, la diffusion de Claude Code auprès de quelque 5 000 ingénieurs a pris de vitesse les prévisions financières du groupe. Le cas a nourri la conférence consacrée au FinOps IA d’Arnaud De Temmerman, CTO et cofondateur de Treez, le 22 septembre au Salon de la Data et de l’IA de Nantes. “Quand on met  de l’IA entre vos mains, c’est un peu comme si on vous avait donné des super pouvoirs”, a imagé Arnaud De Temmerman. L’adoption massive des outils de coding agentique a fait sauter les hypothèses budgétaires, avant que le groupe ne revoie ses réglages, son mix de modèles et son recours aux modèles open weight. Le cas Uber met à mal une équation confortable, longtemps portée par la baisse rapide du prix des modèles. Une IA moins chère à l’unité peut coûter beaucoup plus cher une fois adoptée à grande échelle. “Réfléchissez au nombre important de paramètres que vous ne maîtrisez pas pour savoir si ça va rester rentable dans le temps”, a prévenu le CTO de Treez. 

Le token bon marché nourrit l’appétit 

La baisse du prix des modèles n’a pas empêché les factures de grimper. “Plus c’est à prix abordable, plus je crée d’agents, plus je consomme”, a observé le CTO de Treez. L’agentique accentue même l’écart entre tarif affiché et coût réel. Pour accomplir une seule tâche, un agent peut interroger plusieurs fois le LLM, appeler un outil, récupérer une information puis renvoyer tout ou partie de son contexte au modèle. Chaque boucle ajoute des tokens. “On peut aujourd’hui avoir trois invocations, demain six”, a expliqué Arnaud De Temmerman. Le FinOps IA s’attaque à cet effet rebond avant que la généralisation transforme une économie séduisante à petite échelle en poste de dépense difficile à prévoir. L’industrialisation transforme cette économie séduisante à petite échelle en poste de dépense difficile à prévoir. D’autant plus que les fournisseurs gardent la main sur les grilles tarifaires. “Le modèle de facturation aujourd’hui, c’est du mouvant et ça peut bouger du jour au lendemain”, a-t-il averti. Le coût d’exécution mérite donc sa place dans les choix d’architecture avant la mise en production. Une fois les volumes installés, réduire la voilure devient autrement plus douloureux. 

Utiliser l’IA pour se passer de l’IA 

Puisque chaque appel a un prix, le supprimer peut rapporter davantage que le négocier. Cette logique a guidé un projet de migration mené pour un acteur de la grande distribution. Le chantier portait sur 13 000 rapports Google Data Studio à convertir vers Google Looker en trois mois. Un traitement rapport par rapport avec un modèle frontière aurait fait du volume le principal poste de dépense. “Est-ce que le LLM devrait faire partie du run de ma solution industrialisée ?”, a interrogé Arnaud De Temmerman. Claude 5 a servi pendant la phase d’ingénierie à produire un programme Python capable d’exécuter ensuite les conversions de manière déterministe. L’entreprise a donc accepté un coût de conception supérieur pour abaisser celui de l’exécution à grande échelle. Ce choix révèle une rupture entre POC (proof of concept) et industrialisation. Le premier stade cherche à démontrer qu’une tâche peut être accomplie par l’IA. Le second doit déterminer combien de fois il faudra payer pour qu’elle le soit. “Utiliser l’IA pour se passer de l’IA”, a-t-il résumé. À l’échelle, la sobriété architecturale peut ainsi battre en brèche le réflexe du tout-LLM. 

Jusqu’à cent fois moins cher 

Lorsque le LLM reste indispensable, un deuxième arbitrage s’impose. “Est-ce que je peux faire tourner tout ça sur une infrastructure locale qui n’est pas dépendante d’un fournisseur de services ?”, a interrogé Arnaud De Temmerman. Les modèles open weight changent alors la grammaire financière du projet. L’entreprise troque une facture indexée sur chaque appel contre du matériel à dimensionner, de l’électricité et des coûts d’exploitation. Pour un million de conversations mensuelles, le cofondateur de Treez a situé la facture entre 15 000 et 75 000 dollars avec des modèles frontières, contre 150 à 800 dollars avec de petits modèles spécialisés. “Ne surtout pas prendre le plus gros modèle disponible”, a-t-il conseillé. Le benchmark devient alors une discipline économique. Une tâche de classification, une extraction ou un traitement métier étroit peuvent justifier un modèle spécialisé tandis que les requêtes complexes conservent l’accès à davantage de puissance. Cette recherche du coût minimal rencontre toutefois une ligne rouge. Les économies s’évaporent dès que les erreurs imposent une reprise humaine, dégradent un processus métier ou rendent le service inutilisable. “Une mauvaise réponse pas chère coûte plus cher”, a résumé Arnaud De Temmerman. Le FinOps ne récompense donc pas le modèle le moins cher. Il oblige à chiffrer le niveau de qualité réellement nécessaire pour chaque usage. 

La facture doit retrouver son propriétaire 

Reste à savoir qui consomme quoi. Le routage permet déjà d’envoyer une demande simple vers un petit modèle et de réserver les modèles frontières aux traitements exigeants. Mais aucune martingale architecturale ne dispense d’observer la consommation. “Le premier sujet d’un projet FinOps en IA, c’est de pouvoir poser des sondes et d’agréger les dépenses pour savoir combien ça vous coûte”, a posé Arnaud De Temmerman. Une AI gateway peut centraliser les appels, suivre leur consommation et donner aux équipes une vision commune de la dépense. Cette transparence sert aussi les arbitrages organisationnels. Mais, laisser chaque équipe ouvrir ses propres accès aux fournisseurs fragmente la facture et prive la DSI d’une vue d’ensemble. “Surtout, ne faites pas la bêtise de laisser tout le monde accéder à toutes les solutions possibles”, a mis en garde le CTO et cofondateur de Treez. La mesure prend tout son sens une fois rapprochée du bénéfice métier. Une facture IA de cinq millions peut rester soutenable si le service en économise dix. Un agent bon marché sans gain démontrable reste une dépense. “Il faut gouverner la dépense en regard de la valeur que vous apportez”, a conclu Arnaud De Temmerman. Après la course aux POC, l’IA entre ainsi dans l’âge moins grisant des comptes d’exploitation. Les entreprises ont appris à faire fonctionner les modèles. Elles doivent maintenant apprendre à faire fonctionner leur économie. 


Préférences de consentement