Offres IA / FinOps IA

Tokenomics

Savoir ce que coûte l'IA, et qui la consomme

Nous consolidons vos licences et consommations d'API IA, les rattachons aux équipes et aux usages, puis posons budgets, quotas et alertes. Vous pilotez la dépense au lieu de la découvrir sur la facture.

Le contexte

Les dépenses IA arrivent par plusieurs portes à la fois : licences par utilisateur, abonnements souscrits directement par les équipes, consommation d'API chez plusieurs fournisseurs, parfois via Azure, Bedrock ou Vertex. Chaque source a sa console, sa granularité et son rythme de facturation.

La consommation à l'usage change la nature du problème. Un prompt mal conçu, un modèle surdimensionné ou une boucle d'agent peuvent faire varier la facture sans que personne ne s'en aperçoive avant la fin du mois. Les licences, elles, s'accumulent : doublons, comptes dormants, outils non déclarés.

Maîtriser ces coûts n'est pas un exercice de tableur. Il faut faire passer le trafic par une gateway, collecter les usages via les API des fournisseurs, les rattacher à l'annuaire, puis exploiter une plateforme de suivi. C'est un travail d'infrastructure et de FinOps, que Keltio pratique sur le cloud depuis 2019.

Pour qui

  • DAF et contrôleurs de gestion qui voient les factures IA augmenter sans pouvoir les attribuer
  • DSI qui gèrent des abonnements ChatGPT, Copilot, Claude et des clés API dispersés entre les équipes
  • Éditeurs SaaS dont les fonctionnalités IA consomment des tokens à chaque utilisation client
  • Équipes FinOps cloud qui doivent étendre leur périmètre aux dépenses d'IA générative

C'est pour vous si…

  • Vous ne savez pas dire quelle équipe ou quelle application génère votre facture d'API IA
  • Plusieurs équipes ont souscrit leurs propres abonnements IA sans passer par les achats
  • Des clés API sont partagées entre applications, voire entre personnes
  • Votre facture IA a connu une hausse que personne n'a su expliquer
  • La finance vous demande un budget IA prévisionnel et vous n'avez pas de base pour l'établir
Est-ce urgent pour vous ?

Combien d'euros de dépenses IA sont optimisables ?

Estimez la part de vos dépenses IA récupérable et l'urgence d'en reprendre le contrôle.

Voir comment nous y répondons ↓

Estimation indicative à partir de vos réponses et d'hypothèses prudentes, modifiables. Rien n'est enregistré.

Concrètement

Ce que nous réalisons pour vous

Chaque volet peut être engagé seul ou combiné aux autres : nous ajustons le périmètre à votre existant et à votre objectif.

01

Inventaire des licences et usages

Nous recensons tout ce qui est payé pour l'IA, y compris ce qui n'est pas déclaré.

  • Recensement des abonnements IA (ChatGPT, Copilot, Claude, …) et des consommations d'API
  • Collecte des factures et coûts historiques
  • Identification des doublons, licences inutilisées et outils non déclarés
  • Projection des coûts sur les prochains mois
02

Plateforme de suivi des coûts

Nous déployons sur votre infrastructure l'outil qui centralise les données de coûts.

  • Plateforme de suivi à base de briques open source (LiteLLM, Langfuse, OpenCost, …) selon votre contexte
  • Hébergement conteneurisé sur votre infrastructure, avec SSO
  • Base de données managée, rétention historique et sauvegardes
  • Déploiement en infrastructure as code (Terraform, Helm, …)
03

Connexion aux fournisseurs

Nous automatisons la collecte des usages et leur rattachement aux équipes et aux personnes.

  • Récupération des usages via les API d'administration (OpenAI, Anthropic, Azure, Bedrock, Vertex, Mistral, …)
  • Import des usages des licences SaaS et des factures
  • Rattachement des clés API aux équipes et rapprochement avec l'annuaire (Entra ID, Google Workspace, …)
  • Collecte quotidienne automatisée
04

Budgets, quotas et rate limits

Nous transformons les enveloppes budgétaires en règles appliquées par la gateway.

  • Clés virtuelles par application ou par équipe
  • Budgets mensuels par équipe, avec blocage ou alerte au dépassement
  • Quotas par personne et par modèle, rate limits en requêtes et en tokens
  • Processus de demande d'augmentation de budget
05

Dashboards et alerting

Nous rendons les coûts lisibles pour chaque public, de la finance aux développeurs.

  • Dashboards par fournisseur, modèle, équipe, application et cas d'usage
  • Coût unitaire par tâche métier, par exemple par ticket traité
  • Alertes par e-mail ou messagerie (Slack, Teams, …), détection d'anomalies et prévisions de consommation
  • Rapport mensuel automatique
06

Optimisation et suivi FinOps

Nous identifions les économies possibles et installons un suivi dans la durée.

  • Quick wins : licences inutilisées, modèles surdimensionnés
  • Leviers techniques : cache de prompts, traitement en batch, routage de modèles
  • Préparation des négociations fournisseurs : engagements, tarifs volume
  • Revue mensuelle des écarts au budget et ajustement des quotas
Résultat

Ce que vous obtenez

  • Une vue consolidée des coûts IA par fournisseur, modèle, équipe et application
  • Des budgets, quotas et rate limits appliqués techniquement, avec alertes avant dépassement
  • Une liste de licences dormantes, de doublons et de modèles surdimensionnés à traiter
  • Un rituel FinOps régulier entre finance et équipes techniques, appuyé sur des données fiables
Livrables

Ce que nous vous remettons

  • Inventaire des outils, licences et abonnements IA, avec doublons et licences dormantes
  • Plateforme de suivi déployée, son code d'infrastructure et sa documentation d'exploitation
  • Connecteurs fournisseurs et référentiel clés, équipes et personnes
  • Budgets, quotas et clés virtuelles configurés, avec la procédure de gestion associée
  • Dashboards de coûts, règles d'alerte et rapport mensuel type
  • Note de recommandations et plan d'économies priorisé
Pourquoi Keltio

L'IA en production, c'est d'abord de l'infrastructure

≈ 70 %

d'une mission IA en production relève de l'infra et du DevOps. C'est notre métier depuis 2019.

InfraDevOpsCybersécuritéIA
01

Le FinOps cloud comme point de départ

Nous pratiquons le FinOps sur le cloud depuis 2019 : attribution des coûts, budgets, alertes, revues avec la finance. Les dépenses IA demandent la même discipline, avec une unité de compte différente.

02

Des règles appliquées, pas seulement constatées

Budgets et quotas sont configurés dans une gateway que nous déployons et exploitons. Un dépassement déclenche une alerte ou un blocage, pas seulement une ligne dans un rapport.

03

Une plateforme hébergée chez vous

La plateforme de suivi tourne sur votre infrastructure, déployée en infrastructure as code avec SSO et sauvegardes. Les données d'usage restent sous votre contrôle.

04

Un pont entre finance et technique

Nous produisons des vues lisibles pour la DAF et des leviers actionnables pour les développeurs, pour que l'optimisation ne s'arrête pas au constat.

Démarche

Comment nous travaillons

  1. 1

    Inventorier

    Collecte des factures, abonnements et accès aux consoles d'administration. Premier état des lieux des dépenses, des doublons et des usages non déclarés.

  2. 2

    Outiller

    Déploiement de la plateforme de suivi et de la gateway, connexion aux fournisseurs et à l'annuaire, rattachement des clés aux équipes.

  3. 3

    Encadrer

    Configuration des budgets, quotas, rate limits et alertes à partir des enveloppes définies par la finance. Mise en place des dashboards.

  4. 4

    Optimiser dans la durée

    Recommandations d'optimisation, puis revue mensuelle des coûts et des écarts, ajustement des quotas et intégration des nouveaux outils.

FAQ

Questions fréquentes

Faut-il faire passer tout notre trafic IA par une gateway ?

Pour appliquer des budgets et des quotas en temps réel, oui, au moins pour les appels d'API. L'inventaire et une partie du suivi fonctionnent sans, à partir des API d'administration des fournisseurs et des factures. Nous définissons avec vous un plan de bascule progressif, application par application.

Quels accès devons-nous vous donner ?

Un accès administrateur ou en lecture aux consoles des fournisseurs, les factures, un export de l'annuaire pour attribuer les coûts, et un interlocuteur aux achats ou à la finance. Pour la plateforme, un environnement cloud ou Kubernetes, un nom de domaine et un certificat.

Les prompts de nos utilisateurs sont-ils collectés ?

Le suivi des coûts repose sur des métadonnées : volumes de tokens, modèle, clé, équipe. La journalisation du contenu des requêtes est un choix distinct, que nous configurons selon vos règles internes. La plateforme étant hébergée sur votre infrastructure, ces données restent chez vous.

Quels outils utilisez-vous ?

Principalement des briques open source : LiteLLM comme gateway et pour les budgets, Langfuse ou OpenCost pour le suivi, Grafana ou Metabase pour les dashboards. Le choix dépend de votre existant, et tout est déployé en infrastructure as code pour que vos équipes puissent le reprendre.

Pouvez-vous garantir un niveau d'économies ?

Non, car il dépend de vos usages. Nous vous remettons après l'analyse une estimation des économies potentielles par levier, puis nous suivons les économies effectivement réalisées dans les revues mensuelles.

Une conversation pour résoudre vos enjeux