Offres IA / FinOps IA

Routage de modèles

Chaque requête vers le modèle le plus rentable

Toutes vos requêtes n'ont pas besoin du modèle le plus cher. Nous mesurons la qualité par usage, déployons un routeur derrière votre gateway et vérifions par tests A/B que les économies ne dégradent pas les réponses.

Le contexte

La plupart des applications LLM choisissent un modèle une fois pour toutes, souvent le plus performant disponible au moment du développement. Or une grande partie des requêtes, classification, extraction, reformulation ou questions simples, serait traitée correctement par un modèle plus petit, plus rapide et moins cher.

Le routage consiste à décider, requête par requête, quel modèle appeler selon la tâche, la complexité et vos contraintes. Des outils existent pour cela, par exemple le routeur open source de NotDiamond ou RouteLLM, ou de simples règles dans une gateway comme LiteLLM. Nous choisissons l'approche selon votre contexte, sans lien commercial avec ces éditeurs.

Ce qui fait échouer ces projets, c'est rarement le routeur lui-même. C'est l'absence de jeu d'évaluation pour savoir si la qualité tient, l'absence de logs exploitables pour connaître les usages, et une intégration fragile sans fallback. C'est un travail d'infrastructure, de mesure et d'exploitation, le cœur du métier de Keltio.

Pour qui

  • Éditeurs SaaS dont les fonctionnalités IA envoient tout le trafic vers un seul modèle haut de gamme
  • Équipes produit ou data qui exploitent plusieurs applications LLM en production avec des volumes significatifs
  • Entreprises qui disposent déjà d'une gateway IA et veulent l'utiliser pour réduire leurs coûts
  • Organisations qui doivent réserver certains types de données à des modèles hébergés en Europe

C'est pour vous si…

  • Toutes vos applications appellent le même modèle, quel que soit le type de requête
  • Votre facture d'API LLM croît plus vite que votre usage métier
  • Vous avez des logs d'appels LLM ou une gateway, mais personne ne les analyse
  • Vous hésitez à changer de modèle faute de moyen de vérifier que la qualité reste acceptable
  • Certaines données ne doivent être traitées que par des modèles européens
Est-ce urgent pour vous ?

Combien votre facture LLM pourrait-elle baisser ?

Estimez les économies d'un routage des requêtes vers le modèle le plus rentable, et l'urgence du sujet.

Voir comment nous y répondons ↓

Estimation indicative à partir de vos réponses et d'hypothèses prudentes, modifiables. Rien n'est enregistré.

Concrètement

Ce que nous réalisons pour vous

Chaque volet peut être engagé seul ou combiné aux autres : nous ajustons le périmètre à votre existant et à votre objectif.

01

Analyse des usages et des modèles

Nous partons de vos logs réels pour identifier où le routage a du sens.

  • Recensement des appels LLM par application et par modèle
  • Volumes, coûts et latences actuels
  • Analyse des requêtes par type de tâche et niveau de complexité
  • Liste des usages candidats et estimation des gains
02

Jeu d'évaluation qualité

Nous construisons le référentiel qui permet de juger si un modèle moins cher suffit.

  • Exemples réels par usage prioritaire, anonymisés si besoin
  • Critères de qualité et réponses attendues validés par vos experts métier
  • Évaluation automatique avec Promptfoo ou LLM-as-judge
  • Scores de référence par modèle
03

Déploiement du routeur

Nous installons le routeur dans votre chaîne d'appel, sans réécrire vos applications.

  • Routeur open source en conteneur, par exemple celui de NotDiamond, ou règles de routage dans la gateway
  • Intégration derrière votre gateway existante (ex. LiteLLM)
  • Haute disponibilité et fallback vers un modèle par défaut
  • Déploiement en infrastructure as code, avec possibilité d'un routeur entraîné sur vos données d'évaluation
04

Règles de routage coût / qualité

Nous traduisons vos arbitrages métier en règles configurées et testées.

  • Seuil de qualité et modèle par défaut par usage
  • Arbitrage entre coût, qualité et latence
  • Contraintes de souveraineté : modèles européens uniquement pour certaines données
  • Tests de non-régression des règles
05

Tests A/B et mesure des économies

Nous comparons le routeur au modèle unique sur votre trafic réel avant toute généralisation.

  • Routeur contre modèle unique sur une partie du trafic
  • Mesure des coûts, latences et scores qualité
  • Collecte du retour des utilisateurs
  • Bilan et recommandation go / no-go
Résultat

Ce que vous obtenez

  • Une cartographie de vos appels LLM par application, modèle, coût et latence
  • Des jeux d'évaluation qui mesurent la qualité par usage et servent pour tout futur changement de modèle
  • Un routeur en production derrière votre gateway, avec fallback vers un modèle par défaut
  • Une décision de généralisation fondée sur des tests A/B mesurant coûts, latences et qualité
Livrables

Ce que nous vous remettons

  • Cartographie des usages LLM et estimation des gains du routage
  • Jeux d'évaluation par usage, grille de critères qualité et scores de référence par modèle
  • Routeur déployé, configuration des modèles et endpoints, documentation d'exploitation
  • Règles de routage documentées et appliquées par usage
  • Protocole de test A/B et rapport d'économies et d'impact qualité
  • Recommandation de généralisation
Pourquoi Keltio

L'IA en production, c'est d'abord de l'infrastructure

≈ 70 %

d'une mission IA en production relève de l'infra et du DevOps. C'est notre métier depuis 2019.

InfraDevOpsCybersécuritéIA
01

Indépendance vis-à-vis des outils

Nous citons NotDiamond comme exemple parce que son routeur est open source, pas en raison d'un partenariat. Nous retenons l'outil, ou les simples règles de gateway, qui conviennent à votre architecture.

02

Un routeur exploité comme un composant critique

Placé sur le chemin de toutes vos requêtes, le routeur doit être hautement disponible, observable et doté d'un fallback. Nous le déployons en infrastructure as code, comme nous le faisons pour les plateformes cloud depuis 2019.

03

La mesure avant la promesse

Jeux d'évaluation, tests A/B et rapport d'impact qualité : vous décidez de généraliser sur la base de vos propres données, pas d'un benchmark public.

04

Le routage replacé dans votre FinOps IA

Le routage est un levier parmi d'autres, avec le cache de prompts, le batch et le suivi des budgets. Nous vous indiquons s'il est le plus pertinent dans votre cas.

Démarche

Comment nous travaillons

  1. 1

    Mesurer

    Analyse des logs d'appels et des factures pour cartographier les usages et repérer les candidats au routage.

  2. 2

    Construire l'évaluation

    Constitution des jeux d'évaluation avec vos experts métier et scoring des modèles candidats sur chaque usage prioritaire.

  3. 3

    Déployer et configurer

    Mise en place du routeur derrière la gateway, règles de routage par usage, fallback et tests de non-régression.

  4. 4

    Prouver puis généraliser

    Test A/B sur une partie du trafic, bilan coûts, latences et qualité, puis recommandation go / no-go et extension aux autres usages.

FAQ

Questions fréquentes

Êtes-vous partenaire de NotDiamond ?

Non. NotDiamond est un exemple d'outil possible, que nous citons parce qu'il propose un routeur open source. Selon votre contexte, nous pouvons aussi utiliser d'autres routeurs comme RouteLLM, ou de simples règles dans une gateway comme LiteLLM.

Comment être sûr que la qualité des réponses ne baisse pas ?

Chaque usage routé dispose d'un jeu d'évaluation et d'un seuil de qualité défini avec vos métiers. Le routeur est ensuite comparé au modèle unique en test A/B sur votre trafic réel, et la généralisation ne se décide qu'au vu des résultats.

Quels prérequis pour démarrer ?

Des logs d'appels LLM ou une gateway, les factures des fournisseurs, des exemples réels de requêtes et des experts métier pour valider les réponses attendues. Le test A/B demande aussi un trafic suffisant sur la période pilote et l'accord des équipes applicatives.

Faut-il modifier nos applications ?

Très peu si vos applications passent déjà par une gateway compatible OpenAI : le routeur s'insère derrière elle. Sinon, la première étape consiste à faire transiter les appels par une gateway, ce qui vous sert aussi pour le suivi des coûts et la gouvernance.

Nos données transitent-elles par un service tiers ?

Le routeur que nous déployons tourne en conteneur sur votre infrastructure. Les requêtes ne vont qu'aux modèles que vous avez autorisés, et des règles peuvent réserver certaines données à des modèles européens ou auto-hébergés.

Une conversation pour résoudre vos enjeux