Offres IA / Souveraineté

Infra IA open source

Vos modèles open source derrière une gateway unique

Nous choisissons les modèles open source adaptés à vos usages, les servons sur GPU en cloud souverain ou on-prem, et les exposons derrière une AI gateway compatible OpenAI. Vos applications changent de modèle sans changer de code.

Le contexte

Les modèles open source, Mistral, Llama, Qwen ou Gemma, couvrent désormais une large part des usages d'entreprise : extraction, résumé, classification, RAG, assistance. Ils offrent ce que les API propriétaires ne garantissent pas : contrôle de l'hébergement, stabilité des versions et absence de dépendance à un seul éditeur.

Encore faut-il les faire tourner. Choisir le bon modèle par usage, dimensionner les GPU, servir les modèles avec un bon débit, les exposer proprement aux applications, surveiller la qualité et appliquer les mises à jour de sécurité : ce sont des sujets d'infrastructure, qui représentent environ 70 % d'une mission IA en production.

Keltio aborde l'IA open source comme toute plateforme de production : Kubernetes, infrastructure as code, observabilité, sécurité. Nous travaillons avec OVHcloud et Scaleway, nos partenaires cloud souverain, et savons aussi déployer on-prem ou chez un autre fournisseur selon vos contraintes.

Pour qui

  • Entreprises qui veulent réduire leur dépendance à un fournisseur de modèles propriétaires
  • Organisations dont les données ne peuvent pas être envoyées à une API hébergée hors de l'Union européenne
  • Équipes techniques qui exploitent déjà plusieurs applications LLM et veulent un point d'accès unique
  • Éditeurs qui veulent intégrer l'IA dans leur produit avec des coûts d'inférence maîtrisés

C'est pour vous si…

  • Vos applications appellent directement les API de plusieurs fournisseurs, chacune avec ses clés et son code
  • Une partie de vos cas d'usage est bloquée parce que les données ne peuvent pas partir chez un fournisseur américain
  • Vous voulez tester des modèles open source mais n'avez pas l'équipe pour opérer des GPU
  • Votre facture d'API propriétaire devient un sujet de discussion avec la direction
  • Vous avez besoin d'un modèle spécialisé sur votre vocabulaire métier
Est-ce urgent pour vous ?

Faut-il passer à des modèles open source ?

Estimez l'économie potentielle d'une gateway vers des modèles open source hébergés, et l'urgence du sujet.

Voir comment nous y répondons ↓

Estimation indicative à partir de vos réponses et d'hypothèses prudentes, modifiables. Rien n'est enregistré.

Concrètement

Ce que nous réalisons pour vous

Chaque volet peut être engagé seul ou combiné aux autres : nous ajustons le périmètre à votre existant et à votre objectif.

01

Choix des modèles par usage

Nous comparons les modèles open source sur vos propres requêtes avant tout déploiement.

  • Présélection de modèles open source (Mistral, Llama, Qwen, Gemma)
  • Benchmark qualité, latence, coût et maîtrise du français sur vos exemples
  • Analyse des licences et contraintes d'usage
  • Comparaison avec les modèles propriétaires utilisés aujourd'hui
02

Dimensionnement GPU et hébergement

Nous déterminons l'infrastructure nécessaire et le bon endroit pour l'héberger.

  • Estimation des besoins GPU selon modèles et volumétrie
  • Comparaison cloud souverain (OVHcloud, Scaleway, Outscale), hyperscaler et on-prem
  • Scénarios de charge, autoscaling et stratégie de réservation
  • Architecture cible et estimation des coûts mensuels
03

AI gateway

Nous déployons le point d'entrée unique de vos applications vers tous les modèles.

  • Gateway compatible OpenAI (LiteLLM, …), vers modèles open source et API externes
  • Clés API par application, SSO, journalisation et quotas
  • Cache et fallback entre modèles, haute disponibilité
  • Déploiement Kubernetes en infrastructure as code
04

Serving des modèles

Nous faisons tourner les modèles en production avec un débit et une disponibilité maîtrisés.

  • Serving (vLLM, TGI, …) : LLM, embeddings et reranker
  • Quantification et optimisation du débit
  • Autoscaling sur Kubernetes (KServe, Ray Serve, …)
  • Mises à jour de modèles sans interruption, manifestes Helm
05

Fine-tuning et migration des usages

Nous adaptons un modèle à votre métier si besoin, puis basculons vos applications.

  • Fine-tuning LoRA sur vos données, avec pipeline reproductible (Axolotl, Unsloth)
  • Comparaison au modèle de base sur un jeu de test
  • Bascule progressive des applications vers la gateway, avec adaptation des prompts
  • Tests de non-régression et retour arrière possible
06

Monitoring et MCO

Nous surveillons la plateforme et la maintenons dans la durée.

  • Métriques de serving et GPU (Prometheus, Grafana, …), alertes
  • Suivi qualité des réponses (Langfuse, LangSmith, …) et détection de dérive après mise à jour
  • Mises à jour de sécurité, des modèles et du moteur de serving
  • Optimisation des coûts GPU et revue mensuelle de capacité
Résultat

Ce que vous obtenez

  • Un point d'accès unique compatible OpenAI vers les modèles open source et les API externes que vous autorisez
  • Des modèles choisis sur vos propres usages, servis en production sur l'hébergement de votre choix
  • Une ou plusieurs applications migrées, avec tests de non-régression et retour arrière possible
  • Une plateforme observable et maintenue : performances, qualité, incidents et mises à jour
Livrables

Ce que nous vous remettons

  • Benchmark qualité / coût, matrice de choix modèle par usage et analyse des licences
  • Note de dimensionnement, comparatif d'hébergement et architecture cible
  • AI gateway et modèles servis en production, avec manifestes Helm et code d'infrastructure
  • Documentation d'utilisation pour les développeurs
  • Applications migrées et rapport de non-régression
  • Dashboards (Grafana, …), règles d'alerte et rapport mensuel d'exploitation
Pourquoi Keltio

L'IA en production, c'est d'abord de l'infrastructure

≈ 70 %

d'une mission IA en production relève de l'infra et du DevOps. C'est notre métier depuis 2019.

InfraDevOpsCybersécuritéIA
01

Des plateformes de production depuis 2019

Kubernetes, infrastructure as code, haute disponibilité et observabilité sont notre métier d'origine. Servir des modèles sur GPU relève de la même exigence d'exploitation.

02

Le cloud souverain en pratique

OVHcloud et Scaleway sont nos partenaires cloud souverain. Nous comparons aussi objectivement avec l'on-prem ou d'autres fournisseurs pour retenir l'hébergement adapté à vos contraintes.

03

La sécurité intégrée dès la conception

Clés par application, SSO, journalisation, règles réseau et mises à jour de sécurité font partie du périmètre de la gateway, pas d'un chantier ultérieur.

04

Pas d'enfermement

Briques open source, API compatible OpenAI et code d'infrastructure remis à vos équipes : vous pouvez changer de modèle, de fournisseur ou reprendre l'exploitation.

Démarche

Comment nous travaillons

  1. 1

    Choisir

    Recensement des usages cibles et benchmark de modèles open source sur vos requêtes représentatives, avec analyse des licences.

  2. 2

    Dimensionner

    Estimation des besoins GPU, comparaison des hébergements et définition de l'architecture cible selon vos contraintes de souveraineté et de sécurité.

  3. 3

    Déployer

    Mise en place de la gateway et du serving des modèles en infrastructure as code, puis migration progressive d'une ou plusieurs applications.

  4. 4

    Exploiter

    Monitoring des performances et de la qualité, mises à jour, optimisation des coûts GPU et revue de capacité régulière.

FAQ

Questions fréquentes

Les modèles open source sont-ils au niveau des modèles propriétaires ?

Pas sur tous les usages. C'est pourquoi nous comparons les modèles sur vos propres requêtes avant de décider. La gateway permet de garder un modèle propriétaire pour les usages où il reste nécessaire et d'utiliser l'open source ailleurs.

Faut-il acheter des GPU ?

Pas nécessairement. Les GPU peuvent être loués chez un fournisseur de cloud souverain comme OVHcloud ou Scaleway, ce qui évite l'investissement initial. L'on-prem se justifie selon vos volumes et vos contraintes, et la note de dimensionnement compare les options.

Que deviennent nos données ?

Avec des modèles auto-hébergés, les requêtes sont traitées sur l'infrastructure que vous avez choisie et ne sont pas envoyées à un éditeur de modèle. La gateway journalise les accès selon vos règles et peut interdire certaines routes vers des API externes.

Quels prérequis de votre côté ?

La liste des usages visés avec des exemples de requêtes représentatives, une estimation de la volumétrie, vos contraintes de souveraineté et de sécurité, ainsi qu'un environnement d'hébergement avec règles réseau et nom de domaine. Pour la migration, l'accès aux applications et à leurs équipes.

Qui exploite la plateforme ensuite ?

Au choix. Nous pouvons assurer le MCO : surveillance, correction des incidents, mises à jour de sécurité et des modèles, revue de capacité. Tout étant déployé en infrastructure as code et documenté, vos équipes peuvent aussi reprendre l'exploitation.

Une conversation pour résoudre vos enjeux