Offres IA / Souveraineté

Inférence on-prem / cloud souverain

Vos modèles d'IA sur une infrastructure que vous maîtrisez

Nous dimensionnons, déployons et exploitons vos serveurs d'inférence chez nos partenaires cloud souverain OVHcloud et Scaleway, ou dans votre propre datacenter. Vos données ne quittent pas le périmètre que vous avez choisi.

Le contexte

Les modèles open weights ont atteint un niveau qui permet de couvrir une large part des usages d'entreprise : assistant interne, RAG sur documents, extraction, synthèse, aide au code. Il devient réaliste de les faire tourner sur une infrastructure que vous contrôlez.

Pour de nombreuses organisations, c'est la condition pour utiliser l'IA sur des données sensibles : dossiers clients, contrats, code source, données de santé ou financières. Le choix se joue entre un cloud souverain comme OVHcloud ou Scaleway, et des serveurs GPU installés on-premise.

Ce qui coince, c'est tout ce qui entoure le modèle : dimensionner la mémoire GPU et le débit, installer les pilotes et le runtime, servir les modèles avec une API stable, sécuriser les accès, superviser, tenir la charge et maintenir le tout dans le temps. C'est un projet d'infrastructure, et c'est là que se trouve l'essentiel du travail.

Pour qui

  • Établissements financiers, cabinets juridiques et organisations soumis au secret professionnel ou à des exigences réglementaires fortes
  • Entreprises pour qui l'envoi de données à un fournisseur d'IA hors de l'Union européenne est exclu
  • Éditeurs qui veulent intégrer des modèles d'IA dans leur produit sans dépendre d'une API tierce
  • DSI qui disposent d'un datacenter et envisagent d'y héberger leurs propres modèles

C'est pour vous si…

  • Votre RSSI ou votre DPO refuse l'envoi de données sensibles vers des API d'IA américaines
  • Vous avez identifié des cas d'usage IA bloqués uniquement par la question de l'hébergement
  • Vous hésitez entre un cloud souverain et des serveurs GPU dans votre datacenter, sans éléments de comparaison
  • Vous avez déjà acheté ou envisagez d'acheter des serveurs GPU et ne savez pas comment les exploiter
  • Vos équipes ont testé un modèle open source en local et veulent passer à un service utilisable par tous
Est-ce urgent pour vous ?

Avez-vous besoin d'héberger vos modèles vous-mêmes ?

Évaluez l'urgence de disposer d'une inférence sur cloud souverain ou on-premise.

Voir comment nous y répondons ↓

Estimation indicative à partir de vos réponses et d'hypothèses prudentes, modifiables. Rien n'est enregistré.

Concrètement

Ce que nous réalisons pour vous

Chaque volet peut être engagé seul ou combiné aux autres : nous ajustons le périmètre à votre existant et à votre objectif.

01

Dimensionnement et choix d'hébergement

Nous traduisons vos usages en besoins de calcul et comparons les options cloud souverain et on-premise.

  • Recueil des usages, utilisateurs simultanés et modèles visés
  • Calcul des besoins GPU : mémoire et débit
  • Comparaison du coût complet entre OVHcloud, Scaleway et on-premise
  • Pour l'on-premise : réseau, stockage, énergie et refroidissement
02

Infrastructure GPU

Nous mettons en place les ressources GPU, en cloud souverain ou sur vos serveurs, avec un provisionnement automatisé.

  • Pour l'on-premise : cahier des charges matériel et comparaison des offres constructeurs
  • Installation de l'OS, des pilotes NVIDIA et de CUDA, runtime conteneurs
  • Cluster Kubernetes avec GPU Operator si plusieurs serveurs
  • Provisionnement automatisé en infrastructure as code (Terraform, Ansible, …) et documentation de reprise
03

Serving des modèles et API

Nous déployons les modèles avec un moteur de serving (vLLM, TGI, …) et les exposons derrière une API standard.

  • API compatible OpenAI pour vos applications
  • Plusieurs modèles si besoin : LLM, embeddings, reranker, transcription
  • Gateway (LiteLLM, …) avec clés et quotas par application
  • Optimisation : quantification, batching, répartition des GPU
04

Sécurisation et intégration SI

Nous intégrons la plateforme à votre réseau et à vos outils de sécurité.

  • Règles de pare-feu, segmentation réseau et TLS
  • Authentification par clé API et SSO avec votre annuaire
  • Durcissement des serveurs
  • Journalisation vers votre SIEM
05

Tests de charge et supervision

Nous mesurons la capacité réelle et mettons en place la supervision.

  • Tests de débit et de latence sur des scénarios représentatifs (k6, Locust, …)
  • Ajustement des paramètres de vLLM après tests
  • Monitoring GPU et API (Prometheus, Grafana, DCGM Exporter, …)
  • Alertes et suivi par modèle et par application
06

Maintien en conditions opérationnelles

Nous exploitons la plateforme dans la durée.

  • Surveillance et gestion des incidents
  • Mises à jour de sécurité, des pilotes, du moteur de serving et des modèles
  • Revue de capacité régulière
  • Coordination avec le support du fournisseur cloud ou du constructeur
Résultat

Ce que vous obtenez

  • Une infrastructure d'inférence dimensionnée sur vos usages réels, chez OVHcloud, Scaleway ou on-premise
  • Des modèles servis derrière une API compatible OpenAI, utilisable par vos applications existantes
  • Des accès sécurisés et intégrés à votre SI : annuaire, réseau, journalisation
  • Une capacité mesurée par des tests de charge, supervisée et maintenue dans la durée
Livrables

Ce que nous vous remettons

  • Note de dimensionnement, architecture cible et estimation du coût complet
  • Infrastructure GPU opérationnelle et scripts de provisionnement
  • Modèles servis, API documentée et configuration de déploiement
  • Dossier de sécurité et intégration à l'annuaire
  • Rapport de tests de charge et recommandations de capacité
  • Dashboards de supervision, règles d'alerte et documentation d'exploitation
Pourquoi Keltio

L'IA en production, c'est d'abord de l'infrastructure

≈ 70 %

d'une mission IA en production relève de l'infra et du DevOps. C'est notre métier depuis 2019.

InfraDevOpsCybersécuritéIA
01

L'infrastructure est notre métier d'origine

Depuis 2019, nous construisons, migrons et infogérons des infrastructures cloud et Kubernetes. Servir un modèle d'IA en production, c'est d'abord un sujet de serveurs, de réseau, de supervision et d'exploitation.

02

Partenaires OVHcloud et Scaleway

Nous travaillons avec les deux principaux clouds souverains français. Nous vous aidons à choisir entre eux et l'on-premise selon vos contraintes, sans parti pris.

03

Sécurité by design

Segmentation, durcissement, TLS, SSO, journalisation vers le SIEM : la sécurité est intégrée à l'architecture dès le départ, pas ajoutée à la fin.

04

Tout en infrastructure as code

Provisionnement, configuration et déploiement des modèles sont scriptés et documentés. Votre plateforme est reproductible et vos équipes peuvent la reprendre.

Démarche

Comment nous travaillons

  1. 1

    Dimensionner

    Recueil des usages et des volumes, calcul des besoins, comparaison cloud souverain et on-premise, architecture cible.

  2. 2

    Déployer

    Mise en place de l'infrastructure GPU, du serving des modèles, de l'API et de l'intégration sécurité au SI.

  3. 3

    Éprouver

    Tests de charge sur vos scénarios, optimisation, mise en place de la supervision et des alertes.

  4. 4

    Exploiter

    Maintien en conditions opérationnelles, mises à jour, revue de capacité et évolution vers de nouveaux modèles.

FAQ

Questions fréquentes

Cloud souverain ou on-premise : comment choisir ?

Le cloud souverain (OVHcloud, Scaleway) évite l'investissement matériel et permet d'ajuster la capacité rapidement. L'on-premise se justifie quand les données ne doivent pas quitter vos murs ou quand l'usage est soutenu et prévisible. Nous comparons les deux sur votre cas, coût complet compris.

Les modèles open source sont-ils au niveau des modèles propriétaires ?

Pour beaucoup d'usages d'entreprise, comme le RAG, l'extraction, la synthèse ou l'assistant interne, les meilleurs modèles open weights donnent des résultats satisfaisants. Sur certaines tâches complexes, l'écart peut subsister. Nous testons les modèles sur vos cas réels avant de recommander un choix.

Quels modèles pouvez-vous déployer ?

Les modèles open weights compatibles avec vLLM, selon leur licence et vos besoins : modèles de langage, embeddings, rerankers, transcription. Le choix se fait après le dimensionnement, en fonction de la mémoire GPU disponible et de la qualité attendue.

Mes applications existantes devront-elles être modifiées ?

Généralement peu. Les modèles sont exposés derrière une API compatible OpenAI, que la plupart des outils et bibliothèques savent déjà utiliser. Il suffit souvent de changer l'adresse de l'API et la clé.

Qui exploite la plateforme après la mise en place ?

Au choix : nous assurons le maintien en conditions opérationnelles, ou vos équipes le reprennent à partir des scripts et de la documentation livrés. Une formule mixte est aussi possible, avec notre appui sur les mises à jour et la capacité.

Une conversation pour résoudre vos enjeux