Exécuter l’IA sans que vos données quittent le bâtiment.
Business AI tourne dans notre cloud, en mode hybride, ou entièrement dans votre réseau sur votre propre matériel. La même identité, la même mesure et les mêmes contrôles de dépenses s’appliquent dans les trois cas. Où tourne le modèle est un choix de configuration, pas un autre produit.
Les modèles auto-hébergés sont un mode à part entière, pas une sortie de secours
La configuration des modèles de la plateforme a un mode auto-hébergé qui accepte n’importe quelle URL de base. Tout ce qui expose une API compatible OpenAI peut être la cible, ce qui couvre en pratique Ollama, LM Studio et vLLM.
Ce modèle est ensuite sélectionné centralement pour l’espace de travail et hérité par chaque produit connecté, exactement comme le serait un modèle de pointe. Vos produits ne savent pas et ne se soucient pas de savoir si le point d’accès qu’ils atteignent est dans un centre de données ou dans votre salle serveur.
Les trois formes de déploiement
- Cloud
- Nous l’exploitons. Le plus rapide à créer de la valeur, et il fonctionne avec vos clés fournisseurs ou les nôtres selon le mode de facturation choisi.
- Hybride
- Des modèles de pointe pour le travail quotidien, des modèles locaux pour tout ce que vous ne colleriez jamais dans une API publique. Comme le choix du modèle est une configuration centrale, déplacer une charge de l’un à l’autre est un réglage plutôt qu’une refonte.
- Sur site
- Toute la couche tourne dans votre réseau sur votre matériel. Aucun prompt, aucun document et aucune fiche client ne quitte le bâtiment.
Pourquoi l’hybride est généralement la réponse honnête
Les modèles locaux sont le bon choix pour la fraction du travail qui porte un vrai risque de confidentialité. Ils sont généralement le mauvais choix pour tout le reste, parce que les modèles de pointe sont meilleurs et que la différence se voit dans la qualité des résultats.
Le schéma d’échec que nous observons: des entreprises choisissent un seul modèle pour toute l’organisation pour éviter la question du routage, puis envoient du contenu sensible à une API publique ou acceptent des résultats plus faibles partout. Trancher par charge de travail évite les deux, et cela ne reste praticable que si changer la répartition ne demande pas de travail d’ingénierie.
Ce qui reste identique sur site
L’authentification unique, l’accès par rôles, la mesure par appel, les plafonds de dépenses et le rapport d’entreprise font tous partie de la couche plateforme, pas de l’hébergement. Un déploiement sur site les conserve.
Cela compte plus qu’il n’y paraît. La plupart des installations d’IA auto-hébergées résolvent la question des données et perdent celle de la gouvernance, parce que le point d’accès local n’a aucune idée de qui l’appelle ni de ce qu’il a coûté ce mois-ci. La mesure est dans la plateforme, donc elle survit au déménagement.
Des réponses directes.
Tout point d’accès exposant une API compatible OpenAI, ce qui couvre entre autres Ollama, LM Studio et vLLM. La plateforme stocke une URL de base pour le mode auto-hébergé plutôt qu’une liste fixe de fournisseurs: un environnement dont nous n’avons jamais entendu parler fonctionne s’il parle le même protocole.
Non. Mesure, limites, rôles et rapports vivent dans la couche plateforme, pas dans l’hébergement: ils se comportent de la même façon que le modèle soit une API de pointe ou une machine dans votre bâtiment.
Oui, c’est le mode hybride et c’est le choix le plus courant. Comme le modèle est sélectionné centralement et hérité par les produits connectés, changer quelle charge va où est un changement de configuration, pas un changement de code.
Pour l’inférence contre un modèle local, rien: le prompt va à votre point d’accès. Toute la couche tourne dans votre réseau sur votre matériel, c’est le but de ce mode de déploiement.
En production
Construisez le système d’IA de votre entreprise.
Apportez un vrai processus à l’appel. Nous le faisons passer par la passerelle sous vos yeux, mesuré et attribué, avant que vous ne décidiez quoi que ce soit.
30 minutes · sans slides · réponse sous 24h