Eseguire l’IA senza che i vostri dati lascino l’edificio.
Business AI gira nel nostro cloud, in modalità ibrida o interamente nella vostra rete sul vostro hardware. La stessa identità, misurazione e gli stessi controlli di spesa valgono in tutti e tre i casi. Dove gira il modello è una scelta di configurazione, non un altro prodotto.
I modelli self-hosted sono una modalità a pieno titolo, non un’uscita di emergenza
La configurazione dei modelli della piattaforma ha una modalità self-hosted che accetta un URL di base arbitrario. Qualsiasi cosa esponga un’API compatibile OpenAI può essere la destinazione, il che in pratica copre Ollama, LM Studio e vLLM.
Quel modello viene poi selezionato centralmente per il workspace ed ereditato da ogni prodotto collegato, esattamente come lo sarebbe un modello di frontiera. I vostri prodotti non sanno e non si curano se l’endpoint che raggiungono è in un data center o nella vostra sala server.
Le tre forme di deployment
- Cloud
- Lo gestiamo noi. Il più rapido a creare valore, e funziona con le vostre chiavi dei provider o le nostre a seconda della modalità di fatturazione scelta.
- Ibrido
- Modelli di frontiera per il lavoro quotidiano, modelli locali per tutto ciò che non incollereste mai in un’API pubblica. Poiché la scelta del modello è configurazione centrale, spostare un carico di lavoro dall’uno all’altro è un’impostazione, non una ricostruzione.
- On-premise
- L’intero livello gira nella vostra rete sul vostro hardware. Nessun prompt, nessun documento e nessuna scheda cliente lascia l’edificio.
Perché l’ibrido è di solito la risposta onesta
I modelli locali sono la scelta giusta per la frazione di lavoro che porta un vero rischio di riservatezza. Sono di solito la scelta sbagliata per tutto il resto, perché i modelli di frontiera sono migliori e la differenza si vede nella qualità dei risultati.
Lo schema di fallimento che vediamo: aziende che scelgono un solo modello per tutta l’organizzazione per evitare la questione dell’instradamento, e poi inviano materiale sensibile a un’API pubblica o accettano risultati più deboli ovunque. Decidere per carico di lavoro evita entrambi, e resta praticabile solo se cambiare la suddivisione non richiede lavoro di ingegneria.
Cosa resta uguale on-premise
Single sign-on, accesso basato sui ruoli, misurazione per chiamata, limiti di spesa e report aziendale fanno tutti parte del livello piattaforma, non dell’hosting. Un deployment on-premise li mantiene.
Conta più di quanto sembri. La maggior parte delle installazioni IA self-hosted risolve la questione dei dati e perde quella della governance, perché l’endpoint locale non ha idea di chi lo chiami o di quanto sia costato questo mese. La misurazione sta nella piattaforma, quindi sopravvive al trasloco.
Risposte dirette.
Qualsiasi endpoint che esponga un’API compatibile OpenAI, il che copre tra gli altri Ollama, LM Studio e vLLM. La piattaforma salva un URL di base per la modalità self-hosted invece di una lista fissa di fornitori: un runtime di cui non abbiamo mai sentito parlare funziona se parla lo stesso protocollo.
No. Misurazione, limiti, ruoli e report vivono nel livello piattaforma, non nell’hosting: si comportano allo stesso modo che il modello sia un’API di frontiera o una macchina nel vostro edificio.
Sì, è la modalità ibrida ed è la scelta più diffusa. Poiché il modello è selezionato centralmente ed ereditato dai prodotti collegati, cambiare quale carico va dove è una modifica di configurazione, non di codice.
Per l’inferenza contro un modello locale, nulla: il prompt va al vostro endpoint. L’intero livello gira nella vostra rete sul vostro hardware, che è il senso di questa modalità di deployment.
Live in produzione
Costruite il sistema IA della vostra azienda.
Portate un processo reale alla chiamata. Lo facciamo passare dal gateway sotto i vostri occhi, misurato e attribuito, prima che decidiate qualsiasi cosa.
30 minuti · niente slide · risposta entro 24h