Private AI Appliance

La conoscenza della tua azienda diventa una piattaforma AI privata, installata dentro l'organizzazione

RAG Enterprise è il livello applicativo che gira sopra EuLLM e le appliance I3K Local AI: una sola piattaforma AI locale al posto di più abbonamenti AI in cloud scollegati fra loro.

Non è un discorso sull'hardware. La domanda a cui risponde questa pagina è che cosa la tua organizzazione può effettivamente fare quando modelli, documenti e indice stanno tutti su una macchina che controlli tu — e cosa cambia nel momento in cui smetti di pagare a consumo qualcuno che sta altrove.

Early Access · configurazioni in definizione

Tre livelli, una macchina

L'appliance non è un prodotto monolitico: è uno stack in cui ogni livello fa una cosa sola e può essere sostituito senza rifare gli altri.

  1. RAG Enterprise

    Il livello applicativo. La conoscenza aziendale: caricamento documenti, ricerca, risposte con le fonti, ruoli e permessi, backup.

  2. EuLLM

    Il motore di inferenza. Carica i modelli, li tiene in memoria video, genera. Scegli tu quale modello, e lo cambi senza toccare il livello sopra.

  3. Appliance I3K Local AI

    La macchina. GPU, memoria, storage, sistema operativo preparato. Lo stesso software gira su tutte le configurazioni: cambia quanto ci sta dentro e quanto va veloce.

La conseguenza pratica di questa separazione è che l'hardware non ti vincola al software. Puoi partire dalla Community open-source su una macchina che hai già, passare all'appliance quando il carico lo richiede, e cambiare modello quando ne esce uno migliore — senza rifare l'indice e senza reinstallare tutto.

Cosa ci puoi fare

I carichi di lavoro che un'appliance Local AI può ospitare, raggruppati per quello che risolvono. Si attivano modulo per modulo: nessuno deve accenderli tutti.

Conoscenza e documenti

  • Chat AI privata aziendale
  • Ricerca semantica e hybrid retrieval
  • RAG con fonti e documenti tracciabili
  • Knowledge assistant sull'archivio interno
  • Analisi di PDF, Office, contratti, procedure e documentazione tecnica
  • Document intelligence ed estrazione strutturata
  • OCR e vision su scansioni e immagini
  • Traduzione, sintesi e generazione documentale

Modelli e motore locale

  • Inferenza locale, senza costo per token
  • Scelta fra modelli diversi, sostituibili nel tempo
  • Embedding e reranking calcolati in locale
  • API interne compatibili OpenAI per le tue applicazioni

Agenti e automazione

  • AI agents su procedure interne
  • Workflow e automazioni
  • Accesso controllato a strumenti e applicazioni aziendali
  • Coding assistant per i team tecnici

Voce e riunioni

  • Trascrizione delle riunioni
  • Meeting intelligence: sintesi, decisioni, azioni
  • Voice assistant e voicebot interni

Integrazione col resto dell'azienda

  • CRM ed ERP
  • Help desk e ticketing
  • File server e archivi documentali
  • Database e sistemi gestionali

Da leggere come un elenco di possibilità, non di interruttori già accesi. RAG Enterprise copre il livello documentale — chat sui documenti, ricerca semantica e ibrida, risposte con le fonti, OCR, embedding e reranking locali. Gli altri carichi sono workload che l'appliance è dimensionata per ospitare e che si attivano come moduli, in base a cosa serve davvero: quali entrano nella tua installazione si definisce in fase di analisi, non si dà per scontato qui.

Una piattaforma locale al posto di più abbonamenti separati

La spesa in AI di molte aziende non è una voce sola: è un abbonamento per la chat, uno per la trascrizione, uno per l'assistente di codice, uno per il tool che legge i PDF, più il consumo a token di qualche integrazione. Nessuno di questi parla con gli altri, e ognuno vede un pezzo dei dati aziendali.

Un'appliance locale affronta il problema dall'altro lato: un solo posto dove girano i modelli, un solo perimetro da governare, un solo contratto. Le stesse capacità, ma servite dentro l'organizzazione anziché comprate a pezzi fuori.

Non promettiamo che sostituisca automaticamente tutti i servizi che usi: alcune cose i grandi provider le fanno meglio, e alcuni strumenti sono legati a processi che non si spostano in un trimestre. La formula onesta è che può sostituire o ridurre la dipendenza da più servizi AI esterni — e quali, si vede caso per caso guardando cosa usate davvero.

Perché l'impostazione regge

  1. Documenti e dati restano sotto il controllo dell'organizzazione

    Non è una promessa contrattuale di un fornitore: è una conseguenza di dove gira il software. Quello che non esce non va giustificato, non va mappato fra i responsabili del trattamento e non dipende da termini che possono cambiare.

  2. Può funzionare senza inviare i contenuti a provider LLM esterni

    I modelli stanno sulla macchina. Un'appliance può lavorare senza che una singola riga dei tuoi documenti raggiunga un servizio di terzi.

  3. L'inferenza locale non ha costo per token

    Il conto si sposta dal consumo all'hardware, che compri una volta e resta tuo. Sopra una certa intensità d'uso interno è la differenza fra una voce di bilancio che cresce da sola e una che non cresce.

  4. Scegli tu i modelli, e li cambi quando vuoi

    Non sei legato a quello che un fornitore decide di servire quel mese. Un modello locale è un file: resta quello che hai installato finché non sei tu a sostituirlo.

  5. Stesso stack software su configurazioni hardware diverse

    La differenza fra le taglie è quanto ci sta dentro e quanto va veloce, non quali funzioni sono disponibili. Si scala dalla PMI alla grande organizzazione, fino a installazioni multi-nodo, senza cambiare piattaforma.

  6. I servizi AI esterni restano un'opzione, non un requisito

    Se in certi casi vuoi usare anche un modello di frontiera, si può fare — come canale separato e governato, deciso da te e tracciabile. Il sistema non ne ha bisogno per funzionare.

Tre categorie, non un catalogo di GPU

La scelta utile non è quale scheda montare: è che cosa vuoi che la macchina faccia bene. Da lì discende il resto.

Early Access: configurazioni pianificate, in fase di definizione. Nomi, dotazioni e prezzi possono cambiare prima della disponibilità generale.

Capacity

Modelli molto grandi e knowledge base estese

Per chi deve tenere in memoria modelli di dimensioni importanti e indicizzare archivi molto grandi. Si privilegia quanto ci sta dentro rispetto a quanto va veloce.

  • Local AI Capacity 128

    da € 5.900 + IVA

Performance

RAG, chat e agenti interattivi ad alta velocità

Per l'uso conversazionale quotidiano, dove conta il tempo che passa fra la domanda e le prime parole della risposta. È la categoria giusta per la maggior parte degli uffici.

  • Local AI Performance 32

    da € 5.900 + IVA

  • Local AI Performance 64

    da € 8.900 + IVA

Enterprise

Più utenti, più workload, installazioni multi-nodo

Per organizzazioni grandi che fanno girare più carichi insieme e servono molte persone contemporaneamente, eventualmente su più nodi.

  • Local AI Enterprise 96

    da € 22.900 + IVA

Prezzi indicativi di partenza, IVA esclusa. Il listino aggiornato, le dotazioni esatte e l'acquisto stanno sulla landing I3K Local AI.

Vedi configurazioni e prezzi su I3K

Come funziona la licenza, in breve

Il modello è pensato per essere prevedibile: quello che paghi dipende da quanto è grande l'organizzazione, non da quanto la usi.

  • Con l'appliance sono inclusi 12 mesi di AI Suite.
  • Dal secondo anno si passa a una subscription commisurata alla dimensione dell'organizzazione.
  • L'inferenza locale non ha costo per token: usare di più non fa salire il conto.
  • Le licenze sono per fasce di utenti — non vendiamo il concetto di «utenti illimitati», perché non sarebbe una promessa seria.
  • Il supporto I3K è erogato ai contatti tecnici designati dall'organizzazione, non direttamente a ogni dipendente.
  • Le nuove funzioni dei moduli che hai già acquistato sono incluse finché la subscription è attiva.
  • Eventuali nuovi prodotti o moduli futuri possono richiedere una licenza separata.

Domande frequenti

Che cos'è esattamente un'appliance AI privata?
È una macchina installata nella sede dell'organizzazione, con GPU e sistema operativo già preparati, su cui girano il motore di inferenza e le applicazioni AI. I modelli, i documenti e l'indice restano su quella macchina: il traffico non esce verso un provider esterno. I3K Local AI è la linea di appliance; RAG Enterprise è il livello applicativo che ci gira sopra.
Devo per forza comprare l'hardware da voi?
No. RAG Enterprise nella sua edizione Community è open-source sotto AGPL-3.0 e gira su un server tuo, anche senza GPU. L'appliance serve quando vuoi una macchina già dimensionata, preparata e supportata, e quando ai carichi documentali se ne affiancano altri. Il modo sensato di procedere è quasi sempre installare prima il software su quello che hai già.
Sostituisce ChatGPT, Copilot e gli altri servizi che usiamo?
Può sostituire o ridurre la dipendenza da più servizi AI esterni, non necessariamente tutti. Su ragionamento aperto e creatività i modelli di frontiera restano avanti. Il caso in cui un'appliance vince nettamente è il lavoro sui contenuti dell'organizzazione: lì conta molto di più il recupero dei passaggi giusti della dimensione del modello, e i documenti non devono uscire.
Quali di queste funzioni sono disponibili oggi?
RAG Enterprise copre oggi il livello documentale: chat sui documenti, ricerca semantica e ibrida, risposte con le fonti citate, OCR, embedding e reranking locali. Le altre capacità elencate sono workload che l'appliance è dimensionata per ospitare e che si attivano come moduli. Quali entrano nella tua installazione, e in che ordine, si definisce in fase di analisi.
Che differenza c'è fra Capacity, Performance ed Enterprise?
Capacity privilegia quanto ci sta dentro: modelli molto grandi e knowledge base estese. Performance privilegia la reattività: chat, RAG e agenti interattivi con tempi di risposta brevi. Enterprise è per organizzazioni grandi con più carichi in parallelo, più utenti e, se serve, più nodi. Il software è lo stesso in tutte e tre.
Possiamo comunque usare un modello esterno quando serve?
Sì, ma come scelta esplicita e governata, non come requisito del sistema. L'appliance funziona senza. Se per certi compiti volete instradare una richiesta verso un servizio esterno, è un canale separato che decidete voi, con le sue regole su cosa può uscire.
Quando sono disponibili le appliance?
Le configurazioni indicate sono in Early Access: sono pianificate e in fase di definizione, quindi nomi, dotazioni e prezzi possono cambiare prima della disponibilità generale. Per lo stato aggiornato e per l'acquisto, la landing I3K Local AI è il riferimento.

Da dove si comincia

Il percorso che consigliamo è sempre lo stesso: prima il software su documenti veri, per capire se le risposte servono davvero; poi la misura sul tuo hardware; poi, solo se il carico lo richiede, l'appliance dimensionata di conseguenza. L'hardware si compra bene solo dopo aver visto dei numeri.

Appliance AI privata on-premise — I3K RAG Enterprise