Far girare un modello di IA aperto sul proprio server significa che i dati restano in casa e che non si dipende da un fornitore. Ma quale hardware serve davvero?
Lo strumento calcola, per 12 modelli aperti (Qwen, Gemma, Mistral, gpt-oss, Llama, Nemotron) e per la precisione scelta (16, 8 o 4 bit):
- la memoria necessaria (pesi + contesto);
- la velocità massima in token al secondo, dalla banda di memoria;
- quale hardware basta, tra 9 opzioni dalla RTX 5090 al DGX B200, con le schede tecniche ufficiali NVIDIA e Apple.
Nessun prezzo inventato: per il costo c’è un secondo strumento che confronta server locale e API. Gratuito, senza registrazione, in 5 lingue, codice open source (AGPL).
Feedback benvenuti, soprattutto da chi fa girare modelli in locale.