Stima token, costo, tempo di esecuzione e risorse hardware per un compito eseguito da un modello IA
• Modalità Cloud: il costo si calcola come (token input ÷ 1M × prezzo input) + (token output ÷ 1M × prezzo output), moltiplicato per il numero di richieste. Il tempo si stima dividendo i token di output per la velocità di generazione (token/sec) e sommando una latenza fissa di rete.
• Modalità Self-hosted: la VRAM necessaria si stima da parametri del modello × byte per parametro (in base alla precisione) × 1.2 di overhead. Il tempo si stima dai token di output diviso il throughput atteso sull'hardware scelto; il costo deriva dal costo orario della risorsa (noleggio GPU o energia) moltiplicato per le ore di esecuzione.
Tutti i valori precompilati sono indicativi e vanno aggiornati periodicamente in base ai listini reali dei provider e all'hardware effettivamente disponibile.