Perché la tua GPU da 30.000€ non rende come credevi: L’Ingegneria dell’Inferenza LLM in Produzione
C’è un errore di valutazione che continua a pesare sui bilanci infrastrutturali delle aziende che scalano modelli di intelligenza artificiale: presumere che la velocità di generazione dei token dipenda principalmente dalla potenza di calcolo (FLOPS) della GPU.
Se aggiorni un cluster da NVIDIA A100 a H100, ti aspetti un incremento prestazionale fino a 3 volte coerente con il throughput teorico del chip.

