Il costo invisibile dell’AI in azienda, perché spendere meno per token non significa spendere meno

Tra assistenti, RAG e agenti sempre attivi, la spesa AI può crescere senza che l’azienda sappia davvero quale processo sta generando valore.

Nel 2026 parlare di costo dell’AI significa parlare di molto più del prezzo di un modello o di una licenza.

L’AI sta entrando nei processi aziendali con modalità sempre più articolate. Un assistente può generare una risposta in pochi secondi, un sistema RAG può interrogare documenti e basi di conoscenza, un agente può invece eseguire una sequenza di azioni, utilizzare strumenti diversi e interagire con altri sistemi.

Ogni passaggio può generare consumo.

E non tutti i costi finiscono nella fattura del fornitore.

Ci sono il tempo necessario per controllare gli output, le correzioni, le integrazioni, l’infrastruttura, la governance e, nel tempo, anche il costo di essere legati a una determinata tecnologia o piattaforma.

Per questo una domanda come “quanto costa questo modello?” rischia di essere troppo semplice.

La domanda più utile è: quanto costa davvero ottenere un risultato attraverso l’AI e quanto valore genera quel risultato?

Perché nel 2026 il costo dell’AI sta diventando un tema di management e non solo di IT

Per molto tempo il costo dell’AI è stato associato soprattutto alla scelta del modello.

Un modello costa X per un certo numero di token. Un altro costa meno. Una licenza costa X euro al mese. Un’API viene fatturata in base al consumo.

Questa logica continua a essere importante, ma non è più sufficiente.

Quando l’AI viene inserita in un processo aziendale, infatti, il costo dipende anche da quanto viene utilizzata, come viene utilizzata e cosa deve fare per arrivare al risultato.

La FinOps Foundation considera proprio questa complessità uno degli elementi che rendono necessario un approccio specifico alla gestione dei costi AI. Il consumo può attraversare cloud, data center, servizi SaaS, fornitori di modelli e infrastrutture diverse, rendendo più difficile attribuire la spesa a uno specifico utilizzo.

Per il management questo cambia la domanda.

Non basta sapere quanto è stata spesa per l’AI. Bisogna capire dove viene spesa, da chi, per quale processo e con quale risultato.

Una spesa di 10.000 euro può essere molto diversa se produce 100.000 euro di valore operativo oppure se serve soltanto a generare migliaia di output che qualcuno deve comunque controllare manualmente.

Il tema, quindi, non è semplicemente ridurre il costo dell’AI.

È governare l’economia dell’AI.

Il paradosso, i modelli diventano più efficienti ma l’utilizzo cresce più velocemente

Il prezzo dei modelli tende a diventare più competitivo e l’efficienza per token migliora.

Questo dovrebbe tradursi automaticamente in una riduzione della spesa.

Ma non necessariamente succede.

Quando utilizzare l’AI costa meno, diventa infatti possibile utilizzarla di più. E quando i sistemi diventano più sofisticati, aumenta anche la quantità di lavoro che chiediamo loro di svolgere.

Si passa dalla singola richiesta al workflow.

Una richiesta semplice può richiedere una sola chiamata a un modello. Un processo più complesso può invece prevedere:

  1. recupero delle informazioni;
  2. analisi del contesto;
  3. generazione di una prima risposta;
  4. verifica;
  5. nuova elaborazione;
  6. utilizzo di uno strumento esterno;
  7. generazione dell’output finale.

Il costo complessivo non dipende quindi soltanto dal prezzo di ogni singolo passaggio, ma dal numero e dalla complessità dei passaggi necessari per completare il lavoro.

È il fenomeno che Gartner ha definito “inference paradox”: la riduzione del costo unitario dei token può accompagnarsi a un aumento del costo complessivo perché i sistemi diventano più sofisticati e utilizzano più token e più passaggi per completare un’attività.

Dove si nascondono davvero i costi

Il costo dell’AI può quindi essere distribuito su più livelli.

C’è innanzitutto il costo diretto dell’inferenza, cioè quello legato all’utilizzo dei modelli.

Poi ci sono infrastruttura, storage, database, API, strumenti esterni e sistemi necessari per far funzionare il processo.

Ma c’è un altro costo che spesso non compare in nessuna fattura: la rilavorazione umana.

Se un sistema genera un output che deve essere controllato, corretto o completamente rifatto, il tempo della persona che interviene rappresenta comunque un costo.

Immaginiamo un assistente che produca 1.000 risposte al mese.

Se ogni risposta richiede in media due minuti di verifica, il sistema genera oltre 33 ore di lavoro umano al mese.

Se il tempo di verifica sale a cinque minuti, si superano le 83 ore.

Il costo dell’AI non è quindi più soltanto quello della chiamata al modello. È il costo dell’intero processo necessario per trasformare quella chiamata in un risultato utilizzabile.

Ed è proprio questo il punto che rischia di sfuggire quando si guarda esclusivamente al prezzo dei token.

Assistenti, sistemi RAG e agenti AI, perché livelli diversi di autonomia producono profili di spesa diversi

Non tutte le applicazioni AI hanno lo stesso profilo economico.

Un assistente utilizzato per rispondere a domande semplici può avere un numero relativamente contenuto di passaggi.

Un sistema RAG aggiunge invece una fase di recupero delle informazioni. Prima di generare la risposta, deve individuare e fornire al modello il contesto necessario.

Un agente AI può andare oltre.

Può pianificare un’attività, interrogare sistemi, utilizzare strumenti, verificare il risultato e procedere con ulteriori azioni.

Questo significa che aumenta anche la superficie attraverso cui può essere generato consumo.

La differenza non è quindi soltanto tecnologica. È economica.

Più aumenta l’autonomia del sistema, più diventa importante sapere quali azioni sta eseguendo, quante volte le esegue e quanto costa completare il workflow.

Una ricerca del Digital Economy Lab di Stanford del 2026 evidenzia proprio quanto possa essere variabile il consumo nei workflow agentici: nei task analizzati, l’utilizzo dei token può variare significativamente tra esecuzioni dello stesso compito e un maggiore consumo non implica necessariamente una maggiore accuratezza.

Questo rende ancora più importante monitorare il comportamento reale del sistema e non basarsi soltanto sulle stime iniziali.

Il problema dell’AI “senza proprietario”, quando nessuno sa quale team, processo o use case sta generando il costo

Un altro problema emerge quando l’AI viene adottata senza un responsabile chiaro.

Un team utilizza un assistente. Un altro integra un’API. Un terzo sperimenta un agente. Un quarto acquista una licenza SaaS con funzionalità AI.

Alla fine del mese arriva una fattura.

Ma chi sa dire quali attività hanno generato quella spesa?

Senza un’adeguata attribuzione, il costo AI rischia di diventare una voce aggregata difficile da interpretare.

L’azienda vede quanto ha speso, ma non necessariamente perché ha speso quella cifra.

Per questo ogni caso d’uso dovrebbe essere associato, per quanto possibile, a un owner, un processo, un centro di costo o una business unit.

Non si tratta di creare burocrazia intorno all’AI.

Si tratta di poter rispondere a domande molto concrete:

  • Quale team utilizza questo sistema?
  • Per quale processo?
  • Quanto costa ogni mese?
  • Quanto viene effettivamente utilizzato?
  • Quale risultato produce?
  • Il costo sta crescendo perché aumenta l’utilizzo o perché il workflow è diventato più complesso?
  • Il valore generato sta crescendo nella stessa proporzione?

Senza questa visibilità è difficile anche capire quali iniziative meritino di essere scalate e quali, invece, debbano essere ripensate.

Il lock-in tecnologico, il costo che arriva nel tempo

C’è poi un costo meno evidente, perché non compare necessariamente nel conto economico del primo mese: il lock-in tecnologico.

Scegliere un unico fornitore o costruire un’architettura fortemente dipendente da una determinata piattaforma può essere conveniente all’inizio.

Nel tempo, però, cambiare modello, provider o infrastruttura può diventare complesso.

Se applicazioni, prompt, workflow, dati e integrazioni sono costruiti intorno a un solo ecosistema, il costo di migrazione può diventare significativo.

Questo riduce anche la capacità dell’azienda di negoziare.

Non significa che sia sempre necessario utilizzare più fornitori o progettare architetture estremamente complesse. Significa però che il costo tecnologico dovrebbe essere valutato anche in termini di flessibilità futura.

Un’architettura più aperta e sostituibile può avere un valore economico che non emerge dal confronto tra i prezzi dei token di oggi.

La domanda diventa quindi:

quanto mi costa questa soluzione oggi e quanto mi costerà cambiarla domani?

Dal Cloud FinOps all’AI FinOps, cosa significa collegare consumo, budget e responsabilità

Il concetto di FinOps nasce per collegare consumo tecnologico, costi e valore di business.

Con l’AI questo approccio diventa ancora più importante.

La FinOps Foundation parla infatti di FinOps for AI come di un ambito che deve affrontare specificamente complessità dei costi, imprevedibilità della spesa, velocità di sviluppo e necessità di governance.

L’obiettivo non è semplicemente controllare la fattura.

È creare una relazione tra:

consumo → costo → processo → risultato → valore.

Per farlo servono dati sufficientemente granulari.

Per esempio, invece di sapere soltanto che un’azienda ha speso 20.000 euro in servizi AI, sarebbe più utile sapere che:

  • 8.000 euro sono stati generati dal customer care;
  • 5.000 euro dall’analisi documentale;
  • 4.000 euro da attività di sviluppo;
  • 3.000 euro da sperimentazioni.

Ancora meglio sarebbe sapere quanto costa una singola unità di lavoro.

Quanto costa una richiesta gestita?
Quanto costa una pratica elaborata?
Quanto costa un caso risolto?
Quanto costa un’azione eseguita da un agente?

Sono metriche molto più vicine al linguaggio del business.

Perché il costo per token dice poco e il costo per risultato di business dice molto di più

Il costo per token rimane una metrica utile.

Serve per confrontare modelli, monitorare consumi e individuare anomalie.

Ma preso da solo dice poco sul valore prodotto.

La FinOps Foundation suggerisce proprio di partire dal costo per token e arrivare progressivamente a metriche orientate al risultato, come costo per assist, costo per azione di un agente o costo per caso risolto.

La differenza è sostanziale.

Un modello può costare il 50% in meno per token ma richiedere più passaggi per arrivare allo stesso risultato.

Oppure può produrre output che richiedono più supervisione umana.

Oppure ancora può essere più economico da utilizzare ma più difficile da integrare nel sistema aziendale.

In tutti questi casi il prezzo del token racconta solo una parte della storia.

Per il management è più utile conoscere il costo per risultato.

Se un sistema costa 0,20 euro per gestire una richiesta ma richiede cinque minuti di controllo umano, il suo costo reale è diverso da quello di un sistema che costa 0,30 euro ma produce un risultato utilizzabile quasi immediatamente.

La metrica giusta dipende quindi dal processo.

Due soluzioni AI apparentemente equivalenti, ma con costi molto diversi

Immaginiamo un’azienda che voglia automatizzare la classificazione e la prima gestione di 10.000 richieste al mese.

Vengono valutate due soluzioni.

Soluzione A

  • costo AI per richiesta: 0,10 €
  • costo mensile AI: 1.000 €
  • controllo umano richiesto: 3 minuti per richiesta
  • tempo umano complessivo: 500 ore al mese

Soluzione B

  • costo AI per richiesta: 0,18 €
  • costo mensile AI: 1.800 €
  • controllo umano richiesto: 1 minuto per richiesta
  • tempo umano complessivo: circa 167 ore al mese

A prima vista la Soluzione A sembra la più conveniente: costa 800 euro in meno al mese.

Ma se valorizziamo il tempo delle persone a 30 euro l’ora, il costo della supervisione diventa:

Soluzione A

500 ore × 30 € = 15.000 €

Soluzione B

167 ore × 30 € = 5.010 €

Considerando insieme AI e lavoro umano:

  • Soluzione A: 16.000 € al mese
  • Soluzione B: 6.810 € al mese

La soluzione con il costo AI più basso produce quindi un costo complessivo molto più alto.

E il confronto potrebbe cambiare ancora considerando altri elementi: qualità degli output, costi di integrazione, infrastruttura, manutenzione, governance e possibilità di cambiare modello o fornitore in futuro.

L’esempio è ipotetico, ma mostra il principio: il costo dell’AI deve essere valutato sul processo completo, non sulla singola chiamata al modello.

Governare la spesa AI significa governare anche il valore

Arrivati a questo punto, la domanda non dovrebbe essere soltanto “quanto stiamo spendendo?”.

Dovrebbe essere:

“quanto stiamo spendendo per ottenere quale risultato?”

Questo sposta il focus dal consumo al valore.

Un aumento della spesa può essere perfettamente sostenibile se corrisponde a un aumento significativo dell’utilizzo e del valore prodotto.

Al contrario, una riduzione della spesa può essere un falso risparmio se comporta più lavoro manuale, risultati peggiori o maggiore rigidità tecnologica.

È qui che il concetto di AI FinOps diventa interessante anche per il management.

Non è solo controllo dei costi.

È un modo per prendere decisioni migliori su quali use case scalare, quali ottimizzare, quali fermare e dove investire.

Checklist finale, l’azienda sta governando la spesa AI?

Per capire quanto è maturo il proprio approccio alla gestione economica dell’AI, un’azienda può partire da queste domande:

  • Sappiamo quali strumenti AI stiamo utilizzando?
  • Ogni use case ha un owner?
  • Sappiamo quanto costa ciascun processo AI?
  • Riusciamo ad attribuire il consumo a team, applicazioni o business unit?
  • Monitoriamo non solo i token, ma anche chiamate, workflow e azioni eseguite?
  • Consideriamo il tempo necessario per verificare e correggere gli output?
  • Conosciamo il costo complessivo per ottenere un risultato?
  • Abbiamo metriche che collegano costo e valore di business?
  • Sappiamo quanto siamo dipendenti da un singolo fornitore o modello?
  • Potremmo cambiare tecnologia senza dover riprogettare l’intero processo?
  • Abbiamo soglie o alert per individuare consumi anomali?
  • Rivediamo periodicamente il rapporto tra costo, qualità e valore prodotto?

Se le risposte sono ancora parziali, non significa necessariamente che l’azienda stia spendendo troppo.

Significa che probabilmente non ha ancora sufficiente visibilità su come sta spendendo.

Ed è proprio questa la prima forma di costo invisibile.

Nel momento in cui l’AI entra nei processi reali, il suo valore non può più essere misurato soltanto in token, licenze o chiamate API.

Bisogna guardare all’intero sistema: tecnologia, persone, processi, infrastruttura e risultati.

Perché spendere meno per ogni singolo token può essere un buon risultato.

Spendere meno per ottenere lo stesso risultato è molto meglio. Spendere quanto serve per ottenere un risultato di maggior valore è l’obiettivo vero.