Aumento dei costi della corsa al consumo di token

Aumento dei costi della corsa al consumo di token

      Ultimamente, abbiamo visto un aumento di una pratica chiamata Tokenmaxxing. Sempre più aziende stanno monitorando la produttività dei loro dipendenti con i token spesi per l'uso dell'IA. Jensen Huang, CEO di Nvidia, riassume chiaramente il sentimento: “Se quell'ingegnere da 500.000 dollari non ha consumato almeno 250.000 dollari in token, sarò profondamente allarmato.”

      I critici potrebbero sostenere che Jensen ha un incentivo a sostenere un uso maggiore dei token, poiché si traduce direttamente in maggiori entrate per Nvidia.

      Questo sentimento nella corporate America è evidente in diverse aziende di prodotto e startup. Il CEO di Databricks, Ali Ghodsi, ha messo in evidenza un ingegnere che ha speso oltre 7.000 dollari in token IA, mentre startup come Sendbird hanno una classifica che tiene traccia della spesa in token di ciascun dipendente.

      La spinta per un maggiore consumo di token non è limitata solo alle aziende tecnologiche, ma è stata generalizzata. La spesa in token della startup legale Harvey è aumentata di circa 12 volte, raggiungendo 12 trilioni di token al mese. È chiaro a questo punto che tutti vogliono aumentare la propria spesa in token, ma vale la pena esplorare il motivo dietro a ciò.

      Più token equivalgono a maggiore produttività, o almeno questa è l'affermazione fatta dagli appassionati di IA e dai primi adottanti del tokenmaxxing. C'è una corsa a spendere quanti più token possibile, e le aziende stanno felicemente pagando il conto. L'adozione di modelli di linguaggio di grandi dimensioni (LLM) è un modo completamente nuovo di lavorare in diversi settori, e le aziende che non si evolveranno abbastanza rapidamente saranno lasciate indietro.

      La fattura per gli LLM è qui, ed è enorme

      Dall'entusiasmo iniziale del 2026 per il token maxxing, abbiamo visto molte più aziende implementare limiti sull'uso dei token poiché i costi sono cresciuti in modo esponenziale.

      Una delle storie più grandi in questo campo è emersa all'inizio del 2026 quando il CTO di Uber, Praveen Neppalli Naga, in un'intervista con The Information, ha riferito che avevano esaurito il loro budget annuale per l'IA in soli 4 mesi, e stavano tornando al tavolo da disegno per capire i prossimi passi.

      Come riportato da Sarah Perez, Uber non è l'unica azienda che ha affrontato un risveglio dell'IA a causa dell'esaurimento del proprio budget per l'IA. Adam Mosseri di Meta prevede un futuro in cui avranno limiti di token per ogni dipendente. Hanno già aggiunto politiche per ridurre il loro consumo di token tagliando l'uso sprecone.

      La classifica della spesa per l'IA che ha fatto notizia all'inizio dell'anno è già stata chiusa. Microsoft ha annullato le licenze del codice Claude e ha consolidato tutti sotto Copilot.

      Il costo della tendenza al tokenmaxxing è qui, ed è importante esplorare la causa principale di questo enorme aumento dei costi nei bilanci delle imprese.

      Ci sono diversi fattori che portano all'aumento dei costi associati all'uso degli LLM. Alcuni di questi motivi sono legati all'adozione diffusa dell'uso dell'IA nella corporate America. Nel 2026, le aziende hanno costruito dashboard interne per monitorare la spesa per l'IA e hanno incoraggiato attivamente i loro dipendenti a utilizzare di più l'IA nelle loro attività quotidiane.

      La selezione del modello è cruciale

      Oltre all'adozione diffusa, uno dei principali motivi intrinseci per l'alto costo dei token è la selezione del modello. I modelli di alto livello costano da 5 a 10 volte di più rispetto ai loro omologhi più ottimizzati.

      La seguente tabella fornisce uno sguardo ravvicinato ai modelli ottimizzati e di alto livello di Claude. Tutti i prezzi sono elencati su base per milione di token. Si prega di notare che i prezzi sono di luglio 2026 e potrebbero cambiare, ma aiutano comunque a sottolineare il punto principale.

      Utilizzando Haiku come nostro punto di riferimento, notiamo che Opus 5 è 5 volte più costoso. I modelli di punta più recenti sono ancora più costosi, dove modelli come Fable 5 sono 10 volte più costosi di un modello ottimizzato come Haiku. Queste differenze di prezzo evidenziano la selezione del modello come una delle migliori strategie di ottimizzazione dei costi.

      Per combattere l'aumento dei costi associati a un alto consumo di token, si consiglia alle aziende di scegliere i modelli con saggezza. I grandi modelli di frontiera come Opus sono raccomandati per sessioni di codifica complesse, mentre modelli come Haiku sono raccomandati per domande di consultazione rapida e compiti di subagente.

      Una finestra di contesto più ampia aumenta i costi

      Su un modello di frontiera della stessa dimensione, come Opus 5, una grande finestra di contesto agisce come un fattore cruciale nel costo complessivo. In termini semplici, la finestra di contesto è la memoria di lavoro dell'LLM per la sessione, che include prompt, cronologia delle conversazioni, documenti recuperati e le risposte del modello. Raddoppiare la dimensione della finestra di contesto può quadruplicare il calcolo necessario.

      Per osservare l'impatto del consumo di contesto sui costi, eseguirò un semplice test. Due sessioni identiche di Claude verranno avviate. Verrà posta la stessa domanda, ma la differenza sarà che una delle sessioni verrà alimentata con L'Odissea di Omero nella finestra di contesto.

      Entrambe le sessioni risponderanno alla stessa domanda: “Chi è Calypso e perché ha tenuto prigioniero Ulisse?”

      Questa domanda su un romanzo è stata scelta perché il testo della scrittura è di 132.953 parole, che corrispondono a circa 177.000 token. Rispetto a una sessione di codifica in cui potrebbero essere scaricate nuove dipendenze e ispezionati pacchetti di terze parti, questo metodo di passaggio del contesto a una sessione porta a un consumo di contesto prevedibile.

      La sessione di Claude che non ha il testo copiato nel contesto sarà in grado di eseguire una ricerca web e rispondere alla domanda a una frazione del consumo di token. La seguente tabella elenca il consumo di token delle sessioni.

      Questa grande differenza nel consumo di token si traduce in una vasta differenza nei costi per le sessioni.

      Una scoperta interessante da notare qui è che senza l'alimentazione del contesto, la domanda posta da entrambe le sessioni di Claude è la stessa, ma il costo di ciascuna sessione mostra una grande differenza.

      Per la stessa domanda, la sessione con alimentazione del contesto è costata 0,24 dollari, mentre la sessione senza contesto è costata solo 0,12 dollari. Quando la sessione continua a crescere, questo costo diventa un pavimento che viene aggiunto a ciascuna nuova query dell'LLM. La risposta ricevuta nella sessione con tutto il contesto era più dettagliata e di qualità superiore, ma era 2 volte più costosa.

      Per molte applicazioni pratiche, è necessario fornire il contesto esatto di cui l'LLM ha bisogno, ma trovare il confine da tracciare è un problema molto più difficile. A un certo punto, l'utente scambia contesto e costo per qualità della risposta. Aumentare costantemente la finestra di contesto non è un'opzione praticabile, e modelli come Haiku prevengono questo problema limitando la finestra di token a 200k.

      Outcome maxxing >> token maxxing

      Selezionando modelli grandi per ogni compito e riempiendo le sessioni con contesto extra, gli utenti possono facilmente aumentare le loro fatture LLM. Ci sono stati incentivi per gli utenti nella corporate America per aumentare l'uso dell'IA.

      Ci sono critici della tendenza al token maxxing che sostengono che i token spesi siano una metrica difettosa, e come riporta Bousquette, dovremmo calcolare l'aumento della produzione associato all'uso degli LLM. Yamini Rangan, CEO di HubSpot, l'ha riassunta meglio nel suo post su LinkedIn: “Outcome maxxing >> token maxxing”.

      La tendenza al tokenmaxxing è simile ai primi anni 2000, quando le aziende calcolavano le righe di codice impegnate. Il volume di codice generato o di documenti esaminati è al meglio un proxy e nel peggiore dei casi una metrica difettosa.

      Son

Aumento dei costi della corsa al consumo di token Aumento dei costi della corsa al consumo di token Aumento dei costi della corsa al consumo di token

Altri articoli

OpenAI afferma che segnali precedenti avrebbero potuto prevenire la violazione di Hugging Face OpenAI afferma che segnali precedenti avrebbero potuto prevenire la violazione di Hugging Face Il rapporto di OpenAI afferma di aver visto modelli sfuggire al loro sandbox alla fine di maggio e ha lasciato che la valutazione continuasse. Le regole europee potrebbero non coprire il modello che accusa. La Polonia ha chiesto alla Commissione Europea di multare Meta per 250 milioni di euro a causa di annunci truffa. La Polonia ha chiesto alla Commissione Europea di multare Meta per 250 milioni di euro a causa di annunci truffa. La Polonia ha chiesto alla Commissione Europea di multare Meta per 250 milioni di euro a causa di annunci truffa, dopo aver dato all'azienda sette giorni per rispondere a nove domande. Waystar libera l'IA agentica su reclami, negazioni e documentazione Waystar libera l'IA agentica su reclami, negazioni e documentazione I nuovi agenti di Waystar ripresentano autonomamente le richieste di risarcimento assicurativo negate. La Germania limita il numero di fatture ospedaliere che possono essere contestate e ne stabilisce il prezzo per ciascuna. Nvidia ha riportato un fatturato di 96,2 miliardi di dollari per il secondo trimestre. Nvidia ha riportato un fatturato di 96,2 miliardi di dollari per il secondo trimestre. Nvidia ha riportato un fatturato di 96,2 miliardi di dollari e ha emesso la sua prima previsione per l'anno successivo, con il CFO che ha affrontato direttamente il finanziamento circolare durante la chiamata. Gemini Live guadagna compiti agentici, controllo della casella vocale e intelligenza personale Gemini Live guadagna compiti agentici, controllo della casella vocale e intelligenza personale Gemini Live può ora fornire istruzioni vocali agli agenti in background. In Europa, Google deve consentire agli assistenti concorrenti di raggiungere funzionalità comparabili entro il 2027. Barret Zoph sta tornando a Google, sei anni e due startup dopo. Barret Zoph sta tornando a Google, sei anni e due startup dopo. Il co-fondatore del Thinking Machines Lab, Barret Zoph, si unisce a Google DeepMind come VP della ricerca, poche settimane dopo che Demis Hassabis si è fatto da parte come amministratore delegato.

Aumento dei costi della corsa al consumo di token

Perché il tokenmaxxing sta aumentando i costi dell'IA, come la scelta del modello e le finestre di contesto influenzano le spese degli LLM e perché le aziende dovrebbero concentrarsi sui risultati.