L'adozione dell'IA è attualmente ostacolata dalle elevate spese dei token e dalla mancanza di chiarezza sui prezzi iniziali per le richieste di AI, con conseguente spesa eccessiva di token incontrollata.Questo rischio e' drasticamente amplificato dagli agenti dell'IA., che attualmente operano senza restrizioni di costo del token e possono innescare esplosioni di costi estremi.
Questo articolo spiega cosa sono i token AI, come funziona il prezzo dei token e le strategie attuabili per prevenire la spesa catastrofica dei token.Un caso di impresa ben documentato ha visto un'organizzazione accumulare un $ 500,000Inoltre, secondo quanto riferito, il team di ingegneri di Uber ha esaurito l'intero budget per l'IA 2026 prima del previsto.I token sono le unità fondamentali che i grandi modelli linguistici (LLM) e i chatbot utilizzano per decomporre i suggerimenti del linguaggio umano e generare uscite coerenti di IA.
Ad esempio, l'input prompt Contami della sedimentazione è suddiviso in componenti token discreti:
- Dimmi.
- Io.
- Circa
- sedimenti
-azione
Questa suddivisione in cinque simboli per la singola parola "sedimentazione" aiuta gli LLM ad interpretare con precisione la struttura e il significato delle parole.La divisione della radice sedimento e del suffisso ation consente al modello di riconoscere l'uso coerente del suffisso in numerosi nomiQuesto approccio restringe il campo di ricerca del modello nella sua banca dati.riducendo il tempo di elaborazione invece di scansionare ogni parola contenente un suffisso individualmente.
Come unità di dati di base, i token vengono convertiti in inserzioni vettoriali stringhe numeriche matematiche che codificano significato semantico e vengono memorizzati negli indici del modello.il modello genera più vettori per rappresentare i suoi attributi multidimensionali, come organismi viventi, animali domestici, tratti felini, dimensioni fisiche e altro ancora.e giocattoli sintetici per gatti.
Un ipotetico inserimento vettoriale a cinque dimensioni per il termine cat può essere espresso come [1.5- 0! - 0!4, 7.2, 19.6, 20.2).
Tutti i dati vettoriali esistono in uno spazio vettoriale unificato, consentendo ai modelli di identificare contenuti semanticamente simili misurando la prossimità spaziale tra i punti vettoriali.
Una volta convertiti in vettori, i token vengono elaborati su server GPU ad alto costo dotati di memoria ad alta larghezza di banda.Un NVIDIA DGX SuperPOD con 32 nodi e 256 GPU totali costa tra $ 12 milioni e $ 20 milioniUn'architettura di riferimento più avanzata con 140 nodi DGX H100, rete Quantum-2 InfiniBand, storage completo e infrastrutture di rete e sistemi di supporto possono superare i 100 milioni di dollari.Questi costi di infrastruttura sostanziali si riflettono direttamente negli schemi di prezzo dei token dei modelli tradizionali di fondazione.
I principali fornitori di LLM e chatbot tra cui OpenAI e Anthropic adottano modelli di fatturazione basati su token, con regole di conversione di token prevedibili per i contenuti di testo.un gettone inglese equivale a circa quattro caratteri o 0.75 parole, il che significa 750 parole corrispondono a circa 1.000 token. In particolare, sia le richieste di input che le risposte di output generate consumano token.,L'output dell'IA da 000 parole consuma circa 3.667 token in totale.
Il consumo di token più elevato estende direttamente la latenza di risposta dell'IA. Tutti i token da una singola sessione di risposta istantanea sono contenuti in una finestra di contesto di capacità finita.La finestra di contesto di 000 token può contenere circa 75100.000 parole in inglese, l'equivalente di un libro di 300 pagine.
La capacità insufficiente della finestra di contesto fa sì che i LLM perdano informazioni contestuali, portando a uscite di IA incomplete o imprecise.GPT-4o supporta fino a 128,000 token, Claude 3.5 Sonnet raggiunge i 200.000 token, e gli utenti aziendali Gemini 1.5 Pro selezionati possono accedere a una finestra di contesto di 2 milioni di token.
Il prezzo dei token varia a seconda dei fornitori di modelli.
Per Intuition Labs, l'API ChatGPT di OpenAI opera su una struttura di fatturazione basata su token.con token di output che in genere costano di più. I prezzi variano anche in base allo stato di risposta della cache. Ogni chiamata API comporta due commissioni distinte: una per i token di input immediati e una per i token di output generati dall'IA.utilizzando un modello con un prezzo di $10 per milione di token di output per 100 token di input e 400 token di output si ottiene un costo di input di $10×(100/1,000,000) e costi di produzione di 10 × 400/1,000, 000), con spese totali pari alla somma delle due cifre.
Le imprese possono implementare controlli di governance mirati per limitare la spesa dei token, comprese le quote per utente o per posto, la limitazione del traffico basata sull'utilizzo, i limiti di spesa per progetto,e restrizioni di livello di modelloQuesto campo di governance si sta evolvendo rapidamente, poiché i fornitori di IA competono per ottimizzare la qualità dei servizi, bilanciare i flussi di entrate e competere con i modelli di IA open source.
Gli agenti di IA introducono un livello completamente nuovo di rischio dei costi dei token.Gli esperti del settore raccomandano di trattare gli agenti dell'IA come dipendenti digitali, con le squadre FinOps che attuano un rigoroso monitoraggio delle spese 24 ore su 24 per evitare disastri dei costi.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang, direttore della strategia globale
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Sito web: www.qianxingdata.com/www.storagesserver.com
Affari:
Distribuzione di prodotti TIC/integrazione di sistemi e servizi/soluzioni infrastrutturali
Con oltre 20 anni di esperienza nella distribuzione IT, collaboriamo con i principali marchi globali per fornire prodotti affidabili e servizi professionali.
Utilizzare la tecnologia per costruire un mondo intelligenteIl vostro fornitore di servizi di prodotti ICT di fiducia!