In esecuzione su Oracle Cloud Infrastructure (OCI), WEKA NeuralMesh e Augmented Memory Grid software offre 10 volte maggiore throughput token, 10 volte più utenti simultanei e 7 volte più token per GPU,rispetto agli ambienti OCI standard basati esclusivamente sulla DRAM locale.
WEKA's Augmented Memory Grid estende la memoria del server GPU per l'inferenza AI sfruttando lo storage esterno tramite NeuralMesh, trasformando le risorse esterne in una cache KV ad alte prestazioni.Offre latenza di microsecondi e larghezza di banda multi-GB/sNeuralMesh è il file system AI ad alte prestazioni di WEKA.Tutti i parametri di riferimento sono stati convalidati su un cluster OCI a 9 nodi di H100 in metallo nudo con 100Finestre di contesto con 1.000 token.
Pablo Salem, Senior Director of Software Development di OCI, ha commentato: "I carichi di lavoro di IA aziendale continuano ad espandere le finestre di contesto e ad elevare l'utilizzo della GPU a nuovi limiti.Questi parametri dimostrano che la soluzione di WEKA elimina i colli di bottiglia della memoria GPU su OCI, che consente carichi di lavoro di inferenza più grandi e più impegnativi senza investimenti aggiuntivi in hardware GPU.
WEKA osserva che la crescente domanda di inferenza amplifica le inefficienze dell'infrastruttura dell'IA.danneggia l'esperienza dell'utente e aumenta i costi operativi per tokenPer carichi di lavoro di IA a lungo contesto e agentici con input di oltre 100.000 token, tali spese generali danneggiano gravemente l'economia unitaria delle distribuzioni di IA di produzione.
Il benchmark è stato costruito su 9 nodi, 72 GPU H100, finestre di contesto di 100.000 token e migliaia di utenti simultanei, con chiare lacune di prestazioni mostrate di seguito:
-
Capacità di utilizzazione simultanea: WEKA supporta oltre 5.000 utenti simultanei, rispetto a solo 600 su installazioni solo DRAM.massimizzare il ROI dell'hardware GPU esistente senza acquisti aggiuntivi di GPU.
-
Portata dei token: La pila WEKA ha raggiunto circa 2 milioni di token al secondo, 10 volte più veloce rispetto alla base inferiore ai 200.000 token/sec dei sistemi basati solo sulla DRAM.
-
Volume totale di elaborazione dei token: In un test di un'ora con 2.400 utenti simultanei, WEKA ha elaborato 5 miliardi di token, mentre la configurazione DRAM ha gestito solo 700 milioni di token.
Per i flussi di lavoro dell'AI agentica, la DRAM insufficiente innesca un costante ricalcolo della GPU dopo la saturazione della cache, aumentando i costi per token e riducendo il ROI.WEKA riduce notevolmente i costi complessivi dei token per i servizi di produzione di IA.
Per i servizi di IA in tempo reale, inclusi la ricerca, il riassunto, l'assistenza al codice e gli agenti multi-turn, il throughput dei token definisce i limiti del servizio per la capacità dell'utente,velocità di risposta e potenziale delle entrate infrastrutturaliIl miglioramento del throughput di 10 volte sblocca completamente la potenza di calcolo GPU nativa all'interno del cluster OCI.
In breve, il software di espansione della memoria di WEKA® aiuta le piattaforme cloud a servire più utenti, elaborare più token e ridurre efficacemente i costi operativi.
Liran Zvibel, CEO di WEKA, ha dichiarato: "Le prestazioni di inferenza sono ostacolate dalla memoria efficace GPU disponibile. Questi risultati dimostrano che gli aggiornamenti hardware da soli non possono risolvere i problemi economici dei token AI.La vera limitazione è la parete di memoria di lunga data che limita le prestazioni della GPULa soluzione di WEKA su OCI aumenta drasticamente la capacità di elaborazione dei token con un costo totale di proprietà ottimizzato.
L'OCI ha pubblicato la metodologia completa del benchmark, le configurazioni del sistema e i risultati completi dei test sul suo blog ufficiale AI & Data Science.
NeuralMesh with Augmented Memory Grid è ora generalmente disponibile per i clienti WEKA e quotato su Oracle Marketplace, con OCI che agisce come suo partner esclusivo di lancio del cloud.Le imprese che eseguono l'inferenza di lungo contesto su OCI possono implementare questo, l'architettura completamente convalidata subito.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang, direttore della strategia globale
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Sito web: www.qianxingdata.com/www.storagesserver.com
Affari:
Distribuzione di prodotti TIC/integrazione di sistemi e servizi/soluzioni infrastrutturali
Con oltre 20 anni di esperienza nella distribuzione IT, collaboriamo con i principali marchi globali per fornire prodotti affidabili e servizi professionali.
Utilizzare la tecnologia per costruire un mondo intelligenteIl vostro fornitore di servizi di prodotti ICT di fiducia!