Al vertice RAISE di Parigi, DDN ha presentato la sua collaborazione in corso con Nebul, un fornitore europeo di cloud ibrido sovrano, incentrato sull'aumento dell'efficienza per le implementazioni di inferenza AI su larga scala.Presentato la settimana scorsa, l'iniziativa congiunta unisce la piattaforma di inferenza di Nebul, l'architettura di intelligenza dei dati Infinia di DDN e l'informatica accelerata NVIDIA per risolvere un bottleneck chiave della produzione di IA:costi di movimentazione dei dati e limitazioni delle prestazioni durante i carichi di lavoro di inferenza.
DDN inquadra la collaborazione attorno a metriche critiche di produzione: utilizzo della GPU, throughput dei token, costo per token e latenza.l'inferenza definisce i rendimenti operativi e commercialiL'adozione crescente dell'IA agentica, la generazione aumentata da recupero (RAG),e l'inferenza ad alta convergenza significa che l'infrastruttura di archiviazione e dati ha un impatto diretto sull'efficienza dell'acceleratore e sulle velocità di risposta dell'IA.
Questo progetto attivo di prova di concetto ha dato risultati promettenti.I partner hanno registrato miglioramenti misurabili nel time-to-first-token con la cache KV abilitata e completato la convalida per l'infrastruttura basata su RoCEIl benchmarking in corso copre lunghezze di sequenza di inferenza più lunghe, sbloccando ulteriori potenzialità di ottimizzazione per la piattaforma Infinia.La collaborazione si estende anche agli sforzi congiunti di NVIDIA sui quadri di benchmarking, verifica della scalabilità e prossime pubblicazioni tecniche.
La piattaforma integrata sfrutta i servizi di cache KV distribuiti, il movimento dei dati nativi GPU, l'orchestrazione intelligente dei dati e l'architettura di archiviazione ad alte prestazioni.L'accelerazione della cache KV offre notevoli guadagni di inferenza preservando e recuperando rapidamente gli stati di attenzione pre-calcolati, riducendo i calcoli ridondanti ed eliminando i ritardi di consegna dei dati che causano il funzionamento a vuoto della GPU.
I leader di DDN, Nebul e NVIDIA hanno evidenziato un importante cambiamento nel settore: le priorità dell'infrastruttura AI si stanno spostando dalla distribuzione grezza della GPU all'efficienza operativa,massimizzare il rendimento dell'acceleratore esistente. DDN CEO Alex Bouzari and Nebul CEO Arnold Juffer noted that past focus on larger model scales has given way to optimizing inference economics to make production AI commercially viable via lower per-token costsRod Evans, vicepresidente dell'infrastruttura cloud di NVIDIA, ha aggiunto che i carichi di lavoro agentici su larga scala ora misurano il successo dell'infrastruttura con l'utilizzo e la latenza della GPU, piuttosto che con la pura potenza di calcolo.
DDN sottolinea che l'infrastruttura dell'IA deve evolversi al di là delle funzioni di archiviazione di base per supportare attivamente i flussi di lavoro di esecuzione dell'AI.Le piattaforme infrastrutturali dell'azienda attualmente alimentano oltre un milione di GPU in tutto il mondo, al servizio di iperscale, fornitori di cloud, imprese, governi e istituti di ricerca.
I moderni team di infrastrutture di IA danno ora la priorità a queste metriche di produzione fondamentali:
Utilizzazione della GPU: Misura l'attività effettiva dell'acceleratore durante l'inferenza, massimizzando il valore dell'hardware GPU di fascia alta.
Costo per gettone: collega direttamente le prestazioni infrastrutturali ai costi operativi di output del modello IA.
Token per watt: Valuta l'efficienza energetica dell'output di inferenza dell'IA.
Tempo per il primo segno: Determina la reattività delle applicazioni IA interattive e l'esperienza degli utenti.
Tempo di produzione: Quantifica gli sforzi operativi per migrare i servizi di IA dai test alla distribuzione commerciale scalabile.
Mentre l'inferenza diventa il carico di lavoro dominante dell'intelligenza artificiale, fornendo dati di contesto e aziendali memorizzati in cache alle GPU con basso costo,la latenza stabile sarà fondamentale per sostenere un'elevata utilizzazione della GPU e controllare i costi operativi a lungo termine.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang, direttore della strategia globale
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Sito web: www.qianxingdata.com/www.storagesserver.com
Affari:
Distribuzione di prodotti TIC/integrazione di sistemi e servizi/soluzioni infrastrutturali
Con oltre 20 anni di esperienza nella distribuzione IT, collaboriamo con i principali marchi globali per fornire prodotti affidabili e servizi professionali.
Utilizzare la tecnologia per costruire un mondo intelligenteIl vostro fornitore di servizi di prodotti ICT di fiducia!
Sandy Yang, direttore della strategia globale
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Sito web: www.qianxingdata.com/www.storagesserver.com
Affari:
Distribuzione di prodotti TIC/integrazione di sistemi e servizi/soluzioni infrastrutturali
Con oltre 20 anni di esperienza nella distribuzione IT, collaboriamo con i principali marchi globali per fornire prodotti affidabili e servizi professionali.
Utilizzare la tecnologia per costruire un mondo intelligenteIl vostro fornitore di servizi di prodotti ICT di fiducia!



