logo
Casa Casi

VAST Data e AMD affermano 9 volte più veloce tempo per il primo token con KV Cache Offload su Instinct

Certificazione
Cina Beijing Qianxing Jietong Technology Co., Ltd. Certificazioni
Cina Beijing Qianxing Jietong Technology Co., Ltd. Certificazioni
Rassegne del cliente
Il personale di vendita della tecnologia il Co., srl di Pechino Qianxing Jietong è molto professionale e paziente. Possono fornire rapidamente le citazioni. La qualità e l'imballaggio dei prodotti sono inoltre molto buoni. La nostra cooperazione è molto regolare.

—— LLC del》 di Festfing DV del 《

Quando stavo cercando urgentemente il CPU di Intel e lo SSD di Toshiba, sabbioso dalla tecnologia il Co., srl di Pechino Qianxing Jietong mi ha dato molto aiuto e mi ha ottenuto i prodotti che ho avuto bisogno di rapidamente. Realmente la apprezzo.

—— Kitty Yen

Sabbioso della tecnologia il Co., srl di Pechino Qianxing Jietong è un rappresentante molto attento, che può ricordarmi degli errori di configurazione a tempo in cui compro un server. Gli ingegneri sono inoltre molto professionali e possono realizzare rapidamente il processo difficile.

—— Strelkin Mikhail Vladimirovich

Siamo molto soddisfatti della nostra esperienza di lavoro con Beijing Qianxing Jietong. La qualità del prodotto è eccellente e la consegna è sempre puntuale. Il loro team di vendita è professionale, paziente e molto disponibile con tutte le nostre domande. Apprezziamo molto il loro supporto e non vediamo l'ora di una partnership a lungo termine. Altamente raccomandato!

—— Ahmad Navid

Qualità: “Grande esperienza con il mio fornitore. Il MikroTik RB3011 era già usato, ma era in ottime condizioni e tutto funzionava perfettamente.e tutte le mie preoccupazioni sono state affrontate rapidamente- Un fornitore molto affidabile.

—— Geran Colesio

Sono ora online in chat

VAST Data e AMD affermano 9 volte più veloce tempo per il primo token con KV Cache Offload su Instinct

July 28, 2026
VAST Data ha esteso la sua partnership con AMD per far progredire l'infrastruttura AI per piattaforme cloud e aziendali che eseguono training di modelli, inferenza, generazione aumentata di recupero (RAG) e carichi di lavoro AI agentivi. Lo stack integrato unisce il VAST AI Operating System con processori AMD EPYC di 6a generazione, GPU AMD Instinct, hardware di rete AMD e software ROCm.

Questa collaborazione si allinea a un importante cambiamento del settore: l'infrastruttura AI si sta evolvendo oltre i cluster dedicati solo al training per supportare il contesto persistente, l'inferenza ad alta concorrenza e i flussi di lavoro agentivi multi-turno. Le moderne implementazioni AI danno priorità al movimento efficiente dei dati, alla gestione ottimizzata della cache KV, a una maggiore utilizzo della GPU e all'accesso a bassa latenza a modelli di grandi dimensioni e dataset contestuali.

L'architettura Disaggregated Shared Everything (DASE) di VAST funge da livello dati unificato e condiviso per questi moderni ambienti AI. Consolida lo storage di file e oggetti, i database, lo streaming di eventi e i servizi dati core sotto un unico namespace globale, offrendo al contempo multi-tenancy e isolamento dei carichi di lavoro per i cloud AI che eseguono diverse attività concorrenti di clienti e applicazioni.

AMD EPYC 9006 Alimenta l'Hardware VAST di Nuova Generazione

VAST sta adottando i processori AMD EPYC 9006-series (Venice) di 6a generazione per i suoi imminenti sistemi CBox di 6a generazione ed EBox di 3a generazione, che costituiscono la base hardware del VAST AI Operating System. La piattaforma EPYC 9006 introduce la connettività PCIe Gen6 nella linea hardware di VAST, raddoppiando la larghezza di banda I/O per generazione.

ultimo caso aziendale circa VAST Data e AMD affermano 9 volte più veloce tempo per il primo token con KV Cache Offload su Instinct  0

L'aggiornamento aumenta il throughput dello storage di file e oggetti e riduce la latenza per i carichi di lavoro di database, data warehouse e streaming di eventi supportati da VAST DataBase e DataEngine. Per l'infrastruttura AI, la larghezza di banda I/O migliorata allevia i colli di bottiglia tra calcolo, rete e storage NVMe, a beneficio del caricamento dei modelli, delle pipeline di recupero, dell'accesso ai checkpoint e dei flussi di lavoro di cache KV esterni che superano i limiti della memoria GPU nativa.

Architettura di Riferimento Tri-Player con AMD e DriveNets

VAST, AMD e DriveNets stanno costruendo congiuntamente un'architettura di riferimento unificata per l'infrastruttura AI, combinando l'infrastruttura AI Helios su scala rack di AMD, il VAST AI OS e la rete AI Fabric di DriveNets. Il framework fornisce indicazioni di distribuzione standardizzate per i carichi di lavoro di training AI, inferenza, apprendimento per rinforzo e cache KV, offrendo best practice di dimensionamento e disponibilità per le aziende che costruiscono fabbriche AI con infrastruttura dati condivisa e networking ad alte prestazioni.

VAST ha anche ampliato i suoi legami ecosistemici con i fornitori di inferenza TensorMesh ed EmbeddedLLM, concentrandosi su architetture di inferenza di livello production per casi d'uso AI agentivi, con dettagli specifici di integrazione e lancio ancora da divulgare.

Offload Ottimizzato della Cache KV per Inferenza ad Alta Concorrenza

Un punto centrale della collaborazione aggiornata è l'offload migliorato della cache KV, che sfrutta le GPU AMD Instinct, AMD Infinity Context, il software ROCm e il VAST AI OS. La cache KV memorizza i dati di stato di attenzione generati dall'inferenza per accelerare le interazioni multi-turno e i carichi di lavoro AI a contesto lungo, tuttavia le grandi dimensioni della cache consumano rapidamente la memoria GPU limitata.

ultimo caso aziendale circa VAST Data e AMD affermano 9 volte più veloce tempo per il primo token con KV Cache Offload su Instinct  1

L'offload o il tiering della cache KV su storage condiviso ad alte prestazioni libera la memoria GPU per le attività attive, preservando al contempo i dati contestuali per le successive richieste di inferenza. I primi test sulle GPU AMD Instinct MI355X hanno fornito un tempo di prima token 9 volte più veloce e un throughput di token 9,7 volte superiore per i carichi di lavoro AI agentivi ad alta concorrenza tramite l'offload della cache KV potenziato da VAST, con prestazioni variabili in base alla base hardware, al carico di lavoro e alla configurazione dello storage.

Inoltre, le policy di ciclo di vita automatizzate di VAST si applicano ai dati della cache KV, consentendo la scadenza e l'eliminazione pianificata del contenuto memorizzato nella cache, una funzionalità critica per la gestione di dati di inferenza sensibili, personali o regolamentati.

Interconnessione GPU-Storage ad Alta Velocità tramite Pensando Pollara 400

L'architettura implementa le NIC AI AMD Pensando Pollara 400 per connettere le GPU AMD Instinct ai cluster di storage VAST. Supportando NFS su TCP e RDMA, la NIC consente trasferimenti di dati efficienti da GPU a storage, garantendo un accesso a bassa latenza allo storage VAST basato su NVMe per la cache KV e i carichi di lavoro di inferenza generali.

Questo design disaccoppia la scalabilità della gestione del contesto dai limiti della memoria fisica della GPU. Invece di trattare lo storage come persistenza passiva, VAST posiziona la sua piattaforma come un livello dati ed esecuzione unificato per la gestione distribuita dei modelli, database, streaming, asset di file e contesto AI. Per i fornitori di cloud AI, l'architettura eleva l'utilizzo della GPU e l'efficienza operativa, supportando la transizione del settore dal training batch e dal noleggio di GPU all'inferenza persistente e ai servizi AI agentivi.

Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang/Global Strategy Director
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Sito Web: www.qianxingdata.com/www.storagesserver.com
Focus Aziendale:
Distribuzione Prodotti ICT/Integrazione di Sistemi e Servizi/Soluzioni Infrastrutturali
Con oltre 20 anni di esperienza nella distribuzione IT, collaboriamo con i principali marchi globali per fornire prodotti affidabili e servizi professionali.
“Usare la Tecnologia per Costruire un Mondo Intelligente” Il Tuo Affidabile Fornitore di Servizi per Prodotti ICT!
Dettagli di contatto
Beijing Qianxing Jietong Technology Co., Ltd.

Persona di contatto: Ms. Sandy Yang

Telefono: 13426366826

Invia la tua richiesta direttamente a noi (0 / 3000)