NetApp acquisirà DataPelago, creatore del motore di elaborazione dei dati nucleo universale (UDPE) che accelera il calcolo eterogeneo per l'analisi e l'intelligenza artificiale generativa.
Basato su open-source Gluten, Velox e Substrait, Nucleus velocizza drasticamente Spark e Trino per offrire prestazioni di costo eccezionali.TabellaDataPelago è stata fondata nel 2021 dal CEO Rajan Goyal e dal CPO Anand Iyer, DataPelago è uscita dalla segretezza nell'ottobre 2024 e ha raccolto oltre 75 milioni di dollari in totale.compresa una tornata di finanziamento di 47 milioni di dollari per il 2024.
Il CEO di NetApp, George Kurian, ha dichiarato che l'avanzamento dell'hardware AI richiede un'infrastruttura di dati ugualmente capace per sbloccare il valore dei dati aziendali,e l'acquisizione rafforza la capacità di NetApp di fornire un'elaborazione agile dei dati per la differenziazione competitiva.
Un blog di DataPelago ha notato che Nucleus sarà nativamente incorporato nella piattaforma di dati di NetApp, consentendo un'adozione aziendale molto più ampia di quella che la startup potrebbe ottenere in modo indipendente.DataPelago si classifica al quarto posto nella classifica delle aziende più innovative del mondo per il 2026.
A differenza delle architetture tradizionali che spostano i set di dati su cluster CPU/GPU esterni, Nucleus esegue il calcolo accelerato direttamente al livello di archiviazione.Proiezioni 5 volte più velociIl suo stack è posizionato tra motori di query (Spark, Trino, Flink) e framework Python (Ray, Dask).
1.DataApp: modulo di integrazione innescabile per iniettare accelerazione in Spark, Trino e altri motori.
2.DataOS: strato di orchestrazione che mappia dinamicamente le attività dei dati agli acceleratori misti per un'adeguata prestazione scalabile.
3.DataVM: macchina virtuale personalizzata con ISA specifico per il dominio, che offre un'astrazione di esecuzione unificata per CPU, GPU, FPGA e silicio personalizzato.
Flusso di esecuzione dei dati di base
1.Accesso ai dati tramite i connettori framework: distribuito come plug-in Spark JAR compatibili con i connettori dati standard, supportando Parquet, ORC, Iceberg, Delta Lake, JSON e obiettivi di storage tra cui S3, GCS,ADLS, HDFS e array on-premise. L'accelerazione si estende alle integrazioni di storage mantenendo la semantica delle query native tramite i livelli standard di I/O del motore.
2Pianificazione e ottimizzazione delle query: il motore host genera un piano fisico; DataApp lo converte in una rappresentazione intermedia tramite Gluten/Substrait.Un ottimizzatore intelligente crea grafici di flusso di dati ottimali e alloca risorse CPU / GPU per l'esecuzione di DataOS / DataVM.
3Ottimizzazioni del trasferimento dati cross-hardware: la fusione operatore/kernel e l'esecuzione di streaming eliminano la completa materializzazione intermedia per ridurre le spese generali di I/O.La memoria condivisa a copia zero riduce la duplicazione dei dati CPU-GPU, mentre l'ISA di DataVM® sfrutta LLVM, CUDA e ROCm per indirizzare le attività verso l'hardware ottimale tramite l'elaborazione vettorizzata a colonne.Questi aggiornamenti portano l'utilizzo della GPU all'80-90% riducendo al minimo il shuffling dei dati tra i domini.
Nucleus opera on-premise e su tutti i principali cloud pubblici.si integra anche con Snowflake accelerando l'elaborazione del formato di tavolo aperto e le condotte a monte/a valle Spark/Trino che alimentano il magazzinoDataPelago afferma che Nucleus riduce i costi dell'infrastruttura fino all'80% e offre prestazioni 10 volte più veloci rispetto alle pipeline legacy.,elimina il principale ostacolo che rallenta il lancio dell'IA aziendale, con implementazioni in tempo reale presso grandi imprese globali in tutti i settori verticali.
Il CEO di DataPelago, Rajan Goyal, ha affermato che la missione principale della società è quella di risolvere i colli di bottiglia del trattamento dei dati che impediscono l'innovazione dell'IA.La fusione con NetApp unisce la sua tecnologia di accelerazione all'ampio portafoglio di infrastrutture dati di NetAppLe aziende hanno investito pesantemente in GPU e modelli, ma soffrono di silos di dati frammentati che lasciano l'hardware sottoutilizzato e lo stack combinato semplifica la distribuzione di IA su larga scala.
NetApp definisce l'acquisizione come un notevole aggiornamento del portafoglio, portando l'elaborazione accelerata da GPU direttamente nei flussi di lavoro di archiviazione per offrire una vera attivazione dei dati aziendali a copia zero per l'IA.I dati finanziari dell'operazione rimangono segreti.Dato l'impegno di Nucleus, la stretta sinergia con NetApp AIDE e l'aumento della domanda di IA agentica, la valutazione dell'acquisto è probabilmente pari a un multiplo di 4×5 del finanziamento complessivo di DataPelago di 75 milioni di dollari.DataPelago opererà come filiale interamente controllata da NetApp.
Differenza fondamentale: Nucleus vs KV Cache vs NetApp AIDE
1.Differenziazione della cache di nucleo e KV: Nucleus ottimizza l'ingestione, la trasformazione e la consultazione dei dati prima che i dati raggiungano i server GPU.Nvidia's KV Cache è un'ottimizzazione della memoria in-GPU attiva solo dopo l'arrivo dei dati sull'hardware GPU per aumentare l'efficienza della generazione di token. Nucleus velocizza la consegna dei dati al calcolo; KV Cache ottimizza il runtime del modello dopo che i dati sono atterrati sugli acceleratori.
2.NetApp AIDE vs Nucleus UDPE: AIDE è il pre-elaborazione AI bloccato ONTAP/AFX per LLM e agenti, che funziona come ETL proprietario con database vettoriale integrato, catalogazione dei metadati,Servizio RAG e integrazione Nvidia AI Enterprise (compresi i microservizi di vettorizzazione NIM)L'integrazione di Nucleus con AIDE rafforzerebbe la trasformazione, la formazione, il fine-tuning e le condotte di inferenza.abilitare carichi di lavoro accelerati direttamente sullo storage NetApp AFXÈ prevedibile una soluzione AIDE+Nucleus completa.
Syam Nair, CPO di NetApp, ha commentato che Nucleus offre un'accelerazione definita dal software nello storage, consentendo la preparazione di dati a copia zero, la governance e l'attivazione dell'IA su CPU e GPU.NetApp gestisce più dati multi-ambiente aziendali di qualsiasi rivale, e la prossima ondata di competitività dell'intelligenza artificiale dipende dall'elaborazione dei dati alla loro fonte.
Beijing Qianxing Jietong Technology Co., Ltd.
Sandy Yang, direttore della strategia globale
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Sito web: www.qianxingdata.com/www.storagesserver.com
Affari:
Distribuzione di prodotti TIC/integrazione di sistemi e servizi/soluzioni infrastrutturali
Con oltre 20 anni di esperienza nella distribuzione IT, collaboriamo con i principali marchi globali per fornire prodotti affidabili e servizi professionali.
Utilizzare la tecnologia per costruire un mondo intelligenteIl vostro fornitore di servizi di prodotti ICT di fiducia!