Il crescente interesse per l’intelligenza artificiale ha creato carichi di lavoro che
richiedono sia l'accesso sequenziale che casuale. Allo stesso tempo, Supportato da NVMe
sono emerse soluzioni di archiviazione, fornendo funzionalità di memorizzazione nella cache per colonne di grandi dimensioni
set di dati nell'archiviazione cloud. Le attuali librerie di archiviazione colonnari non sono all'altezza
utilizzando in modo efficace le capacità di un dispositivo NVMe, soprattutto quando arriva
all'accesso casuale. Storicamente, si è ipotizzato che ciò costituisse una debolezza implicita
formati di archiviazione colonnari, ma questo non è stato sufficientemente esplorato. In questo
carta, esaminiamo l'efficacia dei formati colonnari più diffusi come Apache
Freccia, Parquet Apache, e Lance sia nelle attività di accesso casuale che di scansione completa
contro lo storage NVMe.
Sosteniamo che la codifica efficace della struttura di una colonna, come il
informazioni sulla ripetizione e sulla validità, è la chiave per sbloccare il disco
prestazione. Mostriamo quel Parquet, se configurato correttamente, può raggiungere oltre
60x prestazioni di accesso casuale migliori rispetto alle impostazioni predefinite. Lo dimostriamo anche
queste elevate prestazioni di accesso casuale richiedono piccoli compromessi nella scansione
prestazioni e utilizzo della RAM. Descriviamo quindi la codifica strutturale Lance
schema, che alterna due diverse codifiche strutturali basate su
larghezza dei dati, e ottiene migliori prestazioni di accesso casuale senza fare
compromessi nelle prestazioni di scansione o nell'utilizzo della RAM.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



