Reti neurali profonde (DNN) e modelli linguistici di grandi dimensioni (LLM) Avere
rivoluzionato l’intelligenza artificiale, tuttavia il loro dispiegamento è significativo
memoria e sfide computazionali, soprattutto in quelli con risorse limitate
ambienti. Le tecniche di quantizzazione hanno mitigato alcuni di questi problemi
riducendo la precisione dei dati, concentrandosi principalmente sulla moltiplicazione generale delle matrici
(GEMMA). Questo studio introduce un nuovo paradigma di scarsità, scarsità transitiva,
che sfrutta sostanzialmente il riutilizzo dei risultati precedentemente calcolati
ridurre al minimo il sovraccarico computazionale nelle operazioni GEMM. Rappresentando transitivo
relazioni utilizzando un grafo aciclico diretto, sviluppiamo una strategia efficiente per
determinazione degli ordini di esecuzione ottimali, superando così le sfide inerenti
legati alle dipendenze di esecuzione e al parallelismo. Costruire su queste basi,
presentiamo l'array transitivo, un acceleratore senza moltiplicazione progettato per
sfruttare la scarsità transitiva in GEMM. La nostra architettura è efficacemente equilibrata
carichi di lavoro computazionali su più corsie parallele, garantendo un livello elevato
efficienza e utilizzo ottimale delle risorse. Valutazioni complete
demonstrate that the Transitive Array achieves approximately 7.46$\times$ and
3.97$\times$ speedup and 2.31$\times$ and 1.65$\times$ energy reduction
rispetto agli acceleratori all'avanguardia come Olive e BitVert mentre
mantenendo un'accuratezza del modello comparabile sui modelli LLaMA.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



