Grandi modelli multimodali (LMM) percepiscono uniformemente i fotogrammi video, creando
inefficienza computazionale per video con temporali intrinsecamente variabili
densità di informazioni. This paper present \textbf{Visualizzatore rapido}, un LMM con nuovo
paradigma percettivo che suddivide un video di densità non uniforme in variabili
cubi utilizzando Gumbel Softmax, seguito da un ricampionamento unificato per ciascun cubo
ottenere una comprensione video efficiente. Questo approccio semplice e intuitivo
comprimere dinamicamente i video online in base alla loro densità temporale, in modo significativo
riducendo la ridondanza spazio-temporale (overall 45$\times$ compression rate), Mentre
consentendo una formazione efficiente con un ampio campo recettivo. Addestriamo il modello da
la struttura portante del linguaggio attraverso tre fasi progressive, ciascuno incorporante
video di lunga durata in media di 420s/1fps grazie all'efficienza di percezione.
Con solo 0,8 milioni di campioni di testo video totali per la formazione, il nostro modello supera il
linea di base diretta che utilizza una strategia di partizionamento fissa per un massimo di 8.72 In
precisione, dimostrando l’efficacia nella performance. Su Video-MME,
Quicksviewer raggiunge SOTA con lunghezze di sequenza modeste utilizzando solo fino a 5\%
di token per frame richiesti dalle linee di base. Con questo paradigma, ridimensionare il
numero di frame di input rivela una chiara legge di potenza delle capacità del modello. Esso
Viene inoltre verificato empiricamente che i segmenti generati dalla rete di cubatura
può aiutare ad analizzare eventi continui nei video.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



