Grands modèles multimodaux (LMM) percevoir uniformément les images vidéo, créer
inefficacité informatique pour les vidéos dont le temps varie intrinsèquement
densité de l'information. This paper present \textbf{Visionneuse rapide}, un LMM avec de nouveaux
paradigme de perception qui divise une vidéo de densité non uniforme en variables
cubes utilisant Gumbel Softmax, suivi d'un rééchantillonnage unifié pour chaque cube afin
parvenir à une compréhension vidéo efficace. Cette approche simple et intuitive
compresser dynamiquement la vidéo en ligne en fonction de sa densité temporelle, de manière significative
réduire la redondance spatio-temporelle (overall 45$\times$ compression rate), alors que
permettant un entraînement efficace avec un grand champ de réception. Nous formons le modèle à partir de
une base linguistique à travers trois étapes progressives, chacun intégrant
de longues vidéos en moyenne de 420 s/1 ips grâce à l'efficacité de perception.
Avec seulement 0,8 million d'échantillons de texte vidéo au total pour la formation, notre modèle surpasse le
ligne de base directe employant une stratégie de partitionnement fixe par un maximum de 8.72 dans
précision, démontrer l’efficacité dans la performance. En vidéo-MME,
Quicksviewer réalise SOTA avec des longueurs de séquence modestes en utilisant seulement jusqu'à 5\%
de jetons par image requis par les lignes de base. Avec ce paradigme, intensifier le
le nombre de trames d'entrée révèle une loi de puissance claire des capacités du modèle. Il
est également vérifié empiriquement que les segments générés par le réseau de cubage
peut aider à analyser des événements continus dans des vidéos.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



