Große multimodale Modelle (LMMs) Videobilder gleichmäßig wahrnehmen, erstellen
Rechenineffizienz für Videos mit inhärent variierender Zeit
Informationsdichte. This paper present \textbf{Quicksviewer}, ein LMM mit neuem
Wahrnehmungsparadigma, das ein Video mit ungleichmäßiger Dichte in unterschiedliche unterteilt
Würfel mit Gumbel Softmax, gefolgt von einem einheitlichen Resampling für jeden Würfel
Erzielen Sie ein effizientes Videoverständnis. Dieser einfache und intuitive Ansatz
Komprimieren Sie Videos online dynamisch basierend auf ihrer zeitlichen Dichte, deutlich
Verringerung der räumlich-zeitlichen Redundanz (overall 45$\times$ compression rate), während
Ermöglicht ein effizientes Training mit großem Aufnahmefeld. Wir trainieren das Modell von
ein sprachliches Rückgrat durch drei progressive Stufen, jeweils einbeziehend
Längere Videos erreichen dank der Wahrnehmungseffizienz durchschnittlich 420 Sekunden/1 Bild pro Sekunde.
Mit insgesamt nur 0,8 Millionen Videotextbeispielen für das Training, Unser Modell übertrifft das
direkte Basislinie unter Verwendung einer festen Partitionierungsstrategie um maximal 8.72 In
Genauigkeit, Nachweis der Leistungswirksamkeit. Auf Video-MME,
Quicksviewer erreicht SOTA bei bescheidenen Sequenzlängen mit nur bis zu 5\%
Anzahl der Token pro Frame, die für Baselines erforderlich sind. Mit diesem Paradigma, Vergrößerung der
Die Anzahl der Eingaberahmen zeigt ein klares Potenzgesetz der Modellfähigkeiten. Es
Es wird auch empirisch überprüft, ob die Segmente durch das Cubing-Netzwerk erzeugt werden
kann bei der Analyse kontinuierlicher Ereignisse in Videos hilfreich sein.
Dieser Artikel untersucht Zeitreisen und deren Auswirkungen.
PDF herunterladen:



