Autoregressiv (AR) Modelle, lange Zeit dominant in der Sprachgenerierung, Sind
zunehmend auf die Bildsynthese angewendet, werden aber oft als weniger angesehen
wettbewerbsfähiger als diffusionsbasierte Modelle. Eine primäre Einschränkung ist die
Für AR-Modelle ist eine beträchtliche Anzahl an Bildtokens erforderlich, was einschränkt
sowohl Trainings- als auch Inferenzeffizienz, sowie Bildauflösung. Ansprechen
Das, Wir präsentieren Token-Shuffle, eine neuartige und dennoch einfache Methode, die die reduziert
Anzahl der Bild-Tokens in Transformer. Unsere wichtigste Erkenntnis ist die Dimension
Redundanz visueller Vokabulare in multimodalen großen Sprachmodellen (MLLMs),
wo niedrigdimensionale visuelle Codes vom visuellen Encoder direkt abgebildet werden
hochdimensionale Sprachvokabulare. Dies nutzen, Wir betrachten zwei Schlüssel
Operationen: Token-Shuffle, die räumlich lokale Token entlang des Kanals zusammenführt
Dimension, um die Eingabe-Token-Nummer zu verringern, und Token-Unshuffle, welche
entwirrt die abgeleiteten Token nach Transformer-Blöcken, um die Räumlichkeit wiederherzustellen
Anordnung für die Ausgabe. Gemeinsames Training mit Textansagen, Unsere Strategie
erfordert keinen zusätzlichen vorab trainierten Text-Encoder und ermöglicht die Unterstützung von MLLMs
extrem hochauflösende Bildsynthese in einer einheitlichen Next-Token-Vorhersage
Weise und sorgt gleichzeitig für effizientes Training und Inferenz. Erstmals, Wir
Erweitern Sie die Grenzen der AR-Text-zu-Bild-Generierung auf eine Auflösung von 2048×2048
mit erfreulicher Generationsleistung. Im GenAI-Benchmark, unser 2.7B-Modell
erreicht 0.77 Gesamtpunktzahl bei schwierigen Eingabeaufforderungen, übertrifft die AR-Modelle LlamaGen
von 0.18 und Diffusionsmodelle LDM von 0.15. Erschöpfender Großmensch
Auswertungen belegen auch unsere herausragende Fähigkeit zur Bilderzeugung in Bezug auf
Textausrichtung, optischer Mangel, und optisches Erscheinungsbild. Wir hoffen, dass Token-Shuffle
kann als grundlegendes Design für effiziente hochauflösende Bilder dienen
Generation innerhalb von MLLMs.
Dieser Artikel untersucht Zeitreisen und deren Auswirkungen.
PDF herunterladen:



