Die Skalierung der Inferenzzeitberechnung hat die Argumentation erheblich verbessert
Fähigkeiten von Sprachmodellen. Jedoch, bestehende Methoden haben erhebliche Bedeutung
Einschränkungen: Serialisierte Gedankenkettenansätze erzeugen zu lange
Ausgänge, Dies führt zu erhöhter Latenz und erschöpften Kontextfenstern, während
Parallele Methoden wie Selbstkonsistenz leiden unter unzureichender Qualität
Koordinierung, Dies führt zu redundanten Berechnungen und eingeschränkter Leistung
Gewinne. Um diese Mängel zu beheben, Wir schlagen adaptives paralleles Denken vor
(APR), ein neuartiges Argumentationsgerüst, das die Orchestrierung von Sprachmodellen ermöglicht
sowohl serialisierte als auch parallele Berechnungen durchgängig. APR verallgemeinert das Vorhandene
Argumentationsmethoden durch Ermöglichung adaptiver Multithread-Inferenz mithilfe von Spawn()
und mitmachen() Operationen. Eine wichtige Innovation ist unsere End-to-End-Verstärkung
Lernstrategie, Optimierung sowohl der übergeordneten als auch der untergeordneten Inferenzthreads
Erhöhen Sie die Erfolgsquote bei Aufgaben, ohne dass vordefinierte Argumentationsstrukturen erforderlich sind.
Experimente zur Countdown-Argumentationsaufgabe zeigen erhebliche Vorteile von
APR: (1) höhere Leistung im gleichen Kontextfenster (83.4% vs. 60.0% bei
4k Kontext); (2) Überlegene Skalierbarkeit mit erhöhtem Rechenaufwand (80.1% vs.
66.6% bei insgesamt 20.000 Token); (3) verbesserte Genauigkeit bei gleicher Latenz (75.2%
vs. 57.3% bei etwa 5.000 ms). APR stellt einen Schritt in Richtung Ermöglichung dar
Sprachmodelle, um ihre Argumentationsprozesse autonom zu optimieren
adaptive Zuweisung von Berechnungen.
Dieser Artikel untersucht Zeitreisen und deren Auswirkungen.
PDF herunterladen:



