La mise à l'échelle du calcul du temps d'inférence a considérablement amélioré le raisonnement
capacités des modèles de langage. Cependant, les méthodes existantes ont des effets significatifs
limites: les approches de chaîne de pensée sérialisées génèrent des
sorties, conduisant à une latence accrue et à des fenêtres contextuelles épuisées, alors que
les méthodes parallèles telles que l’auto-cohérence souffrent d’une insuffisance
coordination, entraînant des calculs redondants et des performances limitées
gains. Pour remédier à ces lacunes, nous proposons un raisonnement parallèle adaptatif
(AVR), un nouveau cadre de raisonnement qui permet aux modèles de langage d'orchestrer
calculs sérialisés et parallèles de bout en bout. L'APR généralise l'existant
méthodes de raisonnement en permettant une inférence multithread adaptative à l'aide de spawn()
et rejoignez() opérations. Une innovation clé est notre renforcement de bout en bout
stratégie d'apprentissage, optimiser les threads d'inférence parents et enfants pour
améliorer le taux de réussite des tâches sans nécessiter de structures de raisonnement prédéfinies.
Les expériences sur la tâche de raisonnement Compte à rebours démontrent les avantages significatifs de
AVR: (1) performances supérieures dans la même fenêtre de contexte (83.4% contre. 60.0% à
4k contexte); (2) évolutivité supérieure avec un calcul accru (80.1% contre.
66.6% à 20 000 jetons au total); (3) précision améliorée à latence équivalente (75.2%
contre. 57.3% à environ 5 000 ms). L'APR représente une étape vers l'habilitation
modèles de langage pour optimiser de manière autonome leurs processus de raisonnement grâce à
allocation adaptative du calcul.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



