Il ridimensionamento del calcolo del tempo di inferenza ha sostanzialmente migliorato il ragionamento
capacità dei modelli linguistici. Tuttavia, i metodi esistenti hanno un impatto significativo
limitazioni: Gli approcci serializzati basati sulla catena di pensiero generano tempi eccessivamente lunghi
uscite, portando ad un aumento della latenza e all’esaurimento delle finestre di contesto, Mentre
metodi paralleli come l’autoconsistenza sono insufficienti
coordinazione, con conseguenti calcoli ridondanti e prestazioni limitate
guadagni. Per ovviare a queste carenze, proponiamo il Ragionamento Parallelo Adattivo
(APR), un nuovo quadro di ragionamento che consente ai modelli linguistici di orchestrarsi
calcoli sia serializzati che paralleli end-to-end. L'APR generalizza l'esistente
metodi di ragionamento abilitando l'inferenza multi-thread adattiva utilizzando spawn()
e unisciti() operazioni. Un'innovazione chiave è il nostro rinforzo end-to-end
strategia di apprendimento, ottimizzando i thread di inferenza sia genitore che figlio
aumentare il tasso di successo delle attività senza richiedere strutture di ragionamento predefinite.
Gli esperimenti sull'attività di ragionamento Conto alla rovescia dimostrano vantaggi significativi di
APR: (1) prestazioni più elevate nella stessa finestra di contesto (83.4% contro. 60.0% A
4k contesto); (2) scalabilità superiore con maggiore capacità di calcolo (80.1% contro.
66.6% a 20.000 token totali); (3) precisione migliorata a latenza equivalente (75.2%
contro. 57.3% a circa 5.000 ms). L’APR rappresenta un passo verso l’abilitazione
modelli linguistici attraverso i quali ottimizzare autonomamente i propri processi di ragionamento
allocazione adattiva del calcolo.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



