Modelli di ricompensa del processo (PRM) si sono dimostrati efficaci per il ridimensionamento del tempo di test
Modelli linguistici di grandi dimensioni (LLM) su compiti di ragionamento impegnativi. Tuttavia, ricompensa
i problemi di hacking con i PRM limitano la loro riuscita applicazione nel rinforzo
ritocchi. In questo documento, identifichiamo la causa principale della ricompensa indotta da PRM
hacking: la canonica forma di sommatoria dell'assegnazione dei crediti in rinforzo
apprendimento (RL), che definisce il valore come futuro cumulativo gamma-decaduto
ricompense, induce facilmente gli LLM a hackerare i passaggi con ricompense elevate. Per affrontare questo problema,
proponiamo PURO: Apprendimento per rinforzo supervisionato dal processo. L'innovazione chiave
di PURE è un'assegnazione di credito in forma minima che formula la funzione di valore come
il minimo dei premi futuri. Questo metodo allevia significativamente la ricompensa
hacking limitando l'intervallo della funzione valore e distribuendo maggiormente i vantaggi
ragionevolmente. Attraverso ampi esperimenti su 3 modelli base, lo mostriamo
Gli approcci basati su PRM che consentono l'assegnazione di crediti in forma minima raggiungono risultati comparabili
prestazioni di ragionamento a metodi verificabili basati sulla ricompensa solo all'interno 30% passi.
Al contrario, la canonica cessione del credito in forma di somma fa crollare addirittura la formazione
all'inizio! Inoltre, quando integriamo la messa a punto basata sulle PRM con
Appena 10% ricompense verificabili, alleviiamo ulteriormente l'hacking e la produzione di ricompense
il miglior modello perfezionato basato su Qwen2.5-Math-7B nei nostri esperimenti,
raggiungimento 82.5% precisione su AMC23 e 53.3% precisione media attraverso 5
parametri di riferimento. Inoltre, riassumiamo i casi di hackeraggio della ricompensa osservati e
analizzare le cause del collasso dell'allenamento. Codice e modelli sono disponibili su
https://github.com/CJReinforce/PURE.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



