Prozessbelohnungsmodelle (PRMs) haben sich für die Testzeitskalierung von bewährt
Große Sprachmodelle (LLMs) bei anspruchsvollen Denkaufgaben. Jedoch, belohnen
Hacking-Probleme mit PRMs schränken deren erfolgreichen Einsatz zur Verstärkung ein
Feinabstimmung. In diesem Papier, Wir identifizieren die Hauptursache für PRM-induzierte Belohnung
Hacken: die kanonische Summenform-Creditszuweisung zur Verstärkung
Lernen (RL), was den Wert als kumulierte gammazerfallene Zukunft definiert
Belohnungen, verleitet LLMs leicht dazu, Schritte mit hohen Belohnungen zu hacken. Um dies anzugehen,
Wir schlagen REIN vor: Prozessüberwachtes Verstärkungslernen. Die Schlüsselinnovation
von PURE ist eine Kreditzuweisung in Min-Form, die die Wertfunktion als formuliert
das Minimum an zukünftigen Belohnungen. Diese Methode erleichtert die Belohnung erheblich
Hacking durch Einschränkung des Wertefunktionsbereichs und stärkere Verteilung von Vorteilen
vernünftigerweise. Durch umfangreiche Experimente zu 3 Basismodelle, das zeigen wir
PRM-basierte Ansätze, die eine minimale Kreditvergabe ermöglichen, erzielen vergleichbare Ergebnisse
Argumentationsleistung auf überprüfbare belohnungsbasierte Methoden beschränkt 30% Schritte.
Im Gegensatz, Die kanonische Summenform-Kreditvergabe bricht sogar das Training zusammen
am Anfang! Zusätzlich, wenn wir die PRM-basierte Feinabstimmung mit ergänzen
Nur 10% nachweisbare Belohnungen, Wir reduzieren das Hacken und Produzieren von Belohnungen weiter
das am besten abgestimmte Modell basierend auf Qwen2.5-Math-7B in unseren Experimenten,
erreichen 82.5% Genauigkeit auf AMC23 und 53.3% durchschnittliche Genauigkeit über 5
Maßstäbe. Darüber hinaus, Wir fassen die beobachteten Belohnungs-Hacking-Fälle zusammen und
Analysieren Sie die Ursachen für den Trainingszusammenbruch. Code und Modelle sind verfügbar unter
https://github.com/CJReinforce/PURE.
Dieser Artikel untersucht Zeitreisen und deren Auswirkungen.
PDF herunterladen:



