Recenti modelli di ragionamento attraverso il test-time scaling lo hanno dimostrato da tempo
la catena di pensieri può sbloccare sostanziali incrementi delle prestazioni nel ragionamento difficile
compiti come matematica e codice. Tuttavia, il beneficio di pensieri così lunghi per
il ragionamento del sistema 2 è relativamente meno esplorato in altri domini come
i compiti percettivi erano meno profondi, il ragionamento del sistema 1 sembra sufficiente. In questo
carta, introduciamo LongPerceptualThoughts, un nuovo set di dati sintetico con 30K
tracce a lungo pensate per compiti percettivi. Le sfide principali nella sintesi
i pensieri di ragionamento elaborati per compiti percettivi sono modelli standardizzati
non sono ancora dotati di tale comportamento di pensiero e che non lo è
semplice per costruire un verificatore di processo affidabile per compiti percettivi.
Così, proponiamo per primo un nuovo quadro di sintesi dei dati in tre fasi
sintetizza domande a scelta multipla verificabili da descrizioni di immagini dense,
quindi estrae semplici CoT dai VLM per quei problemi verificabili, e infine
espande quei pensieri semplici per elaborare pensieri lunghi attraverso il ragionamento di frontiera
modelli. In esperimenti controllati con un forte modello 7B sintonizzato sulle istruzioni, Noi
dimostrare notevoli miglioramenti rispetto alla generazione di dati di ragionamento visivo esistente
metodi. Il nostro modello, addestrato sul set di dati generato, raggiunge una media +3.4
punti di miglioramento oltre 5 benchmark incentrati sulla visione, compreso +11.8 punti su
V$^*$ Panca. In particolare, nonostante sia sintonizzato per compiti di visione, migliora anche
prestazioni sul benchmark del ragionamento testuale, MMLU-Pro, di +2 punti.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



