Traduzione vocale simultanea (SST) genera traduzioni in parallelo con
input vocale in streaming, bilanciare la qualità della traduzione e la latenza. Sebbene grande
modelli linguistici (LLM) sono stati estesi per gestire la modalità vocale,
lo streaming rimane impegnativo poiché il discorso è anteposto come suggerimento per l'intero
processo di generazione. Per sbloccare la funzionalità di streaming LLM, questo documento propone
SimulS2S-LLM, che forma i LLM vocali offline e utilizza una politica di test-time
per guidare l’inferenza simultanea. SimulS2S-LLM allevia la discrepanza tra
formazione e inferenza estraendo suggerimenti vocali consapevoli dei confini che consentono
per abbinarlo meglio ai dati di input di testo. SimulS2S-LLM raggiunge
traduzione simultanea da parlato a parlato (Simul-S2ST) prevedendo discreto
token vocali di output e quindi sintetizzare il parlato di output utilizzando un file pre-addestrato
vocoder. Una ricerca incrementale del raggio è progettata per espandere lo spazio di ricerca di
previsione del token vocale senza aumentare la latenza. Esperimenti sul CVSS
i dati vocali mostrano che SimulS2S-LLM offre una migliore qualità-latenza della traduzione
compromesso rispetto ai metodi esistenti che utilizzano gli stessi dati di addestramento, ad esempio
migliorare i punteggi ASR-BLEU di 3 punti con latenza simile.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



