Traduction vocale simultanée (SST) produit des traductions en parallèle avec
saisie vocale en streaming, équilibrer la qualité et la latence de la traduction. Bien que grand
modèles de langage (LLM) ont été étendus pour gérer la modalité de parole,
le streaming reste un défi car la parole est ajoutée comme une invite pour l'ensemble
processus de génération. Pour débloquer la capacité de streaming LLM, cet article propose
SimulS2S-LLM, qui forme les LLM de parole hors ligne et utilise une politique de temps de test
pour guider l'inférence simultanée. SimulS2S-LLM atténue le décalage entre
formation et inférence en extrayant des invites vocales tenant compte des limites qui permettent
il doit être mieux adapté aux données de saisie de texte. SimulS2S-LLM réalise
traduction simultanée parole-parole (Simul-S2ST) en prédisant discret
jetons de parole de sortie, puis synthèse de la parole de sortie à l'aide d'un pré-entraîné
vocodeur. Une recherche de faisceau incrémentielle est conçue pour élargir l'espace de recherche de
prédiction de jeton vocal sans augmenter la latence. Expériences sur le CVSS
les données vocales montrent que SimulS2S-LLM offre un meilleur rapport qualité-latence de traduction
compromis par rapport aux méthodes existantes qui utilisent les mêmes données de formation, tel que
améliorer les scores ASR-BLEU en 3 points avec une latence similaire.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



