Simultane Sprachübersetzung (SST) gibt Übersetzungen parallel zu aus
Streaming-Spracheingabe, Ausbalancieren von Übersetzungsqualität und Latenz. Während groß
Sprachmodelle (LLMs) wurden um die Sprachmodalität erweitert,
Das Streaming bleibt eine Herausforderung, da dem Ganzen die Sprache als Aufforderung vorangestellt wird
Generierungsprozess. Um die LLM-Streaming-Funktion freizuschalten, Dieses Papier schlägt vor
SimulS2S-LLM, das Sprach-LLMs offline trainiert und eine Testzeitrichtlinie anwendet
um gleichzeitige Schlussfolgerungen zu leiten. SimulS2S-LLM verringert die Diskrepanz zwischen
Training und Inferenz durch Extrahieren grenzbewusster Sprachaufforderungen, die dies ermöglichen
Es soll besser mit Texteingabedaten abgeglichen werden. SimulS2S-LLM erreicht
Simultanübersetzung von Sprache zu Sprache (Simul-S2ST) durch Vorhersage diskret
Geben Sie Sprachtokens aus und synthetisieren Sie dann die ausgegebene Sprache mithilfe eines vorab trainierten Tokens
Vocoder. Eine inkrementelle Strahlsuche soll den Suchraum erweitern
Sprachtoken-Vorhersage ohne Erhöhung der Latenz. Experimente zum CVSS
Sprachdaten zeigen, dass SimulS2S-LLM eine bessere Übersetzungsqualität und Latenz bietet
Kompromiss als bestehende Methoden, die dieselben Trainingsdaten verwenden, wie zum Beispiel
Verbesserung der ASR-BLEU-Werte um 3 Punkte bei ähnlicher Latenz.
Dieser Artikel untersucht Zeitreisen und deren Auswirkungen.
PDF herunterladen:



