Le développement rapide de l’intelligence artificielle générative a rendu le texte
des modèles vidéo indispensables à la construction des futurs simulateurs du monde multimodal.
Cependant, ces modèles restent vulnérables aux attaques de jailbreak, où spécialement
les invites conçues contournent les mécanismes de sécurité et conduisent à la génération de substances nocives
ou contenu dangereux. De telles vulnérabilités compromettent la fiabilité et la sécurité
d'applications basées sur la simulation. Dans ce document, nous proposons T2VShield, un
cadre de défense agnostique complet et modèle conçu pour protéger le texte vers
modèles vidéo des menaces de jailbreak. Notre méthode analyse systématiquement les
saisir, modèle, et les étapes de sortie pour identifier les limites des
défenses, inclure des ambiguïtés sémantiques dans les invites, difficultés à détecter
contenu malveillant dans les sorties vidéo dynamiques, et inflexible centré sur le modèle
stratégies d'atténuation. T2VShield introduit un mécanisme de réécriture rapide basé sur
sur le raisonnement et la récupération multimodale pour nettoyer les entrées malveillantes, avec
un module de détection multi-portée qui capture les incohérences locales et globales
dans le temps et selon les modalités. Le cadre ne nécessite pas d'accès aux informations internes
paramètres de modèle et fonctionne avec les systèmes open source et fermés. Extensif
des expériences sur cinq plates-formes montrent que T2VShield peut réduire le succès du jailbreak
tarifs allant jusqu'à 35 pourcentage par rapport aux bases de référence solides. Nous développons en outre un
protocole d'évaluation audiovisuelle centré sur l'humain pour évaluer la sécurité perceptuelle,
soulignant l'importance de la défense au niveau visuel pour améliorer le
fiabilité des simulateurs multimodaux de nouvelle génération.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



