Il rapido sviluppo dell'intelligenza artificiale generativa ha reso possibile il testo
modelli video essenziali per la costruzione di futuri simulatori di mondi multimodali.
Tuttavia, questi modelli rimangono vulnerabili agli attacchi di jailbreak, dove appositamente
i suggerimenti elaborati aggirano i meccanismi di sicurezza e portano alla generazione di danni
o contenuti non sicuri. Tali vulnerabilità minano l’affidabilità e la sicurezza
di applicazioni basate sulla simulazione. In questo documento, proponiamo T2VShield, UN
quadro di difesa agnostico completo e modello progettato per proteggere il testo
modelli video dalle minacce di jailbreak. Il nostro metodo analizza sistematicamente il
ingresso, modello, e fasi di output per identificare i limiti dell'esistente
difese, comprese le ambiguità semantiche nei prompt, difficoltà nel rilevamento
contenuti dannosi nelle uscite video dinamiche, e inflessibile incentrato sul modello
strategie di mitigazione. T2VShield introduce un meccanismo di riscrittura rapida basato
sul ragionamento e sul recupero multimodale per disinfettare gli input dannosi, insieme a
un modulo di rilevamento multiambito che cattura incoerenze locali e globali
nel tempo e nelle modalità. Il framework non richiede l'accesso all'interno
parametri del modello e funziona sia con sistemi open source che chiusi. Ampio
esperimenti su cinque piattaforme mostrano che T2VShield può ridurre il successo del jailbreak
tariffe fino a 35 per cento rispetto a linee di base forti. Sviluppiamo ulteriormente a
Protocollo di valutazione audiovisiva centrato sull'uomo per valutare la sicurezza percettiva,
sottolineando l'importanza della difesa a livello visivo nel migliorare il
affidabilità dei simulatori multimodali di prossima generazione.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



