I controfattuali sono un framework popolare per interpretare l’apprendimento automatico
previsioni. Queste spiegazioni sono notoriamente difficili da creare
per i modelli di visione artificiale: sono inclini ai metodi standard basati sul gradiente
produrre esempi contraddittori, in cui impercettibili modifiche all'immagine
i pixel provocano grandi cambiamenti nelle previsioni. Ne introduciamo una nuova,
quadro di facile implementazione per immagini controfattuali che possono adattarsi in modo flessibile
ai progressi contemporanei nella modellazione generativa. Il nostro metodo, Controfattuale
Attacchi, assomiglia ad un attacco contraddittorio alla rappresentazione dell'immagine
lungo una varietà a bassa dimensionalità. Inoltre, dato un set di dati ausiliario di
descrittori di immagini, mostriamo come accompagnare i controfattuali con le funzionalità
attribuzione che quantificano i cambiamenti tra l’originale e il controfattuale
immagini. Questi punteggi di importanza possono essere aggregati in un controfattuale globale
spiegazioni che evidenziano le caratteristiche generali che guidano le previsioni del modello.
Mentre questa unificazione è possibile per qualsiasi metodo controfattuale, ha
particolare efficienza computazionale per la nostra. Dimostriamo l'efficacia di
il nostro approccio con i set di dati MNIST e CelebA.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



