Les contrefactuels sont un cadre populaire pour interpréter l’apprentissage automatique
prédictions. Ces explications et si elles sont notoirement difficiles à créer
pour les modèles de vision par ordinateur: les méthodes standard basées sur le gradient sont sujettes à
produire des exemples contradictoires, dans lequel des modifications imperceptibles de l'image
les pixels provoquent de grands changements dans les prédictions. Nous introduisons un nouveau,
cadre facile à mettre en œuvre pour des images contrefactuelles qui peuvent s'adapter de manière flexible
aux avancées contemporaines de la modélisation générative. Notre méthode, Contrefactuel
Attaques, ressemble à une attaque contradictoire contre la représentation de l’image
le long d'une variété de faible dimension. En outre, étant donné un ensemble de données auxiliaires de
descripteurs d'images, nous montrons comment accompagner les contrefactuels avec des fonctionnalités
attribution qui quantifie les changements entre l'original et le contrefactuel
photos. Ces scores d’importance peuvent être regroupés dans des analyses contrefactuelles globales.
des explications qui mettent en évidence les fonctionnalités globales qui déterminent les prédictions du modèle.
Bien que cette unification soit possible pour toute méthode contrefactuelle, il a
efficacité informatique particulière pour la nôtre. Nous démontrons l’efficacité de
notre approche avec les jeux de données MNIST et CelebA.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



