Kontrafakten sind ein beliebter Rahmen zur Interpretation von maschinellem Lernen
Vorhersagen. Diese Was-wäre-wenn-Erklärungen sind bekanntermaßen schwierig zu erstellen
für Computer-Vision-Modelle: Standardgradientenbasierte Methoden sind anfällig dafür
kontroverse Beispiele hervorbringen, bei denen es zu unmerklichen Bildveränderungen kommt
Pixel führen zu großen Änderungen in den Vorhersagen. Wir stellen ein neues vor,
einfach zu implementierendes Framework für kontrafaktische Bilder, das sich flexibel anpassen lässt
bis hin zu aktuellen Fortschritten in der generativen Modellierung. Unsere Methode, Kontrafaktisch
Angriffe, gleicht einem kontradiktorischen Angriff auf die Darstellung des Bildes
entlang einer niedrigdimensionalen Mannigfaltigkeit. Zusätzlich, gegeben ein Hilfsdatensatz von
Bildbeschreibungen, Wir zeigen, wie man Kontrafaktuale mit Features begleitet
Zuschreibung, die die Veränderungen zwischen dem Original und dem Kontrafaktischen quantifiziert
Bilder. Diese Wichtigkeitswerte können zu globalen kontrafaktischen Werten zusammengefasst werden
Erklärungen, die die allgemeinen Merkmale hervorheben, die Modellvorhersagen beeinflussen.
Diese Vereinheitlichung ist zwar für jede kontrafaktische Methode möglich, es hat
besondere Recheneffizienz für uns. Wir zeigen die Wirksamkeit von
Unser Ansatz mit den MNIST- und CelebA-Datensätzen.
Dieser Artikel untersucht Zeitreisen und deren Auswirkungen.
PDF herunterladen:



