La génération d'images axées sur le sujet vise à synthétiser de nouvelles scènes qui
préserver fidèlement l'identité du sujet à partir des images de référence tout en adhérant à
conseils textuels, Pourtant, les méthodes existantes se heurtent à un compromis critique
entre fidélité et efficacité. Les approches basées sur le réglage nécessitent beaucoup de temps
et optimisation spécifique à un sujet, gourmande en ressources, tandis que les méthodes sans tir
ne parvient pas à maintenir une cohérence adéquate du sujet. Dans ce travail, nous proposons
GratuitGraftor, un cadre sans formation qui répond à ces limitations grâce à
greffe de caractéristiques entre images. Spécifiquement, FreeGraftor utilise la sémantique
correspondance et fusion d'attention contrainte par la position pour transférer les détails visuels
des sujets de référence à l'image générée. En plus, notre cadre
intègre une nouvelle stratégie d'initialisation du bruit pour préserver les a priori de la géométrie
de sujets de référence pour une correspondance robuste des fonctionnalités. De vastes analyses qualitatives et
des expériences quantitatives démontrent que notre méthode permet un sujet précis
transfert d'identité tout en conservant la synthèse de scène alignée sur le texte. Sans
nécessitant un réglage fin du modèle ou une formation supplémentaire, FreeGraftor de manière significative
surpasse les approches existantes sans tir et sans entraînement dans les deux domaines
fidélité et alignement du texte. En outre, notre cadre peut s'étendre de manière transparente
à la génération multi-sujets, ce qui le rend pratique pour un déploiement dans le monde réel. Notre
le code est disponible sur https://github.com/Nihukat/FreeGraftor.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



