Dans l'interaction homme-machine, l'estimation de la pose de la tête influence profondément
fonctionnalité de l'application. Bien que l'utilisation de repères faciaux soit utile pour
ce but, les méthodes existantes basées sur des points de repère donnent la priorité à la précision plutôt qu'à
simplicité et taille du modèle, limiter leur déploiement sur les appareils de périphérie et dans
environnements pauvres en calcul. Pour combler cet écart, we propose \textbf{Groupé
Attention aux ensembles profonds (ANNÉE)}, une nouvelle architecture basée sur le Deep Set
cadre. En regroupant les points de repère en régions et en employant de petits Deep Set
couches, nous réduisons la complexité informatique. Notre mécanisme d’attention multi-têtes
extrait et combine les informations inter-groupes, aboutissant à un modèle qui est
$7.5\times$ smaller and executes $25\times$ faster than the current lightest
modèle à la pointe de la technologie. Notamment, notre méthode permet d'obtenir une réduction impressionnante,
being $4321\times$ smaller than the best-performing model. Nous introduisons la vanille
GADS et GADS hybrides (points de repère + RVB) et évaluer nos modèles sur trois
ensembles de données de référence — AFLW2000, BIWI, et 300W-LP. Nous envisageons notre architecture
comme base de référence robuste pour les méthodes d'estimation de la pose de la tête avec des ressources limitées.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



