Nell'interazione uomo-macchina, la stima della posa della testa influenza profondamente
funzionalità dell'applicazione. Sebbene l'utilizzo dei punti di riferimento facciali sia utile
questo scopo, I metodi esistenti basati sui punti di riferimento danno priorità alla precisione
semplicità e dimensioni del modello, limitandone l'implementazione su dispositivi edge e in
ambienti poveri di calcolo. Per colmare questo divario, we propose \textbf{Raggruppato
Attenzione, profondità (ANNO)}, una nuova architettura basata sul Deep Set
struttura. Raggruppando i punti di riferimento in regioni e utilizzando piccoli Deep Set
strati, riduciamo la complessità computazionale. Il nostro meccanismo di attenzione multitesta
estrae e combina le informazioni tra i gruppi, risultando in un modello che è
$7.5\times$ smaller and executes $25\times$ faster than the current lightest
modello all'avanguardia. In particolare, il nostro metodo raggiunge una riduzione impressionante,
being $4321\times$ smaller than the best-performing model. Introduciamo la vaniglia
GADS e GADS ibridi (punti di riferimento + RGB) e valutare i nostri modelli su tre
set di dati di riferimento — AFLW2000, BIWI, e 300W-LP. Immaginiamo la nostra architettura
come solida base di riferimento per metodi di stima della posa della testa con risorse limitate.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



