Dans les tâches de classification basées sur l'apprentissage profond, la fonction softmax
le paramètre de température $T$ influence de manière critique la distribution de sortie et
performance globale. Cette étude présente une nouvelle perspective théorique selon laquelle
la température optimale $T^*$ est uniquement déterminée par la dimensionnalité du
représentations de fonctionnalités, permettant ainsi la détermination sans formation de $T^*$.
Malgré cette base théorique, des preuves empiriques révèlent que $T^*$
fluctue dans les conditions pratiques en raison des variations des modèles, ensembles de données,
et d'autres facteurs de confusion. Pour faire face à ces influences, nous proposons et
optimiser un ensemble de coefficients de détermination de la température qui spécifient comment $T^*$
doit être ajusté en fonction de la relation théorique avec la fonctionnalité
dimensionnalité. En plus, nous insérons immédiatement une couche de normalisation par lots
avant la couche de sortie, stabiliser efficacement l'espace des fonctionnalités. S'appuyer sur
ces coefficients et une suite d'expériences à grande échelle, nous développons un
formule empirique pour estimer $T^*$ sans formation supplémentaire tout en
introduire un schéma correctif pour affiner $T^*$ en fonction du nombre de classes
et la complexité des tâches. Nos résultats confirment que la température dérivée non seulement
s'aligne sur la perspective théorique proposée mais généralise également
efficacement dans diverses tâches, amélioration constante de la classification
performante et offrant une solution pratique, solution sans formation pour déterminer
$T^*$.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



