Nous introduisons la prédiction des préférences assistée par un grand modèle de langage (LAPON), un
nouveau cadre pour l'apprentissage des robots qui permet, personnalisable, et
acquisition d'un comportement expressif avec un minimum d'effort humain. Contrairement aux précédents
des approches qui s'appuient fortement sur l'ingénierie des récompenses, démonstrations humaines,
capture de mouvement, ou des étiquettes de préférence par paire coûteuses, LAPP s’appuie largement
modèles de langage (LLM) pour générer automatiquement des étiquettes de préférence à partir de données brutes
trajectoires état-action collectées lors de l’apprentissage par renforcement (R.L.). Ces
les étiquettes sont utilisées pour former un prédicteur de préférences en ligne, qui à son tour guide
le processus d’optimisation des politiques visant à satisfaire des comportements comportementaux de haut niveau
spécifications fournies par les humains. Notre principale contribution technique est la
intégration des LLM dans la boucle de rétroaction RL au niveau de la trajectoire
prédiction des préférences, permettre aux robots d'acquérir des compétences complexes, notamment
contrôle subtil des schémas de démarche et du timing rythmique. Nous évaluons LAPP sur une
ensemble diversifié de tâches et de spectacles de locomotion et de manipulation adroite des quadrupèdes
qu'il permet un apprentissage efficace, performances finales plus élevées, plus rapide
adaptation, et un contrôle précis des comportements de haut niveau. Notamment, LAPP permet
des robots pour maîtriser des tâches hautement dynamiques et expressives telles que les quadrupèdes
backflips, qui restent hors de portée des standards générés par LLM ou fabriqués à la main
récompenses. Nos résultats mettent en évidence le LAPP comme une direction prometteuse pour une
apprentissage robotique basé sur les préférences.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



