Wir führen die modellgestützte Präferenzvorhersage für große Sprachen ein (LAPP), A
neuartiges Framework für Roboterlernen, das effizientes Lernen ermöglicht, anpassbar, Und
Ausdrucksverhaltenserwerb mit minimalem menschlichen Aufwand. Im Gegensatz zu früher
Ansätze, die stark auf Belohnungstechnik basieren, menschliche Demonstrationen,
Bewegungserfassung, oder teure paarweise Präferenzetiketten, LAPP greift groß auf
Sprachmodelle (LLMs) um automatisch Präferenzbezeichnungen aus Rohdaten zu generieren
Zustands-Aktions-Trajektorien, die während des Verstärkungslernens gesammelt wurden (RL). Diese
Labels werden verwendet, um einen Online-Präferenzprädiktor zu trainieren, was wiederum leitet
der Richtlinienoptimierungsprozess zur Befriedigung hochrangiger Verhaltensweisen
Vorgaben des Menschen. Unser wichtigster technischer Beitrag ist die
Integration von LLMs in die RL-Feedbackschleife über die Trajektorienebene
Präferenzvorhersage, Ermöglichen Sie Robotern, komplexe Fähigkeiten zu erwerben, einschließlich
subtile Kontrolle über Gangmuster und rhythmisches Timing. Wir bewerten LAPP auf a
abwechslungsreiche vierbeinige Fortbewegungs- und geschickte Manipulationsaufgaben und Show
dass es ein effizientes Lernen ermöglicht, höhere Endleistung, Schneller
Anpassung, und präzise Kontrolle von Verhaltensweisen auf hoher Ebene. Vor allem, LAPP ermöglicht
Roboter zur Bewältigung hochdynamischer und ausdrucksstarker Aufgaben wie zum Beispiel im Vierfüßlerstand
Backflips, die für standardmäßig erstellte oder handgefertigte LLM-Lösungen unerreichbar bleiben
Belohnungen. Unsere Ergebnisse unterstreichen LAPP als vielversprechende Richtung für Skalierbarkeit
Präferenzgesteuertes Roboterlernen.
Dieser Artikel untersucht Zeitreisen und deren Auswirkungen.
PDF herunterladen:



