Cet article étudie les agents multimodaux, en particulier, OpenAI
Agent utilisateur d'ordinateur (AIR), formé pour contrôler et accomplir des tâches grâce à un
interface informatique standard, semblable aux humains. Nous avons évalué l’agent
performance sur le jeu Wordle du New York Times pour susciter des comportements modèles et
identifier les lacunes. Nos résultats ont révélé une divergence significative dans
la capacité du modèle à reconnaître correctement les couleurs en fonction du contexte. Le
le modèle avait un $5.36\%$ taux de réussite sur plusieurs centaines d'exécutions sur une semaine de
Mot. Malgré l'immense enthousiasme suscité par les agents d'IA et leurs
potentiel pour inaugurer l’intelligence générale artificielle (AGI), nos découvertes
renforcer le fait que même des tâches simples présentent des défis considérables pour
les modèles d’IA d’aujourd’hui. Nous concluons par une discussion sur le potentiel
causes sous-jacentes, implications pour le développement futur, et orientations de recherche
pour améliorer ces systèmes d’IA.
Cet article explore les excursions dans le temps et leurs implications.
Télécharger PDF:



