Questo articolo studia gli agenti multimodali, in particolare, OpenAI
Agente utente computer (ARIA), addestrato a controllare e completare le attività attraverso a
interfaccia informatica standard, simili agli umani. Abbiamo valutato quello dell'agente
performance sul gioco Wordle del New York Times per suscitare comportamenti modello e
identificare le carenze. I nostri risultati hanno rivelato una discrepanza significativa nella
la capacità del modello di riconoscere correttamente i colori a seconda del contesto. IL
il modello aveva un $5.36\%$ tasso di successo su diverse centinaia di corse in una settimana di
Wordle. Nonostante l'immenso entusiasmo che circonda gli agenti IA e i loro
potenziale per inaugurare l’intelligenza generale artificiale (AGI), le nostre scoperte
rafforzare il fatto che anche i compiti più semplici presentano sfide sostanziali
i modelli di intelligenza artificiale di frontiera di oggi. Concludiamo con una discussione sulle potenzialità
cause sottostanti, implicazioni per lo sviluppo futuro, e direzioni di ricerca
per migliorare questi sistemi di intelligenza artificiale.
Questo articolo esplora i giri e le loro implicazioni.
Scarica PDF:



