In diesem Artikel werden multimodale Agenten untersucht, insbesondere, OpenAIs
Computer-Benutzer-Agent (LUFT), trained to control and complete tasks through a
standard computer interface, ähnlich wie Menschen. We evaluated the agent’s
Auftritt beim New York Times Wordle-Spiel, um Modellverhalten hervorzurufen und
Mängel erkennen. Unsere Ergebnisse zeigten eine erhebliche Diskrepanz in der
Die Fähigkeit des Modells, Farben je nach Kontext richtig zu erkennen. Der
Modell hatte eine $5.36\%$ Erfolgsquote über mehrere hundert Läufe in einer Woche
Wordle. Trotz der immensen Begeisterung rund um KI-Agenten und ihre
Potenzial, künstliche allgemeine Intelligenz einzuführen (AGI), unsere Erkenntnisse
unterstreichen die Tatsache, dass selbst einfache Aufgaben große Herausforderungen darstellen
today’s frontier AI models. We conclude with a discussion of the potential
zugrundeliegende Ursachen, implications for future development, und Forschungsrichtungen
to improve these AI systems.
Dieser Artikel untersucht Zeitreisen und deren Auswirkungen.
PDF herunterladen:



