News
Langfristige Leistungsbewertung von KI-Agenten mit dem Long-Horizon Terminal-Bench
Das Wichtigste in Kürze
- Der neue Long-Horizon Terminal-Bench (LHTB) ist ein Benchmark zur Bewertung der langfristigen Leistungsfähigkeit von KI-Agenten in komplexen Terminalumgebungen.
- Im Gegensatz zu traditionellen Benchmarks, die oft kurze und klar definierte Aufgaben umfassen, konzentriert sich LHTB auf Aufgaben, die Hunderte von Schritten und eine Ausführungszeit von bis zu 90 Minuten erfordern.
- LHTB umfasst 46 Aufgaben in neun Kategorien, die in einer isolierten Docker-Umgebung ausgeführt werden.
- Die Bewertung erfolgt durch verdeckte, manipulationssichere Verifizierer, die den tatsächlichen Zustand überprüfen und eine kontinuierliche Teilleistungsbewertung ermöglichen.
- Die initialen Ergebnisse zeigen, dass selbst führende Modelle Schwierigkeiten haben, die Aufgaben vollständig zu lösen, was auf die Notwendigkeit weiterer Forschung in der Agenten-Ausdauer und -Fehlerbehandlung hinweist.
- Minimax M3 von MiniMax AI führt derzeit das Leaderboard an, gefolgt von Kimi k2.7 Code und GLM 5.2.
Die Entwicklung von KI-Agenten hat in den letzten Jahren signifikante Fortschritte gemacht, insbesondere bei der Bewältigung klar definierter, kurzfristiger Aufgaben. Doch die reale Welt stellt Agenten oft vor Herausforderungen, die eine weitaus längere Planungs- und Ausführungsdauer erfordern. Um diese Lücke zu schließen, wurde der Long-Horizon Terminal-Bench (LHTB) eingeführt, ein neuer Benchmark, der die Ausdauer und Problemlösungsfähigkeiten von KI-Agenten in komplexen, terminalbasierten Umgebungen auf die Probe stellt.
LHTB: Ein neuer Standard für die Agentenbewertung
Der Long-Horizon Terminal-Bench, entwickelt von einem Team unter der Leitung von Zongxia Li und Kollegen von Tencent HY LLM Frontier sowie verschiedenen Universitäten, adressiert eine kritische Schwachstelle in der aktuellen Bewertung von KI-Agenten: deren Leistungsfähigkeit über längere Zeiträume und bei Aufgaben, die eine Vielzahl von aufeinander aufbauenden Schritten erfordern. Während viele bestehende Benchmarks Agenten auf Aufgaben testen, die innerhalb weniger Minuten abgeschlossen sind und oft nur ein binäres Pass/Fail-Ergebnis liefern, simuliert LHTB realistische Szenarien, in denen Agenten in einer Terminalumgebung über Hunderte von Aktionen hinweg agieren müssen.
Aufbau und Methodik des Benchmarks
LHTB besteht aus 46 sorgfältig ausgewählten Aufgaben, die in neun Kategorien unterteilt sind. Diese Aufgaben reichen von der Erstellung eines Systems von Grund auf über die Migration eines Frameworks mit breaking changes bis hin zum Spielen eines Spiels Zug für Zug. Ein zentrales Merkmal von LHTB ist die Ausführung der Agenten in einer isolierten Docker-Umgebung. Dies gewährleistet eine konsistente und reproduzierbare Testumgebung.
Die Bewertung der Agenten erfolgt durch versteckte, manipulationssichere Verifizierer. Diese Verifizierer überprüfen nicht nur das Endergebnis, sondern auch den tatsächlichen Zustand der Umgebung über den gesamten Ausführungsprozess hinweg. Dies ermöglicht eine kontinuierliche Teilleistungsbewertung (dense reward grading), die auch Zwischenfortschritte und Teillösungen berücksichtigt. Eine einzelne Aufgabe kann bis zu 90 Minuten Ausführungszeit beanspruchen und erfordert die Verarbeitung von Millionen von Token.
Die Herausforderung der Langfristigkeit
Die Hauptinnovation von LHTB liegt in der Betonung von "Long-Horizon"-Aufgaben. Diese Aufgaben sind so konzipiert, dass sie Agenten dazu zwingen, über längere Zeiträume hinweg kohärente Strategien zu verfolgen, Fehler zu erkennen und zu korrigieren sowie ihr Verständnis der Umgebung aufrechtzuerhalten. Die Fähigkeit eines Agenten, 300+ Schritte in einem Terminal zu überleben, ohne den "Plot zu verlieren", ist ein Indikator für eine robuste und intelligente Agentenarchitektur. Die Entwickler des Benchmarks betonen, dass die Agenten nicht nur das Endziel erreichen müssen, sondern auch den gesamten Prozess nachhaltig gestalten sollen.
Aktuelle Ergebnisse und das Leaderboard
Die ersten Tests mit 18 führenden Modellen auf LHTB haben gezeigt, dass selbst die fortschrittlichsten KI-Agenten noch erhebliche Schwierigkeiten haben, diese langfristigen Aufgaben zu meistern. Keines der getesteten Modelle konnte auch nur ein Drittel der Aufgaben erfolgreich abschließen. Dies unterstreicht die Komplexität und den anspruchsvollen Charakter des Benchmarks und zeigt auf, wo weitere Forschungs- und Entwicklungsanstrengungen erforderlich sind.
Das aktuelle Leaderboard, veröffentlicht auf Hugging Face, präsentiert die führenden Modelle:
- 🥇 Minimax M3 von MiniMax AI - 🥈 Kimi k2.7 Code von Kimi Moonshot - 🥉 GLM 5.2 von Zai.orgDiese Modelle haben die besten Ergebnisse in Bezug auf die mittlere Belohnung (mean reward) über die 46 Aufgaben erzielt. Die detaillierten Ergebnisse zeigen, dass die Fähigkeit, komplexe Probleme über längere Zeiträume zu lösen, eine der größten Herausforderungen für aktuelle KI-Agenten darstellt.
Einblick in die Aufgaben: Super Mario
Ein anschauliches Beispiel für die Art der Aufgaben ist "Super Mario". Hierbei muss der Agent das Spiel über das Terminal steuern, indem er Zug um Zug Befehle eingibt. Nach Beendigung des Laufs wird ein versteckter Verifizierer die Bewegungen des Agenten in einer deterministisch gesäten Engine wiedergeben und das Ergebnis als Video rendern. Die Bewertung erfolgt anhand des normalisierten Super-Mario-Rewards, der den Fortschritt in den Levels misst. Interessanterweise haben nur wenige Modelle es geschafft, World 1-1 zu überwinden, was die Schwierigkeit selbst scheinbar einfacher Aufgaben verdeutlicht, wenn sie über lange Zeiträume und in einer Terminalumgebung ausgeführt werden müssen.
Implikationen für die B2B-Anwendung von KI-Agenten
Für Unternehmen, die KI-Agenten in ihren Prozessen einsetzen oder dies planen, liefert LHTB wichtige Erkenntnisse. Die Fähigkeit eines Agenten, komplexe und langwierige Aufgaben zuverlässig zu bearbeiten, ist entscheidend für den Erfolg in vielen B2B-Szenarien, beispielsweise in der Softwareentwicklung, Systemadministration oder komplexen Datenanalyse. Die Ergebnisse des Benchmarks deuten darauf hin, dass die aktuellen Modelle noch nicht die Robustheit und Ausdauer besitzen, die für eine vollautomatisierung solcher Aufgaben erforderlich wäre.
Unternehmen sollten bei der Implementierung von KI-Agenten daher nicht nur die kurzfristige Leistungsfähigkeit, sondern auch die Fähigkeit zur Bewältigung von Langzeitaufgaben und zur Fehlerbehebung berücksichtigen. Der LHTB bietet eine wertvolle Metrik, um die Fortschritte in diesem Bereich zu verfolgen und informierte Entscheidungen über den Einsatz von KI-Technologien zu treffen.
Ausblick
Der Long-Horizon Terminal-Bench stellt einen wichtigen Schritt zur realistischeren Bewertung von KI-Agenten dar. Er beleuchtet die Grenzen aktueller Modelle und fördert die Entwicklung von Agenten, die nicht nur kurzfristig brillieren, sondern auch langfristig kohärent und zuverlässig agieren können. Es bleibt abzuwarten, wie sich kleinere, lokale Modelle auf diesem Benchmark schlagen werden, was weitere Einblicke in die Skalierbarkeit und Effizienz von Agentenarchitekturen liefern könnte. Die kontinuierliche Weiterentwicklung und Verfeinerung von Benchmarks wie LHTB ist unerlässlich, um die Leistungsfähigkeit von KI-Agenten weiter voranzutreiben und ihren praktischen Nutzen in der Wirtschaft zu maximieren.
Bibliographie
- Li, Z., Li, Z., Shi, Y., Wang, R., Yang, J., Liu, Z., Wu, X., Li, A., Yu, Y., Liu, N., Sun, L., Mi, H., & Liang, L. (2026). Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading. arXiv preprint arXiv:2607.08964. - Long-Horizon Terminal-Bench (LHTB). (n.d.). Project Website. Verfügbar unter: https://zli12321.github.io/LHTB/ - Hugging Face. (n.d.). Community Leaderboard — Long-Horizon Terminal-Bench. Verfügbar unter: https://huggingface.co/datasets/IntelligenceLab/Long-Horizon-Terminal-Bench - Developers Digest. (2026, 14. Juli). Long-Horizon Terminal Bench Shows Why Coding Agents Still Stall. Verfügbar unter: https://www.developersdigest.tech/blog/long-horizon-terminal-bench-agent-evals - GitHub. (n.d.). zli12321/LHTB. Verfügbar unter: https://github.com/zli12321/LHTBWeitere News-Artikel
Alle ansehen- Langfristige Partnerschaft zwischen AMD und OpenAI zur Lieferung von Instinct GPUs
- Langkontextmodelle und visuell sprachliche KI Fortschritte durch LongVILA
- Langtextgenerierung durch KI Neue Perspektiven mit LongWriter
- Langzeitverhalten autonomer KI-Agenten in simulierten Umgebungen
- Langzeitverhalten von KI-Agenten: Ein Experiment zu Regeln und Autonomie
- LARP: Fortschritte in der Video-Tokenisierung durch generative KI
KI, die in Deutschland zu Hause ist.
Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.