News
Entwicklung und Bewertung von KI-Agenten durch HarnessDev
Das Wichtigste in Kürze
- Die Fähigkeit von KI-Agenten, sich selbst zu entwickeln, rückt zunehmend in den Fokus der Forschung.
- ByteDance Seed hat den Benchmark HarnessDev vorgestellt, um die Entwicklung und Evolution von "Agent Harnesses" durch Large Language Models (LLMs) zu bewerten.
- Ein "Agent Harness" bezeichnet die externe Ausführungsinfrastruktur, die für die Funktionalität eines KI-Agenten entscheidend ist.
- HarnessDev bewertet nicht nur die Aufgabenlösung, sondern die zugrunde liegende, lauffähige Infrastruktur selbst.
- LLMs zeigen bei der Erstellung von Harnesses in Bereichen wie Textgenerierung und ML-Experimenten gute Leistungen, hinken aber bei der Codegenerierung und der Suchfunktionalität hinter menschlichen Entwicklungen her.
- Die Evolution bestehender Harnesses durch LLMs führt zu instabilen und nur teilweise übertragbaren Verbesserungen.
- Ein signifikanter Anteil der von LLMs generierten Harnesses enthält inaktive Code- oder Speichermechanismen.
Die Forschung im Bereich der Künstlichen Intelligenz (KI) widmet sich zunehmend der Frage, ob große Sprachmodelle (LLMs) nicht nur spezifische Aufgaben lösen, sondern auch die zugrunde liegende Infrastruktur, die sogenannten "Agent Harnesses", eigenständig entwickeln und optimieren können. Diese Fähigkeit würde einen wesentlichen Schritt in Richtung autonomer und sich selbst entwickelnder KI-Systeme darstellen.
Die Bedeutung des "Agent Harness"
Ein "Agent Harness" ist die externe Ausführungsinfrastruktur, die für die Funktionsweise eines KI-Agenten unerlässlich ist. Dazu gehören Werkzeuge, Speichermechanismen, Ausführungsschleifen und Überprüfungen. Die Leistungsfähigkeit eines Agenten hängt maßgeblich von dieser Infrastruktur ab. Eine Änderung des Harness kann die Aufgabenleistung eines Modells erheblich beeinflussen, selbst wenn die Modellgewichte unverändert bleiben. Bislang konzentrierten sich Evaluierungen von Agenten primär auf die Ergebnisse der Aufgabenlösung unter einem vordefinierten Harness, während die Fähigkeit der Modelle, diesen Harness selbst zu entwickeln, weniger Beachtung fand.
HarnessDev: Ein neuer Bewertungsstandard
ByteDance Seed hat mit HarnessDev einen neuen Benchmark eingeführt, der die Bewertung von den reinen Aufgabenergebnissen auf die lauffähige Infrastruktur selbst verlagert. Dieser Benchmark ist in zwei Hauptphasen unterteilt:
- Erstellungsphase (Creation): Hier beginnt der Agent mit einem minimalen Startpunkt und einer geringen Anzahl von Anwendungsfällen, um ein vollständiges Ausführungssystem aufzubauen.
- Evolutionsphase (Evolution): In dieser Phase startet der Agent mit einem von ihm selbst erstellten Harness und überarbeitet diesen iterativ unter Nutzung von Feedback aus der nachgelagerten Ausführung. Das Ziel ist eine Verbesserung der Benchmark-Leistung.
Die Evaluierung jedes konstruierten Harness erfolgt anhand seiner Fähigkeit (Task-Erfolg bei unabhängigen Benchmarks) und seiner Effizienz (Ausführungs-Token-Kosten).
Ergebnisse der HarnessDev-Evaluierung
Die bisherigen Ergebnisse der Erstellungsphase, die sechs verschiedene LLMs, vier Domänen und fünf nachgelagerte Benchmarks umfassen, zeigen ein differenziertes Bild:
- Stärken der LLMs: Bei Aufgaben wie Textgenerierung und der Durchführung von Experimenten im Bereich des maschinellen Lernens können die von LLMs generierten Harnesses mit menschlich entwickelten Referenzsystemen mithalten oder diese sogar übertreffen.
- Schwächen der LLMs: In den Bereichen Codegenerierung sowie Such- und Forschungsfunktionen bleiben die generierten Harnesses deutlich hinter den ausgereiften, von Menschen entwickelten Referenzen zurück.
- Kostenvariabilität: Es wurde eine erhebliche Variation der Ausführungskosten festgestellt.
Die Evolutionsphase zeigte, dass zwar einige Leistungssteigerungen erzielt werden konnten, diese jedoch oft instabil waren und nur teilweise auf ungesehene Aufgaben übertragbar waren. Experimente mit einem festen Laufzeitmodell deuteten darauf hin, dass die erzielten Verbesserungen stark vom Modell abhängen, das den Harness ausführt, was auf eine begrenzte Übertragbarkeit zwischen verschiedenen Modellen hindeutet.
Analyse der Implementierungsdetails
Eine detaillierte Analyse der generierten Harnesses ergab, dass ein Großteil von ihnen "toten" Code oder inaktive Speichermechanismen enthält, die zur Laufzeit nie ausgeführt werden. Dies deutet darauf hin, dass die LLMs zwar die Struktur und das "Gerüst" eines Harness erstellen können, aber Schwierigkeiten haben, effiziente und vollständig funktionale Implementierungen zu generieren, insbesondere in Bezug auf Zustandsverwaltung und Speicherfunktionen. Die Beobachtung, dass der "execution loop" bei allen sechs getesteten Modellen am stärksten ausgeprägt war, während "state and memory" die blasseste Spalte bildeten, unterstützt diese Annahme. Dies könnte auch die Instabilität der Evolutionsgewinne erklären, da die Bearbeitung von Code, der nie ausgeführt wird, keine Leistungsverbesserung bewirken kann.
Ausblick und Implikationen für die B2B-Anwendung
Die Erkenntnisse aus dem HarnessDev-Benchmark sind für Unternehmen, die KI-Agenten entwickeln und einsetzen, von hoher Relevanz. Sie verdeutlichen, dass die autonome Entwicklung und Evolution von Agent-Infrastrukturen durch LLMs noch in den Anfängen steckt. Während LLMs bereits in bestimmten Domänen vielversprechende Ergebnisse liefern, bleibt die Herausforderung bestehen, sie zu befähigen, robuste, effiziente und vollständig funktionale Harnesses eigenständig zu erstellen und zu optimieren. Für B2B-Anwendungen bedeutet dies, dass menschliche Expertise bei der Entwicklung und Wartung der Agent-Infrastruktur weiterhin unerlässlich ist, insbesondere in kritischen Bereichen wie Codegenerierung und komplexen Suchfunktionen. Die Forschung an Benchmarks wie HarnessDev ist jedoch ein wichtiger Schritt, um die Fähigkeiten von LLMs in diesem Bereich systematisch zu bewerten und zukünftige Entwicklungen voranzutreiben.
Bibliographie
- Wu, Y., Zhang, J., Shi, J., Lei, X., Gu, Q., Zhang, Y., ... & Zhang, W. (2026). HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness? arXiv preprint arXiv:2609.01437. - ByteDance Seed and TokenWave. (2026). Self-Developing Agents — From Half-Loop to Closed-Loop RSI. Project page: https://self-developing-agents.github.io/ - Kadam, P. (2026). Can an AI Build Its Own Toolkit? The HarnessDev Benchmark. YouTube Short: https://www.youtube.com/shorts/7hLX1O06llA - HuggingPapers. (2026). X Post regarding HarnessDev. https://x.com/HuggingPapers/status/2095545764793520204 - AI Quanting. (2026). X Comment regarding HarnessDev. https://x.com/AIQuanting/status/2095548045496865146
Weitere News-Artikel
Alle ansehen- Entwicklung von Chat-Anwendungen mit der Perplexity API
- Entwicklung computer-nutzender Agenten: OpenAI sucht Experten zur Unterstützung
- Entwicklung der Cybersicherheit: KI-gestützte Maßnahmen von Google im Jahr 2025
- Die Entwicklung von Datenagenten: Autonomie, Herausforderungen und Zukunftsperspektiven
- Die Entwicklung des Papiers und seine Rolle in der modernen Technologie
- Die Entwicklung der Diskussionskultur im digitalen Zeitalter
KI, die in Deutschland zu Hause ist.
Testen Sie Mindverse Studio oder sprechen Sie mit unserem Team über Ihren Anwendungsfall.