Was messen Multi-Agent-Benchmarks wirklich?
Multi-Agent-Benchmarks untersuchen, wie mehrere Agenten unter festgelegten Aufgaben, Modellen, Koordinationsprotokollen und Bewertungsregeln zusammenarbeiten oder konkurrieren. Ein Ergebnis ist nur so aussagekräftig wie sein Studiensetting. Besonders wichtig ist, Single-Agent-Fähigkeiten, agentisches Tool-Use und echte Multi-Agent-Koordination auseinanderzuhalten. Die hier dokumentierten Resultate wurden extern gemessen und von AgentenCode kuratiert. AgentenCode hat weder MARBLE noch AgentBench als eigene Benchmark-Kampagne ausgeführt.
| Quelle | Testgegenstand | Geeignet für | Nicht geeignet als |
|---|---|---|---|
| MultiAgentBench / MARBLE (Zhu et al., ACL 2025) | Kooperation und Wettbewerb mehrerer LLM-Agenten; Koordinationsprotokolle | Forschungseinordnung zu Multi-Agent-Verhalten und Meilensteinen | Allgemeine Bestenliste kommerzieller Agenten |
| AgentBench (ICLR 2024) | LLMs als Agenten über verschiedene Umgebungen | Kontext zur Fähigkeit, Agentenaufgaben zu lösen | Direkter Vergleich von Handoff gegen Graph-Orchestrierung |
| Microsoft Agent Framework Workflows | Dokumentierte Framework-Muster | Beleg, dass bestimmte Workflowformen implementiert sind | Peer-reviewter Leistungsvergleich |
| AgentenCode-Agentenprofile | Quellenbasierte Produkt-/Governancefelder | Nachweis produktspezifischer Eigenschaften | Unabhängig gemessener Multi-Agent-Benchmark |
Forschungsanker: MultiAgentBench, ACL 2025
Die peer-reviewte Studie „MultiAgentBench: Evaluating the Collaboration and Competition of LLM agents“ wurde von Kunlun Zhu und Mitautoren in den ACL-Proceedings 2025 veröffentlicht (DOI: 10.18653/v1/2025.acl-long.421). Sie untersucht interaktive Kooperations- und Wettbewerbsszenarien. Der Abstract nennt koordinierende Stern-, Ketten-, Baum- und Graphstrukturen sowie Strategien wie Gruppendiskussion und kognitive Planung. Offizielle Publikation.
Was im Abstract tatsächlich steht: In den dort untersuchten Forschungsaufgaben erreichte gpt-4o-mini im Mittel den höchsten Task-Score, die Graphstruktur schnitt beim Research-Szenario unter den Koordinationsprotokollen am besten ab, und kognitive Planung verbesserte die Meilenstein-Zielerreichung um drei Prozent. Diese Aussagen dürfen nicht als universelle Rangfolge aller Modelle, Agenten oder Orchestrierungsarchitekturen verwendet werden. Der Abstract allein spezifiziert nicht alle Konfidenzintervalle, Reproduktionsdetails oder Kostenfolgen.
Was eine seriöse Ergebniskarte enthalten muss
- Studienschlüssel und Version: DOI, Erscheinungsjahr, getesteter Repository-Stand.
- Aufgabenfamilie: Welcher konkrete Test wurde bearbeitet – etwa interaktive Recherche statt Coding?
- Systemkonfiguration: Modelle, Agentenzahl, Koordinationsprotokoll, Prompts, Tools, Ressourcen und Budgets.
- Metrik und Richtung: Task-Score oder Meilenstein-Zielerreichung ist nicht dasselbe wie Latenz oder Kosten.
- Vergleichsgruppe: Welche alternativen Protokolle wurden im selben Setting getestet?
- Unsicherheit: Zahl der Versuche, Streuung und statistische Verfahren – falls nicht geprüft, als nicht verifiziert markieren.
- Provenienz: Originalquelle, konkrete Fundstelle und tatsächliches Abruf-/Prüfdatum.
Die erste Forschungsdatenversion auf dieser Website übernimmt deshalb keine erfundenen vollständigen Leaderboards. Stattdessen führt sie die veröffentlichte Studie, dokumentierte Architekturklassen und eng begrenzte qualitative Resultatbeschreibungen. Das öffentliche Forschungsschema kann später um nachvollziehbar extrahierte Messreihen ergänzt werden.
MARBLE: offizielle Forschungsimplementierung
Die Autoren verlinken das Repository ulab-uiuc/MARBLE als Begleitcode. Dort werden Komponenten einer Multi-Agent-Forschungsumgebung, Daten- und Simulationsbausteine sowie Installationshinweise beschrieben. Das Repository zeigt eine MIT-Lizenz für den Code; daraus folgt keine pauschale Lizenzfreigabe aller eingebundenen Dritt-Datensätze oder Benchmark-Ergebnisgrafiken. Deshalb übernimmt AgentenCode keine fremden Ergebnisdateien und keine Tabellenkopien automatisch. Die Website verwendet redaktionell eigenständige Erläuterungen und verweist auf die Originale.
Reproduzierbarkeit: Ein reproduzierbarer Lauf müsste Repository-Commit, Abhängigkeiten, Modellversionen, API-Parameter, Prompts, Datensatzversion, Seed, Hardware-/Laufzeitumgebung, Evaluation und Kosten dokumentieren. Öffentlicher Quellcode allein erfüllt diese Voraussetzungen noch nicht. AgentenCode behauptet ausdrücklich keinen solchen Lauf.
AgentBench: wichtig, aber anderer Messgegenstand
AgentBench ist eine umfassendere Benchmark-Umgebung für LLMs als Agenten, bekannt aus ICLR 2024. Der Schwerpunkt liegt auf Aufgaben in verschiedenen interaktiven Umgebungen. Diese Resultate dürfen die Einschätzung von Modell-/Agentenfähigkeiten ergänzen, aber nicht kommentarlos in eine „beste Multi-Agent-Orchestrierung“-Tabelle übernommen werden. Die Einheiten und Versuchsdesigns sind verschieden.
Warum Studien-Scores selten direkt vergleichbar sind
| Vergleichsdimension | Vergleich nur bei … | Häufiges Problem |
|---|---|---|
| Testdaten | gleicher Datensatz und nachvollziehbare Version | Daten haben sich verändert oder sind kontaminiert |
| Aufgabe | gleichwertigem Ziel und erlaubten Werkzeugen | Research und Coding gelten als eine Disziplin |
| Modelle | identischer Modellversion oder kontrolliertem Modellaustausch | Koordinationseffekt mit Modellqualität verwechselt |
| Topologie | expliziter Graph-/Handoff-/Concurrent-Konfiguration | Produktname ersetzt Architekturangabe |
| Metrik | identischer Definition, Einheit und Aggregation | Erfolgsrate mit Score addiert |
| Laufbudget | gleicher Token-, Zeit- und Tool-Grenze | Mehr Kosten werden nicht berücksichtigt |
| Statistik | dokumentierter Stichprobe und Unsicherheitsanalyse | Einzelresultat wirkt wie allgemeine Sicherheit |
Daher zeigt unser Ansatz keine zusammengeworfenen Score-Werte. Selbst eine gemeldete Verbesserung innerhalb derselben Studie belegt nur den dort beschriebenen Fall. Außerdem reicht eine peer-reviewte Veröffentlichung nicht aus, um automatisch eine produktive Implementierung des getesteten Musters sicher oder DSGVO-konform zu nennen.
Vom Paper zur überprüfbaren Architekturentscheidung
Schritt 1: Ein realer Anwendungsfall wird definiert: z. B. drei voneinander unabhängige, quellenkritische Recherchen. Schritt 2: Ein Einzelagent bildet die Baseline. Schritt 3: Concurrent, Sequential und gegebenenfalls Graph werden bei gleichen Aufgaben und Budgets geprüft. Schritt 4: Es werden neben Task-Erfolg auch Quellengenauigkeit, Latenz, Kosten, Schleifen, menschliche Eingriffe und risikoreiche Aktionen erfasst. Schritt 5: Nur statistisch und methodisch nachvollziehbare Unterschiede werden als Ergebnis berichtet.
Diese Schritte sind ein Evaluierungsplan, keine von AgentenCode ausgeführten Experimente. Für konkrete Muster siehe Orchestrierungsarchitekturen. Wie die Plattform mit Unbekannt, Versionierung, Lizenzen und Interessenkonflikten umgeht, steht in der Methodik.
Quellen, Zitierbarkeit und Stand
Primärreferenzen: Zhu et al. (ACL 2025), MARBLE-Repository, AgentBench-Repository und Microsoft Agent Framework. Quellenprüfung für diese erste Redaktion: 9. Oktober 2026. Aussagen entsprechen jeweils dem genannten Veröffentlichungs- oder Dokumentationsscope; nicht nachgemessene Zahlen und offene Nutzungsrechte sind entsprechend gekennzeichnet.
FORSCHUNGSREGISTER
Externe Studien filtern
Die Tabelle basiert auf der veröffentlichten Quellen- und Studiendatenbasis; sie zeigt keine nicht verifizierten Scores.
Die Quellen stehen in der Studienübersicht oben.
Primärquellen und Provenienz
Jede Quellenverwendung wird auf die konkret dokumentierte Aussage begrenzt. Fremde Ergebnisse wurden nicht durch AgentenCode selbst gemessen.
- Zhu et al. · MultiAgentBench, ACL 2025
- MARBLE · Forschungsrepository
- AgentBench · Referenzrepository
- Microsoft Agent Framework · Orchestrations
Forschungsdatensatz: JSON · explizite Graphbeziehungen: JSON
Häufige Fragen
Was ist der Unterschied zwischen MultiAgentBench und AgentBench?
MultiAgentBench untersucht mehrere interagierende Agenten und Koordination; AgentBench testet breiter LLMs als Agenten in verschiedenen Umgebungen.
Hat AgentenCode die Ergebnisse selbst gemessen?
Nein. Die Befunde stammen aus externen Publikationen und Repositorien und sind als solche gekennzeichnet.
Kann man die Zahlen verschiedener Studien direkt vergleichen?
Nur bei kompatiblen Aufgaben, Metriken, Modellversionen, Budgets und statistischen Bedingungen. Sonst wäre die Gegenüberstellung irreführend.
Warum zeigt die Seite kein Top-10-Ranking?
Ein allgemeines Ranking würde inkompatible Tests vermischen und Eigenschaften unterstellen, die nicht gemessen wurden.
Sind MARBLE-Daten frei übernehmbar?
Die Repository-Code-Lizenz ersetzt keine Prüfung der Rechte an eingebundenen Daten, Tabellen und Grafiken.