---
title: Arena Skill für Claude — Schlechte Antworten von mehreren Agenten prüfen lassen.
description: "Der Arena Skill lässt mehrere Claude-Sub-Agenten dieselbe Aufgabe unterschiedlich bearbeiten, sich kritisieren und von einem Richter bewerten. Installation in Claude, Kosten und wann --quick reicht."
category: guides
date: 2026-10-08
canonical: https://thanisch.co/wissen/guides/arena-skill
url: https://thanisch.co/wissen/guides/arena-skill
---

# Arena Skill für Claude — Schlechte Antworten von mehreren Agenten prüfen lassen.

- Was der Arena Skill mit einer Aufgabe macht

- Den Skill in Claude installieren

- Wann 16 Agenten reichen und wann 100

- Warum der Gewinner trotzdem geprüft werden muss

> **Kurz gesagt**
> Wenn eine einzelne Claude-Antwort nicht reicht, lässt du mit `/arena` mehrere Lösungswege gegeneinander antreten. Für den Einstieg: */arena --quick, und die 100 Agenten erst, wenn die Aufgabe wirklich wichtig ist.*

Wenn Claude eine Aufgabe nicht überzeugend löst, hilft oft ein neuer Prompt. Bei schwierigen Aufgaben führt das jedoch schnell zu endlosen Überarbeitungen. Genau hier setzt der Arena Skill an: Er lässt mehrere Claude-Sub-Agenten dieselbe Aufgabe auf unterschiedliche Weise bearbeiten, ihre Lösungen gegenseitig kritisieren und anschließend von einem weiteren Agenten bewerten.

Das klingt im Reel zugespitzt nach „100 Versionen von Claude, die bis zum Tod kämpfen“. Technisch handelt es sich jedoch nicht um 100 verschiedene KIs oder eigenständige Modelle, sondern um mehrere Sub-Agenten desselben laufenden Claude-Modells mit unterschiedlichen Strategie-Vorgaben.

## Was ist der Arena Skill?

Der Arena Skill ist ein Open-Source-Skill für Claude. Er wird über den Befehl `/arena` gestartet und ist für Situationen gedacht, in denen du mit einer bestehenden Antwort nicht zufrieden bist.

Bei der Standardausführung werden bis zu 100 Sub-Agenten eingesetzt. Alle erhalten dieselbe Aufgabenstellung, aber jeweils eine andere Kombination aus:

- Denkweise, zum Beispiel „First Principles“, Umkehrung oder adversariales Denken
- Arbeitsablauf, zum Beispiel „erst recherchieren, dann zusammenfassen“
- Strategie, zum Beispiel maximale Genauigkeit, Einfachheit oder Fokus auf Randfälle

Anschließend treten die Lösungen in einem K.-o.-Verfahren gegeneinander an. Die Agenten greifen die Lösung des jeweils anderen an, verteidigen und überarbeiten ihre eigene Antwort. Ein separater Claude-Agent bewertet die überarbeiteten Lösungen anhand eines festgelegten Bewertungsrasters.

Am Ende bleibt eine Lösung übrig. Sie gilt im Sinne des Workflows als Gewinnerin, weil sie alle Runden überstanden hat. Das ist aber kein mathematischer Beweis, dass sie tatsächlich korrekt oder objektiv die beste Antwort ist.

## So funktioniert der Ablauf

Der Arena Skill arbeitet in mehreren Phasen.

### 1. Aufgabenstellung und Varianten

Zunächst erhalten alle Sub-Agenten denselben Aufgabentext. Zusätzlich bekommt jeder eine eigene „Strategy Card“. Diese Karte legt fest, aus welcher Perspektive der Agent die Aufgabe bearbeitet.

Das sorgt für unterschiedliche Lösungswege, obwohl alle mit derselben Aufgabe beginnen. Die Unterschiede entstehen also durch die Vorgaben für Denkweise, Workflow und Strategie – nicht durch 100 verschiedene Modelle.

### 2. Gegenseitige Kritik

Die erzeugten Lösungen werden zu Paaren zusammengestellt. Jeder Agent untersucht die Lösung seines Gegners auf konkrete Schwächen:

- sachliche Fehler
- fehlende Anforderungen
- logische Widersprüche
- problematische Sonderfälle
- unklare oder nicht ausführbare Anweisungen

Die Kritik soll möglichst überprüfbar sein. Statt „Diese Lösung ist schlecht“ soll der Agent beispielsweise zeigen, welche Anforderung fehlt oder bei welchem konkreten Beispiel die Lösung scheitert.

### 3. Verteidigung und Überarbeitung

Danach erhält jeder Agent die Kritik an seiner Lösung. Er muss entscheiden, ob die Kritik berechtigt ist, und seine Antwort entsprechend verbessern.

Eine gute Verteidigung besteht deshalb nicht nur aus Widerspruch. Wenn ein Fehler tatsächlich vorhanden ist, soll der Agent ihn anerkennen und korrigieren. Anschließend wird eine vollständige überarbeitete Lösung erstellt.

### 4. Bewertung durch einen Richter

Ein separater Sub-Agent bewertet beide überarbeiteten Lösungen. Das Bewertungsraster berücksichtigt fünf Kriterien:

- Korrektheit: 30 Prozent
- Vollständigkeit: 25 Prozent
- Robustheit gegenüber Kritik: 20 Prozent
- Spezifität: 15 Prozent
- Klarheit: 10 Prozent

Eine Lösung mit einem bestätigten schwerwiegenden Fehler darf dabei nicht gegen eine fehlerfreie Lösung gewinnen. Die unterlegene Lösung scheidet aus.

### 5. Wiederholung bis zum Finale

Die verbleibenden Lösungen durchlaufen weitere Runden. Bei einer Standardausführung reduziert sich das Feld ungefähr so:

100 → 50 → 25 → 13 → 7 → 4 → 2 → 1

Der Gewinner wird anschließend zusammen mit den überstandenen Angriffen und der Anzahl der Runden ausgegeben.

## Sind es wirklich 100 Claude-Agenten?

Ja und nein.

Der Arena Skill kann standardmäßig 100 Sub-Agenten anlegen. „100 Versionen von Claude“ ist deshalb als Beschreibung des Ablaufs nicht völlig falsch. Es handelt sich aber nicht um 100 unterschiedliche KI-Modelle. Die Sub-Agenten verwenden das Claude-Modell, das in deiner Claude-Code-Umgebung aktiv ist.

Ihre unterschiedlichen Ergebnisse entstehen durch verschiedene Strategie-Karten und durch die Zufälligkeit der Modellantworten. Auch bei gleichem Startwert – dem sogenannten Seed – bleiben Karten und Turnierbaum gleich, die Antworten müssen jedoch nicht identisch ausfallen.

Die Formulierung „bis zum Tod kämpfen“ ist eine Marketing-Metapher. Tatsächlich greifen die Agenten Lösungen an, verteidigen sie und scheiden im Rahmen eines programmierten K.-o.-Turniers aus.

## Installation in Claude

Der Arena Skill ist für Claude gedacht. Er benötigt die Agent-Funktion von Claude und Python ab Version 3.8. Zusätzliche Python-Pakete müssen laut Repository nicht installiert werden.

Der aktuelle Quellcode liegt im Repository von [Ultra-Smashed/arena-skill auf GitHub](https://github.com/Ultra-Smashed/arena-skill). Falls dir im Reel noch der alte Link `github.com/Ultra-Smashed/arena-skill` begegnet, nimm stattdessen den aktuellen Repository-Link.

### Variante 1: Installation über Claude

Füge Claude diese Anweisung ein:

**Claude**

```
https://github.com/Ultra-Smashed/arena-skill

Installiere diesen Skill und bestätige anschließend, dass /arena funktioniert.
```

Prüfe danach, ob der Befehl `/arena` verfügbar ist.

### Variante 2: Manuelle Installation

Alternativ kannst du das Repository klonen und den Skill in dein persönliches Claude-Code-Skill-Verzeichnis kopieren:

**Klon**

```
Danach sollte der Skill als `/arena` verfügbar sein.

### Variante 3: Installation als Plugin

<Terminal label="Plugin">
/plugin marketplace add Ultra-Smashed/arena-skill
/plugin install arena-skill@arena-skill
```

In diesem Fall kann der Skill unter dem Namen `/arena-skill:arena` erscheinen.

Wenn du ihn nur für ein bestimmtes Projekt installieren möchtest, kopierst du den Ordner in `.claude/skills/` im jeweiligen Projektverzeichnis.

## So verwendest du den Arena Skill

Die einfachste Variante:

**/arena**

```
/arena
```

Dann verwendet der Skill deine letzte Aufgabenstellung und – sofern vorhanden – die Antwort, mit der du zuvor unzufrieden warst.

Du kannst auch direkt eine Aufgabe anhängen:

**Aufgabe**

```
/arena Schreibe eine Landingpage für unser neues Produkt.
```

Für eine kleinere und schnellere Ausführung gibt es `--quick`:

**--quick**

```
/arena --quick Schreibe eine überzeugende Überschrift für unsere Preisseite.
```

`--quick` verwendet 16 statt 100 Agenten und eignet sich besser für alltägliche Aufgaben.

Weitere Optionen:

**--agents**

```
/arena --agents 32 Verbessere diesen fehlerhaften Test.
```

Damit legst du die Zahl der konkurrierenden Agenten selbst fest.

**--seed**

```
/arena --seed 7 Plane eine Marketingkampagne für die kommende Woche.
```

Mit einem Seed werden die Strategie-Karten und der Turnierbaum reproduzierbar festgelegt. Die Antworten selbst sind dadurch nicht garantiert identisch.

**--wave**

```
/arena --wave 20 Bearbeite diese komplexe Architekturaufgabe.
```

Mit `--wave` lässt sich die Zahl der parallel gestarteten Sub-Agenten anpassen. Das sollte nur geschehen, wenn die Parallelitätsgrenze von Claude ebenfalls entsprechend erhöht wurde.

## Was kostet der Arena Skill?

Der Skill selbst wird unter der MIT-Lizenz veröffentlicht und verlangt laut Repository keine zusätzliche Installationsgebühr, keinen separaten API-Schlüssel und keine Registrierung.

Kostenlos bedeutet jedoch nicht, dass eine Ausführung ohne Verbrauch bleibt. Die Sub-Agenten verbrauchen Claude-Tokens. Je mehr Agenten und je größer die Aufgabenstellung, desto höher kann der Verbrauch ausfallen.

| Anzahl Agenten | Runden | Sub-Agent-Aufrufe |
| --- | --- | --- |
| 100 | 7 | 595 |
| 64 | 6 | 379 |
| 32 | 5 | 187 |
| 16, `--quick` | 4 | 91 |
| 8 | 3 | 43 |

> **Token**
> Laufen wirklich alle 100 Sub-Agenten das Turnier durch, kann der Verbrauch extrem hoch werden. 595 Aufrufe, und jeder liest die Aufgabe plus eine oder zwei Lösungen. Für den Alltag bleibt `--quick`.

Wird zusätzlich eine bereits abgelehnte Antwort als Vergleich herangezogen, kommt ein weiterer Bewertungsaufruf hinzu.

Die 100-Agenten-Variante ist deshalb eher für wichtige oder besonders schwierige Aufgaben gedacht. Für normale Prompts ist `--quick` oder eine Ausführung mit 16 bis 32 Agenten meist sinnvoller.

## Verändert der Skill meine Dateien?

Laut Dokumentation verändert der Arena Skill dein Projekt nicht direkt. Die Sub-Agenten speichern ihre Zwischenstände und Ergebnisse im Verzeichnis `.arena/`.

Die Gewinnerlösung kann beispielsweise einen Code-Diff oder vollständige Dateien enthalten. Ob du diese Änderungen tatsächlich in dein Projekt übernimmst, entscheidest du selbst.

Beachte trotzdem, dass die Agenten innerhalb deines Claude-Code-Projekts arbeiten und Dateien im `.arena`-Verzeichnis anlegen. Je nach Berechtigungsmodus können deshalb mehrere Freigabeabfragen erscheinen.

## Die wichtigsten Einschränkungen

Der Arena Skill kann die Qualität einer Antwort verbessern, beseitigt aber nicht alle Risiken.

### Der Gewinner ist nicht automatisch korrekt

Die Bewertung erfolgt ebenfalls durch Claude. Der „Sieger“ ist die Lösung, die im definierten Turnier die höchste Bewertung erhält – nicht zwingend die objektiv richtige Lösung.

Gerade bei Fakten, rechtlichen Themen, medizinischen Fragen oder aktuellen Informationen solltest du die Ausgabe weiterhin selbst prüfen und gegebenenfalls mit verlässlichen Quellen abgleichen.

### Mehr Agenten bedeuten nicht automatisch bessere Ergebnisse

100 Varianten können mehr Perspektiven liefern, erhöhen aber vor allem den Tokenverbrauch und die Laufzeit. Eine schlecht formulierte Aufgabe erzeugt auch mit 100 Agenten viele Varianten derselben Unklarheit.

Die Dokumentation bringt es sinngemäß auf den Punkt: Aus einer vagen Aufgabe entstehen viele unterschiedliche Versionen einer vagen Antwort.

### Die Agenten sehen nicht den gesamten Chat

Der Skill schreibt die Aufgabenstellung in eine separate Datei. Die Sub-Agenten arbeiten mit diesem Aufgabentext und den vom Orchestrator bereitgestellten Lösungsdateien.

Wenn eine wichtige Anforderung nur in einem früheren Chatabschnitt steht und nicht in der übergebenen Aufgabe landet, kann sie von allen Agenten übersehen werden.

### Die Ausführung dauert

100 Agenten werden nicht zwingend gleichzeitig ausgeführt. Claude arbeitet standardmäßig in Wellen mit begrenzter Parallelität. Das vollständige 100-Agenten-Turnier umfasst laut Repository 70 Wellen und kann deshalb deutlich länger dauern als eine normale Claude-Antwort.

## Für welche Aufgaben lohnt sich Arena?

Besonders interessant ist der Skill bei Aufgaben, bei denen mehrere plausible Lösungen existieren und eine kritische Gegenprüfung nützlich ist, zum Beispiel:

- Architektur- und Designentscheidungen
- komplexe Programmieraufgaben
- technische Konzepte und Refactoring
- Recherche- und Strukturierungsaufgaben
- Marketing- und Produkttexte
- Projekt- und Launch-Planung
- Aufgaben mit vielen Anforderungen und Randfällen

Für eine einfache Übersetzung, eine kurze E-Mail oder eine triviale Formatierung ist der zusätzliche Aufwand meist nicht nötig.

## Fazit

Der Arena Skill verwandelt eine einzelne Claude-Antwort in einen strukturierten Wettbewerb mehrerer Sub-Agenten. Die Agenten entwickeln unterschiedliche Lösungen, kritisieren sich gegenseitig, überarbeiten ihre Entwürfe und lassen die Ergebnisse anhand eines Bewertungsrasters vergleichen.

Die Reel-Formulierung von „100 Claudes, die bis zum Tod kämpfen“ beschreibt den Mechanismus anschaulich, sollte aber technisch eingeordnet werden: Es sind nicht 100 verschiedene Modelle, sondern viele Sub-Agenten desselben Claude-Code-Systems mit unterschiedlichen Strategie-Vorgaben.

Der Skill ist selbst kostenlos und steht unter der MIT-Lizenz. Die eigentlichen Kosten entstehen durch den Tokenverbrauch und die längere Laufzeit. Für wichtige Aufgaben kann der Arena-Ansatz eine interessante zusätzliche Qualitätssicherung sein – als Ersatz für Faktenprüfung, menschliche Kontrolle oder klare Aufgabenstellung eignet er sich jedoch nicht.

**Einstieg**

```
/arena --quick Deine Aufgabe
```

Erst wenn die Aufgabe wirklich wichtig ist, lohnt sich der große Durchlauf mit 100 Agenten.

## Dein Aktionsplan

Hak ab, was du erledigt hast:

- [ ] Aktuellen Repository-Link verwendet, nicht den alten aus dem Reel

- [ ] Skill in Claude installiert, `/arena` ist verfügbar

- [ ] Zuerst `/arena --quick` mit einer echten Aufgabe

- [ ] Die 100 Agenten nur, wenn die Aufgabe wirklich wichtig ist

- [ ] Gewinnerlösung selbst geprüft, bevor etwas ins Projekt kommt
