Unabhängige Benchmarks im Kontext.

Welche Aufgaben werden bewertet, welche Modelle erfasst und wo gelten die Ergebnisse?

Artificial Analysis

Artificial Analysis · video evaluations

Artificial Analysis · Text-zu-Video-Modelle. Messgröße: Veröffentlichtes Evaluationsverfahren. Lies Methode, Aufgaben und getestete Modellversion, bevor du Ergebnisse auf ein Tool überträgst. Hier wird kein Tool-Score abgeleitet.

Geltungsbereich
Text-zu-Video-Modelle
Messgröße
Veröffentlichtes Evaluationsverfahren

VBench team

VBench Leaderboard

VBench team · Text-zu-Video-Modelle. Messgröße: Qualitäts- und Konsistenzdimensionen. Mehrdimensionaler Video-Benchmark für Bildqualität, Bewegung und Konsistenz.

Geltungsbereich
Text-zu-Video-Modelle
Messgröße
Qualitäts- und Konsistenzdimensionen

Artificial Analysis

Artificial Analysis · speech evaluations

Artificial Analysis · Text-zu-Sprache-Anbieter. Messgröße: Veröffentlichtes Evaluationsverfahren. Lies Methode, Aufgaben und getestete Modellversion, bevor du Ergebnisse auf ein Tool überträgst. Hier wird kein Tool-Score abgeleitet.

Geltungsbereich
Text-zu-Sprache-Anbieter
Messgröße
Veröffentlichtes Evaluationsverfahren

TTS-AGI & contributors

Speech synthesis evaluation sources

TTS-AGI & contributors · Text-zu-Sprache-Modelle. Messgröße: Veröffentlichtes Evaluationsverfahren. Lies Methode, Aufgaben und getestete Modellversion, bevor du Ergebnisse auf ein Tool überträgst. Hier wird kein Tool-Score abgeleitet.

Geltungsbereich
Text-zu-Sprache-Modelle
Messgröße
Veröffentlichtes Evaluationsverfahren

BigCode project

BigCodeBench

BigCode project · Code-Modelle, nicht Editoren. Messgröße: Praktische Coding-Aufgaben. Misst Modelle bei Multi-Library-Aufgaben; kein Produkt-Ranking für Cursor, Windsurf oder Bolt.

Geltungsbereich
Code-Modelle, nicht Editoren
Messgröße
Praktische Coding-Aufgaben

Artificial Analysis

Artificial Analysis · image evaluations

Artificial Analysis · Text-zu-Bild-Modelle. Messgröße: Veröffentlichtes Evaluationsverfahren. Lies Methode, Aufgaben und getestete Modellversion, bevor du Ergebnisse auf ein Tool überträgst. Hier wird kein Tool-Score abgeleitet.

Geltungsbereich
Text-zu-Bild-Modelle
Messgröße
Veröffentlichtes Evaluationsverfahren

Hugging Face & contributors

Open ASR Leaderboard

Hugging Face & contributors · Nur Spracherkennungsmodelle. Messgröße: Transkriptionsgenauigkeit und Geschwindigkeit. Vergleicht Wortfehlerrate und Geschwindigkeit; Zusammenfassungen oder Integrationen werden nicht gemessen.

Geltungsbereich
Nur Spracherkennungsmodelle
Messgröße
Transkriptionsgenauigkeit und Geschwindigkeit

Datacurve

DeepSWE

Datacurve · Coding-Agenten über mini-swe-agent. Messgröße: Erfolg bei langfristigen Engineering-Aufgaben. Misst führende Coding-Agenten an 113 originalen Langzeitaufgaben in 91 Repositories und fünf Sprachen.

Geltungsbereich
Coding-Agenten über mini-swe-agent
Messgröße
Erfolg bei langfristigen Engineering-Aufgaben