Unabhängige Benchmarks im Kontext.
Welche Aufgaben werden bewertet, welche Modelle erfasst und wo gelten die Ergebnisse?
Artificial Analysis
Artificial Analysis · Text-zu-Video-Modelle. Messgröße: Veröffentlichtes Evaluationsverfahren. Lies Methode, Aufgaben und getestete Modellversion, bevor du Ergebnisse auf ein Tool überträgst. Hier wird kein Tool-Score abgeleitet.
- Geltungsbereich
- Text-zu-Video-Modelle
- Messgröße
- Veröffentlichtes Evaluationsverfahren
VBench team
VBench team · Text-zu-Video-Modelle. Messgröße: Qualitäts- und Konsistenzdimensionen. Mehrdimensionaler Video-Benchmark für Bildqualität, Bewegung und Konsistenz.
- Geltungsbereich
- Text-zu-Video-Modelle
- Messgröße
- Qualitäts- und Konsistenzdimensionen
Artificial Analysis
Artificial Analysis · Text-zu-Sprache-Anbieter. Messgröße: Veröffentlichtes Evaluationsverfahren. Lies Methode, Aufgaben und getestete Modellversion, bevor du Ergebnisse auf ein Tool überträgst. Hier wird kein Tool-Score abgeleitet.
- Geltungsbereich
- Text-zu-Sprache-Anbieter
- Messgröße
- Veröffentlichtes Evaluationsverfahren
TTS-AGI & contributors
TTS-AGI & contributors · Text-zu-Sprache-Modelle. Messgröße: Veröffentlichtes Evaluationsverfahren. Lies Methode, Aufgaben und getestete Modellversion, bevor du Ergebnisse auf ein Tool überträgst. Hier wird kein Tool-Score abgeleitet.
- Geltungsbereich
- Text-zu-Sprache-Modelle
- Messgröße
- Veröffentlichtes Evaluationsverfahren
BigCode project
BigCode project · Code-Modelle, nicht Editoren. Messgröße: Praktische Coding-Aufgaben. Misst Modelle bei Multi-Library-Aufgaben; kein Produkt-Ranking für Cursor, Windsurf oder Bolt.
- Geltungsbereich
- Code-Modelle, nicht Editoren
- Messgröße
- Praktische Coding-Aufgaben
Artificial Analysis
Artificial Analysis · Text-zu-Bild-Modelle. Messgröße: Veröffentlichtes Evaluationsverfahren. Lies Methode, Aufgaben und getestete Modellversion, bevor du Ergebnisse auf ein Tool überträgst. Hier wird kein Tool-Score abgeleitet.
- Geltungsbereich
- Text-zu-Bild-Modelle
- Messgröße
- Veröffentlichtes Evaluationsverfahren
Hugging Face & contributors
Hugging Face & contributors · Nur Spracherkennungsmodelle. Messgröße: Transkriptionsgenauigkeit und Geschwindigkeit. Vergleicht Wortfehlerrate und Geschwindigkeit; Zusammenfassungen oder Integrationen werden nicht gemessen.
- Geltungsbereich
- Nur Spracherkennungsmodelle
- Messgröße
- Transkriptionsgenauigkeit und Geschwindigkeit
Datacurve
Datacurve · Coding-Agenten über mini-swe-agent. Messgröße: Erfolg bei langfristigen Engineering-Aufgaben. Misst führende Coding-Agenten an 113 originalen Langzeitaufgaben in 91 Repositories und fünf Sprachen.
- Geltungsbereich
- Coding-Agenten über mini-swe-agent
- Messgröße
- Erfolg bei langfristigen Engineering-Aufgaben