Benchmarks independientes, con contexto.

Descubre qué evalúan, qué modelos cubren y dónde se aplican los resultados.

Artificial Analysis

Artificial Analysis · video evaluations

Artificial Analysis · Modelos de texto a vídeo. Qué mide: Protocolo de evaluación publicado. Consulta el método, las tareas y la versión del modelo antes de aplicar los resultados a una herramienta. No deducimos una puntuación del producto.

Alcance
Modelos de texto a vídeo
Qué mide
Protocolo de evaluación publicado

VBench team

VBench Leaderboard

VBench team · Modelos de texto a vídeo. Qué mide: Dimensiones de calidad y consistencia. Benchmark multidimensional de calidad visual, movimiento y consistencia.

Alcance
Modelos de texto a vídeo
Qué mide
Dimensiones de calidad y consistencia

Artificial Analysis

Artificial Analysis · speech evaluations

Artificial Analysis · Proveedores de texto a voz. Qué mide: Protocolo de evaluación publicado. Consulta el método, las tareas y la versión del modelo antes de aplicar los resultados a una herramienta. No deducimos una puntuación del producto.

Alcance
Proveedores de texto a voz
Qué mide
Protocolo de evaluación publicado

TTS-AGI & contributors

Speech synthesis evaluation sources

TTS-AGI & contributors · Modelos de texto a voz. Qué mide: Protocolo de evaluación publicado. Consulta el método, las tareas y la versión del modelo antes de aplicar los resultados a una herramienta. No deducimos una puntuación del producto.

Alcance
Modelos de texto a voz
Qué mide
Protocolo de evaluación publicado

BigCode project

BigCodeBench

BigCode project · Modelos de código, no editores. Qué mide: Finalización de tareas de código. Mide modelos en tareas con varias librerías; no clasifica Cursor, Windsurf o Bolt como productos.

Alcance
Modelos de código, no editores
Qué mide
Finalización de tareas de código

Artificial Analysis

Artificial Analysis · image evaluations

Artificial Analysis · Modelos de texto a imagen. Qué mide: Protocolo de evaluación publicado. Consulta el método, las tareas y la versión del modelo antes de aplicar los resultados a una herramienta. No deducimos una puntuación del producto.

Alcance
Modelos de texto a imagen
Qué mide
Protocolo de evaluación publicado

Hugging Face & contributors

Open ASR Leaderboard

Hugging Face & contributors · Solo modelos de reconocimiento de voz. Qué mide: Precisión y velocidad de transcripción. Compara error de palabra y velocidad; no mide resúmenes ni integraciones.

Alcance
Solo modelos de reconocimiento de voz
Qué mide
Precisión y velocidad de transcripción

Datacurve

DeepSWE

Datacurve · Agentes de código ejecutados con mini-swe-agent. Qué mide: Éxito en tareas de ingeniería de larga duración. Mide agentes de código avanzados en 113 tareas originales y prolongadas, 91 repositorios y cinco lenguajes.

Alcance
Agentes de código ejecutados con mini-swe-agent
Qué mide
Éxito en tareas de ingeniería de larga duración