Benchmarks independientes, con contexto.
Descubre qué evalúan, qué modelos cubren y dónde se aplican los resultados.
Artificial Analysis
Artificial Analysis · Modelos de texto a vídeo. Qué mide: Protocolo de evaluación publicado. Consulta el método, las tareas y la versión del modelo antes de aplicar los resultados a una herramienta. No deducimos una puntuación del producto.
- Alcance
- Modelos de texto a vídeo
- Qué mide
- Protocolo de evaluación publicado
VBench team
VBench team · Modelos de texto a vídeo. Qué mide: Dimensiones de calidad y consistencia. Benchmark multidimensional de calidad visual, movimiento y consistencia.
- Alcance
- Modelos de texto a vídeo
- Qué mide
- Dimensiones de calidad y consistencia
Artificial Analysis
Artificial Analysis · Proveedores de texto a voz. Qué mide: Protocolo de evaluación publicado. Consulta el método, las tareas y la versión del modelo antes de aplicar los resultados a una herramienta. No deducimos una puntuación del producto.
- Alcance
- Proveedores de texto a voz
- Qué mide
- Protocolo de evaluación publicado
TTS-AGI & contributors
TTS-AGI & contributors · Modelos de texto a voz. Qué mide: Protocolo de evaluación publicado. Consulta el método, las tareas y la versión del modelo antes de aplicar los resultados a una herramienta. No deducimos una puntuación del producto.
- Alcance
- Modelos de texto a voz
- Qué mide
- Protocolo de evaluación publicado
BigCode project
BigCode project · Modelos de código, no editores. Qué mide: Finalización de tareas de código. Mide modelos en tareas con varias librerías; no clasifica Cursor, Windsurf o Bolt como productos.
- Alcance
- Modelos de código, no editores
- Qué mide
- Finalización de tareas de código
Artificial Analysis
Artificial Analysis · Modelos de texto a imagen. Qué mide: Protocolo de evaluación publicado. Consulta el método, las tareas y la versión del modelo antes de aplicar los resultados a una herramienta. No deducimos una puntuación del producto.
- Alcance
- Modelos de texto a imagen
- Qué mide
- Protocolo de evaluación publicado
Hugging Face & contributors
Hugging Face & contributors · Solo modelos de reconocimiento de voz. Qué mide: Precisión y velocidad de transcripción. Compara error de palabra y velocidad; no mide resúmenes ni integraciones.
- Alcance
- Solo modelos de reconocimiento de voz
- Qué mide
- Precisión y velocidad de transcripción
Datacurve
Datacurve · Agentes de código ejecutados con mini-swe-agent. Qué mide: Éxito en tareas de ingeniería de larga duración. Mide agentes de código avanzados en 113 tareas originales y prolongadas, 91 repositorios y cinco lenguajes.
- Alcance
- Agentes de código ejecutados con mini-swe-agent
- Qué mide
- Éxito en tareas de ingeniería de larga duración