Независимые бенчмарки в контексте.

Узнайте, что измеряется, какие модели охвачены и где применимы результаты.

Artificial Analysis

Artificial Analysis · video evaluations

Artificial Analysis · Модели text-to-video. Что измеряется: Опубликованная методика оценки. Перед применением результатов к инструменту изучите методику, задачи и версию модели. Оценка продукта здесь не выводится.

Область оценки
Модели text-to-video
Что измеряется
Опубликованная методика оценки

VBench team

VBench Leaderboard

VBench team · Модели text-to-video. Что измеряется: Параметры качества и согласованности. Многомерный бенчмарк качества, движения и согласованности видео.

Область оценки
Модели text-to-video
Что измеряется
Параметры качества и согласованности

Artificial Analysis

Artificial Analysis · speech evaluations

Artificial Analysis · Провайдеры text-to-speech. Что измеряется: Опубликованная методика оценки. Перед применением результатов к инструменту изучите методику, задачи и версию модели. Оценка продукта здесь не выводится.

Область оценки
Провайдеры text-to-speech
Что измеряется
Опубликованная методика оценки

TTS-AGI & contributors

Speech synthesis evaluation sources

TTS-AGI & contributors · Модели text-to-speech. Что измеряется: Опубликованная методика оценки. Перед применением результатов к инструменту изучите методику, задачи и версию модели. Оценка продукта здесь не выводится.

Область оценки
Модели text-to-speech
Что измеряется
Опубликованная методика оценки

BigCode project

BigCodeBench

BigCode project · Модели кода, а не редакторы. Что измеряется: Выполнение практических задач. Оценивает модели на задачах с несколькими библиотеками, но не ранжирует Cursor, Windsurf или Bolt.

Область оценки
Модели кода, а не редакторы
Что измеряется
Выполнение практических задач

Artificial Analysis

Artificial Analysis · image evaluations

Artificial Analysis · Модели text-to-image. Что измеряется: Опубликованная методика оценки. Перед применением результатов к инструменту изучите методику, задачи и версию модели. Оценка продукта здесь не выводится.

Область оценки
Модели text-to-image
Что измеряется
Опубликованная методика оценки

Hugging Face & contributors

Open ASR Leaderboard

Hugging Face & contributors · Только модели распознавания речи. Что измеряется: Точность и скорость транскрипции. Сопоставляет ошибку распознавания и скорость; не оценивает итоги встреч и интеграции.

Область оценки
Только модели распознавания речи
Что измеряется
Точность и скорость транскрипции

Datacurve

DeepSWE

Datacurve · Агенты программирования через mini-swe-agent. Что измеряется: Успех в длительных инженерных задачах. Оценивает передовые агенты на 113 длительных задачах в 91 репозитории и пяти языках.

Область оценки
Агенты программирования через mini-swe-agent
Что измеряется
Успех в длительных инженерных задачах