Bağımsız benchmarklar, açık kapsam.

Değerlendirmelerin neyi ölçtüğünü, hangi modelleri kapsadığını ve sonuçların nerede geçerli olduğunu incele.

Artificial Analysis

Artificial Analysis · video evaluations

Artificial Analysis · Metinden videoya modeller. Ne ölçüyor?: Yayınlanan değerlendirme yöntemi. Sonuçları bir araca uygulamadan önce yayıncının yöntemini, görev kapsamını ve test edilen model sürümünü inceleyin. Buradan bir araç puanı türetilmez.

Kapsam
Metinden videoya modeller
Ne ölçüyor?
Yayınlanan değerlendirme yöntemi

VBench team

VBench Leaderboard

VBench team · Metinden videoya modeller. Ne ölçüyor?: Kalite ve tutarlılık boyutları. Görsel kalite, hareket ve tutarlılığı çok boyutlu ele alan video benchmarkı.

Kapsam
Metinden videoya modeller
Ne ölçüyor?
Kalite ve tutarlılık boyutları

Artificial Analysis

Artificial Analysis · speech evaluations

Artificial Analysis · Metinden sese sağlayıcılar. Ne ölçüyor?: Yayınlanan değerlendirme yöntemi. Sonuçları bir araca uygulamadan önce yayıncının yöntemini, görev kapsamını ve test edilen model sürümünü inceleyin. Buradan bir araç puanı türetilmez.

Kapsam
Metinden sese sağlayıcılar
Ne ölçüyor?
Yayınlanan değerlendirme yöntemi

TTS-AGI & contributors

Speech synthesis evaluation sources

TTS-AGI & contributors · Metinden sese modeller. Ne ölçüyor?: Yayınlanan değerlendirme yöntemi. Sonuçları bir araca uygulamadan önce yayıncının yöntemini, görev kapsamını ve test edilen model sürümünü inceleyin. Buradan bir araç puanı türetilmez.

Kapsam
Metinden sese modeller
Ne ölçüyor?
Yayınlanan değerlendirme yöntemi

BigCode project

BigCodeBench

BigCode project · Kod üreten modeller; editörler değil. Ne ölçüyor?: Pratik kodlama görevi tamamlama. Modelleri çok kütüphaneli görevlerde ölçer; Cursor, Windsurf veya Bolt ürünlerini sıralamaz.

Kapsam
Kod üreten modeller; editörler değil
Ne ölçüyor?
Pratik kodlama görevi tamamlama

Artificial Analysis

Artificial Analysis · image evaluations

Artificial Analysis · Metinden görsele modeller. Ne ölçüyor?: Yayınlanan değerlendirme yöntemi. Sonuçları bir araca uygulamadan önce yayıncının yöntemini, görev kapsamını ve test edilen model sürümünü inceleyin. Buradan bir araç puanı türetilmez.

Kapsam
Metinden görsele modeller
Ne ölçüyor?
Yayınlanan değerlendirme yöntemi

Hugging Face & contributors

Open ASR Leaderboard

Hugging Face & contributors · Yalnızca konuşma tanıma modelleri. Ne ölçüyor?: Transkripsiyon doğruluğu ve hızı. ASR modellerinde kelime hata oranını hızla karşılaştırır; özetleri, görevleri veya entegrasyonları ölçmez.

Kapsam
Yalnızca konuşma tanıma modelleri
Ne ölçüyor?
Transkripsiyon doğruluğu ve hızı

Datacurve

DeepSWE

Datacurve · mini-swe-agent üzerinden çalışan kodlama ajanları. Ne ölçüyor?: Uzun süreli mühendislik görev başarısı. Öncü kodlama ajanlarını 91 depo ve beş dilde 113 özgün, uzun süreli mühendislik göreviyle ölçer.

Kapsam
mini-swe-agent üzerinden çalışan kodlama ajanları
Ne ölçüyor?
Uzun süreli mühendislik görev başarısı