Bağımsız benchmarklar, açık kapsam.
Değerlendirmelerin neyi ölçtüğünü, hangi modelleri kapsadığını ve sonuçların nerede geçerli olduğunu incele.
Artificial Analysis
Artificial Analysis · Metinden videoya modeller. Ne ölçüyor?: Yayınlanan değerlendirme yöntemi. Sonuçları bir araca uygulamadan önce yayıncının yöntemini, görev kapsamını ve test edilen model sürümünü inceleyin. Buradan bir araç puanı türetilmez.
- Kapsam
- Metinden videoya modeller
- Ne ölçüyor?
- Yayınlanan değerlendirme yöntemi
VBench team
VBench team · Metinden videoya modeller. Ne ölçüyor?: Kalite ve tutarlılık boyutları. Görsel kalite, hareket ve tutarlılığı çok boyutlu ele alan video benchmarkı.
- Kapsam
- Metinden videoya modeller
- Ne ölçüyor?
- Kalite ve tutarlılık boyutları
Artificial Analysis
Artificial Analysis · Metinden sese sağlayıcılar. Ne ölçüyor?: Yayınlanan değerlendirme yöntemi. Sonuçları bir araca uygulamadan önce yayıncının yöntemini, görev kapsamını ve test edilen model sürümünü inceleyin. Buradan bir araç puanı türetilmez.
- Kapsam
- Metinden sese sağlayıcılar
- Ne ölçüyor?
- Yayınlanan değerlendirme yöntemi
TTS-AGI & contributors
TTS-AGI & contributors · Metinden sese modeller. Ne ölçüyor?: Yayınlanan değerlendirme yöntemi. Sonuçları bir araca uygulamadan önce yayıncının yöntemini, görev kapsamını ve test edilen model sürümünü inceleyin. Buradan bir araç puanı türetilmez.
- Kapsam
- Metinden sese modeller
- Ne ölçüyor?
- Yayınlanan değerlendirme yöntemi
BigCode project
BigCode project · Kod üreten modeller; editörler değil. Ne ölçüyor?: Pratik kodlama görevi tamamlama. Modelleri çok kütüphaneli görevlerde ölçer; Cursor, Windsurf veya Bolt ürünlerini sıralamaz.
- Kapsam
- Kod üreten modeller; editörler değil
- Ne ölçüyor?
- Pratik kodlama görevi tamamlama
Artificial Analysis
Artificial Analysis · Metinden görsele modeller. Ne ölçüyor?: Yayınlanan değerlendirme yöntemi. Sonuçları bir araca uygulamadan önce yayıncının yöntemini, görev kapsamını ve test edilen model sürümünü inceleyin. Buradan bir araç puanı türetilmez.
- Kapsam
- Metinden görsele modeller
- Ne ölçüyor?
- Yayınlanan değerlendirme yöntemi
Hugging Face & contributors
Hugging Face & contributors · Yalnızca konuşma tanıma modelleri. Ne ölçüyor?: Transkripsiyon doğruluğu ve hızı. ASR modellerinde kelime hata oranını hızla karşılaştırır; özetleri, görevleri veya entegrasyonları ölçmez.
- Kapsam
- Yalnızca konuşma tanıma modelleri
- Ne ölçüyor?
- Transkripsiyon doğruluğu ve hızı
Datacurve
Datacurve · mini-swe-agent üzerinden çalışan kodlama ajanları. Ne ölçüyor?: Uzun süreli mühendislik görev başarısı. Öncü kodlama ajanlarını 91 depo ve beş dilde 113 özgün, uzun süreli mühendislik göreviyle ölçer.
- Kapsam
- mini-swe-agent üzerinden çalışan kodlama ajanları
- Ne ölçüyor?
- Uzun süreli mühendislik görev başarısı