Evalboard
Chargement...

Trois sources agrégées

Evalboard

6sources
--modèles
--comparables
--écart de coût
Roboflow Vision Evals Six tâches de vision corrigées contre une vérité terrain : détection, comptage, identification, OCR, extraction, raisonnement. Synchronisé via data.js
SimpleBench 213 questions de raisonnement de bon sens (simple-bench.com). Première source du score Knowledge. Synchronisé via data.js
AA-Omniscience — Accuracy 6 000 questions factuelles sur 6 domaines (droit, santé, business, SWE, sciences, humanités). Taux de bonnes réponses mesuré par Artificial Analysis. Deuxième source du score Knowledge. Synchronisé via data.js
Humanity's Last Exam 2 500 questions académiques de niveau expert, relevé Artificial Analysis. Troisième source du score Knowledge. Synchronisé via data.js
DataCurve DeepSWE v1.1 113 tâches de génie logiciel en environnement isolé (SWE-bench frontier). Taux de résolution pass@1. Ancre le classement combiné et l'onglet Codage. Synchronisé via data.js
Code Migration — vals.ai Migration de code applicatif : portages CLI, modernisation COBOL et qualité du code produit, joués par un agent. Seconde source du score Codage. Synchronisé via data.js

Filtrer

Sélection des benchmarks (Moyenne générale) ⚠️ Au moins 1 benchmark doit rester actif
3 / 3 benchmarks inclus
Combinaisons rapides :
(exclut les modèles sans note sur l'un des benchmarks actifs)

Chargement des données depuis data.json...

La ligne relie les modèles non dominés