Trois sources agrégées
Evalboard
⚙️ Paramètres de calcul interactifs
Éditeur de Configuration (CONFIG)
Ajustez les coefficients de calcul en direct pour personnaliser le classement selon vos cas d'usage. Chaque modification est enregistrée dans ce navigateur et rechargée automatiquement à la prochaine visite.
Pondération relative entre les 3 sources de la moyenne générale : Codage (DeepSWE × Migration), Vision Evals et Knowledge (SimpleBench × AA-Omniscience × HLE).
Importance de chaque tâche dans le score Composite Vision.
Gérez les modèles présents dans le classement combiné : associez les benchmarks correspondants, ajoutez de nouveaux modèles ou réaffichez ceux masqués, et supprimez/masquez les modèles non souhaités.
Sélectionnez n'importe quel modèle présent dans DeepSWE, Roboflow Vision, SimpleBench, AA-Omniscience, HLE ou Code Migration pour l'ajouter automatiquement au classement combiné :
| Modèle & Labo AI | DeepSWE | Vision Evals associé (Roboflow) | SimpleBench associé (simple-bench.com) (Knowledge) | AA-Omniscience associé (accuracy) (Knowledge) | Humanity's Last Exam associé (Knowledge) | Code Migration associé (vals.ai) (onglet Codage) | Action |
|---|
Filtrer
La ligne relie les modèles non dominés