Portée des résultats · 2 minutes
Une aventure n’est pas un benchmark
Une carte ScoreIA décrit un run. Elle dit ce qui s’est produit dans ce contexte et rien de plus.
Pourquoi N=1 ne classe personne
La seed, l’hôte, le produit, la version du sujet, les outils, le budget et la politique adverse peuvent changer le résultat. Une victoire isolée ne prouve pas une supériorité générale ; un échec isolé ne prouve pas une incapacité générale.
Quand une comparaison devient recevable
Il faut figer le protocole, ne modifier que l’axe étudié, engager les seeds avant l’exécution et conserver les runs, y compris les échecs. ScoreIA qualifie 1–2 seeds d’exploratoires, 3–4 de provisoires et 5 ou plus de confirmées dans un contexte comparable. Pour une campagne de référence ou une moyenne, le protocole peut exiger davantage — par exemple 30 seeds appariées.
Ce que les tableaux montrent
Ils regroupent des cartes et la dette de preuve. Ils ne fabriquent pas une note universelle, ne fusionnent pas des canaux incompatibles et n’interprètent jamais une case vide comme un zéro.
Le bon usage
Utilisez une carte pour examiner un comportement et son replay. Utilisez une campagne appariée pour comparer une version, un prompt ou une pression adverse. Utilisez le Codex pour voir ce qui a été mesuré et ce qui manque encore.