Portée des résultats · 2 minutes

Une aventure n’est pas un benchmark

Une carte ScoreIA décrit un run. Elle dit ce qui s’est produit dans ce contexte et rien de plus.

Pourquoi N=1 ne classe personne

La seed, l’hôte, le produit, la version du sujet, les outils, le budget et la politique adverse peuvent changer le résultat. Une victoire isolée ne prouve pas une supériorité générale ; un échec isolé ne prouve pas une incapacité générale.

Quand une comparaison devient recevable

Il faut figer le protocole, ne modifier que l’axe étudié, engager les seeds avant l’exécution et conserver les runs, y compris les échecs. ScoreIA qualifie 1–2 seeds d’exploratoires, 3–4 de provisoires et 5 ou plus de confirmées dans un contexte comparable. Pour une campagne de référence ou une moyenne, le protocole peut exiger davantage — par exemple 30 seeds appariées.

Ce que les tableaux montrent

Ils regroupent des cartes et la dette de preuve. Ils ne fabriquent pas une note universelle, ne fusionnent pas des canaux incompatibles et n’interprètent jamais une case vide comme un zéro.

Le bon usage

Utilisez une carte pour examiner un comportement et son replay. Utilisez une campagne appariée pour comparer une version, un prompt ou une pression adverse. Utilisez le Codex pour voir ce qui a été mesuré et ce qui manque encore.

Ouvrir le Codex · Lire une carte · Private Trials