Le résultat

La simulation produit 64 résultats non incertains sur 72 et 8 états incertains. Elle évite les faux résultats favorables, mais conserve trois faux négatifs et transforme des désaccords en abstentions.

Le trade-off

Le coût moyen simulé est inférieur à Sonnet seul parce que le vérificateur n’est déclenché que conditionnellement. En revanche, la réserve P90 du workflow peut être plus élevée et le signal pédagogique s’est dégradé.

Ce que nous conservons

Le désaccord a de la valeur : il signale un cas où LearnX doit s’abstenir. Mais le modèle ne doit plus être l’autorité qui attribue directement le niveau.