Corpus et premières comparaisons
24 cas synthétiques français couvrant écriture, réflexion, pratique et projet, avec cas réussis, partiels, erronés, ambigus, hors sujet et injectés.
LearnX · Dossier de recherche V4
État documenté des essais de modèles, des limites rencontrées et du passage vers un moteur où l’IA cherche des preuves tandis que LearnX applique la grille.
Les campagnes ont montré que des modèles utiles peuvent rester instables aux frontières et propager une même lacune entre plusieurs critères. LearnX formalise donc la grille : les modèles repèrent ou contestent des preuves, puis des règles versionnées déterminent les niveaux.
L’IA cherche les preuves. LearnX exécute la grille et s’abstient lorsque le résultat ne peut pas être déterminé honnêtement.
Chaque campagne est conservée comme une étape de recherche. Le protocole a retiré progressivement au modèle la note, la décision et le feedback libre pour transférer ces responsabilités à LearnX.
24 cas synthétiques français couvrant écriture, réflexion, pratique et projet, avec cas réussis, partiels, erronés, ambigus, hors sujet et injectés.
Séparation des erreurs fournisseur, sorties invalides, citations inventées, injection, variabilité et décision pédagogique. Création d’un holdout scellé jamais ouvert.
Le modèle ne produit plus de score ni de verdict. Cette campagne a confirmé l’intérêt d’une autorité serveur, tout en laissant encore trop de jugement et de feedback au modèle.
LearnX compile 3 critères et 9 éléments atomiques, vérifie leurs propriétaires, exécute les règles de niveau et sélectionne des remédiations authorées.
Le gate v2 réussit 3/3 cas sémantiques uniques. Le panel 10×2 s’arrête après 10/20 workflows valides — 5/10 cas uniques couverts deux fois — puis une citation non exacte au 11e appel. Cette configuration est NO-GO.
Le screening réussit 3/3 cas uniques, 27/27 statuts et 17 citations exactes. Le panel s’arrête après 10/20 workflows valides — 5/10 cas uniques couverts deux fois — lorsque le 11e appel consomme 2 500 tokens de raisonnement et n’émet aucun token visible.
Une nouvelle identité réserve 1 024 tokens au raisonnement et 1 800 à la sortie visible, soit 2 824 au total. Le premier et seul appel produit 758 tokens visibles, mais 1 082 tokens de raisonnement — 58 de trop, soit +5,66 %. Le gate s’arrête avant le deuxième cas : 1/4 appel, 0/4 workflow validé.
LearnX découpe la réponse et attribue des identifiants opaques aux passages. Le modèle ne cite plus librement : il propose seulement une relation pour, contre ou une abstention. Ces relations restent candidates et ne peuvent produire ni score, ni niveau, ni progression.
Le cas positif atteint 9/9 relations. Sur le cas négatif, Sonnet signale une preuve explicite contre une recommandation là où le gold attend seulement « non démontré » : 7/9, puis arrêt obligatoire. Deux appels sur quatre, coût exact 0,025622 USD, mutation et injection non envoyées.
La campagne est close sans replay. La prochaine étape est hors ligne : distinguer absence de preuve, réfutation explicite, contradiction et ambiguïté, puis créer une nouvelle identité. Tester davantage de modèles avec une frontière ambiguë ne produirait pas une comparaison fiable.
Chaque niveau répond à une question différente. Réussir un premier test prouve seulement que le modèle peut dialoguer avec notre système ; cela ne suffit jamais à le sélectionner.
| Terme | Définition simple | Ce que cela permet de conclure |
|---|---|---|
| Smoke test | Un test très court sur un seul cas représentatif. Il vérifie que la route fournisseur, le modèle et le format de réponse fonctionnent ensemble. | Le modèle peut tenter le test suivant. Cela ne prouve pas encore sa qualité pédagogique. |
| Gate | Une courte série préenregistrée de cas différents, avec arrêt au premier défaut. Le dernier gate prévoyait quatre cas : positif, négatif, mutation et injection. | Le profil peut passer à un panel plus discriminant uniquement si tous les cas passent. Un arrêt précoce ne constitue ni une promotion ni un verdict global sur le modèle. |
| Série de smokes | Trois cas successifs : une réponse clairement réussie, une réponse ambiguë et une tentative d’injection. L’essai s’arrête au premier défaut important. | Le modèle semble techniquement compatible et assez sûr pour un petit panel. |
| Mini-panel | Un petit ensemble prédéfini, généralement six réponses variées, soumis à une revue pédagogique aveugle séparée de l’exécution. | Il détecte rapidement les erreurs de jugement, de ton ou de grille avant une campagne coûteuse. |
| Panel 10×2 | 10 cas sémantiques uniques, chacun répété deux fois : 20 workflows au maximum. Les 10 répétitions servent à mesurer la stabilité, pas à prétendre disposer de 20 situations différentes. | Il confronte le chercheur à des mutations de preuve, des réponses négatives et des injections avant tout élargissement. |
| Full panel | La campagne complète sur tout le corpus de développement. Dans notre cas, elle couvre les 24 réponses étalonnées. | Elle mesure la qualité sur toutes les familles prévues, mais pas encore la généralisation à des cas inconnus. |
| 24×3 | Les mêmes 24 réponses sont évaluées trois fois, soit 72 runs logiques. Les répétitions ne servent pas à gonfler l’échantillon : elles mesurent la stabilité. | On observe à la fois les erreurs moyennes et les changements de jugement sur une réponse identique. |
| Holdout scellé | Un second corpus jamais utilisé pour régler le prompt ou choisir les seuils. Son contenu reste fermé jusqu’à ce que la configuration soit figée. | Il vérifie si la solution se généralise sans avoir appris les réponses du corpus de développement. |
Règle de lecture. Un résultat est toujours présenté sous la forme n/N. Un panel 10×2 terminé représente 10 cas sémantiques uniques et 20 workflows ; un full 24×3 représente 24 cas uniques et 72 workflows. Les répétitions mesurent la stabilité, elles n’augmentent pas la diversité sémantique.
Mistral est robuste et économique mais a surévalué trois réponses. Sonnet est plus conservateur, sans faux positif observé, mais refuse davantage de réponses recevables et connaît plus d’incidents de format.
| Configuration | Sorties utilisables | Faux positifs | Faux négatifs certains | Limite principale |
|---|---|---|---|---|
| Mistral seul | 72 / 72 | 3 | 5 | Surévaluation de certaines réponses partielles |
| Sonnet seul | 71 / 72 | 0 | 6 | Sévérité et invalidité finale observée |
| Cascade ciblée simulée | 64 décisions non incertaines / 72 | 0 | 3 | 8 désaccords à présenter sans fausse certitude |
Limite de comparaison. La cascade est une simulation rétrospective obtenue avec des campagnes qui n’utilisaient pas exactement le même prompt ni le même protocole. Elle guide l’architecture mais ne constitue pas une preuve de promotion ni une base tarifaire définitive.
| Campagne | Couverture | Résultat exact | Décision |
|---|---|---|---|
| Gemini · gate v2 | 3/3 cas uniques · 3/3 workflows | 27/27 éléments couverts ; négatif et injection conformes | Gate valide uniquement ; autorisation de préparer le panel, aucune promotion |
| Gemini · panel v2 10×2 | 5/10 cas uniques · 10/20 workflows valides, puis arrêt au 11e appel | Citation non exacte rejetée par LearnX ; 9/20 workflows non appelés ; coût 0,04345875 USD | NO-GO réel de cette configuration ; campagne close sans reprise |
| Sonnet 5 · screening | 3/3 cas uniques · 3/3 workflows | 27/27 statuts, 17 citations exactes, injection sûre | Screening réussi ; pas une promotion |
| Sonnet 5 · panel 10×2 | 5/10 cas uniques · 10/20 workflows valides et concordants, puis arrêt au 11e appel | 2 500 tokens de raisonnement, 0 token visible ; 9/20 workflows non appelés ; coût 0,287208 USD | NO-GO technique du profil de requête, sans verdict pédagogique négatif sur Sonnet 5 |
| Sonnet 5 · gate borné 4 cas | 1/4 appel · 0/4 workflow validé · 0 répétition | Maximum raisonnement 1 024 + réserve visible 1 800 = total 2 824 ; usage observé 1 082 raisonnement (+58 / +5,66 %), 758 visible, total 1 840 ; route et fournisseur Anthropic ; coût 0,026104 USD | NO-GO technique du nouveau profil ; arrêt avant le deuxième appel et aucun verdict pédagogique sur Sonnet 5 |
| Sonnet 5 · evidence-assist 3.0 | 2/4 appels · 1/4 workflow entièrement concordant · arrêt avant mutation et injection | Positif 9/9 ; négatif 7/9 ; cumul 16/18. Deux relations « contre » jugées divergentes face à un gold « non démontré ». Coût 0,025622 USD, réconciliation 100 %, aucun faux support observé. | NO-GO sémantique de cette identité. Le stop est valide, mais la divergence révèle une ontologie incomplète plutôt qu’une erreur pédagogique évidente du modèle. |
État au 20 août 2026. Ces résultats restent de la recherche intermédiaire : 0 pipeline promu, 0 contrat publié, 0 runtime actif. La sécurité du dernier gate n’a pas été démontrée contre l’injection, puisque ce cas n’a pas été envoyé. Les coûts sont des dépenses de recherche réconciliées, jamais un prix utilisateur.
Les modèles n’ont pas tous atteint le même niveau d’évaluation. Le tableau distingue les campagnes complètes, les panels, les smokes techniques et les modèles seulement examinés dans le catalogue.
| Modèle | Niveau de preuve | Résultat observé | Enseignement |
|---|---|---|---|
| Mistral Medium 3.5 | Plusieurs panels et full 24×3 | 72/72 sorties utilisables ; 3 faux positifs et 5 faux négatifs sur la campagne 1.6 | Baseline économique conservée ; NO-GO comme juge et pipeline Mistral–Sonnet non requalifié. |
| Claude Sonnet 4.6 | Panels et full 24×3 sous protocole 3.0.1 | 0 faux positif, 6 faux négatifs, 1 run finalement inutilisable | Baseline conservatrice conservée ; NO-GO comme juge et aucun rôle de falsificateur accordé sans nouvelle preuve. |
| Gemini 3.6 Flash | Full historique ; gate chercheur 3/3 ; panel 10×2 interrompu | Gate v2 3/3 valide, puis 10/20 workflows valides avant une citation non exacte au 11e appel ; coût 0,04345875 USD | NO-GO réel de la configuration panel v2. Les dix résultats simples restent historiques mais ne compensent pas le défaut de preuve. |
| Claude Sonnet 5 | Screening 3/3 ; panel 10×2 interrompu ; gate borné 1/4 ; gate evidence-assist 2/4 | Le screening réussit. Deux profils techniques échouent ensuite. Sous evidence-assist 3.0, le positif fait 9/9 et le négatif 7/9 avant un arrêt sur la polarité « contre » face au gold « non démontré » ; coût 0,025622 USD. | La campagne evidence-assist est close en NO-GO, mais le dernier écart ne démontre pas une faute pédagogique évidente du modèle. La méthode doit distinguer réfutation explicite et absence de preuve. |
| GPT-5.6 Terra | Smokes techniques | Route OpenRouter structurée indisponible pour le contrat épinglé | Aucun verdict pédagogique ; pourrait nécessiter une campagne distincte via API directe. |
| GPT-5.6 Sol | Smokes séquentiels | Cas réussi valide ; cas ambigu expiré ou tronqué selon la campagne | Capable mais profil actuel trop lent/verbeux pour le contrat borné. |
| Claude Opus 4.8 | Full historique non comparable + 2 smokes protocole 3 | Deux smokes récents valides ; données historiques plus coûteuses et corpus antérieur | Référence qualitative possible, mais preuve actuelle insuffisante pour une promotion. |
| Kimi K2.5 | Premier smoke | Timeout avant résultat exploitable | Arrêt précoce conformément au budget et au gate séquentiel. |
| Command A | Premier smoke | Erreur fournisseur 400 avant sortie exploitable | Compatibilité technique non démontrée. |
| Qwen 3.7 Max | Smokes exploratoires | Sortie invalide au plafond, puis timeout | Écarté avant panel pour coût/latence sans preuve pédagogique suffisante. |
| DeepSeek V4 Flash | Catalogue uniquement | Routes structurées identifiées, aucun benchmark facturable lancé | Alternative conservée en réserve ; aucune performance revendiquée. |
Lecture correcte. Un échec de transport ou de format ne signifie pas que le modèle est pédagogiquement mauvais. Il signifie seulement qu’il n’a pas exécuté de manière fiable le contrat LearnX testé. Inversement, deux smokes réussis ne suffisent pas à démontrer une qualité de production.
La cible reste lisible : LearnX segmente la réponse ; un modèle propose des relations candidates sur ces passages ; LearnX reste l’unique autorité pour les contrôler, appliquer les règles mécaniques et produire la restitution. Le dernier gate a validé le transport mais révélé une frontière sémantique incomplète.
Les éléments, propriétaires, règles et remédiations sont compilés.
LearnX crée les passages, leurs identifiants opaques, offsets et empreintes avant l’appel.
Sonnet propose uniquement « pour », « contre » ou « abstention » sur les identifiants autorisés.
LearnX valide les relations candidates. Elles ne peuvent jamais produire directement un score, un niveau ou une progression.
LearnX choisit un feedback authoré ; aucun texte libre du modèle ni effet sur la progression.
Frontière stricte. Le modèle ne produit jamais niveau final, score, PASS/FAIL, progression ou feedback libre. La difficulté actuelle vient du vocabulaire de preuve : « rien ne démontre X » et « la réponse réfute explicitement X » ne doivent plus être confondus.
Le compilateur doit d’abord démontrer qu’aucune preuve ne peut être comptée deux fois, qu’aucun niveau n’est impossible et qu’une preuve ajoutée ne peut pas faire baisser le résultat.
Le moteur hors ligne existe et le transport evidence-assist fonctionne. Le prochain travail porte sur la qualité de l’oracle : il faut rendre la polarité négative non ambiguë avant toute nouvelle dépense.
Conserver les deux appels, le résultat 16/18, le coût et les empreintes comme preuve append-only. Ne pas envoyer mutation ou injection sous cette identité close.
Séparer clairement : démontré, explicitement réfuté, non démontré et ambigu. Une contradiction interne reste un élément dédié et ne doit pas être confondue avec la réfutation d’une proposition.
Construire des paires minimales : silence, abstention, négation explicite, contradiction et preuve positive. Vérifier que seule la relation attendue change et que les remédiations restent cohérentes.
Persister séparément tokens d’entrée, cache, raisonnement et sortie. Toute modification du mapping, de l’oracle, du runner ou du corpus crée une nouvelle identité.
Un nouveau gate exige un nouvel arbitrage Finance et un nouveau GO propriétaire. Le panel 10×2 puis le holdout one-shot restent conditionnés à un résultat 4/4.
Aucun contrat WRITING n’est publié et aucun runtime n’est activé. Le flow produit reste testable uniquement avec des certificats simulés.