Recherche & méthodologie
Programme de recherche sur la correction formative assistée
Protocoles, résultats expérimentaux et arbitrages méthodologiques de LearnX, publiés par étape et conservés dans leur contexte d’origine.
Dernière mise à jour : 24 août 2026. Les campagnes utilisent des cas synthétiques ; aucune donnée apprenant réelle ni validation humaine n’est revendiquée.
Évaluation Writing sous protocole scellé : résultats et décision de déploiement borné
Sur 72 workflows, l’exécution est techniquement complète mais les gates pédagogiques échouent : 80,19 % d’accord critériel, 7 faux PASS et un écart ordinal de deux niveaux.
Lire l’article →Corriger les seuils, puis accepter le refus du holdout
Une arithmétique mal adaptée transformait 1 % en tolérance zéro. Après correction, Sonnet franchit le développement et la revue aveugle, puis échoue honnêtement sur l’examen scellé.
Lire l’article →Ce qui fonctionnait, ce qui bloquait encore
Le probe Gemini a isolé un incident de transport et de réconciliation. La méthode progressait, mais aucun verdict pédagogique n’était encore possible.
Lire l’article →Du LLM juge au moteur de rubrique exécutable
Les modèles cherchent ou contestent des preuves exactes ; LearnX applique ensuite des règles versionnées et peut s’abstenir honnêtement.
Lire l’article →Pourquoi deux modèles ne suffisent pas à créer la vérité
La cascade Mistral + Sonnet réduit certains risques techniques mais crée encore des faux FAIL et des abstentions. Le désaccord devient un signal, pas un arbitre.
Lire l’article →Comparer les modèles sans confondre conformité et pédagogie
Le benchmark 24 × 3 révèle les forces de Mistral, Sonnet et Gemini, mais aussi les faux verdicts et les limites d’un modèle qui choisit directement un niveau.
Lire l’article →Consulter le rapport technique complet
Le dossier conserve les tableaux, coûts, gates, modèles explorés, changements de protocole et limites dans leur niveau de détail maximal.
Ouvrir le dossier →