Question de recherche

La campagne générale antérieure associait quatre familles d’activités — écriture, réflexion, pratique et projet — dont les exigences n’étaient pas suffisamment homogènes. La revue canonique a notamment confirmé un défaut éliminatoire sur les cas Practice. L’évaluation suivante a donc été restreinte à une question plus précise : le pipeline peut-il produire un feedback Writing en français qui soit techniquement exploitable, fidèle aux preuves et suffisamment concordant avec des étalons préenregistrés ?

Protocole

Le plan a été enregistré avant l’exécution. Le corpus frais comprend 24 cas Writing synthétiques, répétés trois fois, soit 72 workflows logiques. Les étalons ont été produits par deux processus d’authoring autonomes indépendants, comparés avant scellement, puis limités aux propositions convergentes selon la règle d’accord définie à l’avance. Le modèle, la route fournisseur, le prompt, le protocole, les seuils et la bande de seconde passe ont été figés avant tout appel.

Le candidat évalué est Claude Sonnet 4.6, via la route Anthropic. Une seconde passe du même modèle est déclenchée uniquement dans la bande de score préenregistrée. Aucun retry transport ni fallback fournisseur n’est autorisé.

Résultats d’exécution

Les 72 appels primaires et les six secondes passes déclenchées ont tous produit une sortie structurée valide. Aucun incident transport, coût inconnu, hallucination de preuve ou obéissance à une injection n’a été observé. Le coût fournisseur total réconcilié est de 1,551831 USD.

Résultats pédagogiques

  • accord critériel : 80,19 %, sous le minimum préenregistré de 85 % ;
  • 7 faux PASS, pour un maximum préenregistré de 0 ;
  • 1 écart ordinal de deux niveaux, pour un maximum préenregistré de 0 ;
  • taux de critères incertains : 1,85 %.

Les faux PASS concernent trois répétitions d’un cas explicatif ambigu, trois répétitions d’un plan d’action erroné et une répétition d’un plan d’action ambigu. Cette concentration indique que la difficulté ne relève pas du transport : elle porte sur la calibration des niveaux et sur la capacité du système à identifier sa propre clémence.

Interprétation et limites

L’expérience distingue deux conclusions. D’une part, le pipeline satisfait les exigences techniques de structure, de traçabilité des coûts, de sécurité face aux injections et de fidélité des citations. D’autre part, il ne franchit pas les critères pédagogiques fixés pour une promotion scientifique. Une garde déclenchée à partir du score produit par le modèle ne suffit pas à repérer toutes ses surévaluations.

La portée statistique reste limitée à 24 situations sémantiques synthétiques et à la famille Writing en français. Les trois répétitions mesurent la stabilité, mais ne constituent pas 72 situations indépendantes. L’étude ne comporte aucune donnée apprenant réelle et ne démontre ni exactitude pédagogique universelle ni validation de maîtrise.

Arbitrage de déploiement borné

À la suite de ce NO-GO, une décision produit distincte autorise un pilote limité. Cette décision ne modifie ni les résultats, ni les seuils, ni le verdict expérimental. Elle accepte un niveau de risque documenté afin d’observer l’usage réel dans un périmètre contrôlé.

  • activité writing/fr-FR, texte et faible risque uniquement ;
  • feedback strictement formatif, présenté critère par critère ;
  • score indicatif sans effet sur la validation de maîtrise ou la progression ;
  • absence de score global exact lorsqu’un critère ne peut pas être restitué de manière fiable ;
  • identité Sonnet 4.6 et route Anthropic épinglées ; même modèle pour la seconde passe ciblée ;
  • crédits offerts uniquement durant le pilote, sans vente publique de correction IA ;
  • surveillance explicite des contraintes dures ignorées et des surévaluations non détectées par la garde de score.

Conditions d’une extension

L’élargissement à d’autres familles, langues ou usages payants nécessitera un nouvel examen scellé et une réduction mesurée des faux résultats favorables. Les données du pilote serviront à caractériser couverture, abstention, incidents et réception du feedback ; elles ne remplaceront pas un corpus annoté et un protocole préenregistré.