Comment nous testons
Cette page indique exactement ce que DeAIze mesure, comment une réécriture est acceptée, et comment lire les chiffres que nous publions. Elle est rédigée pour que quiconque puisse vérifier nos affirmations par rapport à son propre texte.
1. Ce qu'est un score de détection
Les détecteurs ne détectent pas la paternité ; ils détectent une régularité statistique. Le texte généré par machine tend à être plus prévisible que l'écriture humaine — perplexité plus faible, rythme de phrase plus plat, moins de surprises lexicales. Chaque score que vous voyez, y compris le nôtre, est une estimation de probabilité issue de ce signal, et non une mesure de qui a écrit le texte.
2. Notation au niveau de la phrase
Un score unique pour un document ne vous dit rien sur l'endroit où se situe le problème. Mettez en évidence les traces d'IA par phrase — identifiez précisément les lignes à réécrire. Les scores par phrase sont ce sur quoi agit la boucle de réécriture, et ce que l'atelier met en évidence.
3. La boucle fermée
Réécrivez, comparez avec votre sens d'origine et conservez la version qui vous ressemble. Une proposition de réécriture n'est acceptée que lorsque la similarité sémantique avec l'original dépasse un seuil, ce qui explique pourquoi le sens est préservé et pourquoi l'outil signale un « remboursement automatique en cas de non-modification » lorsqu'il ne peut pas améliorer un passage plutôt que d'inventer une modification.
4. Vérifications croisées des détecteurs
Une prédiction issue de notre propre modèle ne constitue pas une preuve. Lorsqu'une API de détecteur est configurée, l'étape de vérification envoie le texte réécrit au détecteur réel et enregistre ce résultat. Le nombre de ces exécutions est publié sur la page de statistiques afin que le nombre de vérifications tierces qui sous-tendent nos chiffres soit visible. Un taux de réussite déclaré ne constitue pas une vérification croisée : seules les exécutions réellement envoyées à une API de détecteur sont comptabilisées ici.
5. Ce que signifie le « score humain prédit »
Il s'agit de l'estimation de notre propre modèle sur le caractère humain de la lecture du résultat — une mesure directionnelle pour suivre l'amélioration, et non un score officiel provenant d'un détecteur tiers. Lorsque nous citons un chiffre tiers (GPTZero, Turnitin, Copyleaks, Originality.ai, Sapling), nous le précisons et, lorsque nous le pouvons, enregistrons l'exécution comme vérification croisée.
Scores humains déclarés par les détecteurs. Les scores humains affichés sur la page d'accueil et sur la page de statistiques sont des chiffres de première partie que DeAIze déclare pour sa propre sortie de réécriture. Les fournisseurs de détecteurs ne les publient pas et ne les ont pas audités, et ils ne constituent pas une garantie pour un document individuel. L'indicateur de rédaction IA de Turnitin n'a pas d'API de notation publique, donc l'entrée Turnitin n'est pas une lecture d'API en direct ; les quatre autres peuvent être réexécutés via leurs API publiques, et ces exécutions sont comptabilisées comme vérifications croisées au §4. Nous datons les chiffres et nous ne les présentons pas comme un benchmark indépendant.
6. Limites et divulgation
- Les scores des détecteurs varient selon la version, la langue, la longueur du texte et le domaine. Un chiffre sans date ni version de détecteur n'est pas reproductible, c'est pourquoi nous datons nos chiffres publiés.
- Les performances en langues autres que l'anglais sont plus faibles qu'en anglais, et les textes courts sont plus bruités que les longs.
- Lorsque nous publions un benchmark, il comporte sa taille d'échantillon, sa date de test et les versions des détecteurs. Les scores humains affichés sur la page d'accueil sont étiquetés comme des chiffres rapportés par des tiers et non comme un benchmark audité, car c'est ce qu'ils sont.
- Les faux positifs sont réels et nuisibles. Si un détecteur signale votre propre écriture, humaniser votre brouillon est une réponse légitime à un gardien probabiliste — dénaturer le travail de quelqu'un d'autre ne l'est pas.
Corrections
Si un chiffre ici ne peut pas être reproduit, dites-le-nous et nous le corrigerons : [email protected].