Tous les billets
5 min de lecture

Expliquer au bot avec vos mots ce qu'il doit supprimer

Les règles d'IA s'écrivent en langage ordinaire. Comment les formuler, ce que le modèle sait d'un message et comment tester une règle dans le simulateur.

Les règles de phrases exigent d'énumérer les mots. La modération par IA procède autrement : vous décrivez en texte ordinaire ce qui compte comme infraction, et le modèle le reconnaît sous n'importe quelle formulation, y compris celles que vous n'aviez pas prévues.

On dirait qu'on peut écrire n'importe quoi. En pratique, certaines formulations fonctionnent et d'autres restent muettes, et la différence est prévisible.

Où cela se configure#

Section Modération → carte Modération par IA → onglet « Règles ». Vos règles travaillent par-dessus les thèmes intégrés : les thèmes attrapent les arnaques, le phishing et la publicité pour les jeux d'argent ; les règles, ce qui est déplacé précisément chez vous.

La carte de modération par IA avec l'onglet Règles

Une règle décrit ce qu'il faut attraper#

La première chose à comprendre : une règle est la description d'une infraction, pas une consigne au bot. Ce qu'on fait de la trouvaille, la chaîne de sanctions le décide, comme dans les autres blocs.

Donc pas « supprime les messages publicitaires », mais simplement « publicité pour des chaînes extérieures et invitations vers d'autres communautés ».

Les bonnes formulations ressemblent à ceci :

  • messages contenant des grossièretés ou des insultes ;
  • offres de travail et de revenus, y compris « écris-moi en privé » et les liens vers des chaînes d'emploi ;
  • annonces de vente de quoi que ce soit, sauf le matériel de pêche et les appâts ;
  • collectes d'argent, coordonnées bancaires et demandes de virement ;
  • discussions sur la politique, les élections et l'actualité de la guerre ;
  • attaques personnelles : parler des membres plutôt que de leurs messages.

Les exceptions s'écrivent au même endroit et dans les mêmes termes : « parler de son propre travail n'est pas une infraction ».

Ce que le modèle sait d'un message#

Seulement son texte. Ni le nom du chat, ni la description de la communauté, ni l'auteur, ni l'heure, ni ce qui a été écrit avant.

D'où l'erreur classique du débutant : des formulations comme « hors sujet », « sans rapport avec le thème du chat », « flood dans le mauvais fil ». Pour le modèle ce sont des mots vides : il n'a rien à quoi comparer. Énumérez concrètement ce qui est de trop dans votre chat.

Pour la même raison, les règles portant sur les personnes et les horaires n'ont pas de sens : « messages des nouveaux membres », « publicité le week-end ». La première se règle par le niveau de confiance ; la seconde ne se règle pas du tout.

Chaque règle dispose de 500 caractères — assez pour une description avec deux ou trois exceptions.

Sensibilité#

Chaque règle propose deux modes :

  • Précis : ne réagir que si le modèle est sûr ;
  • Sensible : réagir aussi en confiance moyenne.

La logique est simple : plus une fausse alerte coûte cher, plus le mode doit être strict. Les grossièretés se reconnaissent sans ambiguïté, le mode sensible convient. Les « attaques personnelles » sont subjectives : mieux vaut le mode précis, sinon le bot se met à nettoyer des débats normaux.

L'ordre des règles#

Les règles sont vérifiées de haut en bas, et l'ordre se change avec des flèches. La règle la plus importante et la plus étroite mérite de remonter : la première qui correspond se déclenche, et c'est son nom qui figure dans le journal.

Autre détail : vos règles s'exécutent dans une vérification distincte et seulement si le message n'est tombé dans aucun des thèmes d'arnaque intégrés. L'arnaque manifeste n'atteint pas vos règles.

Vérifiez dans le simulateur#

À côté des règles se trouve un simulateur : vous collez un exemple de message et voyez quelle règle se serait déclenchée et avec quelle confiance. Aucune sanction n'est appliquée.

Deux réserves : la vérification est débitée du solde comme un message ordinaire, et seules vos règles participent au simulateur — les thèmes intégrés n'y sont pas testés.

Un déroulé qui marche : vous écrivez la règle, vous passez au simulateur cinq ou six vrais messages de votre chat — des infractions et des messages inoffensifs qui leur ressemblent —, vous affinez la formulation et seulement ensuite vous attribuez des sanctions.

Combien de règles créer#

Moins qu'on ne voudrait. Chaque règle participe à la vérification de chaque message et renchérit le traitement ; le tableau de bord le signale franchement, et le plafond est de vingt règles par chat.

Trois à cinq suffisent en général : elles couvrent ce qui gêne vraiment, et les thèmes intégrés ramassent le reste.

Vos règles sont l'étage supérieur de la protection. Ce qui doit se trouver en dessous : Protéger un groupe Telegram du spam.

Comment écrire une règle pour la modération par IA ?

Décrivez en texte ordinaire ce qui compte comme infraction, par exemple « publicité pour des chaînes extérieures ». N'écrivez pas de consignes du type « supprime » ou « bannis » : ce qu'on fait de la trouvaille, la chaîne de sanctions le décide.

Une règle « supprimer le hors-sujet » fonctionnera-t-elle ?

Non. Le modèle ne voit que le texte du message et ignore de quoi parle votre chat, il n'a donc rien à quoi comparer. Énumérez concrètement ce qui est de trop.

Quelle différence entre « Précis » et « Sensible » ?

Le mode précis ne réagit qu'en forte confiance du modèle, le sensible réagit aussi en confiance moyenne. Pour les choses sans ambiguïté comme les grossièretés, prenez le sensible ; pour les cas subjectifs, le précis.

Combien de règles puis-je créer ?

Jusqu'à vingt par chat. Mais chaque règle renchérit le traitement de chaque message, trois à cinq suffisent donc en général.

Une vérification dans le simulateur coûte-t-elle de l'argent ?

Oui, elle est débitée du solde comme un message ordinaire. Aucune sanction n'est appliquée.

À lire ensuite