Todas las publicaciones
4 min de lectura

La moderación con IA se llenó de ajustes

Reglas propias en lenguaje corriente en lugar de solo temas listos, una sanción por cada tema, control del gasto de saldo y recarga automática.

La moderación con IA salió con seis temas listos: estafas, phishing, apuestas y compañía. Eso cubre lo que molesta a todo el mundo, pero cada chat tiene su propia lista de lo que no encaja, y rara vez coincide con la ajena. En mes y medio el bloque ganó todo lo que le faltaba.

Reglas propias en lenguaje corriente#

La incorporación principal. En la pestaña «Reglas» puedes añadir las tuyas junto a los temas integrados. Una regla es la descripción de lo que hay que capturar, no una orden al bot: qué se hace con lo encontrado lo decide la cadena de sanciones, igual que en el resto de bloques.

Se escribe en texto corriente, sin sintaxis: ni paréntesis, ni conectores, ni escapes:

  • mensajes con palabrotas o insultos;
  • ofertas de trabajo y de ingresos, incluido «escríbeme por privado» y enlaces a canales de empleo;
  • anuncios de venta de cualquier cosa salvo aparejos de pesca y cebo;
  • colectas de dinero, datos de tarjetas y peticiones de transferencia;
  • discusiones de política, elecciones y noticias de guerra;
  • publicidad de otros chats y canales, invitaciones a otras comunidades;
  • ataques personales: hablar de los miembros en lugar de sus mensajes.

Las excepciones se escriben en el mismo sitio y con las mismas palabras: «contar cosas del propio trabajo no es una infracción». El modelo entiende tu formulación igual que entiende un tema integrado, y la captura igual en cualquier reformulación.

Una limitación importante: el modelo solo ve el mensaje en sí. No sabe de qué va tu chat, quién escribe ni qué día es, así que formulaciones como «fuera de tema» están vacías para él: enumera en concreto qué cuenta como infracción. Cada regla dispone de 500 caracteres, y sobra.

Orden, sensibilidad y simulador#

Tus reglas se comprueban en una consulta aparte y solo si el mensaje no ha caído en ninguno de los temas de estafa integrados, y además de arriba abajo, en el orden en que las hayas colocado. El orden se cambia con flechas, así que una regla más importante puede subir.

Cada regla tiene su sensibilidad: «Preciso» reacciona solo cuando el modelo está seguro, «Sensible» también con confianza media. Para las palabrotas encaja la segunda; para los «ataques personales», más bien la primera.

Para comprobar una formulación sin esperar al spam real está el simulador: pegas un mensaje de ejemplo y ves qué regla se habría activado. No se aplican sanciones, pero la comprobación se descuenta del saldo como un mensaje normal, y los temas integrados no participan en el simulador: solo tus reglas.

Una sanción propia para cada regla y cada tema#

La regla tiene nombre y a partir de ahí vive por su cuenta: cadena de sanciones propia, contador de infracciones propio, línea propia en el registro. Lo mismo recibieron los temas integrados: por phishing se puede banear de inmediato y por publicidad de apuestas basta un aviso, y esas infracciones no se suman en un mismo contador.

En el registro de moderación ya no aparece un genérico «se activó la moderación con IA», sino el nombre de la regla o el tema concretos. Mientras no haya sanciones definidas, la regla no se activa, y el panel lo advierte abiertamente en lugar de dejar una regla muda encendida.

Control del gasto#

El bloque se paga según el uso, así que llegaron ajustes que deciden si llamar o no al modelo:

  • longitud mínima del mensaje: los «ok» y los «gracias» no llegan al modelo;
  • no revisar lo ya capturado: si el mensaje lo cortaron las frases, los enlaces, regex o la longitud, el modelo no se llama por defecto; una casilla aparte obliga a revisarlo igual y puede aplicar una segunda sanción independiente;
  • álbumes: se activan por separado, porque un álbum de diez fotos son diez comprobaciones, no una.

Con las reglas conviene lo mismo: solo las necesarias. Cada una participa en la comprobación de cada mensaje y encarece el procesamiento. Por eso hay un tope de veinte reglas por chat, y el panel avisa del aumento de coste en vez de cobrar más en silencio.

Por las repeticiones no pagas dos veces#

Los spammers envían el mismo mensaje en decenas de copias. Pagar por cada copia no tiene sentido, así que comprobar un texto idéntico cuesta como comprobarlo una vez: la repetición recibe la respuesta ya preparada y no llega al modelo. En el historial de saldo esas comprobaciones están marcadas aparte, de modo que el ahorro se ve.

Recarga automática#

Un saldo que se agota de noche significa un chat sin moderación con IA hasta la mañana. Ahora puedes fijar un umbral y un importe: cuando el resto se acerca al límite inferior, el saldo se recarga solo. El aviso de saldo bajo llega en cualquier caso.

Sigue leyendo