Todas as publicações
4 min de leitura

A moderação com IA ganhou configurações

Regras suas em linguagem comum em vez de apenas temas prontos, uma punição por tema, controle do gasto de saldo e recarga automática.

A moderação com IA estreou com seis temas prontos: golpes, phishing, apostas e companhia. Isso cobre o que atrapalha todo mundo, mas cada chat tem a própria lista do que não cabe, e ela raramente coincide com a dos outros. Em um mês e meio o bloco ganhou tudo o que lhe faltava.

Regras suas em linguagem comum#

O acréscimo principal. Na aba «Regras» dá para somar as suas aos temas embutidos. Uma regra é a descrição do que deve ser capturado, não uma ordem ao bot: o que se faz com o achado quem decide é a cadeia de punições, como nos demais blocos.

Ela se escreve em texto comum, sem sintaxe: nem parênteses, nem conectores, nem escapes:

  • mensagens com palavrões ou ofensas;
  • ofertas de trabalho e de renda, inclusive «me chama no privado» e links para canais de vagas;
  • anúncios de venda de qualquer coisa, exceto material de pesca e isca;
  • vaquinhas, dados de cartão e pedidos de transferência;
  • discussões sobre política, eleições e notícias de guerra;
  • publicidade de outros chats e canais, convites para outra comunidade;
  • ataques pessoais: falar dos membros em vez de falar das mensagens deles.

As exceções se escrevem no mesmo lugar e com as mesmas palavras: «contar sobre o próprio trabalho não é infração». O modelo entende sua formulação como entende um tema embutido, e a captura do mesmo jeito em qualquer reformulação.

Uma limitação importante: o modelo só vê a mensagem em si. Ele não sabe do que trata o seu chat, quem escreveu nem que dia é hoje, então formulações como «fora do tema» ficam vazias para ele — enumere concretamente o que conta como infração. Cada regra tem 500 caracteres, e sobra.

Ordem, sensibilidade e simulador#

Suas regras são verificadas numa consulta à parte e só se a mensagem não caiu em nenhum dos temas de golpe embutidos — e de cima para baixo, na ordem em que você as dispôs. A ordem se muda com setas, então uma regra mais importante pode subir.

Cada regra tem a sua sensibilidade: «Preciso» reage só quando o modelo está seguro, «Sensível» reage também com confiança média. Para palavrões cabe a segunda; para «ataques pessoais», mais a primeira.

Para conferir uma formulação sem esperar o spam real existe o simulador: você cola uma mensagem de exemplo e vê qual regra teria disparado. Nenhuma punição é aplicada, mas a verificação é debitada do saldo como uma mensagem comum, e os temas embutidos não participam do simulador — só as suas regras.

Uma punição própria para cada regra e cada tema#

A regra tem nome e daí em diante vive por si: cadeia de punições própria, contador de infrações próprio, linha própria no registro. Os temas embutidos ganharam o mesmo: por phishing dá para banir de imediato e por publicidade de apostas basta um aviso, e essas infrações não se somam num contador único.

No registro de moderação agora aparece, em vez de um genérico «a moderação com IA disparou», o nome da regra ou do tema concreto. Enquanto não houver punições definidas, a regra não dispara — e o painel avisa isso abertamente, em vez de deixar uma regra muda ligada.

Controle do gasto#

O bloco é pago conforme o uso, então surgiram configurações que decidem se o modelo é chamado:

  • tamanho mínimo da mensagem — «ok» e «obrigado» não chegam ao modelo;
  • não checar o que já foi capturado — se a mensagem já foi cortada pelas frases, pelos links, por regex ou pelo tamanho, o modelo não é chamado por padrão; uma caixa à parte obriga a checar assim mesmo e pode gerar uma segunda punição independente;
  • álbuns — ligam-se separadamente, porque um álbum de dez fotos são dez verificações, não uma.

Com as regras vale o mesmo: só as necessárias. Cada uma participa da verificação de cada mensagem e encarece o processamento. Daí o teto de vinte regras por chat e o aviso do painel sobre o aumento de custo, em vez de cobrar mais em silêncio.

Por repetições você não paga duas vezes#

Os spammers mandam a mesma mensagem em dezenas de cópias. Pagar por cada cópia não faz sentido, então checar um texto idêntico custa como checar uma vez: a repetição recebe a resposta pronta e não chega ao modelo. No histórico de saldo essas verificações vêm marcadas à parte, então a economia fica visível.

Recarga automática#

Um saldo que acaba de madrugada significa chat sem moderação com IA até de manhã. Agora dá para definir um limite e um valor: quando o restante se aproxima do piso, o saldo se recarrega sozinho. O aviso de saldo baixo chega de qualquer forma.

Leia a seguir