Alle Beiträge
4 Min. Lesezeit

Die KI-Moderation hat Einstellungen bekommen

Eigene Regeln in normalen Worten statt nur fertiger Themen, eine eigene Strafe je Thema, Kontrolle über den Guthabenverbrauch und automatisches Aufladen.

Die KI-Moderation startete mit sechs fertigen Themen — Betrug, Phishing, Glücksspiel und Konsorten. Das deckt ab, was allen im Weg steht, aber jeder Chat hat seine eigene Liste unpassender Dinge, und die deckt sich selten mit fremden. In anderthalb Monaten hat der Block alles bekommen, was ihm fehlte.

Eigene Regeln in normalen Worten#

Die wichtigste Ergänzung. Im Tab „Regeln" können Sie den eingebauten Themen eigene hinzufügen. Eine Regel ist die Beschreibung dessen, was zu fangen ist, kein Befehl an den Bot: Was mit einem Treffer geschieht, entscheidet die Strafkette, wie in allen anderen Blöcken.

Geschrieben wird sie als normaler Text, ohne Syntax — keine Klammern, keine Verknüpfungen, kein Escaping:

  • Nachrichten mit Schimpfwörtern oder Beleidigungen;
  • Job- und Verdienstangebote, auch „schreib mir privat" und Links zu Jobkanälen;
  • Verkaufsanzeigen für alles außer Angelzubehör und Köder;
  • Geldsammlungen, Kartendaten und Bitten um Überweisungen;
  • Diskussionen über Politik, Wahlen und Kriegsnachrichten;
  • Werbung für fremde Chats und Kanäle, Einladungen in andere Communities;
  • persönliche Angriffe, also über Mitglieder statt über ihre Nachrichten reden.

Ausnahmen stehen an derselben Stelle und in denselben Worten: „vom eigenen Job erzählen ist kein Verstoß". Das Modell versteht Ihre Formulierung wie ein eingebautes Thema und fängt sie ebenso in jeder Umformulierung.

Eine wichtige Einschränkung: Das Modell sieht nur die Nachricht selbst. Es weiß nicht, worum es in Ihrem Chat geht, wer geschrieben hat und welcher Tag ist. Formulierungen wie „nicht zum Chatthema passend" oder „Offtopic" sind für es leer — zählen Sie konkret auf, was als Verstoß gilt. Pro Regel stehen 500 Zeichen zur Verfügung, das reicht mit Reserve.

Reihenfolge, Empfindlichkeit und Simulator#

Ihre Regeln werden in einer eigenen Anfrage geprüft und nur, wenn die Nachricht in keinem der eingebauten Betrugsthemen gelandet ist — und zwar von oben nach unten, in der von Ihnen gesetzten Reihenfolge. Die Reihenfolge ändern Pfeile, sodass eine wichtigere Regel nach oben rücken kann.

Jede Regel hat ihre eigene Empfindlichkeit: „Genau" reagiert nur, wenn das Modell sicher ist, „Empfindlich" auch bei mittlerer Sicherheit. Für Schimpfwörter passt die zweite, für „persönliche Angriffe" eher die erste.

Um eine Formulierung zu prüfen, ohne auf echten Spam zu warten, gibt es den Simulator: Sie fügen eine Beispielnachricht ein und sehen, welche Regel gegriffen hätte. Strafen werden dabei nicht verhängt, aber die Prüfung wird wie eine normale Nachricht vom Guthaben abgebucht, und eingebaute Themen nehmen am Simulator nicht teil — nur Ihre Regeln.

Eine eigene Strafe je Regel und Thema#

Eine Regel hat einen Namen und lebt fortan für sich: eigene Strafkette, eigener Verstoßzähler, eigene Zeile im Protokoll. Dasselbe haben die eingebauten Themen bekommen: Für Phishing kann sofort gesperrt werden, für Glücksspielwerbung reicht eine Verwarnung, und diese Verstöße addieren sich nicht zu einem Zähler.

Im Moderationsprotokoll steht jetzt statt eines allgemeinen „KI-Moderation hat gegriffen" der Name der konkreten Regel oder des Themas. Solange keine Strafen gesetzt sind, greift eine Regel nicht — und das Dashboard sagt es klar, statt eine stumme Regel eingeschaltet zu lassen.

Den Verbrauch im Griff#

Der Block kostet nach Nutzung, deshalb gibt es jetzt Einstellungen, die entscheiden, ob das Modell überhaupt gerufen wird:

  • Mindestlänge der Nachricht — „ok" und „danke" erreichen das Modell gar nicht erst;
  • nicht prüfen, was schon gefangen wurde — hat die Nachricht bereits ein Phrasen-, Link-, Regex- oder Längenfilter abgefangen, wird das Modell standardmäßig nicht gerufen; ein eigenes Häkchen erzwingt die Prüfung trotzdem und kann eine zweite, unabhängige Strafe auslösen;
  • Alben — werden separat eingeschaltet, denn ein Album aus zehn Fotos sind zehn Prüfungen, nicht eine.

Auch bei den Regeln gilt: nur so viele wie nötig. Jede nimmt an der Prüfung jeder Nachricht teil und macht die Verarbeitung teurer. Daher liegt die Grenze bei zwanzig Regeln pro Chat, und das Dashboard warnt vor steigenden Kosten, statt still mehr abzubuchen.

Für Wiederholungen zahlen Sie nicht doppelt#

Dieselbe Nachricht verschicken Spammer in Dutzenden Kopien. Für jede Kopie zu zahlen ergibt keinen Sinn, deshalb kostet die Prüfung identischen Textes nur einmal: Eine Wiederholung bekommt die fertige Antwort und erreicht das Modell nicht. Im Guthabenverlauf sind solche Prüfungen eigens markiert, sodass die Ersparnis sichtbar ist.

Automatisches Aufladen#

Ein Guthaben, das nachts leer wird, bedeutet einen Chat ohne KI-Moderation bis zum Morgen. Jetzt lassen sich Schwelle und Betrag festlegen — nähert sich der Rest der Untergrenze, lädt sich das Guthaben selbst auf. Eine Benachrichtigung bei niedrigem Stand kommt ohnehin.

Weiterlesen