Aller au contenu principal

Détection du spam par image OCR dans Telm

Comment Telm lit le texte à l’intérieur des images, reconnaît les bannières de spam connues et décode les QR codes afin que le spam par image seule soit attrapé aussi vite que le texte brut.

6 min de lecture
En bref

Les spammeurs sont passés du texte aux images parce que les bots limités aux mots-clés y sont aveugles. Telm vérifie chaque image de trois façons à la fois : un hachage perceptuel reconnaît les bannières de spam connues même après redimensionnement ou recoloration, l’OCR lit le texte imprimé à l’intérieur de l’image, et un décodeur de QR extrait les liens et numéros de téléphone cachés. Le texte extrait d’une image passe par les mêmes règles anti-spam que les messages normaux, si bien qu’une bannière de casino avec un QR code est retirée aussi vite qu’une publicité textuelle.

La gestion des images se trouve dans les Filtres de contenu ; le texte à l'intérieur des images est lu automatiquement.

Envie de configurer ça ? Faites-le directement dans votre compte Telm.

Ouvrir dans votre tableau de bord

1Pourquoi le spam se cache dans les images

Un filtre classique par mots-clés ne regarde que le texte du message, alors les spammeurs mettent plutôt leur offre dans une image : une bannière de casino, une capture d’écran d’investissement, un QR code qui mène à un canal d’arnaque. Pour un bot naïf, le message paraît vide et inoffensif.

Telm traite une image comme un contenu à lire, pas comme une pièce jointe opaque. Chaque photo est inspectée pendant que le reste des contrôles tourne, si bien que le spam par image est arrêté dans la même passe que le spam textuel.

2Comment Telm lit le texte à l’intérieur d’une image

L’OCR (reconnaissance optique de caractères) reconvertit en texte les lettres imprimées sur une image. Telm lit avec le moteur Tesseract, réglé pour les langues que votre communauté parle réellement.

Une fois le texte extrait, une image anormalement chargée de texte est traitée comme une publicité probable, et les mots récupérés sont passés à travers vos règles de spam normales. Si ces règles correspondent, l’image est scorée exactement comme un message texte qui aurait dit la même chose.

  • Lecture multilingue prête à l’emploi — anglais et russe par défaut, plus allemand, français, espagnol et CJK (chinois, japonais, coréen).
  • Une image chargée de texte (beaucoup de mots imprimés à bonne confiance) est en soi un signal de spam.
  • Le texte récupéré est revérifié au regard de la bibliothèque complète de règles, si bien que les offres cachées dans les bannières sont attrapées.
  • Les résultats sont mémorisés par empreinte d’image, si bien que la même image n’est jamais traitée deux fois.

3Trois contrôles sur chaque image

L’OCR est l’un des trois contrôles qui tournent ensemble sur chaque image. Entre eux, ils couvrent les bannières réutilisées, le texte imprimé et les liens encodés.

  • Hachage perceptuel — reconnaît une bannière de spam connue même après qu’elle a été redimensionnée, recadrée ou recolorée. Une image signalée comme spam dans un groupe est reconnue dans tous les groupes.
  • OCR — lit le texte imprimé à l’intérieur de l’image et le passe à travers les règles de spam.
  • Décodeur de QR — extrait les liens (y compris t.me, wa.me et telegram.me) et les numéros de téléphone cachés dans un QR code, et signale les cibles suspectes.
La base de données d’images de spam est mondiale : dès qu’une bannière est marquée comme spam dans un groupe protégé, Telm la connaît partout. Voir comment fonctionne la détection de spam pour le pipeline complet.

4Quand la vision IA intervient

Les contrôles rapides ci-dessus règlent d’eux-mêmes la plupart des images. Pour la véritable zone grise — une image qui n’est ni une bannière connue évidente ni manifestement propre — Telm peut escalader vers un modèle de vision IA qui décrit ce que l’image montre réellement.

Ce regard plus approfondi est réservé à ces cas limites, il n’intervient donc que lorsque les signaux plus rapides ne sont pas concluants.

Le hachage perceptuel, l’OCR et le décodage de QR tournent sur tous les plans dans le cadre du moteur central. L’escalade vers la vision IA fait partie de la modération IA, disponible sur Pro et Business.

5Ce que vous contrôlez

La détection intelligente des images ne nécessite aucune configuration — elle est active dès que le bot applique. Si votre communauté ne devrait pas publier d’images du tout, vous pouvez aussi appliquer un blocage brutal qui supprime chaque image quel qu’en soit le contenu.

Les deux approches sont indépendantes : la détection intelligente retire les images spammy tout en laissant passer les photos normales ; le filtre brutal retire toutes les images. La plupart des groupes ne veulent que la détection intelligente.

  • Détection intelligente (hachage + OCR + QR) — garde les vraies photos, retire le spam par image. Activée par défaut.
  • Bloquer toutes les images — un filtre strict pour les communautés limitées au texte. Voir filtres de contenu.
Cet article vous a-t-il été utile ?

Prêt à protéger votre groupe ?

Ajoutez Telm à votre groupe Telegram et laissez-le gérer le spam.