Pular para o conteúdo principal

Detecção de spam em imagem por OCR no Telm

Como o Telm lê texto dentro de imagens, reconhece banners de spam conhecidos e decodifica QR codes para que spam apenas em imagem seja pego tão rápido quanto texto simples.

6 min de leitura
Em resumo

Os spammers migraram do texto para as imagens porque bots de palavra-chave simples são cegos a elas. O Telm verifica cada imagem de três formas ao mesmo tempo: um hash perceptual reconhece banners de spam conhecidos mesmo após redimensionamento ou mudança de cor, o OCR lê o texto impresso dentro da imagem, e um decodificador de QR extrai links e números de telefone escondidos. O texto extraído de uma imagem passa pelas mesmas regras antispam das mensagens normais, então um banner de cassino com um QR code é removido tão rápido quanto um anúncio em texto.

O tratamento de imagens fica em Filtros de conteúdo; o texto dentro das imagens é lido automaticamente.

Quer configurar isto? Faça direto na sua conta Telm.

Abrir no seu painel

1Por que o spam se esconde dentro de imagens

Um filtro de palavra-chave clássico só olha o texto da mensagem, então os spammers colocam a oferta em uma imagem: um banner de cassino, uma captura de tela de investimento, um QR code que leva a um canal de golpe. Para um bot ingênuo, a mensagem parece vazia e inofensiva.

O Telm trata uma imagem como conteúdo a ser lido, não um anexo opaco. Cada foto é inspecionada enquanto o resto das verificações roda, então o spam em imagem é barrado na mesma passagem que o spam em texto.

2Como o Telm lê texto dentro de uma imagem

O OCR (reconhecimento óptico de caracteres) transforma as letras impressas em uma foto de volta em texto. O Telm lê com o motor Tesseract, ajustado para os idiomas que a sua comunidade de fato fala.

Uma vez extraído o texto, uma imagem incomumente carregada de texto é tratada como um provável anúncio, e as palavras recuperadas são passadas pelas suas regras normais de spam. Se essas regras combinam, a foto é pontuada como uma mensagem de texto que dissesse a mesma coisa.

  • Leitura em vários idiomas de imediato — inglês e russo por padrão, mais alemão, francês, espanhol e CJK (chinês, japonês, coreano).
  • Uma imagem carregada de texto (muitas palavras impressas com boa confiança) é, por si só, um sinal de spam.
  • O texto recuperado é reverificado contra a biblioteca completa de regras, então ofertas escondidas dentro de banners são pegas.
  • Os resultados são lembrados pela impressão digital da imagem, então a mesma foto nunca é processada duas vezes.

3Três verificações em cada imagem

O OCR é uma de três verificações que rodam juntas em cada foto. Entre elas, cobrem banners reutilizados, texto impresso e links codificados.

  • Hash perceptual — reconhece um banner de spam conhecido mesmo após ser redimensionado, cortado ou ter a cor alterada. Uma foto sinalizada como spam em um grupo é reconhecida em todos os grupos.
  • OCR — lê o texto impresso dentro da imagem e o passa pelas regras de spam.
  • Decodificador de QR — extrai links (incluindo t.me, wa.me e telegram.me) e números de telefone escondidos em um QR code, e sinaliza alvos suspeitos.
O banco de dados de imagens de spam é global: uma vez que um banner é marcado como spam em qualquer grupo protegido, o Telm o conhece em todo lugar. Veja como a detecção de spam funciona para o pipeline completo.

4Quando a visão de IA entra em cena

As verificações rápidas acima resolvem a maioria das imagens por conta própria. Para a genuína zona cinzenta — uma foto que não é nem um banner conhecido óbvio nem obviamente limpa — o Telm pode escalar para um modelo de visão de IA que descreve o que a imagem realmente mostra.

Essa análise mais profunda é reservada para esses casos limítrofes, então ela entra em cena apenas quando os sinais mais rápidos são inconclusivos.

O hashing perceptual, o OCR e a decodificação de QR rodam em todos os planos como parte do motor central. A escalada para visão de IA faz parte da moderação por IA, disponível no Pro e Business.

5O que você controla

A detecção inteligente de imagens não precisa de configuração — está ativa assim que o bot está aplicando. Se a sua comunidade não deve publicar fotos de forma alguma, você também pode aplicar um bloqueio bruto que apaga toda imagem independentemente do conteúdo.

As duas abordagens são independentes: a detecção inteligente remove imagens de spam enquanto deixa fotos normais passarem; o filtro bruto remove todas as imagens. A maioria dos grupos quer apenas a detecção inteligente.

  • Detecção inteligente (hash + OCR + QR) — mantém fotos reais, remove spam em imagem. Ativa por padrão.
  • Bloquear todas as imagens — um filtro rígido para comunidades apenas de texto. Veja filtros de conteúdo.
Este artigo foi útil?

Pronto para proteger seu grupo?

Adicione o Telm ao seu grupo do Telegram e deixe que ele cuide do spam.