Спамери перейшли з тексту на картинки, бо прості бот на ключових словах їх не бачать. Telm перевіряє кожне зображення трьома способами одразу: перцептивний хеш розпізнає відомі спам-банери навіть після зміни розміру чи кольору, OCR читає текст, надрукований усередині картинки, а декодер QR видобуває приховані посилання й номери телефонів. Текст, витягнутий із зображення, проходить крізь ті самі антиспам-правила, що й звичайні повідомлення, тож банер казино з QR-кодом видаляється так само швидко, як текстова реклама.
Хочете це налаштувати? Зробіть це просто у своєму акаунті Telm.
Відкрити в дашборді1Чому спам ховається всередині картинок
Класичний фільтр за ключовими словами дивиться лише на текст повідомлення, тож спамери кладуть свою пропозицію в зображення: банер казино, скриншот інвестицій, QR-код, що веде на шахрайський канал. Для наївного бота повідомлення виглядає порожнім і нешкідливим.
Telm ставиться до зображення як до контенту, який слід прочитати, а не як до непрозорого вкладення. Кожне фото інспектується, поки виконується решта перевірок, тож спам на зображеннях зупиняється на тому самому проході, що й текстовий спам.
2Як Telm читає текст усередині зображення
OCR (оптичне розпізнавання символів) перетворює літери, надруковані на картинці, назад у текст. Telm читає рушієм Tesseract, налаштованим на мови, якими ваша спільнота насправді говорить.
Щойно текст витягнуто, незвично насичене текстом зображення трактується як імовірна реклама, а відновлені слова прогоняються крізь ваші звичайні спам-правила. Якщо ці правила збігаються, картинка оцінюється так само, як текстове повідомлення, що сказало б те саме.
- Багатомовне читання з коробки — англійська та російська за замовчуванням, плюс німецька, французька, іспанська та CJK (китайська, японська, корейська).
- Насичене текстом зображення (багато надрукованих слів із доброю впевненістю) саме по собі є спам-сигналом.
- Відновлений текст повторно перевіряється проти повної бібліотеки правил, тож приховані пропозиції всередині банерів ловляться.
- Результати запам'ятовуються за відбитком зображення, тож та сама картинка ніколи не обробляється двічі.
3Три перевірки на кожному зображенні
OCR — одна з трьох перевірок, що виконуються разом на кожній картинці. Разом вони охоплюють повторно використані банери, надрукований текст та закодовані посилання.
- Перцептивний хеш — розпізнає відомий спам-банер навіть після зміни розміру, обрізання чи перефарбування. Картинка, позначена як спам в одній групі, розпізнається в усіх групах.
- OCR — читає текст, надрукований усередині зображення, та прогоняє його крізь спам-правила.
- Декодер QR — видобуває посилання (включно з t.me, wa.me та telegram.me) і номери телефонів, приховані в QR-коді, та позначає підозрілі цілі.
4Коли вступає AI-зір
Швидкі перевірки вище вирішують більшість зображень самотужки. Для справжньої сірої зони — картинки, яка не є ані очевидним відомим банером, ані очевидно чистою — Telm може ескалювати до AI-моделі зору, що описує, що зображення насправді показує.
Цей глибший погляд зарезервовано для тих граничних випадків, тож він вступає лише тоді, коли швидші сигнали непереконливі.
5Що ви контролюєте
Розумне визначення зображень не потребує налаштування — воно ввімкнене, щойно бот примушує. Якщо ваша спільнота взагалі не повинна постити картинки, ви також можете застосувати тупе блокування, що видаляє кожне зображення незалежно від вмісту.
Ці два підходи незалежні: розумне визначення прибирає спамні зображення, пропускаючи звичайні фото; тупий фільтр прибирає всі зображення. Більшість груп хочуть лише розумне визначення.
- Розумне визначення (хеш + OCR + QR) — лишає реальні фото, прибирає спам на зображеннях. Ввімкнено за замовчуванням.
- Блокувати всі зображення — жорсткий фільтр для суто текстових спільнот. Див. контентні фільтри.