Что мы обнаруживаем
Текст на картинках (OCR)
Извлекаем и анализируем текст с картинок, скриншотов и фотографий.
QR-коды
Декодируем QR-коды, раскрывая скрытые ссылки и спам.
Что попадается чаще всего
- Картинки крипто-скама с адресами кошельков
- QR-коды, ведущие на фишинговые сайты
- Рекламные картинки со спам-текстом
- Скриншоты спам-сообщений
Как текст и коды извлекаются из картинок
Спамеры переносят полезную нагрузку в картинки именно затем, чтобы уйти от текстовых фильтров, поэтому Telm читает и изображения. Каждая картинка проходит через OCR — оптическое распознавание символов, — чтобы извлечь любой содержащийся в ней текст: будь то адрес кошелька на графике крипто-скама, реклама поверх фото или скриншот спам-сообщения. Параллельно любой QR-код декодируется, чтобы раскрыть спрятанную внутри ссылку — часто это фишинговый или вредоносный адрес, который картинка нигде не показывает открытым текстом. Извлечённый текст и декодированные ссылки затем прогоняются через тот же конвейер, что судит обычные сообщения, так что спам в картинках оценивается по своему настоящему содержанию.
Это закрывает очевидную брешь любой чисто текстовой защиты и работает автоматически на каждой картинке, вместе с перцептивным хешированием изображений, которое узнаёт уже виденную картинку даже после лёгкого перекодирования. Распознавание охватывает восемь языков — английский, русский, немецкий, французский, испанский, китайский, японский и корейский, — и здесь же лежат честные пределы: OCR неидеален на сильно стилизованных шрифтах, искажённом тексте или картинках очень низкого разрешения, а письменность вне этого набора расшифрована не будет. Это сильный дополнительный уровень, а не гарантия, что в картинке не спрячется никакой текст, и именно поэтому он питает более широкий конвейер, а не решает в одиночку.
Частые вопросы
Замедлит ли сканирование каждой картинки мою группу и стоит ли оно чего-нибудь?
Сканирование идёт автоматически в фоне по мере поступления картинок; участники его не ждут и продолжают общаться. Это часть защитного конвейера, а не отдельное платное дополнение. Перцептивное хеширование изображений к тому же позволяет быстро узнать уже виденную и оценённую картинку, так что повторные спам-изображения не требуют каждый раз полного повторного анализа.
Не примет ли OCR обычные картинки за спам и не отметит ли безобидные посты?
OCR только извлекает текст; сам он ничего не решает. Извлечённые слова и любая декодированная QR-ссылка проходят через тот же конвейер обнаружения, что и обычное сообщение, так что безобидный мем с текстом оценивается по тому, что этот текст на самом деле говорит. Как и при любом обнаружении, пограничные решения фиксируются и доступны для пересмотра, а понаблюдать за этим можно в режиме наблюдения, прежде чем применение мер включено.
Какие языки он реально читает?
Распознавание охватывает восемь языков: английский, русский, немецкий, французский, испанский, китайский, японский и корейский. Текст на языке вне этого набора надёжно расшифрован не будет, а сильно стилизованные шрифты, искажённые буквы или скриншоты очень низкого разрешения могут сбить OCR — это одна из причин, почему он работает как уровень, питающий более широкий конвейер, а не как отдельный фильтр.
Могут ли спамеры обойти OCR, исказив текст на картинке?
Иногда — намеренно искривлённый или зашумлённый текст как раз то, с чем OCR справляется тяжело, и упорный спамер может ухудшить картинку, чтобы навредить распознаванию. Именно поэтому OCR не стоит особняком: декодирование QR ловит ссылки, спрятанные в виде кодов, перцептивное хеширование ловит переиспользованные картинки, а AI-конвейер судит любой восстановленный текст, так что обход одного уровня не снимает всех остальных.
Связанные функции
Узнайте больше способов, как Telm может помочь вашему сообществу