Що ми виявляємо
Текст зображення (OCR)
Витягуйте та аналізуйте текст з зображень, скріншотів та фотографій.
QR-коди
Декодуйте QR-коди, щоб виявити приховані посилання та спам-контент.
Загальні виявлення
- Зображення крипто-шахрайства з адресами гаманців
- QR-коди, що ведуть на фішингові сайти
- Рекламні зображення зі спам-текстом
- Скріншоти спам-повідомлень
Як текст і коди видобуваються із зображень
Спамери переносять корисне навантаження в картинки саме для того, щоб уникнути текстових фільтрів, тож Telm читає й зображення теж. Кожне зображення проходить через OCR — оптичне розпізнавання символів, — щоб видобути будь-який текст, який воно містить, чи то адреса гаманця в графіці криптошахрайства, реклама, написана поверх фото, чи скриншот спам-повідомлення. Паралельно будь-який QR-код декодується, щоб розкрити приховане в ньому посилання, часто фішингове чи шкідливе призначення, якого зображення ніколи не показує відкритим текстом. Видобутий текст і декодовані посилання потім подаються назад через той самий конвеєр, що оцінює звичайні повідомлення, тож спам у зображеннях оцінюється за його фактичним вмістом.
Це закриває очевидну прогалину в будь-якому суто текстовому захисті й працює автоматично на кожному зображенні, поряд із перцептивним хешуванням зображень, яке впізнає картинку, бачену раніше, навіть коли її злегка перекодовано. Розпізнавання охоплює вісім мов — англійську, російську, німецьку, французьку, іспанську, китайську, японську й корейську, — і саме тут лежать чесні обмеження: OCR не досконалий на сильно стилізованих шрифтах, спотвореному тексті чи зображеннях дуже низької роздільності, а письмо поза цим набором не буде транскрибовано. Це потужний додатковий рівень, а не гарантія, що жоден текст не сховається в картинці, і саме тому він живить ширший конвеєр, а не вирішує сам.
Поширені запитання
Чи сповільнює сканування кожного зображення мою групу й чи коштує це мені чогось?
Сканування працює автоматично у фоні в міру надходження зображень; учасники не чекають на нього, щоб спілкуватися далі. Це частина конвеєра захисту, а не окрема платна надбудова. Перцептивне хешування зображень також дає змогу швидко впізнати картинку, яку вже бачили й оцінили, тож повторювані спам-зображення не потребують щоразу повного повторного аналізу.
Чи хибно прочитає OCR звичайні зображення й позначить безневинні пости?
OCR лише видобуває текст; він не вирішує самостійно. Видобуті слова й будь-яке декодоване QR-посилання проходять через той самий конвеєр виявлення, що й звичайне повідомлення, тож нешкідливий мем із текстом оцінюється за тим, що цей текст насправді каже. Як і з усім виявленням, межові рішення записуються й доступні для перегляду, а ви можете спостерігати за цим у режимі моніторингу, перш ніж дотримання ввімкнено.
Які мови він насправді може читати?
Розпізнавання охоплює вісім мов: англійську, російську, німецьку, французьку, іспанську, китайську, японську й корейську. Текст мовою поза цим набором не буде надійно транскрибовано, а сильно стилізовані шрифти, спотворені літери чи скриншоти дуже низької роздільності можуть здолати OCR — це одна з причин, чому він працює як рівень, що живить ширший конвеєр, а не як окремий фільтр.
Чи можуть спамери обійти OCR, спотворивши текст у зображенні?
Іноді — навмисно викривлений чи зашумлений текст — це саме те, з чим OCR має труднощі, а рішучий спамер може погіршити зображення, щоб зашкодити розпізнаванню. Ось чому OCR не стоїть окремо: декодування QR ловить посилання, приховані як коди, перцептивне хешування ловить повторно використані зображення, а ШІ-конвеєр оцінює будь-який відновлений текст, тож обхід одного рівня не долає всіх.
Пов'язані функції
Дізнайтеся більше про те, як Telm може допомогти вашій спільноті