Co Wykrywamy
Tekst z Obrazów (OCR)
Wydobywaj i analizuj tekst z obrazów, zrzutów ekranu i zdjęć.
Kody QR
Dekoduj kody QR, aby ujawnić ukryte linki i treści spamowe.
Typowe Wykrycia
- Obrazy oszustw kryptowalutowych z adresami portfeli
- Kody QR prowadzące do stron phishingowych
- Obrazy promocyjne z tekstem spamowym
- Zrzuty ekranu wiadomości spamowych
Jak tekst i kody są wyciągane z obrazów
Spamerzy przenoszą swój ładunek do obrazków właśnie po to, by ominąć filtry tekstowe, więc Telm czyta również obrazy. Każdy obraz przechodzi przez OCR — optyczne rozpoznawanie znaków — by wyciągnąć zawarty w nim tekst, czy to adres portfela na grafice z oszustwem kryptowalutowym, promocja napisana na zdjęciu, czy zrzut ekranu wiadomości spamowej. Równolegle każdy kod QR jest dekodowany, by ujawnić ukryty w nim link, często phishingowy lub prowadzący do złośliwego oprogramowania, którego obraz nigdy nie pokazuje wprost jako tekst. Wyciągnięty tekst i zdekodowane linki są następnie ponownie przepuszczane przez ten sam potok, który ocenia zwykłe wiadomości, więc spam obrazkowy jest oceniany na podstawie swojej faktycznej treści.
To zamyka oczywistą lukę w każdej obronie opartej wyłącznie na tekście i działa automatycznie na każdym obrazie, obok percepcyjnego haszowania obrazów, które rozpoznaje wcześniej widziane zdjęcie nawet po lekkim ponownym zakodowaniu. Rozpoznawanie obejmuje osiem języków — angielski, rosyjski, niemiecki, francuski, hiszpański, chiński, japoński i koreański — i tu właśnie leżą uczciwe ograniczenia: OCR nie jest doskonały przy mocno stylizowanych czcionkach, zniekształconym tekście czy obrazach o bardzo niskiej rozdzielczości, a pismo spoza tego zestawu nie zostanie przepisane. To mocna dodatkowa warstwa, a nie gwarancja, że żaden tekst nie ukryje się w obrazku, dlatego zasila szerszy potok, zamiast decydować samodzielnie.
Najczęściej zadawane pytania
Czy skanowanie każdego obrazu spowalnia moją grupę lub coś mnie kosztuje?
Skanowanie działa automatycznie w tle w miarę napływania obrazów; członkowie nie czekają na nie, by rozmawiać dalej. Jest częścią potoku ochrony, a nie osobnym płatnym dodatkiem. Percepcyjne haszowanie obrazów pozwala też szybko ponownie rozpoznać zdjęcie, które już zostało zobaczone i ocenione, więc powtarzające się obrazy spamowe nie wymagają za każdym razem pełnej ponownej analizy.
Czy OCR źle odczyta normalne obrazy i oznaczy niewinne wpisy?
OCR jedynie wyciąga tekst; sam nie podejmuje decyzji. Wyciągnięte słowa i każdy zdekodowany link z kodu QR są przepuszczane przez ten sam potok wykrywania co zwykła wiadomość, więc nieszkodliwy mem z tekstem jest oceniany na podstawie tego, co ten tekst faktycznie mówi. Jak przy każdym wykrywaniu, przypadki graniczne są rejestrowane i możliwe do przejrzenia, a możesz obserwować to w trybie monitorowania, zanim egzekwowanie zostanie włączone.
Które języki faktycznie potrafi odczytać?
Rozpoznawanie obejmuje osiem języków: angielski, rosyjski, niemiecki, francuski, hiszpański, chiński, japoński i koreański. Tekst w języku spoza tego zestawu nie zostanie wiarygodnie przepisany, a mocno stylizowane czcionki, zniekształcone litery czy zrzuty ekranu o bardzo niskiej rozdzielczości mogą pokonać OCR — to jeden z powodów, dla których działa on jako warstwa zasilająca szerszy potok, a nie samodzielny filtr.
Czy spamerzy mogą pokonać OCR, zniekształcając tekst w obrazie?
Czasami — celowo zniekształcony lub zaszumiony tekst to dokładnie to, z czym OCR ma problem, a zdeterminowany spamer potrafi pogorszyć obraz, by utrudnić rozpoznawanie. Dlatego OCR nie działa samodzielnie: dekodowanie QR wychwytuje linki ukryte jako kody, percepcyjne haszowanie wychwytuje ponownie użyte obrazy, a potok AI ocenia każdy odzyskany tekst, więc pokonanie jednej warstwy nie omija wszystkich.
Powiązane funkcje
Odkryj więcej sposobów, w jakie Telm może pomóc Twojej społeczności