Przejdź do treści głównej
OCR

Rozpoznawanie
tekstu na obrazach

Wyodrębnij i analizuj tekst z obrazów i kodów QR, aby wykryć ukryty spam.

  • Wyodrębnianie tekstu z obrazów
  • Skanowanie kodów QR
  • Wielojęzyczny OCR
Przesłany obrazTekst wyodrębnionySpam zablokowany

Co Wykrywamy

Tekst z Obrazów (OCR)

Wydobywaj i analizuj tekst z obrazów, zrzutów ekranu i zdjęć.

Kody QR

Dekoduj kody QR, aby ujawnić ukryte linki i treści spamowe.

8
Języki rozpoznawania — angielski, rosyjski, niemiecki, francuski, hiszpański, chiński, japoński, koreański
Automatycznie
Każdy obraz jest skanowany
Łącznie
Działa razem z haszowaniem obrazów

Typowe Wykrycia

  • Obrazy oszustw kryptowalutowych z adresami portfeli
  • Kody QR prowadzące do stron phishingowych
  • Obrazy promocyjne z tekstem spamowym
  • Zrzuty ekranu wiadomości spamowych

Jak tekst i kody są wyciągane z obrazów

Spamerzy przenoszą swój ładunek do obrazków właśnie po to, by ominąć filtry tekstowe, więc Telm czyta również obrazy. Każdy obraz przechodzi przez OCR — optyczne rozpoznawanie znaków — by wyciągnąć zawarty w nim tekst, czy to adres portfela na grafice z oszustwem kryptowalutowym, promocja napisana na zdjęciu, czy zrzut ekranu wiadomości spamowej. Równolegle każdy kod QR jest dekodowany, by ujawnić ukryty w nim link, często phishingowy lub prowadzący do złośliwego oprogramowania, którego obraz nigdy nie pokazuje wprost jako tekst. Wyciągnięty tekst i zdekodowane linki są następnie ponownie przepuszczane przez ten sam potok, który ocenia zwykłe wiadomości, więc spam obrazkowy jest oceniany na podstawie swojej faktycznej treści.

To zamyka oczywistą lukę w każdej obronie opartej wyłącznie na tekście i działa automatycznie na każdym obrazie, obok percepcyjnego haszowania obrazów, które rozpoznaje wcześniej widziane zdjęcie nawet po lekkim ponownym zakodowaniu. Rozpoznawanie obejmuje osiem języków — angielski, rosyjski, niemiecki, francuski, hiszpański, chiński, japoński i koreański — i tu właśnie leżą uczciwe ograniczenia: OCR nie jest doskonały przy mocno stylizowanych czcionkach, zniekształconym tekście czy obrazach o bardzo niskiej rozdzielczości, a pismo spoza tego zestawu nie zostanie przepisane. To mocna dodatkowa warstwa, a nie gwarancja, że żaden tekst nie ukryje się w obrazku, dlatego zasila szerszy potok, zamiast decydować samodzielnie.

Najczęściej zadawane pytania

Czy skanowanie każdego obrazu spowalnia moją grupę lub coś mnie kosztuje?

Skanowanie działa automatycznie w tle w miarę napływania obrazów; członkowie nie czekają na nie, by rozmawiać dalej. Jest częścią potoku ochrony, a nie osobnym płatnym dodatkiem. Percepcyjne haszowanie obrazów pozwala też szybko ponownie rozpoznać zdjęcie, które już zostało zobaczone i ocenione, więc powtarzające się obrazy spamowe nie wymagają za każdym razem pełnej ponownej analizy.

Czy OCR źle odczyta normalne obrazy i oznaczy niewinne wpisy?

OCR jedynie wyciąga tekst; sam nie podejmuje decyzji. Wyciągnięte słowa i każdy zdekodowany link z kodu QR są przepuszczane przez ten sam potok wykrywania co zwykła wiadomość, więc nieszkodliwy mem z tekstem jest oceniany na podstawie tego, co ten tekst faktycznie mówi. Jak przy każdym wykrywaniu, przypadki graniczne są rejestrowane i możliwe do przejrzenia, a możesz obserwować to w trybie monitorowania, zanim egzekwowanie zostanie włączone.

Które języki faktycznie potrafi odczytać?

Rozpoznawanie obejmuje osiem języków: angielski, rosyjski, niemiecki, francuski, hiszpański, chiński, japoński i koreański. Tekst w języku spoza tego zestawu nie zostanie wiarygodnie przepisany, a mocno stylizowane czcionki, zniekształcone litery czy zrzuty ekranu o bardzo niskiej rozdzielczości mogą pokonać OCR — to jeden z powodów, dla których działa on jako warstwa zasilająca szerszy potok, a nie samodzielny filtr.

Czy spamerzy mogą pokonać OCR, zniekształcając tekst w obrazie?

Czasami — celowo zniekształcony lub zaszumiony tekst to dokładnie to, z czym OCR ma problem, a zdeterminowany spamer potrafi pogorszyć obraz, by utrudnić rozpoznawanie. Dlatego OCR nie działa samodzielnie: dekodowanie QR wychwytuje linki ukryte jako kody, percepcyjne haszowanie wychwytuje ponownie użyte obrazy, a potok AI ocenia każdy odzyskany tekst, więc pokonanie jednej warstwy nie omija wszystkich.

Gotowy, aby zacząć?

Zacznij chronić swoją społeczność już dziś. Dostępny plan darmowy.