Lewati ke konten utama

Deteksi spam gambar OCR di Telm

Cara Telm membaca teks di dalam gambar, mengenali spanduk spam yang dikenal, dan memecahkan kode QR sehingga spam khusus gambar tertangkap secepat teks biasa.

Baca 6 menit
Singkatnya

Spammer beralih dari teks ke gambar karena bot kata kunci biasa buta terhadapnya. Telm memeriksa setiap gambar dengan tiga cara sekaligus: sebuah hash perseptual mengenali spanduk spam yang dikenal bahkan setelah diubah ukuran atau warnanya, OCR membaca teks yang tercetak di dalam gambar, dan sebuah pemecah QR mengekstrak tautan dan nomor telepon tersembunyi. Teks yang ditarik dari gambar dijalankan melalui aturan anti-spam yang sama seperti pesan biasa, sehingga spanduk kasino dengan kode QR dihapus secepat iklan teks.

Pengelolaan gambar ada di Filter Konten; teks di dalam gambar dibaca secara otomatis.

Ingin mengatur ini? Lakukan langsung di akun Telm Anda.

Buka di dasbor Anda

1Mengapa spam bersembunyi di dalam gambar

Filter kata kunci klasik hanya melihat teks pesan, jadi spammer menaruh tawaran mereka dalam sebuah gambar: spanduk kasino, tangkapan layar investasi, kode QR yang menuju kanal penipuan. Bagi bot yang naif, pesan itu tampak kosong dan tak berbahaya.

Telm memperlakukan sebuah gambar sebagai konten yang harus dibaca, bukan lampiran buram. Setiap foto diperiksa sementara pemeriksaan lainnya berjalan, sehingga spam gambar dihentikan pada langkah yang sama dengan spam teks.

2Cara Telm membaca teks di dalam sebuah gambar

OCR (pengenalan karakter optik) mengubah huruf yang tercetak pada sebuah gambar kembali menjadi teks. Telm membaca dengan mesin Tesseract, disetel untuk bahasa yang benar-benar digunakan komunitas Anda.

Setelah teks diekstrak, gambar yang luar biasa padat-teks diperlakukan sebagai kemungkinan iklan, dan kata-kata yang dipulihkan dialirkan melalui aturan spam normal Anda. Jika aturan itu cocok, gambar dinilai persis seperti pesan teks yang mengatakan hal yang sama.

  • Pembacaan multibahasa siap pakai — Inggris dan Rusia secara bawaan, plus Jerman, Prancis, Spanyol, dan CJK (Tionghoa, Jepang, Korea).
  • Gambar yang padat-teks (banyak kata tercetak pada keyakinan yang baik) itu sendiri adalah sinyal spam.
  • Teks yang dipulihkan diperiksa ulang terhadap pustaka aturan lengkap, sehingga tawaran tersembunyi di dalam spanduk tertangkap.
  • Hasil diingat berdasarkan sidik jari gambar, sehingga gambar yang sama tidak pernah diproses dua kali.

3Tiga pemeriksaan pada setiap gambar

OCR adalah salah satu dari tiga pemeriksaan yang berjalan bersama pada setiap gambar. Di antara mereka, ketiganya mencakup spanduk yang digunakan ulang, teks tercetak, dan tautan yang dikodekan.

  • Hash perseptual — mengenali spanduk spam yang dikenal bahkan setelah diubah ukuran, dipotong, atau diubah warnanya. Sebuah gambar yang ditandai sebagai spam di satu grup dikenali di semua grup.
  • OCR — membaca teks yang tercetak di dalam gambar dan menjalankannya melalui aturan spam.
  • Pemecah QR — mengekstrak tautan (termasuk t.me, wa.me, dan telegram.me) dan nomor telepon yang tersembunyi dalam kode QR, dan menandai target yang mencurigakan.
Basis data gambar spam bersifat global: begitu sebuah spanduk ditandai sebagai spam di grup terlindungi mana pun, Telm mengenalinya di mana saja. Lihat cara kerja deteksi spam untuk pipeline lengkapnya.

4Kapan penglihatan AI turun tangan

Pemeriksaan cepat di atas menyelesaikan sebagian besar gambar sendiri. Untuk zona abu-abu yang sesungguhnya — sebuah gambar yang bukan spanduk dikenal yang jelas maupun yang jelas bersih — Telm dapat mengeskalasi ke model penglihatan AI yang mendeskripsikan apa yang sebenarnya ditunjukkan gambar.

Tinjauan yang lebih dalam ini disimpan untuk kasus batas tersebut, sehingga ia turun tangan hanya ketika sinyal yang lebih cepat tidak meyakinkan.

Hashing perseptual, OCR, dan pemecahan QR berjalan pada setiap paket sebagai bagian dari mesin inti. Eskalasi penglihatan AI adalah bagian dari moderasi AI, tersedia pada Pro dan Business.

5Apa yang Anda kendalikan

Deteksi gambar cerdas tidak memerlukan penyiapan — ia aktif segera setelah bot menegakkan. Jika komunitas Anda sama sekali tidak boleh mengirim gambar, Anda juga dapat menerapkan blokir tumpul yang menghapus setiap gambar tanpa memandang isinya.

Kedua pendekatan itu independen: deteksi cerdas menghapus gambar yang berbau spam sambil meloloskan foto normal; filter tumpul menghapus semua gambar. Sebagian besar grup hanya menginginkan deteksi cerdasnya.

  • Deteksi cerdas (hash + OCR + QR) — mempertahankan foto asli, menghapus spam gambar. Aktif secara bawaan.
  • Blokir semua gambar — filter keras untuk komunitas khusus-teks. Lihat filter konten.
Apakah artikel ini membantu?

Siap melindungi grup Anda?

Tambahkan Telm ke grup Telegram Anda dan biarkan ia menangani spam.