跳到主要内容

Telm 中的 OCR 图像垃圾检测

Telm 如何读取图像内的文字、识别已知的垃圾横幅并解码二维码,让纯图像垃圾被捕捉得和纯文本一样快。

阅读时间 6 分钟
简而言之

垃圾发布者从文本转向图片,因为纯关键词机器人对它们视而不见。Telm 会同时以三种方式检查每张图像:一个 感知哈希 即使在缩放或改色之后也能识别已知的垃圾横幅,OCR 读取图片内印着的文字,而一个 二维码解码器 提取隐藏的链接和电话号码。从图像中提取出的文本会通过与普通消息相同的反垃圾规则,因此一张带二维码的赌场横幅被移除得和一条文本广告一样快。

图片处理位于内容过滤中;图片内的文字会被自动识别。

想设置这个功能吗?直接在你的 Telm 账户里完成吧。

在控制台中打开

1为什么垃圾藏在图片里

经典的关键词过滤器只看消息文本,因此垃圾发布者改为把他们的报价放进一张图像里:一张赌场横幅、一张投资截图、一个通往骗局频道的二维码。对一个天真的机器人来说,消息看起来空洞而无害。

Telm 把图像当作要读取的内容,而非一个不透明的附件。每张照片都在其余检查运行时被检视,因此图像垃圾会在与文本垃圾相同的一遍中被拦下。

2Telm 如何读取图像内的文字

OCR(光学字符识别)把印在图片上的字母还原为文本。Telm 用 Tesseract 引擎读取,针对你社区实际使用的语言进行调校。

文本一旦被提取,一张异常富含文字的图像就会被当作可能的广告,还原出的词语会通过你的常规垃圾规则。如果这些规则匹配,该图片就会像一条说同样话的文本消息一样被评分。

  • 开箱即用的多语言读取——默认英语和俄语,外加德语、法语、西班牙语和 CJK(中文、日文、韩文)。
  • 一张富含文字的图像(大量以良好置信度印出的词语)本身就是一个垃圾信号。
  • 还原出的文本会对照完整的规则库重新检查,因此横幅内隐藏的报价会被捕捉。
  • 结果按图像指纹被记住,因此同一张图片绝不会被处理两次。

3对每张图像的三项检查

OCR 是对每张图片一起运行的三项检查之一。它们之间涵盖了重用的横幅、印刷的文字和编码的链接。

  • 感知哈希——即使一张已知的垃圾横幅被缩放、裁剪或改色,也能识别它。在一个群组中被标记为垃圾的图片会在所有群组中被识别。
  • OCR——读取图像内印着的文字并让它通过垃圾规则。
  • 二维码解码器——提取二维码中隐藏的链接(包括 t.me、wa.me 和 telegram.me)和电话号码,并标记可疑的目标。
垃圾图像数据库是全局的:一旦一张横幅在任何受保护群组中被标记为垃圾,Telm 就会在各处认得它。关于完整流水线,参见 垃圾检测的工作原理

4AI 视觉何时介入

上述快速检查自行解决了大多数图像。对于真正的灰色地带——一张既非明显已知横幅也非明显干净的图片——Telm 可以升级到一个描述图像实际展示内容的 AI 视觉模型。

这种更深入的查看专门留给那些处于边缘的情况,因此它只在更快的信号无定论时才介入。

感知哈希、OCR 和二维码解码作为核心引擎的一部分在所有套餐上运行。AI 视觉升级是 AI 审核的一部分,在 Pro 和 Business 上可用。

5你控制什么

智能图像检测无需设置——机器人一旦强制执行,它就开启。如果你的社区根本不应发图片,你也可以施加一个不论内容删除每张图像的粗放拦截。

这两种方式是独立的:智能检测移除垃圾图像而放行正常照片;粗放过滤器移除所有图像。大多数群组只想要智能检测。

  • 智能检测(哈希 + OCR + 二维码)——保留真实照片,移除图像垃圾。默认开启。
  • 拦截所有图像——为纯文本社区提供的硬过滤器。参见 内容过滤器
这篇文章有帮助吗?

准备好保护你的群组了吗?

把 Telm 添加到你的 Telegram 群组,让它处理垃圾信息。