メインコンテンツへスキップ
OCR

画像内テキスト
認識

画像やQRコードからテキストを抽出・分析し、隠れたスパムを検出。

  • 画像テキスト抽出
  • QRコードスキャン
  • 多言語対応
アップロードされた画像テキストを抽出スパムをブロック

検出するもの

画像テキスト (OCR)

画像、スクリーンショット、写真からテキストを抽出して分析します。

QRコード

QRコードをデコードして隠れたリンクやスパムコンテンツを明らかにします。

8
認識言語 — 英語、ロシア語、ドイツ語、フランス語、スペイン語、中国語、日本語、韓国語
自動
すべての画像がスキャンされます
組み合わせ
画像ハッシュと連携して動作

一般的な検出

  • ウォレットアドレスを含む暗号詐欺画像
  • フィッシングサイトにリンクするQRコード
  • スパムテキストを含むプロモーション画像
  • スパムメッセージのスクリーンショット

画像からテキストやコードを抽出する仕組み

スパマーはテキストフィルターを回避するために、まさにその狙いでペイロードを画像に移します。そこでTelmは画像も読み取ります。すべての画像はOCR(光学文字認識)を通して、含まれるあらゆるテキストを抽出します。それが仮想通貨詐欺の画像に書かれたウォレットアドレスであれ、写真の上に書かれた宣伝文句であれ、スパムメッセージのスクリーンショットであれ同様です。並行して、あらゆるQRコードをデコードして中に隠されたリンク(多くの場合、画像には平文で表示されないフィッシングやマルウェアの宛先)を明らかにします。抽出したテキストとデコードしたリンクは、通常のメッセージを判断するのと同じパイプラインに送り返されるため、画像スパムはその実際の内容に基づいて評価されます。

これはテキストのみの防御が持つ明らかな穴を塞ぎ、すべての画像に対して自動で機能します。さらに、知覚的画像ハッシュと並んで動作し、軽く再エンコードされた画像でも以前に見たものだと認識します。認識は8言語(英語、ロシア語、ドイツ語、フランス語、スペイン語、中国語、日本語、韓国語)をカバーしており、正直な限界もそこにあります。OCRは、極端に装飾されたフォント、歪んだテキスト、非常に低解像度の画像では完璧ではなく、その言語セット外のスクリプトは文字起こしされません。これはテキストが画像の中に一切隠せないことを保証するものではなく、強力な追加レイヤーです。だからこそ単独で判断するのではなく、より広いパイプラインに情報を供給します。

よくある質問

すべての画像をスキャンすると、グループが遅くなったり費用がかかったりしませんか?

スキャンは画像が届くとバックグラウンドで自動的に実行され、メンバーがそれを待つことなくチャットを続けられます。これは別料金のアドオンではなく、保護パイプラインの一部です。また知覚的画像ハッシュにより、すでに見て判断済みの画像はすぐに再認識されるため、繰り返されるスパム画像を毎回フルで再解析する必要はありません。

OCRが通常の画像を誤読して、無害な投稿にフラグを立ててしまいませんか?

OCRはテキストを抽出するだけで、単独で判断することはありません。抽出された語句やデコードされたQRリンクは、通常のメッセージと同じ検出パイプラインを通るため、テキスト入りの無害なミームは、そのテキストが実際に何を言っているかに基づいて判断されます。あらゆる検出と同様、判断が難しいケースはログに記録されて見直せますし、実際の適用を有効にする前にモニタリングモードで見守れます。

実際に読み取れる言語はどれですか?

認識は8言語(英語、ロシア語、ドイツ語、フランス語、スペイン語、中国語、日本語、韓国語)をカバーします。その言語セット外のテキストは確実には文字起こしされず、極端に装飾されたフォント、歪んだ文字、非常に低解像度のスクリーンショットはOCRを妨げることがあります。これも、OCRが単独のフィルターではなく、より広いパイプラインに情報を供給するレイヤーとして機能する理由の1つです。

スパマーは画像内のテキストを歪めてOCRを回避できますか?

時にはできます。意図的に歪めたりノイズを加えたりしたテキストは、まさにOCRが苦手とするもので、本気のスパマーは認識を妨げるために画像を劣化させられます。だからこそOCRは単独では機能しません。QRデコードはコードとして隠されたリンクを捕捉し、知覚的ハッシュは再利用された画像を捕捉し、AIパイプラインは復元できたテキストを判断します。1つのレイヤーを突破しても、すべてを突破したことにはなりません。

始める準備はできましたか?

今日からコミュニティを保護しましょう。無料プランあり。