跳到主要内容

面向你群组的个人 ML 模型

上传一份 Telegram 导出文件,Telm 便训练一个个人 ML 层,它会在你社区的正常言论上否决误报的垃圾警报,并有严格的质量门槛。

阅读时间 7 分钟
简而言之

上传一份你聊天的 Telegram 导出文件,我们便就你社区实际如何说话训练一个 个人 ML 层。它会在你群组的正常言论上 否决误报的垃圾警报——它绝不会自行封禁。它在匿名化数据上训练,在上线前经过检查,并可随时关闭。适用于 Pro 及以上,带每月导入配额;在 设置 中管理它。

根据你社群的表达方式训练专属 ML 模型。

想设置这个功能吗?直接在你的 Telm 账户里完成吧。

在控制台中打开

1个人模型是什么

我们的全局垃圾模型在来自成千上万个群组的垃圾上训练。但每个社区都有自己的说话方式——行话、俚语、内部梗——偶尔全局模型会把那种正常言论误当成垃圾。

个人模型解决了这一点。你上传一份你自己聊天的 Telegram 导出文件,我们在其上训练一个额外的模型层,它会学习在你群组中具体什么才算正常。从那时起,它就能否决那些不符合你社区嗓音的误报垃圾警报。

关键在于,它始终只移除误报——它绝不能自行封禁任何人。它能做的最坏的事,也不过是放行一条消息让人来查看。

个人 ML 模型适用于 Pro(每个群组每月 1 次导入)、Business(每月 2 次),并为组织提供更大的配额。

2它如何帮助

个人模型与全局模型并肩而立。当全局模型把一条消息标记为垃圾,但个人模型认出它是你社区的正常言论时,垃圾裁决会被扣下,消息会被送交审查而不是被移除。

结果是在你群组中完全正常的话题和措辞上误报更少,同时不削弱对真正垃圾的防护。

  • 最适合有独特词汇的社区——交易台、开发聊天、粉丝圈、地方俚语。
  • 它实时工作,不增加可察觉的延迟。
  • 它只改变误报的那一面;真正的垃圾仍会被其他每一层捕捉。

3训练如何进行

你不必准备任何技术性的东西。你把聊天历史导出为一个文件,上传它,其余的都会自动进行,而你只需观看进度。

在幕后,你的导出文件会被清洗和匿名化,一个模型会在你社区的言论上训练,并在它被开启之前经过检查。

  • 你的导出文件会先被匿名化——用户名、电话号码、电子邮件和链接在训练任何东西之前都会被替换为占位符。
  • 它从你受信任的常客那里学习,因此它捕捉你社区真正的嗓音。
  • 一个模型会在你社区的言论上训练,然后测试其准确性。
  • 只有通过每一项检查的模型才会被发布和应用;较弱的会被丢弃。

4让它安全的检查

只有当一个个人模型通过自动检查时才会被开启。如果它未通过其中任何一项,就会被拒绝且绝不应用,因此它绝不会让你的防护变得更糟。

  • 它不得放过真正的垃圾——它会对照已知垃圾被检查。
  • 它必须认得你群组自己的言论——在你受信任成员的样本上测试。
  • 它必须无差错地处理干净消息。
  • 所有上传的数据在训练之前都会被匿名化(用户名、电话、电子邮件和链接被替换为占位符)。

5隐私与你的数据

导出文件绝不会变成公开的,也不会被留存。它被用于训练你的模型,然后被移除。

关于完整情况,参见 Telm 能看到哪些数据数据隐私与存储

  • 个人信息在任何训练发生之前都会被替换为占位符。
  • 原始上传文件在处理后被删除;被放弃的上传会被自动清理。
  • 训练好的模型捕捉的是言语模式,而非可读的消息日志。

6上传你的聊天导出文件

你从 Telegram Desktop 把群组历史导出为 JSON,然后通过仪表盘中的导入向导上传它。处理会自动运行,你可以观看它的进度。

导出文件越大越干净,模型就越能学会你的社区——更大的历史还能赢得更长的订阅奖励(见下文)。

7套餐、配额与奖励

导入每月有限,且上限取决于你的套餐。

  • Pro——每个群组每月 1 次导入。
  • Business——每个群组每月 2 次导入。
  • 组织——每个群组每月最多 4 次导入。
  • 奖励:一次成功的导入会为你的订阅增加 7 天,或对于 10,000 条以上消息的导出增加 14 天。
  • 因文件损坏或消息过少而被拒绝的上传不会占用你的配额。

8管理模型

训练完成后,个人模型会被自动应用。你从群组设置中保持对它的掌控。

有一个按群组的开关可以开启或关闭个人模型——关闭它不会删除训练好的模型,因此你以后无需重新导入即可重新启用它。

  • 随时按群组开启或关闭它。
  • 关闭它会保留训练好的模型,因此重新启用无需新的导入。
  • 如果你社区的风格变化很大,就在你的每月配额内重新导入。
这篇文章有帮助吗?

准备好保护你的群组了吗?

把 Telm 添加到你的 Telegram 群组,让它处理垃圾信息。