永发信息网

火车头采集器怎么过滤删除无用信息

答案:2  悬赏:20  手机版
解决时间 2021-12-21 06:59
  • 提问者网友:火车头
  • 2021-12-21 03:00
火车头采集器怎么过滤删除无用信息
最佳答案
  • 五星知识达人网友:一秋
  • 2021-12-21 03:54
火车头采集器怎么过滤删除无用信息?大家在使用火车头采集器的过程中难免会遇见某些无用的信息或者是自己不想要采集的数据,但是因为各种各样的原因而无法避免。

对于文章内容页出现的垃圾信息,我们可以通过内容替换功能将其删除。
相对进阶一点的使用替换功能过滤删除垃圾信息还可以使用星号功能来进行模糊删除,
举例,我们通过采集规则设置需要采集一批新闻内容,结果这些新闻内容的标题中混入了几个软件下载地址,这时候我们利用过滤功能就能够方便的解决问题。

我们可以打开标题标签的编辑界面,选择内容过滤,在不得包含的内容中填入下载,这样在标题中所有包含“下载”字样的标题就会被过滤出来。

之后,我们在详细设置中对于过滤处理选择删除,就可以删除这些我们不想要的采集内容。
合理利用火车头采集器自带的过滤垃圾信息的功能,就可以大大提高我们的采集质量,避免了人工审核内容的烦恼。
全部回答
  • 1楼网友:舍身薄凉客
  • 2021-12-21 04:47
建议用八爪鱼采集器采集cms内容直接发布相比火车头要简单很多。你可以试试
我要举报
如以上回答内容为低俗、色情、不良、暴力、侵权、涉及违法等信息,可以点下面链接进行举报!
点此我要举报以上问答信息
大家都在看
推荐资讯