快捷导航
004.jpg
003.jpg
设置了连续点击,每个回复下面的回复,每个回复都产生了一个XML只有最后一个XML是最终完整的,请问这个可以避免吗?或者怎么设置?
举报 使用道具
| 回复

共 1 个关于本帖的回复 最后回复于 2018-2-12 15:58

Fuller 管理员 发表于 2018-2-12 15:58:02 | 显示全部楼层
这个避免不了。

通常情况下,一个网页生成一个结果文件。

但是,如果有连续动作,没做一轮循环,就会产生一个结果文件。如果在动作过程中,网页内容越来越多,那么生成的结果文件就会越来越大。必须导入到数据库以后进行过滤。

对于旗舰版用户,在点击动作和滚屏动作中有个高级选项:清除老数据,参看《抓取瀑布流网站是清除老数据》,但是不能使用你这个情况,你是点击展开所有回复,如果清除老数据,那么有些还没有被点开的内容就被清除了
举报 使用道具
您需要登录后才可以回帖 登录 | 立即注册

精彩推荐

  • 批量爬取蘑菇街商品价格、评论信息
  • 微博用户数据分析
  • 批量爬取苏宁商品价格、评论信息
  • 批量爬取亚马逊商品价格、评论信息
  • 批量爬取eBay商品价格、销售情况信息

热门用户

集搜客GooSeeker网络爬虫 ( 粤ICP备11065265号-2 )

GMT+8, 2018-7-18 03:12