正在阅读:火车采集器关联多页采集设置火车采集器关联多页采集设置

2019-04-22 09:41 出处:其他 作者:佚名 责任编辑:gushunjun1

  关联多页

  当采集的信息不在当前默认页,而在当前默认页某一个链接的所在页时,此时就要用到多页管理了,

  多页管理界面如下:

  来获取获取它的公司介绍和联系方式页面的联系方式信息。

  公司介绍在网址http://kimi201406.1688.com/page/creditdetail.htm里获取,而联系方式信息在网址http://kimi201406.1688.com/page/contactinfo.htm里获取。所以我们需要借助多页功能来实现。

  前者叫默认页地址,后者叫做多页地址。

  流程:点击①创建多页,进行②多页设置,然后在数据来源③选择多页调用,最后根据多页源代码设置提取方式。

  下面重点讲解②,多页地址获取方式:

  a.页面地址替换

  b.源码中截取

  a.页面地址替换:也就是默认页和多页地址有相同的地方,通过简单的替换就可以变成多页地址。

  b.源码中截取:也就是多页的地址在默认页的页面源代码里面。

  下面就上述网址来说明下这两种方式如何获取多页。

  a.页面地址替换

  比较默认页“http://kimi201406.1688.com/page/creditdetail.htm”和多页地址:“http://kimi201406.1688.com/page/contactinfo.htm”之间的共同点,默认页“creditdetail.htm”替换为“contactinfo.htm”就是我们的多页地址了。

  设置:

  正则表达式中(。*)为任意通配符。

  $1,$2…$数字来按照顺序对应上面(。*)表示的部分。

  若要对多页源码部分区域做限定,可在指定多页源码区域设置。

  若留空则默认返回多页整个源代码。

  设置好以后,点击测试查看结果。

  b.源码中截取

  可以看到默认页源码中有多页地址

  所以设置如下:

  保存即可。

  最后设置数据来源和提取方式,

  注:如需要多级多页,则在多页地址获取方式:选择需要的多页即可

火车采集器系列软件最新版本下载
火车采集器(LocoySpider)软件版本:9.4正式版网络工具立即查看
火车采集器2010SP2软件版本:免费版网络工具立即查看

关注我们

最新资讯离线随时看 聊天吐槽赢奖品