阿布云

你所需要的,不仅仅是一个好用的代理。

增量式抓取时候什么呢?

阿布云 发表于

  6.png  

    Nutch爬虫的工作方式一般可以分为累积式抓取(cumulative crawling)和增量式抓取(incremental crawling)两种方式.
    累积式抓取是指从某一个时间点开始,通过遍历的方式抓取系统所能允许存储和处理的所有网页信息.这种方式在理想的软硬件环境下,过足够时间的运行,就可以保证抓取到相当规模的网页集合.但由于Web数据的动态特性,集合中网页被抓取时间点是不一样的,页面被更新的情况也不同,因此累积式抓取到的网页集合在实际的操作上并无法与真实环境中的网络数据保持一致.
    增量式抓取是指在具有一定量规模的网络页面集合的基础上,采用更新数据的方式选取已有集合中的过时网页进行抓取,以保证所抓取到的数据与真实网络数据足够接近.但是进行增量式抓取的前提是,系统已经抓取了足够数量的网络页面,并具有这些页面被抓取的时间信息.
    在面向实际应用环境的网络蜘蛛设计中,通常都会包括累积式抓取,同时也包括增量式抓取的策略.累积式抓取一般用于数据集合的整体建立或大规模更新阶段;而增量式抓取则主要针对数据集合的日常维护与即时更新.