! @$ \ y5 Y# w; k/ s9 ]
这篇文章主要讲解搜索引擎的蜘蛛爬虫的工作原理,包括它的四种抓取策略。: J. }# c- x3 v9 Q& j7 I @6 w
; {+ |7 c% b& ]首先呢,搜索引擎的蜘蛛抓取网页是有着一定的规律,不会去随便抓取网页,并且呢,蜘蛛是通过超连接来抓取网页的,我们刚刚说了,搜索引擎有四种抓取网页的策略,www.88msc.com下边我们一一讲解。, A- T: n: ^/ ^9 ^3 R% N1 s+ M
k% n" q+ o% ^8 E2 ^, g. c
深度优先
# V: @! e, W# H6 y3 K- z* v, A
* o( \9 Q8 t# s$ n! h: w4 o2 L& ^所谓深度优先,就是蜘蛛在一个页面中发现第一个超链接,然后爬取这个页面,当爬到第二个页面后,在第二个页面发现的第一个超链接,然后再顺着往下爬,如下图:
7 O5 V: m# D+ s4 m: m, _! Z) n( u3 l5 F/ i0 n$ F
. u0 m" F" p' i2 j- N3 V4 v- \, o% r9 C8 O9 Y
深度优先,导致蜘蛛抓取的网页的质量,越来越低,并且在传递网站权重上,也有着根本的问题。! q8 E" c9 ?% _( B+ }: ^' e
, w/ O$ X& c/ A# @" I1 Z宽度优先
) z2 M0 Q$ a6 a0 q4 u3 k! i' h8 b2 s/ q8 N# u
在深度优先上,搜索引擎有着根本的问题,那么在之后,搜索引擎又推出了蜘蛛抓取的第二个策略,也就是宽度优先,宽度优先指的是,蜘蛛会先把这个页面所有的链接都爬一次,然后在顺着这些链接往下爬,如下图:
% I6 T, G. p# V$ c! A f
+ f$ t) @3 c, x" u- o& A/ P$ Q
6 I& j6 i9 x9 N
1 G( x+ ?' v$ b3 T3 y; m但是宽度优先也存在着问题,那就是蜘蛛抓取的效率和质量问题。' g2 k! t- C2 R
/ c/ @. l0 Y1 c/ S% K; z先宽后深 – 权重优先
! Y- Y& a' ~* u8 A1 O+ J; ?% |, B
. \& \) d0 U7 Q/ H. O+ m$ S+ J现在搜索引擎是宽度和深度优先的结合,蜘蛛在抓取一个网页的时候,会先把这个页面所有的链接都抓取一次,然后再根据这些ULR的权重来判定,那个URL的权重高,那么就采用深度优先,那个URL权重低,就采用宽度优先或者不抓取。
# s& n; V0 K* X! P0 |: G
/ z9 ?7 `! k& P6 Z. x7 S3 ]3 s重访抓取策略% F; G5 K" [* k9 y8 t
4 G) U0 z/ S3 P4 j7 _' Z重访抓取策略,是最后的一个,搜索引擎蜘蛛在抓取完这个网页之后,然后根据这个页面的权重、包括它的更新频率、更新质量、外链的数量等等来判定,那么对于权重高的页面,蜘蛛会在相隔较短的时间段在回来重新抓取,比如新浪网,权重很高,搜索引擎蜘蛛都是按照秒来重新抓取的。而对于一些权重较低的页面,比如长期不更新的页面,那么蜘蛛会隔好长时间在来抓取一次,比如我们常常搜索的百度大更新,蜘蛛就是对于一些网页权重较低的页面进行一次全部的抓取,一般情况,百度大更新,一个月一次。! @$ e6 h6 _# a9 @5 j9 e5 c
1 N \( F9 a+ @. t4 G# H, S |