) g! Y5 Q% c/ `& v
这篇文章主要讲解搜索引擎的蜘蛛爬虫的工作原理,包括它的四种抓取策略。
# D% B! l: K' z! {( c1 V' y* X
5 K6 Z. v5 h$ A' J4 }" O1 a: t& ?首先呢,搜索引擎的蜘蛛抓取网页是有着一定的规律,不会去随便抓取网页,并且呢,蜘蛛是通过超连接来抓取网页的,我们刚刚说了,搜索引擎有四种抓取网页的策略,www.88msc.com下边我们一一讲解。
0 N$ j) m4 G; G
+ v5 J) n: q7 L& u5 m% a; c; e深度优先
* M, o$ W) P0 V! i3 b, J
; o/ X. _6 q: u8 U" z) \) e! P所谓深度优先,就是蜘蛛在一个页面中发现第一个超链接,然后爬取这个页面,当爬到第二个页面后,在第二个页面发现的第一个超链接,然后再顺着往下爬,如下图:
7 k( }' z3 V- n5 v. h+ g3 V
, t8 p2 c& L# e# e+ x# U5 s0 _8 S% @% Y! M
' x: u$ B3 _3 V' K7 @. }+ t1 w. j深度优先,导致蜘蛛抓取的网页的质量,越来越低,并且在传递网站权重上,也有着根本的问题。
$ L$ u2 s! R8 w- i: n/ F4 Y- n+ K8 U4 G! G$ k9 T
宽度优先' m- W& U+ R) ]4 c& R; J8 b
9 c2 k r3 t" M8 Q: [在深度优先上,搜索引擎有着根本的问题,那么在之后,搜索引擎又推出了蜘蛛抓取的第二个策略,也就是宽度优先,宽度优先指的是,蜘蛛会先把这个页面所有的链接都爬一次,然后在顺着这些链接往下爬,如下图:
( g* S5 @! ?. Y) F# r$ Y1 g! C9 c: N' d
7 _ b |% Y/ w% Q
( A, q1 J* x5 a/ c( r2 L6 ]" G但是宽度优先也存在着问题,那就是蜘蛛抓取的效率和质量问题。
7 r! q- V' Q& p
* d4 l+ Y) w p% R5 B先宽后深 – 权重优先
' f4 ], Q) Q# u* u, _! C2 d' _* s$ \$ v( V; q6 l1 h* A
现在搜索引擎是宽度和深度优先的结合,蜘蛛在抓取一个网页的时候,会先把这个页面所有的链接都抓取一次,然后再根据这些ULR的权重来判定,那个URL的权重高,那么就采用深度优先,那个URL权重低,就采用宽度优先或者不抓取。% C& A1 M7 T' S% g
1 x4 L4 f% I! s( [
重访抓取策略3 x! E% b C0 J% C& f$ d
0 o, C8 Y% o& B6 Y7 m重访抓取策略,是最后的一个,搜索引擎蜘蛛在抓取完这个网页之后,然后根据这个页面的权重、包括它的更新频率、更新质量、外链的数量等等来判定,那么对于权重高的页面,蜘蛛会在相隔较短的时间段在回来重新抓取,比如新浪网,权重很高,搜索引擎蜘蛛都是按照秒来重新抓取的。而对于一些权重较低的页面,比如长期不更新的页面,那么蜘蛛会隔好长时间在来抓取一次,比如我们常常搜索的百度大更新,蜘蛛就是对于一些网页权重较低的页面进行一次全部的抓取,一般情况,百度大更新,一个月一次。 B9 i) O8 _! Q
- y# H9 p4 l2 C3 A5 n) G |