- @) z$ M4 e! e& E8 U% M 这篇文章主要讲解搜索引擎的蜘蛛爬虫的工作原理,包括它的四种抓取策略。
# p8 I( v) i/ w) Q0 b0 u# g1 k' n8 q
首先呢,搜索引擎的蜘蛛抓取网页是有着一定的规律,不会去随便抓取网页,并且呢,蜘蛛是通过超连接来抓取网页的,我们刚刚说了,搜索引擎有四种抓取网页的策略,www.88msc.com下边我们一一讲解。
2 m$ M6 C1 N# p( ~" H" e9 k- f8 W% Q' \) W, J- u1 G v* R( [
深度优先
4 ^- h$ Z' X+ v1 r$ U" h S0 Y* u$ K" w; x8 e3 b$ S* E
所谓深度优先,就是蜘蛛在一个页面中发现第一个超链接,然后爬取这个页面,当爬到第二个页面后,在第二个页面发现的第一个超链接,然后再顺着往下爬,如下图:$ V7 D" [4 [# \4 `
y. N. n5 L" k$ ^7 S$ G) I0 d0 c
/ J3 O* A4 h7 e* k9 {% W" h/ P- m7 M% T) C& U
深度优先,导致蜘蛛抓取的网页的质量,越来越低,并且在传递网站权重上,也有着根本的问题。$ J- z2 {9 u' S8 ~& L
% L; |$ k% P# b2 g7 |) S" W+ Y宽度优先# Y- n4 A; o* e1 @
' C6 V" } i% U7 l/ t9 t) p
在深度优先上,搜索引擎有着根本的问题,那么在之后,搜索引擎又推出了蜘蛛抓取的第二个策略,也就是宽度优先,宽度优先指的是,蜘蛛会先把这个页面所有的链接都爬一次,然后在顺着这些链接往下爬,如下图:
5 _( |6 s6 Z. \ O8 \
9 E6 h5 @% V B* `& B4 K9 I
& E: K0 F3 o4 Q9 f) O7 c3 h N: d6 _ @" X( [- l0 D; u
但是宽度优先也存在着问题,那就是蜘蛛抓取的效率和质量问题。
# u, x, w4 g3 e U( J0 F9 }- }
6 L* ]) d. w9 l7 l先宽后深 – 权重优先
4 H% L3 V/ l9 t8 G; h& D) F7 u, l: a, y5 `6 B0 L& ]( y1 u
现在搜索引擎是宽度和深度优先的结合,蜘蛛在抓取一个网页的时候,会先把这个页面所有的链接都抓取一次,然后再根据这些ULR的权重来判定,那个URL的权重高,那么就采用深度优先,那个URL权重低,就采用宽度优先或者不抓取。
9 J) q" t9 f) C) U0 Y
5 Z' o4 W) s3 O$ x( G重访抓取策略0 d- l7 u9 l$ T" e! M
8 ]6 R9 A* t, r! \9 u
重访抓取策略,是最后的一个,搜索引擎蜘蛛在抓取完这个网页之后,然后根据这个页面的权重、包括它的更新频率、更新质量、外链的数量等等来判定,那么对于权重高的页面,蜘蛛会在相隔较短的时间段在回来重新抓取,比如新浪网,权重很高,搜索引擎蜘蛛都是按照秒来重新抓取的。而对于一些权重较低的页面,比如长期不更新的页面,那么蜘蛛会隔好长时间在来抓取一次,比如我们常常搜索的百度大更新,蜘蛛就是对于一些网页权重较低的页面进行一次全部的抓取,一般情况,百度大更新,一个月一次。
3 H4 _$ o2 A4 u* S: r% E, ?" t; B! {, M
|