搜索引擎机器人也称网络蜘蛛(Web Spider),这是一个很形象的名字。把互联网比喻
; ]$ r; U& s% o1 j G0 ?成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛通过网页的链接地址来1 {) V9 K8 j U# C. `
寻找网页,从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它
8 G4 M# E. @3 W' J% f8 G链接地址,然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所) U6 q: V* b8 r4 Q0 z
有的网页都抓取完为止。如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理
- k& l% b2 z5 @# _7 V' q把互联网上所有的网页都抓取下来。 4 w9 z) k/ |1 a& F
在抓取网页的时候,网络蜘蛛一般有两种策略:广度优先和深度优先& M) d2 V o& n6 M: G. B
广度优先 是指网络蜘蛛会先抓取起始网页中链接的所有网页,然后再选择其中的一个$ `8 @, G: Q9 \& O! Q2 S
链接网页,继续抓取在此网页中链接的所有网页。这是最常用的方式,因为这个方法可以让
m. u9 S. k4 G ]6 j1 I4 ` O7 y网络蜘蛛并行处理,提高其抓取速度。
; m$ W* y* M6 N1 k 深度优先 是指网络蜘蛛会从起始页开始,一个链接一个链接跟踪下去,处理完这条线+ l0 |: f! ~$ D+ s
路之后再转入下一个起始页,继续跟踪链接。这个方法有个优点是网络蜘蛛在设计的时候比; |% M& x+ N# d; n* i9 k \
较容易。
6 _& G \; a+ M: C9 } 由于不可能抓取所有的网页,有些网络蜘蛛对一些不太重要的网站,设置了访问的层数。8 }" R, ~) ]) r" B+ o9 j! H
例如上图A为起始网页,属于0层,B、C、D、E、F属于第1 层,G、H属于第2层,I
' p1 L5 x; D+ {' X2 r# \6 E属于第3层。如果网络蜘蛛设置的访问层数为2的话,网页I是不会被访问到的。这也让有* u' u$ M0 G( \% `
些网站上一部分网页能够在搜索引擎上搜索到,另外一部分不能被搜索到。对于网站设计者' H7 H" z8 d* D8 s
来说,扁平化的网站结构设计有助于搜索引擎抓取其更多的网页。 # @+ C2 x$ P. u ]
网络蜘蛛在访问网站网页的时候,经常会遇到加密数据和网页权限的问题,有些网页是, w, f, O- K& r9 o
需要会员权限才能访问。! M7 S7 D6 D O7 l, i f; i- r
当然,网站的所有者可以通过协议让网络蜘蛛不去抓取,但对于一7 t- d7 s) B x4 k9 f+ D* t/ O. X+ K
些出售报告的网站,他们希望搜索引擎能搜索到他们的报告,但又不能完全免费的让搜索者) Z$ i1 L* \2 ~+ b' N! f: l
查看,这样就需要给网络蜘蛛提供相应的用户名和密码。网络蜘蛛可以通过所给的权限对这
+ y! T: z$ `" l) ^, n1 m7 [, a( {些网页进行网页抓取,从而提供搜索。而当搜索者点击查看该网页的时候,同样需要搜索者
3 s( |3 g: i% }% p" M: A提供相应的权限验证。
: L7 W( k2 L# U9 I1 N曾几何时我告诉自己:旋木你是来自天津seo世界的小可爱,可惜了,旋木感冒了,我要好好学习天津seo,做一名天津seo的三好生我爱天津卫:http://www.xuanmuseo.com/
2 r: O9 n1 L- Q0 R2 h$ O5 w& J: u- A7 D
/ Z# y7 N# u! i6 c |