搜索引擎机器人也称网络蜘蛛(Web Spider),这是一个很形象的名字。把互联网比喻
T+ a$ W+ [; q) b) K成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛通过网页的链接地址来
6 W' g1 L7 [, N& X寻找网页,从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它
, g; L# @' ~: G1 s链接地址,然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所
\! Q8 d( D/ p4 c7 \7 y有的网页都抓取完为止。如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理7 l W: x1 }' X
把互联网上所有的网页都抓取下来。
* q4 U7 D) P2 z: `; \3 W 在抓取网页的时候,网络蜘蛛一般有两种策略:广度优先和深度优先
; q: R- R: g8 ~. z5 y 广度优先 是指网络蜘蛛会先抓取起始网页中链接的所有网页,然后再选择其中的一个
$ M. I+ H# g& H/ u" X# S链接网页,继续抓取在此网页中链接的所有网页。这是最常用的方式,因为这个方法可以让4 V3 V: R' }: U2 R
网络蜘蛛并行处理,提高其抓取速度。 ' U) }5 c- D8 g% J
深度优先 是指网络蜘蛛会从起始页开始,一个链接一个链接跟踪下去,处理完这条线
: H p4 Z# y) n/ Q9 `7 a% K$ }路之后再转入下一个起始页,继续跟踪链接。这个方法有个优点是网络蜘蛛在设计的时候比$ a5 i1 f6 [" t/ D: r) s
较容易。 4 @7 n" w a6 \: f! N4 k2 \
由于不可能抓取所有的网页,有些网络蜘蛛对一些不太重要的网站,设置了访问的层数。
6 z" f9 n$ L0 c2 A- I* N9 O6 P4 d例如上图A为起始网页,属于0层,B、C、D、E、F属于第1 层,G、H属于第2层,I
: e3 r+ c* p7 ^, @属于第3层。如果网络蜘蛛设置的访问层数为2的话,网页I是不会被访问到的。这也让有
+ V$ P2 n& u5 N) w些网站上一部分网页能够在搜索引擎上搜索到,另外一部分不能被搜索到。对于网站设计者
/ ?) q0 l) r7 c* d5 I) N4 y来说,扁平化的网站结构设计有助于搜索引擎抓取其更多的网页。 1 c0 t) ^# |4 x' V# g- U: O) y
网络蜘蛛在访问网站网页的时候,经常会遇到加密数据和网页权限的问题,有些网页是& ]4 I* A8 c( h+ @8 j
需要会员权限才能访问。5 K2 c9 q( R6 b" }5 b( ?
当然,网站的所有者可以通过协议让网络蜘蛛不去抓取,但对于一
/ ~+ z3 h2 r! }些出售报告的网站,他们希望搜索引擎能搜索到他们的报告,但又不能完全免费的让搜索者
( M5 t8 Y, z. I& D: Y4 i6 ]9 C) r查看,这样就需要给网络蜘蛛提供相应的用户名和密码。网络蜘蛛可以通过所给的权限对这
3 k8 u8 o: Z0 o9 Z! ~% O) P8 B些网页进行网页抓取,从而提供搜索。而当搜索者点击查看该网页的时候,同样需要搜索者
5 q+ U, p9 y5 n提供相应的权限验证。 3 g1 d) ]- V9 c+ A1 V- m
曾几何时我告诉自己:旋木你是来自天津seo世界的小可爱,可惜了,旋木感冒了,我要好好学习天津seo,做一名天津seo的三好生我爱天津卫:http://www.xuanmuseo.com/
+ p8 a( H" F8 V3 S# x F, L$ y! y* [7 @, Y, b# g( b
|