找回密码
 加入怎通
查看: 971|回复: 2

[其他] 何为搜索引擎机器人?

[复制链接]
天津旋木 发表于 2013-01-18 17:55:31 | 显示全部楼层 |阅读模式
    搜索引擎机器人也称网络蜘蛛(Web Spider),这是一个很形象的名字。把互联网比喻
/ \* g' X9 x& W8 N7 z* h# u" ^* Q成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛通过网页的链接地址来
* B% U2 Y  |/ Y+ k& S6 k7 |4 q( r寻找网页,从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它& Z# j2 @8 g5 O+ P
链接地址,然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所
) V! S7 y7 K1 z4 G* C8 d+ C; s有的网页都抓取完为止。如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理( K8 j: y9 I3 \7 U2 W+ L
把互联网上所有的网页都抓取下来。
0 _: W- q6 _# Q( g/ j* r    在抓取网页的时候,网络蜘蛛一般有两种策略:广度优先和深度优先1 d( U  v1 c9 m
    广度优先  是指网络蜘蛛会先抓取起始网页中链接的所有网页,然后再选择其中的一个1 j$ \( M, w: k" N! s) v4 H4 M
链接网页,继续抓取在此网页中链接的所有网页。这是最常用的方式,因为这个方法可以让. J+ m( R5 X/ l; K, k7 Q
网络蜘蛛并行处理,提高其抓取速度。
6 a6 l8 M( G) S) O8 _/ n& T    深度优先  是指网络蜘蛛会从起始页开始,一个链接一个链接跟踪下去,处理完这条线% i" h" N" q! u' V2 c" [
路之后再转入下一个起始页,继续跟踪链接。这个方法有个优点是网络蜘蛛在设计的时候比5 G! U$ D+ P" z- L2 S0 A2 V
较容易。 0 Q( d" @: Q3 z0 ~0 p5 e4 C  F$ O5 i+ I
    由于不可能抓取所有的网页,有些网络蜘蛛对一些不太重要的网站,设置了访问的层数。6 {  q2 Q- C7 I
例如上图A为起始网页,属于0层,B、C、D、E、F属于第1 层,G、H属于第2层,I; P3 l5 e( ~5 e+ Z6 r
属于第3层。如果网络蜘蛛设置的访问层数为2的话,网页I是不会被访问到的。这也让有
$ E9 m( U4 `( W1 E- L! [7 J" f些网站上一部分网页能够在搜索引擎上搜索到,另外一部分不能被搜索到。对于网站设计者( N1 l* p2 j( H5 E2 E5 L- H; C
来说,扁平化的网站结构设计有助于搜索引擎抓取其更多的网页。
1 n' h5 `5 x' s( d8 B6 M0 ]网络蜘蛛在访问网站网页的时候,经常会遇到加密数据和网页权限的问题,有些网页是- U* e3 x0 B  y  g0 ]
需要会员权限才能访问。
) X# a4 |4 V" @# f  o     当然,网站的所有者可以通过协议让网络蜘蛛不去抓取,但对于一
+ O1 R6 P4 T7 e& q3 R6 h些出售报告的网站,他们希望搜索引擎能搜索到他们的报告,但又不能完全免费的让搜索者
. A7 b4 a8 H) X6 I查看,这样就需要给网络蜘蛛提供相应的用户名和密码。网络蜘蛛可以通过所给的权限对这) c1 w7 q& q) d# G3 j
些网页进行网页抓取,从而提供搜索。而当搜索者点击查看该网页的时候,同样需要搜索者; E/ P" \+ x$ |  e
提供相应的权限验证。 5 P- W7 y3 H* r
曾几何时我告诉自己:旋木你是来自天津seo世界的小可爱,可惜了,旋木感冒了,我要好好学习天津seo,做一名天津seo的三好生我爱天津卫:http://www.xuanmuseo.com/
0 e+ Z, S% R6 _. O0 M$ u9 P

9 B% `0 l( f3 V7 R. k
回复

使用道具 举报

kuangrenlian 发表于 2013-01-18 20:12:46 | 显示全部楼层
{:soso_e100:}好久没有看到有人讲这个了 重温一下。
回复 支持 反对

使用道具 举报

yyss1yy 发表于 2026-04-16 23:43:31 | 显示全部楼层
蹲了这么久,终于看到有价值的讨论,支持一下!
回复 支持 反对

使用道具 举报

    您需要登录后才可以回帖 登录 | 加入怎通

    本版积分规则

    QQ|手机版|小黑屋|网站地图|真牛社区 ( 苏ICP备2023040716号-2 )

    GMT+8, 2026-6-13 03:14 , Processed in 0.184293 second(s), 54 queries , Gzip On.

    免责声明:本站信息来自互联网,本站不对其内容真实性负责,如有侵权等情况请联系420897364#qq.com(把#换成@)删除。

    Powered by Discuz! X3.5

    快速回复 返回顶部 返回列表