找回密码
 加入怎通
查看: 348|回复: 4

[其他] 搜索引擎蜘蛛是按照什么样的策略进行的爬取呢

[复制链接]
ako3922 发表于 2013-07-26 10:40:20 | 显示全部楼层 |阅读模式
  做站有一段时间了,在这段时间里,对搜索引擎有了新的认识--首先立场不同了,自然认识也不同了。以前是作为搜索引擎的使用者,只是关心搜索引擎能不能正确的找到我需要的资料。现在立场不同了,成了搜索引擎的上游内容提供者,可以近距离观察搜索引擎的工作情况,对搜索引擎有了深入的认识。特别是本站下定决心更换新域名前后,对搜索引擎的工作特别关心,每天都注意观察三大搜索引擎的收录页面数,有了一些体会,下面给大家随便谈一下,不当之处,请高手指正:3 r/ K+ |# ?  i, b; d5 C# ~  H
4 y  v0 K% O+ d; y% w
  搜引得擎蜘蛛是按照啥子样的策略施行的爬取呢
" [5 q. Y7 B7 @, {0 v0 Y6 K; L) P6 c; |
  那么到底搜引得擎蜘蛛是按照啥子样的策略施行的爬取呢?以下我们来施行更深化的剖析吧。第一、宽度优化遍历策略0 ?$ r9 f: W+ G

4 D# ^7 V& g. C$ g! Z5 ?( z4 @  宽度优化遍历是一种十分简单直观且历史很悠久的遍历办法,在搜引得擎爬行动物一出现就起始采用了。新提出的抓取策略往往会将这种办法作为比较基准,但应当注意到的是,这种策略也是一种相当悍勇的办法,众多新办法实效果不见昨比宽度优化遍历策略好,所以至今这种办法也是众多实际爬行动物系统优先采用的爬取策略。网页爬取顺序基本是按照网页的关紧性排序的。之所以如此,有研讨成员认为,假如某个网页包含众多入链,那么更可能被宽度优化遍历策略早早爬到,而入链这个数从侧面体现了网页的关紧性,即其实宽度优化遍历策略隐含了一点网页优化级如果。第二、非纯粹pagerank策略( Z6 {  w3 l7 i$ k3 E

- J6 m. ]1 |/ g4 `: T0 J. O- X+ B  PageRank是一种闻名的链接剖析算法,可以用来权衡网页的关紧性。很洒脱地,可以想到用PageRank的思想来对URL优化级施行排序。不过这搭有个问题,PageRank是个全局性算法,也就是说当所有网页下载完成后,其计算结果才是靠得住的,而爬行动物的目标就是去下载网页,在运行过程中只能看见一局部页面,所以在爬取阶段的网页是无法得到靠得住的PageRank得分的。对于已经下载的网页,加上待爬取的URL队列中的一URL一起,形成网页聚齐,在此聚齐内施行PageRank计算,计算完成然后,将待爬取URL队列里的网页按照按照PageRank得分由高低排序,形成的序列就是爬行动物接下来应当依次爬取的URL列表。这也是为何称之为“非纯粹PageRank”的端由,第三、OPIC策略( Online Page Importance Computation)
' n9 p+ i+ `# |, O+ K# _: i# M( O( w8 V3 k
  OPIC的字面含义是“在线页面关紧性计算”,可以将其看做是一种改进的PageRank算法。在算法起始之前,每个互联网页面都赋予相同的现金,每当下载了某个页面P后,P就将自个儿拥有的现金均分给页面中包含的链接页面,氢自个儿的现金清空。而对于待爬取URL队列中的网页,则依据其手边拥有的现金金额若干排序,优先下载现金最充裕的网页,OPIC从大的框架上与PageRank思路基本相符,差别在于:PageRank每每需要迭代计算,而OPIC策略不必迭代过程。所以计算速度远远快与PageRank,适应实时 计算使役。同时,PageRank,在计算时,存在向无链接关系网页的长程跳转过程,而OPIC没有这一计算因数。实验结果表明,OPIC是较好的关紧性权衡策略,效果略优于宽度优化遍历策略。第四、大站优化策略( r1 t/ _& V0 H0 c: [3 {
$ J& q$ j% ]% ^; U* B
  大部优化策略思路笔直接:以网站为单位来选题网页关紧性,对于待爬取URL队列中的网页依据所属网站归类,假如哪个网站等待下载的页面最多,则优化先下载这些链接,实则质思想倾向于优先下载大型网站。因为大型网站往往包含更多的页面。鉴于大型网站往往是闻名企业的内容,其网页质量普通较高,所以这个思路虽然简单,不过有一定依据。实验表明这个算法效果也要略优先于宽度优先遍历策略。第五、网页更新策略
2 M9 N7 {$ l5 `8 d9 @7 f8 ?& x2 ^/ g9 a
  互联网的动态是其显著特征,随时都有新出现的页面,页面的内容被更改还是压根儿存在的页面删除。对于爬行动物来说,并非将网页抓取到本地就算完成任务,也要体现出互联网这种动态性。本地下载的网页可被看做是互联网页的镜像,爬行动物要尽可能保障其相符性。可以如果一种情况:某 个网页已被删除还是内容做出重大变动,而搜引得擎对此惘然无知,毅然按其旧有内容排序,将其作为搜索结果提提供用记,其用户体验度之糟糕不言而喻。所以对于已经爬取的网页,爬行动物还要负责保持其内容和互联网页面内容的同步,这取决于爬行动物所彩用的网页更新策略。7 d8 Z3 U- v- c/ H) o
! @. P9 v! n  ^# b$ ~
  最后唠叨一句,真正懂seo的人,其实待遇还是不错的。我本人有体会,众多seo爱好者、学习者,坚持吧,让你的资源成为你的资本,什么问题都将不是问题。本文由阿里巴巴产品发布和更新 http://jiq.swy365.com/ 收集整理欢迎转载,转载请注明- z) j  p/ s, u( R
! q6 b; Y5 \& r; o

暂时无法加载帖子列表

回复

使用道具 举报

drplay 发表于 2026-08-24 21:09:30 | 显示全部楼层
这个分享太实用了,刚好能用到,感谢楼主!
回复

使用道具 举报

seoaz 发表于 2026-09-05 21:22:18 | 显示全部楼层
这个思路很新颖,打开了新世界的大门,谢谢分享
回复

使用道具 举报

三营三连bdf 发表于 2026-09-08 23:53:24 | 显示全部楼层
楼主辛苦了,整理这么多内容,必须点赞收藏
回复

使用道具 举报

qai520 发表于 2026-09-10 21:12:07 | 显示全部楼层
刚好遇到类似问题,看完这个帖子心里有底了
回复

使用道具 举报

    您需要登录后才可以回帖 登录 | 加入怎通

    本版积分规则

    QQ|手机版|小黑屋|网站地图|真牛社区 ( 苏ICP备2023040716号-2 )

    GMT+8, 2026-9-11 02:02 , Processed in 0.035924 second(s), 25 queries , Gzip On.

    免责声明:本站信息来自互联网,本站不对其内容真实性负责,如有侵权等情况请联系420897364#qq.com(把#换成@)删除。

    Powered by Discuz! X3.5

    快速回复 返回顶部 返回列表