找回密码
 加入怎通
查看: 673|回复: 2

[站长八卦] 搜索引擎抓取信息的原理

[复制链接]
TONY 发表于 2014-10-09 14:58:17 | 显示全部楼层 |阅读模式
    我们都知道,我们在百度输入一个关键词,在一瞬间会出现很多页面,其中发什么什么变化呢?他是如何展现出来的呢?今天我们就来分析一下它是如何抓取以及排序的。. ^* k# Z* t4 C: Z
    百度工作原理$ u$ Y5 P" u8 F6 C4 V
    我们可以看到,在百度搜索一个关键词,它首先会在分析你的关键词,然后去数据库中找到你想要的结果,并计算出排列顺序,然后给你展现出来。这就是一个排序过程。它怎么知道什么页面排在第一页。什么排在第二页。这就需要一个算法,进行排序。他早已经算好,放在它的数据库中。那么数据是从哪儿来的呢?! I0 q0 Q6 A; s4 ^
    如果你的内容它没有抓取到,是不能展现给你相对应的结果的。它需要把内容提前抓取好,存好,分好类。再给我们指令来进行相应的反馈,并且展示出来。从图上我们可以看到,它是经过抓取,建库这么一个过程。这就是我们所说的收录。1 p# Z' ^$ q$ D7 @& p8 M' {
    步骤一:抓取
& x6 g5 M2 g# ~5 M9 e7 [; S3 N    那么什么是抓取呢?抓取就是蜘蛛已经开始爬了。建库是百度已经把你的数据放入自己的数据库中了。虽然过程很复杂,但原理是不变的。抓取从哪儿抓呢?互联网!我们都知道互联网是海量的。蜘蛛就要去不停的爬行,在海量的互联网中抓取有价值的内容,然后筛选。- |! p& A9 c" w
    步骤二:建库9 v6 d; T3 ~5 C0 |# w4 ]( M+ }
    蜘蛛爬完之后会放到所对应的数据库中,比如你是企业站站啊,你是图片啊,它会进行分类和精细的筛选。
6 F7 e9 ]. l+ l# `1 l% x* v    步骤三:内部分析6 n0 z; q" V- o/ R8 E4 ^6 i
    建库之后它内部就会进行分析。把它之前抓取的内容进行拆分,包括分词啊。包括连接的权重。全部进行算好之后放入索引数据库中。只要你去给它一个请求,它就会调用数据,给我们展示出来。过程是毫秒计算的,比较快,提前已经给你分析好了,无时无刻都在分析。如果你的内容没有抓取到,就不存在建库,也不存在排序。5 D9 l. e/ z  }6 q% d
    步骤四:计算排列顺序。4 t3 g, s% p; m( ^( T3 P) _5 r
    它会根据你页面的价值进行排序。页面质量好的,它认为最接近用户需求的页面,它就会考虑放在前面。它会考虑你这个页面对用户的价值。$ l1 a' B( c( K8 ^
    总结:这就是搜索引擎的抓取原理。我们要做的就是提交我们的没有收录的页面,先让它收录。只有收录才会展现,其次要做好高质量的页面,只有你页面的质量OK抓取后才会有更好的展现。
: S" s/ Q4 S4 t5 c4 [+ p
) W. G2 ^- s, ]3 m2 m0 S: u2 t

暂时无法加载帖子列表

回复

使用道具 举报

◇|OvЁ寶 发表于 2026-09-09 09:14:21 | 显示全部楼层
这个思路很新颖,打开了新世界的大门,谢谢分享
回复

使用道具 举报

融兴恒资本 发表于 2026-09-10 19:16:34 | 显示全部楼层
说得很实在,没有夸大其词,这种真实分享太难得了
回复

使用道具 举报

    您需要登录后才可以回帖 登录 | 加入怎通

    本版积分规则

    QQ|手机版|小黑屋|网站地图|真牛社区 ( 苏ICP备2023040716号-2 )

    GMT+8, 2026-9-10 21:29 , Processed in 0.066767 second(s), 27 queries , Gzip On.

    免责声明:本站信息来自互联网,本站不对其内容真实性负责,如有侵权等情况请联系420897364#qq.com(把#换成@)删除。

    Powered by Discuz! X3.5

    快速回复 返回顶部 返回列表