核心提示: 搜索引擎工作过程非常复杂,作为 SEO 从业人员,结合着自己的工作经验,简要谈谈自己对搜索引擎工作原理的了解。只有当我们了解了原理后,才能够有的放矢,提供给搜索引擎他们喜欢的信息,从而提高流量和排名。 搜索引擎的工作过程大体上可以分成三个阶段: 1、爬行和抓取:
5 H9 @+ A0 x X( N5 U2 G z- v& F3 q- M
搜索引擎工作过程非常复杂,作为SEO从业人员,结合着自己的工作经验,简要谈谈自己对搜索引擎工作原理的了解。只有当我们了解了原理后,才能够有的放矢,提供给搜索引擎他们喜欢的信息,从而提高流量和排名。 L" U8 ]- O( A1 w3 c
! P# l2 W( d* x: q: d
搜索引擎的工作过程大体上可以分成三个阶段:
: D5 h0 H& B/ C4 y& Q% w" Y1 J+ D# x0 W( G: D
1、爬行和抓取:搜索引擎通过蜘蛛通过跟踪链接访问网页,也就是咱们平时说的外链和内链,获得页面HTML代码存入数据库中。
' Z5 g$ q0 h7 }% C! K+ a/ H% D* R* l2 c7 E
2、预处理:索引程序对抓取来的页面数据进行文字提取、中文分词、索引等处理,为了搜索的时候更快的提取数据。" \% V7 K0 b$ m- @' l5 S# Z2 s4 u C
. p# F% _* B. w& S8 Q4 g2 q 3、排名:用户输入关键词后,排名程序调用索引库数据,通过计算搜索词的相关性,然后按照既定的逻辑机构排名。- N; |$ u( m+ B5 z* e/ l
. F! p8 h6 ~- Q; \1 A# P' h3 S 接下来咱们一步步去分析搜索引擎的搜索和排名机制:
1 d! g; \4 ` R) z: l& n+ @3 L6 Y, L) m& D' W2 O
1、爬行和盐城白癜风医院和抓取蜘蛛搜索引擎用来爬行页面和访问页面的程序叫做蜘蛛,大家也成为机器人(robots)。搜索引擎蜘蛛访问网站页面时类似于普通用户使用的浏览器,蜘蛛程序发出页面访问请求后,服务器返回HTML代码,蜘蛛程序把收到的代码存入原始页面数据库中。搜索引擎为了提高爬行和抓取速度,都使用多个蜘蛛一起爬行页面,提高爬行速度。* {1 t l% O- O/ {
! D" L. |9 R3 q1 Z# L
蜘蛛访问任何一个网站时,都会先访问网站根目录下的robots.txt文件。如果robots.txt文件禁止搜索引擎抓取某些文件或目录,搜索引擎就不会爬行抓取,直接过滤这些文件。
% u! L2 P" l4 N3 j: L3 d9 M9 h8 c+ }' o9 S* O. B& k
2、跟踪链接为了抓取网上尽量多的页面,搜索引擎蜘蛛会跟踪页面的链接,从一个页面爬行到另外一个页面,一层层的爬行直至没有继续往下的链接为主。
! v# V6 \8 b: ?! E. Y, w7 A8 s3 a3 m! N) b2 z
搜索引擎爬行的原理有两种:一种是深度优化,另外一种就是广度优先。
8 j# i# Q. ?, y: F% E; L/ _8 \' A! m/ @
所谓深度优先,指的就是蜘蛛沿着发现的链接一直向前爬行,直到前面再也没有其他链接指向,然后返回到第一个页面,继续爬行。' |) p4 x: @8 y% a. W
& P+ {/ v! }6 a! {" L
广度优先是指蜘蛛在一个页面上发现多个链接地址,不是顺着一个链接一直往前,而是把页面上所有第一层的链接都爬行无锡武警医院最好的白癜风治疗医院一遍后,在从第二层页面开始爬行直至最后。从理论上说,无论是深度优先还是广度优先,只要给蜘蛛足够长的时间,都能爬完整个互联网。在实际工作中,蜘蛛的带宽资源、时间都是有限的,也不可能爬行完所有的页面。所以深度优先和广度优先通常是混合使用的,这样既可以照顾到尽量多的页面,也能够照顾到一部分内页。: q! ]( p, I- B
' W& Y8 \2 K" x" O4 ~ K( K9 z
3、吸引蜘蛛那接下来我们就要思考,该如何吸引蜘蛛爬行,去抓取更多的页面,我认为应该从以下几个方面去考虑:0 t! u6 [$ I/ ^* p; Q- y9 _% Z+ Q4 P; v
% y! v' r8 b) x9 F, [ (1) 网站和页面的权重:
! R( n4 X+ e/ m/ s% b
4 g& T' v1 R6 C0 \5 \ 质量高、资格老的网站被认为权重比较高,这种网站的页面被爬行的深度也会比较高,被收录的内页也会增加。
. v n+ c) k/ v- k( l9 P0 j. J3 N; d. d" B. V/ X0 P# B
(2) 页面更新度:
& ?! \4 G" ^" S: F* R( K X
5 w( Q3 l2 S: R) J& F 蜘蛛每次爬行都会把页面数据存储起来,如果第二次爬行发现页面与第一次收录完全一样,说明这个网站页面没有更新,蜘蛛下次过来继续爬行的概率也不会很高。
* I8 U/ W0 a' ?% _& ]1 d2 D& _. [8 k; n4 ?
(3) 导入链接:
; u& K* q$ a r
2 k5 f$ Z- [: M' N/ P" r, X5 t 导入链接也就是咱们经常说的外链和内链,外链顾名思义是从外部网站导入过来的,比较多的就是友情链接。内链主要是针对网站内部来说,是指从网站的一个页面指向另外一个页面。高质量的外链可以增加网站的权重,也可以增加搜索引擎白癜风要好时是痒吗爬行网站的深度。( K+ [' Q s! v @
5 ^7 w( ~" y* M/ k9 U/ G4 X5 K (4)与首页的点击距离一般来说网站上权重最高的页面就是首页,大部分外部链接也都是指向首页,蜘蛛访问最频繁的也是首页。所以,离首页距离越近,页面的权重越高,被蜘蛛爬行的几率也会更大。
$ Z; g# ~) g- p8 Q4 b: _6 W ^# Z# c# i% @% m$ _% Z3 c
4、地址库为了避免重复爬行和抓取网址,搜索引擎内部会建立一个地址库,记录已经被发现还没有抓取的页面,以及已经被抓取的页面。( ^8 O( r$ F: S9 B# Y
) `& E* }, U! }6 ^0 \7 h) |
地址库中的URL有几个来源:
* d% R' H+ M% b/ l6 o) I, l U! t" g" f/ W; ]4 Z9 F% p+ \
(1) 人工录入的种子网站(2) 蜘蛛爬行抓取页面后,从HTML中解析出新的URL,与地址库中的数据库进行对比,如果是地址库中没有的网址,就会存入待访问的地址库。& R5 L) i7 z- T" f
; L2 H' [# `: J* L) v* Q9 `# j
(3) 站长通过搜索引擎网站页面表格提交进来的网址。7 Y) |9 D J4 Z+ f
# G! l( v y4 _! J2 N 5、文件存储搜索引擎蜘蛛抓取的数据存入原始页面数据库,其中的页面数据与用户浏览器得到的HTML是完全一样,每一个URL都有相应的文件编号。
6 A1 }2 J4 L; u
* t+ E+ l1 ?) n 6、爬行时的复制内容检测百度会定期对重复收录的页面进行检测,一般在每个月都会有一次大的更新,目的是尽可能删除那些重复收录的页面,对用户提供更多精准的信息,满足用户的搜索目的。
: }: O& u$ {% N- R |