百度曾在站长贴吧里做过这样一个回复:从用户体验角度,“有些转载未必比原创差”。比方一篇科技原创博文,被知名门户网站的科技频道转载。如果这种转载保留原创者姓名和出处链接,实际上对原创者是有利的,因为起到了更好的传播效果。只是国内的转载,很多是掐头去尾,使原创者比较受伤。( o: r- e/ \7 L! ^
6 g6 `. P! f/ c据资料表明近似重复网页的数量占网页总数的的比较高达全部页面的29%,而完全相同的页面大约占全部页面的22%。很多站长都会抱怨,自己写的文章被转载后要么排名消失、要么转载站排在前面,比如下图:" I/ _ b1 @! b$ w4 G* O# d
在解决这个问题之前,我认为有必要了解下搜索引擎的“去重算法框架”,换个角度看看搜索引擎是怎么给网页去重的。
# s- t2 O: v4 M- U8 T7 ]" _* s) q7 r1 f# K$ ?
5 O/ O) P& g' J i2 c' B$ l% m因为互联网上有大约22%的内容是相同的,一旦你的文章发表在网上,就有可能会被转载,而一般判断帮你的网页为转载,那么搜索引擎一般会从三个时间段来删除你的网页:
6 x6 I, y7 W" Z. ^5 D5 ]' P/ f7 F* q0 u- P( h. C
(1)抓取页面的时候删除,这样可以减少搜索引擎带宽以及减少存储数量;
% ?1 P+ T$ W. f& @/ H
# S) S4 B9 ?, C" [8 j' m9 V(2)收录之后删除重复网页;
% [. C6 Y4 R8 R& B2 \1 _! |
* [$ w- B; X* T(3)用户检索时候进行再次删除;增加准确性,耗费时间;; m4 e' _( I) n. ^
: L( U6 {# a. T2 U
内容重复的4种类型:& [3 s8 _5 z* ?" R3 j
6 g4 h7 [1 n8 C" I/ y ?/ G0 ]1.如果2篇文章内容和格式上毫无差别,则这种重复叫做“完全重复页面”
! y6 y$ O) o6 f4 ~% K% w; Y/ O3 s
! t4 L# T7 ?% W* \/ K2.如果2篇文章内容相同,但是格式不同,则叫做“内容重复页面”
& ]5 V2 h1 _2 b9 E3 @( {
- c. u$ N+ e7 X0 d: q7 t3.如果2篇文章有部分重要的内容相同,并且格式相同,则称为“布局重复页面”2 C% c( |" a/ {1 \5 {
4 i+ q) t. _* H+ _4.如果2篇文章有部分重要的内容相同,但是格式不同,则称为“部分重复页面”8 r; E/ _" S- J b$ v \
% f8 R# a6 m- |0 Y" J7 {3 d4 |. `5 A删除重复网页对于搜索引擎有很多好处:
$ _" w, c1 X7 n/ G) }$ C; R5 J9 _' v' W3 ]% F
1.如果这些重复网页并从搜索引擎数据库中去掉,就能节省一部分存储空间,提高检索的质量。 l4 p1 q- V) z @/ {
: \& A& R( }6 `" F* i P$ W% _2.为了提高网页的搜集速度,搜索引擎会对以往搜集信息的分析,预先发现重复网页,在今后的网页搜集过程中就可以避开这些网页,这就是为什么总转载的网站排名不高的原因了。
$ c( {/ l4 G+ y) k' C: k
A5 H F4 N" Y3.对某个镜像度较高的网页,搜索引擎会赋予它较高的优先级,当用户搜索时就会赋予它较高的权重。
3 N8 s6 b. j+ H" k8 i8 e$ d
: O1 j4 C2 j( \; ~4. 近似镜像网页的及时发现有利于改善搜索引擎系统的服务质量,也就是说如果用户点击了一个死链接,那么可以将用户引导到一个相同页面,这样可以有效的增加用户的检索体验。7 \; R7 `! O$ z% E2 w
- a- l$ i1 |' }" q
通用去重算法框架0 c9 v4 E# Z) x) g# f7 i
s. X0 k' l) V3 x对于网页去重任务,具体可以采取的技术手段五花八门,各有创新和特色,但是如果仔细研究,其实大致都差不多。
, o: f+ h6 m/ Q |