很多人在群里聊到一些事情,比如原创是如何被搜索引擎确定的?核桃今天分享一下自己对搜索引擎确定原创内容的看法。
7 a/ x8 }. ~4 W4 f% x 首先我们明确两个概念:原创与伪原创' p; ]& A! X2 w2 N
原创:简单地理解就是第一次在网络上发表的内容。- J5 p: U0 {' h9 R- S
伪原创:就是对原创进行的第二次或者第n次经过修改的转载发表。比如修改标题,增加摘要,转载不完整内容等等。
4 n7 v7 h" \; M9 J8 e- Z 搜索引擎对于原创的判断是如何进行的呢?$ J1 a( |: ^- N) {, h9 ~ p9 I
一般来讲有以下几个方面的因素决定:
2 x/ Z/ p5 N h8 e# @; l6 J 1、快照日期。) T* k- a8 [( r& h- `3 u7 n
2、蜘蛛抓取日期。
" S7 m) O4 y% @% Q# }; z 3、页面外链的多少。% O' X6 b4 @# J$ k- i
4、文章修改的程度。, N5 M! v$ @6 M$ e
举例:如果一篇标题为《搜索引擎如何确定你的就是原创内容》的文章在今天10点第一次发表在一个博客或者网站上。会有什么结果呢?* d6 W* d0 Z$ B9 [& Z" D
搜索引擎蜘蛛来到这个博客或者网站,发现这个页面,分析内容,放入数据库,并且被确定为首次发现,这肯定就是原创了!
8 ^3 w# H T/ m: Y& ^! u; g- j 那么这个收录与判断的过程中间有几个细节方面问题:
6 n$ h Y0 W. K9 T 1、必要条件- Z/ m# o4 d: c) q. z' C+ M# _
——假如这个网站没有被收录,这篇文章会认为是原创吗?
* K* f/ o. g* h% c$ y" e% k ——当然不是!因为它根本不可能出现在搜索数据库里!6 P: O7 F6 @3 Y1 |
——如何让它成为原创内容?; o0 n& }) X, A: c2 r
——第一个条件,网站必须有被搜索引擎收录。
# k1 ]. d, Z4 W: B% f: J+ s ——假如这个网站收录了,但是不经常更新呢?
* }. {( |* \: C: R( S# e ——很简单,如果不经常更新,发表的文章到收录的时候也会认为是原创的。4 g6 I; \! n( V; s
3、转载与采集
5 D$ o0 a0 i8 r3 O9 ~8 V, l9 D ——如果文章被转载了呢?
1 h. b. g6 {" L# k) S1 e9 a ——如果文章被转载,那么看转载这篇文章的站更新周期与首次发表站的更新周期哪个更快。
! d9 B+ A( m- I/ L- X; [2 X ——不太明白更新周期。
6 X, t, ~2 d X4 `: C' a/ h ——比如在a站发表,b站转载,如果蜘蛛先访问了a站,发现了文章,再来到b站发现了文章,很明显的,原创权重归a站。0 I' t) S- q8 D b8 \
——采集的情况是否符合这种情况?
& n) E. S) Y, D+ [( ~1 @ ——是的,采集的情况一样。如果b采集a,但b收录比a早,b就可能变成原创喽!0 u6 I9 T1 u8 _# c
4、访问时间4 {, W0 t7 o# r. P
——如果蜘蛛先访问了b站呢?. @# D4 _% v+ L2 x; N
——当然权重给b站,一般的情况下都会这样!
2 g7 C2 S4 j6 A. n4 [5 w' u o ——如果b站转载的文章带了a站的原文章页面链接呢?9 @% N- ]6 D: _1 n; ^
——这就很明白了,刚收录的时候,如果排名,两条结果一起出现,有可能还是b站的排名好一点。/ S2 i0 R: x/ j7 d3 i
当然,文章转载次数多了以后,a站的链接越多,对a站的文章越有好处,排名会慢慢变成a站在前面。
1 y$ v; }) E$ M3 C ——如果另外转载的文章带的是b站页面的链接呢?) H9 n& Q H- r" Z( M$ z1 S
——这种情况就搞笑了,给搜索引擎开了个玩笑,但它们如果判断不好,就变成了一个链接流行度的比赛了。
/ F9 E2 ?2 P' d 不过,如果都有很多外部链接,并且相差不大,那么判断的规则应该回到原点,谁先被收录谁就是原创。' l2 b* ?+ i+ `4 r& ?4 O( C
5、快照日期: R7 U# M/ v: \
——快照日期显示时间最早的,一般就是原创了吧!
3 }# a: q, u+ t: _; G ——不一定,这个说法要在一个更新周期之内,比如说文章发表后一周内,快照时间越早的地址将越有被认可为原创的可能。
8 P" K C0 i' ^) Y8 J5 n 但如果文章都发表了几个月了,说不定搜索引擎已经重新获取过快照了,快照的日期就变了!( r+ z8 N+ p: {# R5 `8 i5 E9 W
——还有其它的可能吗?' ?8 ]8 K' y5 s s. `' s, f5 s1 O
——有,一般比如百度收录,他可能会有一个收录的数据库,经过过滤后,收录的内容才会到搜索结果里来。在这个期间就有一些问题了,比如a站首次发表,b站转载。蜘蛛先访问a站再访问b站。而后可能先把b站的结果放出来了,而a站还在数据库里。
- E l; L7 a* b9 [: s9 |/ Z2 }0 L$ V 所以说搜索引擎没有收录并不表示搜索引擎蜘蛛没有访问过这些内容,也许在搜索引擎的库存里已经有记录了,只是你查的时间没有放出来而已,就像25号才放出来的内容,但是快照是20号的,这就是搜索引擎的库存内容,同时这也是检验原创的核心时间点。+ ^ D- Z+ M$ d' ^! D
这种情况一般出现在新站与老站之间,a站发表,b站转载,但a站在搜索引擎的信任度并不高的时候。不过只要是a站先被访问到的,原创权还是a站的,这是最难分出来的情况,因为我们不知道蜘蛛先访问哪个站,除非你知道两个站的网站空间日志内容,能看到搜索引擎对两个页面的访问时间。. A: Q& r5 j7 n( w/ R6 y
6、伪原创
2 O7 U# e( x% C, B) V ——伪原创也会被认为是原创?0 H( j' l C1 `: {0 O6 w
——大多时候是这样的,搜索引擎蜘蛛智力相当于三岁小孩子一样,不能明确分别这些东西,因为它的思维太程式化了。如果你的标题改过,文章的段落改过,那么蜘蛛将很难确定这篇文章是否有过收录,也许它可以确定有部分内容是重复的,但它也不能因为这些而将这篇文章确认为是转载!当然,随着搜索引擎程式设计的提高,应该会有一个相似度的东西出来,比如文字内容相似度超过百分之几就会被认为是转载。1 u% D; w- `) d
这样分析下来,相信大家应该了解了吧。只是核桃自己的看法,希望大家吸收自己想要的东西,不认同的了也来提下自己的意见!
1 ~: T, {/ }6 x5 @% I O 另外提几个建议:( f( b/ o+ L" Z. |3 L9 U8 B
1、如果你的站是新站,权重不高,如何让蜘蛛首页找到你的页面并放入数据库?其实很简单:用网摘、百度收藏这些工具让蜘蛛更快的找到你的页面!
, z3 d9 c6 U( R c \1 e 2、大家都有过建议,就是加上自己的版权及内容页面的地址,别人采集的时候你就爽了,收录虽然不会快,但最后链接多了,你依然是原创内容。( ^6 L3 W% m: F
3、发表文章等到自己收录以后再去其它的站点进行发表,同时加上自己的原文地址,这种办法很有保障!大站被采的机率很大!
1 t0 ~( }; D, a |