做为一个SEOER学会分析网站日志这是必修课,有很网站出现了问题,光看网站是看不出任何问题的,这个时候要想找原因就必须配合网站来分析,才能得到一个结果。因为日志记记录了网站被搜索引擎爬取的痕迹,给站长提供了蜘蛛是否来访的有力物证,站长朋友可以通过网站日志来分析搜索引擎蜘蛛的抓取情况,分析网站的是否存在收录异常问题。并且我们可以根据这个日志文件判断蜘蛛来访频率以及抓取规律,对于网站的一个长期SEO是非常有帮助的。那我们应该如何做网站日志分析呢? 红涛前面推荐了一款工具:网站日志分析工具1 Z; G/ ^! B+ B E7 D a2 i+ Y, k
网站所以有访问纪录都会存在这个网站日志上,包括搜索引擎的记录与访客的信息。一般都会生存在网站的根目录下,常见的形式名件夹名log、weblog或www_logs。我们一般分析就得先这个方件夹里面的内容下载到本地,然后可以用记事本去打开。以下是我空间的网站日志截图:' _' s3 t% ?2 w- G/ g
" L: o N ~9 s3 p1 A
! r+ F; S6 R! \' c7 Y" E' D既然知道了日志存放在哪儿,那么我们又如何简单的入手去分析日志呢?下面我来找一段简单点的日志还看一下:5 |- C |, u# M r* N9 m/ H8 ?0 C
#Software: Microsoft Internet Information Services 6.0
8 q2 t* Y5 L, w. d$ {# @3 s#Version: 1.0# G& ~$ N; q! V) m/ V( T/ \6 p
#Date: 2011-03-01 00:00:17
" u+ }2 F% v5 j# {#Fields: date time s-sitename s-ip cs-method cs-uri-stem cs-uri-query s-port cs-username c-ip cs(User-Agent) sc-status sc-substatus sc-win32-status sc-bytes cs-bytes" P+ r" Y6 l/ M7 D% G
2011-03-01 02:44:37 W3SVC381 211.154.135.217 GET /news/news.asp id=200 80 – 203.208.60.169 Mozilla/5.0+(compatible;+Googlebot/2.1;++http://www.g o o g l e.com/bot.html) 200 0 0 29057 2981 w; }5 E. o) w# i0 y) i& A
搜索引擎蜘蛛:
$ F# h i$ C& G- r3 `' K! w百度:baiduspider Google:Googlebot Msn:msnbot9 Y$ h) r9 B3 Q7 n) e
yahoo:Slurp yodao:YoudaoBot sogou:Sogou+get+spider
, g5 K, I, K, M2 y3 S2 {' C) p搜索以上蜘蛛名称,就可以看到蜘蛛抓取的痕迹。我们重要的就是如何读懂后面的那些代码。我们称HTTP状态码。1 o7 h( t* }; L
date表示记录访问日期;
" x$ i9 o2 S$ c ztime访问时间; r9 x7 ?6 _: P; U8 }
s-sitename表示你的虚拟主机的代称。" Y6 W& N3 Q" F; }
s-ip访问者IP;
/ V! p9 L; J' A& E% ]cs-method表示访问方法,常见的有两种,一是GET,就是平常我们打开一个URL访问的动作,二是POST,提交表单时的动作;/ w, w& | Z# \: E
cs-uri-stem就是访问哪一个文件;
( {( ~; H7 S2 Xcs-uri-query是指访问地址的附带参数,如asp文件?后面的字符串id=12等等,如果没有参数则用-表示;
1 m+ }; [0 ^5 T3 m8 G0 Q/ s# Bs-port 访问的端口/ D7 h0 ~6 r3 E* v8 K1 g0 {0 \6 U3 J
cs-username 访问者名称
5 q" V) q, z1 ]8 r: pc-ip 来源ip
+ u# j0 A5 |) ^- r3 f1 n! |6 ~( Jcs(User-Agent)访问来源;
& m! N, I: \( G |sc-status状态,200表示成功,403表示没有权限,404表示打不到该页面,500表示程序有错;# N1 s& Y. `. e8 H! P. v
sc-substatus 服务端传送到客户端的字节大小;
' |8 I4 V! \# p+ |- f1 _% c' ]2 ]cs–win32-statu客户端传送到服务端的字节大小;
9 W& d' U2 E ]1**:请求收到,继续处理
; h* y2 p2 c5 @# y8 s2**:操作成功收到,分析、接受9 p/ [! ~4 S( u: m' P
3**:完成此请求必须进一步处理
$ ~" |# M2 u: i4**:请求包含一个错误语法或不能完成6 F' L8 n+ V) U# q6 |+ J; }. ]( c
5**:服务器执行一个完全有效请求失败
- }$ ~: s% v9 W100——客户必须继续发出请求, r# H0 E" w5 E& z
101——客户要求服务器根据请求转换HTTP协议版本
6 W% F. M9 f' ?% J7 J200——交易成功
" p( s( p0 k) h9 |5 s& J# Z201——提示知道新文件的URL
$ Z3 F, t& e: y! V3 f202——接受和处理、但处理未完成! n# } Q5 v( [: P
203——返回信息不确定或不完整
' n1 U0 k5 `% L* q204——请求收到,但返回信息为空+ a! ]; N9 E9 C0 [( y
205——服务器完成了请求,用户代理必须复位当前已经浏览过的文件
& S$ o, s: m3 P$ m' S206——服务器已经完成了部分用户的GET请求
0 n# _% w% Q8 z) W* Q300——请求的资源可在多处得到
; u' ~9 \* z3 o2 B% Q301——删除请求数据
( e6 J, N7 A% i! S& \* H5 C' _# M, Y9 G302——在其他地址发现了请求数据- l+ u% E( ? i* Z
303——建议客户访问其他URL或访问方式
, K, b. e3 g! H7 u; h* D6 `304——客户端已经执行了GET,但文件未变化
, M+ t9 \& R4 r+ i" i2 Y" p( w9 P305——请求的资源必须从服务器指定的地址得到
) Y6 M% l% @6 C. p! w4 n$ V& v0 S306——前一版本HTTP中使用的代码,现行版本中不再使用$ [6 ?1 a# O6 x# B
307——申明请求的资源临时性删除
! T# t6 p8 r3 j; n$ q400——错误请求,如语法错误 R4 \0 a4 z/ m
401——请求授权失败
, k& m+ b% I" \0 |4 s402——保留有效ChargeTo头响应( j1 x* q. J/ H( n; a$ ?
403——请求不允许
8 u! `1 H3 Z: f& Y404——没有发现文件、查询或URl$ R. u( s8 _, s4 |, v& h
405——用户在Request-Line字段定义的方法不允许
y8 Y- G1 ]5 F* i6 S5 w" i406——根据用户发送的Accept拖,请求资源不可访问9 Y7 x5 m* x' Q( a' E
407——类似401,用户必须首先在代理服务器上得到授权+ r8 ?* a% M3 [5 e8 z
408——客户端没有在用户指定的饿时间内完成请求
9 a, e# h1 o5 C/ y. k2 r409——对当前资源状态,请求不能完成, d- b+ A5 |# Q" r8 ^# N% ]$ }& o
410——服务器上不再有此资源且无进一步的参考地址; m2 ^; Q# g$ I# }* e( L# d
411——服务器拒绝用户定义的Content-Length属性请求* K/ C0 L7 s* W! U( `; K9 v& K5 K
412——一个或多个请求头字段在当前请求中错误
/ N k) @# P* ]( u4 c! _413——请求的资源大于服务器允许的大小4 X5 _+ O8 O) y: a% ? ^
414——请求的资源URL长于服务器允许的长度- W9 c+ J# Y- a: G5 u
415——请求资源不支持请求项目格式6 |3 P8 n7 a( `2 T
416——请求中包含Range请求头字段,在当前请求资源范围内没有range指示值,请求也不包含If-Range请求头字段
; F5 D. b* c7 u+ D$ k% G( ]- r4 _6 R417——服务器不满足请求Expect头字段指定的期望值,如果是代理服务器,可能是下一级服务器不能满足请求" V; E# `( s/ ]& K
500——服务器产生内部错误
: m: S( t. e# Q5 k2 `/ b) a* U7 D, D! q501——服务器不支持请求的函数
9 }) [, k. F- Z, q0 u" O6 |502——服务器暂时不可用,有时是为了防止发生系统过载
8 v# z- S% f$ a9 Y6 l- R503——服务器过载或暂停维修; H1 a, M$ r5 n* P4 t) e( n/ X5 d
504——关口过载,服务器使用另一个关口或服务来响应用户,等待时间设定值较长
9 _0 A# I7 V# p; b( `1 t505——服务器不支持或拒绝支请求头中指定的HTTP版本; y, K# a+ d- l
我们站长朋友有时候非常关心的问题就是网站收录,特别是新站,我们也经常去,看看收录了哪些页面等等。如果是这种情况我们最好的方式就是去分析一下日志,有可能新站前期蜘蛛是有来我们网站的抓取,但是结果没有放出来,我们光靠前面那个命令是查不结果的,但是在网站日志里面会留下纪录。这个时候我们要做的事情,就是看看搜索引擎爬行我们网站上时,返回的一个状态码,是否正常。如果返回200说明抓取成功,如果返回404说明页面错误,或者页面不存在,就需要做301永久重定向或者302暂时重定向。如果基本是200信息,那我们不用担心,网站会很快放出来的。就这个收录问题红涛前几天写过一篇文章:新站如何让百度快速收录 做为一个SEOER学会分析网站日志这是必修课,有很网站出现了问题,光看网站是看不出任何问题的,这个时候要想找原因就必须配合网站来分析,才能得到一个结果。因为日志记记录了网站被搜索引擎爬取的痕迹,给站长提供了蜘蛛是否来访的有力物证,站长朋友可以通过网站日志来分析搜索引擎蜘蛛的抓取情况,分析网站的是否存在收录异常问题。并且我们可以根据这个日志文件判断蜘蛛来访频率以及抓取规律,对于网站的一个长期SEO是非常有帮助的。那我们应该如何做网站日志分析呢? 红涛前面推荐了一款工具:网站日志分析工具
2 F$ B2 {9 k- d) g网站所以有访问纪录都会存在这个网站日志上,包括搜索引擎的记录与访客的信息。一般都会生存在网站的根目录下,常见的形式名件夹名log、weblog或www_logs。我们一般分析就得先这个方件夹里面的内容下载到本地,然后可以用记事本去打开。以下是我空间的网站日志截图:
1 p4 H- F. ^# W N9 \2 T* n# c0 }" b& ^1 G! Z- w5 Y: W
2 x! P6 e1 V3 f; U6 P* L) q
既然知道了日志存放在哪儿,那么我们又如何简单的入手去分析日志呢?下面我来找一段简单点的日志还看一下:
6 ]3 S0 V/ J" z6 w) b) @#Software: Microsoft Internet Information Services 6.09 a& Z" E8 L" J$ [' V d4 a
#Version: 1.0& ?( Q9 _+ R8 K5 o, C& t
#Date: 2011-03-01 00:00:17" S, k/ q7 D4 \
#Fields: date time s-sitename s-ip cs-method cs-uri-stem cs-uri-query s-port cs-username c-ip cs(User-Agent) sc-status sc-substatus sc-win32-status sc-bytes cs-bytes; h/ C& _. S7 K+ y
2011-03-01 02:44:37 W3SVC381 211.154.135.217 GET /news/news.asp id=200 80 – 203.208.60.169 Mozilla/5.0+(compatible;+Googlebot/2.1;++http://www.g o o g l e.com/bot.html) 200 0 0 29057 2984 q8 t/ w6 `! j; H, ` g
搜索引擎蜘蛛:/ N8 m+ Y7 m% M* {6 W. F2 m6 M
百度:baiduspider Google:Googlebot Msn:msnbot
: Q7 E! B' b9 a J: G' y6 {yahoo:Slurp yodao:YoudaoBot sogou:Sogou+get+spider! k% v M* A( O$ p
搜索以上蜘蛛名称,就可以看到蜘蛛抓取的痕迹。我们重要的就是如何读懂后面的那些代码。我们称HTTP状态码。
& I8 r/ k# Q+ p& Cdate表示记录访问日期;. X. v6 g- u' U, b/ k
time访问时间;
* U& V( t6 I5 i6 p9 h6 cs-sitename表示你的虚拟主机的代称。
* y, L$ d+ Z. ns-ip访问者IP;: N4 [0 K& Y5 w
cs-method表示访问方法,常见的有两种,一是GET,就是平常我们打开一个URL访问的动作,二是POST,提交表单时的动作;6 L$ V, m3 y9 F
cs-uri-stem就是访问哪一个文件;
! D& E; `; B; k' P, `$ jcs-uri-query是指访问地址的附带参数,如asp文件?后面的字符串id=12等等,如果没有参数则用-表示;+ V! \5 w E N% G* g
s-port 访问的端口
2 Y' n; p3 l; Q! t A' V1 Acs-username 访问者名称! i! H+ x* _. B! V- C5 v& ]
c-ip 来源ip% G! }* o' X0 {! A2 j: B
cs(User-Agent)访问来源;. B$ l: ]+ |6 {" V7 a
sc-status状态,200表示成功,403表示没有权限,404表示打不到该页面,500表示程序有错;
/ X- K1 u- v) E8 ssc-substatus 服务端传送到客户端的字节大小;( ^6 _# @5 x% V) G4 [: z" S
cs–win32-statu客户端传送到服务端的字节大小;+ r" V0 E9 U% }$ G( j2 a- K
1**:请求收到,继续处理7 G3 W+ v Q6 B; A' S
2**:操作成功收到,分析、接受" z1 g' B6 q1 n* V: _2 j
3**:完成此请求必须进一步处理
! K3 z9 V. e. Z) w. i, Q& `4**:请求包含一个错误语法或不能完成# f) z, r$ O+ p% l1 ?
5**:服务器执行一个完全有效请求失败! z7 L: Z' R+ S9 K! f9 y
100——客户必须继续发出请求
; N6 o2 F/ l0 a7 T! [6 E101——客户要求服务器根据请求转换HTTP协议版本8 k$ F9 |: E) q2 j
200——交易成功
2 M$ `7 |" G0 G+ h5 I201——提示知道新文件的URL
4 j* ~) T6 X$ R9 J0 A3 f0 F202——接受和处理、但处理未完成
4 W8 d T# Z$ J! B203——返回信息不确定或不完整
: |* _* V; s! h0 D) h4 I. T ?204——请求收到,但返回信息为空
; G' s% f& x& t: m5 e205——服务器完成了请求,用户代理必须复位当前已经浏览过的文件
5 W L8 J' x, q4 Q206——服务器已经完成了部分用户的GET请求 a7 t' }" Y* W& l% C1 Z& B
300——请求的资源可在多处得到1 O! w5 z3 j( K h6 p0 Q
301——删除请求数据
& H- k; G% I7 @ o) O, T- s302——在其他地址发现了请求数据
- c2 U$ z1 g& u5 W# i: W" r303——建议客户访问其他URL或访问方式
# L8 |6 ]6 H1 Z# `7 r( c/ Q304——客户端已经执行了GET,但文件未变化
h. H. L% q. ?" v3 q9 a. i# A& D# B, H305——请求的资源必须从服务器指定的地址得到
; z8 E& r6 O$ C! e306——前一版本HTTP中使用的代码,现行版本中不再使用
" B8 o" N `2 V; g3 N$ P307——申明请求的资源临时性删除( B" g& Q: E. y. M9 [
400——错误请求,如语法错误
9 r! S- }+ ^ c* ^' ^" V+ z' H401——请求授权失败7 Z$ ]- i* b$ \( O
402——保留有效ChargeTo头响应
5 I3 r- d" w5 b# |6 _403——请求不允许, X% _! ^3 j. [
404——没有发现文件、查询或URl4 {2 F5 I' |4 w* A
405——用户在Request-Line字段定义的方法不允许! o7 g/ J( s7 [ d
406——根据用户发送的Accept拖,请求资源不可访问
$ o8 u: {6 T+ p; S) I407——类似401,用户必须首先在代理服务器上得到授权' H( e% c; R" E& n2 G1 m
408——客户端没有在用户指定的饿时间内完成请求/ C5 w2 c! E6 P R
409——对当前资源状态,请求不能完成
. k# j1 | M) Q; e% n7 P, B410——服务器上不再有此资源且无进一步的参考地址
) \2 V2 V0 o( E8 x411——服务器拒绝用户定义的Content-Length属性请求
; u) b/ v6 A" u+ `- F% ^& i412——一个或多个请求头字段在当前请求中错误
+ s& G7 d! v' N* V2 C: \$ d413——请求的资源大于服务器允许的大小' }2 f. P8 T7 L" F u
414——请求的资源URL长于服务器允许的长度3 T# h$ i' ^8 T
415——请求资源不支持请求项目格式
4 x" ]( L, Y2 p/ ?+ p4 P. W416——请求中包含Range请求头字段,在当前请求资源范围内没有range指示值,请求也不包含If-Range请求头字段1 U! j1 S3 z( B5 \
417——服务器不满足请求Expect头字段指定的期望值,如果是代理服务器,可能是下一级服务器不能满足请求# o$ R/ O! O7 Q( z ?
500——服务器产生内部错误5 B9 {! A- Z( q; {7 m
501——服务器不支持请求的函数* K) Q5 S% k$ m. {
502——服务器暂时不可用,有时是为了防止发生系统过载
" V$ y8 `$ ~! h4 c503——服务器过载或暂停维修3 `7 r( i' Y" }! t
504——关口过载,服务器使用另一个关口或服务来响应用户,等待时间设定值较长
) B! C ^+ p- q; q" e2 e1 \0 e' D505——服务器不支持或拒绝支请求头中指定的HTTP版本! g: t; ?4 T, v" ?" }6 t* E
我们站长朋友有时候非常关心的问题就是网站收录,特别是新站,我们也经常去site:www.hongtaoseo.com ,看看收录了哪些页面等等。如果是这种情况我们最好的方式就是去分析一下日志,有可能新站前期蜘蛛是有来我们网站的抓取,但是结果没有放出来,我们光靠前面那个命令是查不结果的,但是在网站日志里面会留下纪录。这个时候我们要做的事情,就是看看搜索引擎爬行我们网站上时,返回的一个状态码,是否正常。如果返回200说明抓取成功,如果返回404说明页面错误,或者页面不存在,就需要做301永久重定向或者302暂时重定向。如果基本是200信息,那我们不用担心,网站会很快放出来的。就这个收录问题红涛前几天写过一篇文章:新站如何让百度快速收录8 e6 [; N) @1 Z1 Q% L2 V
分析网站日志还是非常重要的,平时我们新站和被降权的网站,我们一般要多观察网站日志,这个里面就能看出网站真正的问题。只是日志有时候比较复杂,所以我们就不能懒手脚,要耐心的去看。本文由www.hspayy.com论坛发布,转载请注明出处!
1 l' J5 g8 L( `$ \/ V: K0 N9 _ L+ U$ ~" P$ |. Q) i( T0 d$ y
分析网站日志还是非常重要的,平时我们新站和被降权的网站,我们一般要多观察网站日志,这个里面就能看出网站真正的问题。只是日志有时候比较复杂,所以我们就不能懒手脚,要耐心的去看。
% ?7 A7 c* d9 O2 t: _( l
8 l1 S( w, M" T1 r3 X) Y4 w' E' t/ D: r4 {! O" h
|