做为一个SEOER学会分析网站日志这是必修课,有很网站出现了问题,光看网站是看不出任何问题的,这个时候要想找原因就必须配合网站来分析,才能得到一个结果。因为日志记记录了网站被搜索引擎爬取的痕迹,给站长提供了蜘蛛是否来访的有力物证,站长朋友可以通过网站日志来分析搜索引擎蜘蛛的抓取情况,分析网站的是否存在收录异常问题。并且我们可以根据这个日志文件判断蜘蛛来访频率以及抓取规律,对于网站的一个长期SEO是非常有帮助的。那我们应该如何做网站日志分析呢? 红涛前面推荐了一款工具:网站日志分析工具9 v& B$ Z6 T, N% k
网站所以有访问纪录都会存在这个网站日志上,包括搜索引擎的记录与访客的信息。一般都会生存在网站的根目录下,常见的形式名件夹名log、weblog或www_logs。我们一般分析就得先这个方件夹里面的内容下载到本地,然后可以用记事本去打开。以下是我空间的网站日志截图:) Z) V7 R. v% `# U
0 X, L0 B* }2 I8 {3 c9 l
6 G7 Z6 R( a, g$ J- @- Q
既然知道了日志存放在哪儿,那么我们又如何简单的入手去分析日志呢?下面我来找一段简单点的日志还看一下:
/ ~% ]8 s1 M& T3 `7 Q+ i3 W0 F#Software: Microsoft Internet Information Services 6.0$ C, ^6 e6 i6 h5 h- J/ w
#Version: 1.0& o2 O; E/ c* x- o
#Date: 2011-03-01 00:00:176 I! [# m t+ Q5 b
#Fields: date time s-sitename s-ip cs-method cs-uri-stem cs-uri-query s-port cs-username c-ip cs(User-Agent) sc-status sc-substatus sc-win32-status sc-bytes cs-bytes o8 R% }* q7 `' N; U
2011-03-01 02:44:37 W3SVC381 211.154.135.217 GET /news/news.asp id=200 80 – 203.208.60.169 Mozilla/5.0+(compatible;+Googlebot/2.1;++http://www.g o o g l e.com/bot.html) 200 0 0 29057 2983 c! l+ z* s+ q+ Y
搜索引擎蜘蛛:
6 B# N: r$ ~9 y2 e. o百度:baiduspider Google:Googlebot Msn:msnbot& k( ]( {* D8 S1 l* U$ e
yahoo:Slurp yodao:YoudaoBot sogou:Sogou+get+spider; L) U7 A( k/ }' ^: U0 q8 |, ?
搜索以上蜘蛛名称,就可以看到蜘蛛抓取的痕迹。我们重要的就是如何读懂后面的那些代码。我们称HTTP状态码。" q7 {( E6 y, Z5 D
date表示记录访问日期;* Q; K& b; h" N K n3 |9 Y c. A2 T1 g# p$ T
time访问时间;
, N1 x1 g0 h8 z. Ks-sitename表示你的虚拟主机的代称。
6 ~2 { ~4 v8 M8 d' Ks-ip访问者IP;
1 ~* |' O1 j3 a8 U# Wcs-method表示访问方法,常见的有两种,一是GET,就是平常我们打开一个URL访问的动作,二是POST,提交表单时的动作;4 \. k4 @+ t% ~1 k. ?$ m9 x G
cs-uri-stem就是访问哪一个文件;
y! D, X4 y) ]! p& hcs-uri-query是指访问地址的附带参数,如asp文件?后面的字符串id=12等等,如果没有参数则用-表示;% G$ ?& A& a3 Z) }# i8 j- T
s-port 访问的端口
% J+ [! m [4 dcs-username 访问者名称6 l1 _7 O" V% L6 c5 F' ^( B! o
c-ip 来源ip- q8 s! q. ^& g0 Y- A5 D1 m( d4 F+ ^
cs(User-Agent)访问来源;
- [" ~5 D. z8 a9 F/ D! msc-status状态,200表示成功,403表示没有权限,404表示打不到该页面,500表示程序有错;( A% c" S, a+ M; `( J
sc-substatus 服务端传送到客户端的字节大小;
+ U- ~1 d7 a J+ [+ ?, [ ics–win32-statu客户端传送到服务端的字节大小;
9 z Q \% Z# o+ A- S1**:请求收到,继续处理
2 g# ?1 d- T0 q/ A# j2**:操作成功收到,分析、接受
0 C/ M! m$ K& k$ ?8 T( m3**:完成此请求必须进一步处理$ O) H7 H2 h: `4 `. e
4**:请求包含一个错误语法或不能完成
. B4 O6 o. c9 c8 w+ N2 j# O5**:服务器执行一个完全有效请求失败
( N5 e) P) {6 A+ ~5 W# {" S4 V* T100——客户必须继续发出请求$ `+ I! q* v+ F. m: O0 |
101——客户要求服务器根据请求转换HTTP协议版本
! f3 x; S `$ g3 s1 B5 G200——交易成功( M- L$ ~$ W d
201——提示知道新文件的URL
4 T9 h8 z- I+ K0 _6 |! e5 D$ G202——接受和处理、但处理未完成
2 s4 }! r/ N8 i203——返回信息不确定或不完整
7 q4 {4 o) M' O. p% W204——请求收到,但返回信息为空
7 z" B: y: y" w" w: }: y6 t205——服务器完成了请求,用户代理必须复位当前已经浏览过的文件+ D* P( k6 E$ \
206——服务器已经完成了部分用户的GET请求! j- ^6 a# @) v4 J
300——请求的资源可在多处得到+ Y I' R9 J# L" C, p- ^" n
301——删除请求数据+ v: U; _- v9 K( w0 g! @- o# f% g
302——在其他地址发现了请求数据; Z4 s/ K5 g. s$ A; ]6 x
303——建议客户访问其他URL或访问方式* {: D. `6 }5 w) L
304——客户端已经执行了GET,但文件未变化5 W& v+ ~/ N! J. R/ Q6 `
305——请求的资源必须从服务器指定的地址得到
0 @$ y8 H, M* K1 T5 {+ T306——前一版本HTTP中使用的代码,现行版本中不再使用; U0 i8 U' Z# B A0 _: q; t
307——申明请求的资源临时性删除7 }0 Z+ _. L: h- V* G1 h3 W
400——错误请求,如语法错误
, ^: S! l, I% S# J* O( `401——请求授权失败
) a+ O9 ?+ ^& q: n* y5 `% B402——保留有效ChargeTo头响应
. R7 p8 w0 g( P# p8 B403——请求不允许, B% ?7 X) y3 z
404——没有发现文件、查询或URl
4 j/ z) m6 n7 b3 f2 e6 i405——用户在Request-Line字段定义的方法不允许
2 y8 h5 H8 L1 e1 b- A# C" l( h7 O( Q406——根据用户发送的Accept拖,请求资源不可访问
1 n/ P* P6 j, C/ C407——类似401,用户必须首先在代理服务器上得到授权
3 j, H f; t) y, }+ Z; B0 U408——客户端没有在用户指定的饿时间内完成请求- L/ \' C2 T' c! h, r
409——对当前资源状态,请求不能完成# B7 V+ [6 D7 E4 x4 G! W) l( U% x* ^
410——服务器上不再有此资源且无进一步的参考地址
8 J8 s5 d! {2 e3 C& x6 @6 d9 K411——服务器拒绝用户定义的Content-Length属性请求
- C5 t { ]" \% q4 b, g D412——一个或多个请求头字段在当前请求中错误' j% r7 w2 i" C
413——请求的资源大于服务器允许的大小6 f( G8 i/ t6 q$ K9 y# r
414——请求的资源URL长于服务器允许的长度9 K# s( Z4 a$ W8 v& C$ c
415——请求资源不支持请求项目格式2 H8 l7 T( a4 S' F
416——请求中包含Range请求头字段,在当前请求资源范围内没有range指示值,请求也不包含If-Range请求头字段7 p2 h: X( B" n7 C' |
417——服务器不满足请求Expect头字段指定的期望值,如果是代理服务器,可能是下一级服务器不能满足请求
6 k" z6 {) Z2 M; E! N2 S, W* @& G500——服务器产生内部错误
; P u( U7 b9 P0 A) T: L _) V501——服务器不支持请求的函数" I8 P0 l& l( B+ ] K( E
502——服务器暂时不可用,有时是为了防止发生系统过载8 U( }: n- W( M/ T0 c! k
503——服务器过载或暂停维修: X9 L+ S) J f3 P# j
504——关口过载,服务器使用另一个关口或服务来响应用户,等待时间设定值较长
6 \! _3 V. w0 v505——服务器不支持或拒绝支请求头中指定的HTTP版本
7 A8 O0 }+ ~: l7 h我们站长朋友有时候非常关心的问题就是网站收录,特别是新站,我们也经常去,看看收录了哪些页面等等。如果是这种情况我们最好的方式就是去分析一下日志,有可能新站前期蜘蛛是有来我们网站的抓取,但是结果没有放出来,我们光靠前面那个命令是查不结果的,但是在网站日志里面会留下纪录。这个时候我们要做的事情,就是看看搜索引擎爬行我们网站上时,返回的一个状态码,是否正常。如果返回200说明抓取成功,如果返回404说明页面错误,或者页面不存在,就需要做301永久重定向或者302暂时重定向。如果基本是200信息,那我们不用担心,网站会很快放出来的。就这个收录问题红涛前几天写过一篇文章:新站如何让百度快速收录 做为一个SEOER学会分析网站日志这是必修课,有很网站出现了问题,光看网站是看不出任何问题的,这个时候要想找原因就必须配合网站来分析,才能得到一个结果。因为日志记记录了网站被搜索引擎爬取的痕迹,给站长提供了蜘蛛是否来访的有力物证,站长朋友可以通过网站日志来分析搜索引擎蜘蛛的抓取情况,分析网站的是否存在收录异常问题。并且我们可以根据这个日志文件判断蜘蛛来访频率以及抓取规律,对于网站的一个长期SEO是非常有帮助的。那我们应该如何做网站日志分析呢? 红涛前面推荐了一款工具:网站日志分析工具
2 D: R2 E& L# Q. T$ ~) E网站所以有访问纪录都会存在这个网站日志上,包括搜索引擎的记录与访客的信息。一般都会生存在网站的根目录下,常见的形式名件夹名log、weblog或www_logs。我们一般分析就得先这个方件夹里面的内容下载到本地,然后可以用记事本去打开。以下是我空间的网站日志截图:
! Y& ?2 q* ]/ E- P+ M. s* Y$ d' U" H y/ ~3 O, z
/ V# |/ d3 g; ~$ V( n5 j: @既然知道了日志存放在哪儿,那么我们又如何简单的入手去分析日志呢?下面我来找一段简单点的日志还看一下:
$ o& I7 Q; b, s/ I9 X) P#Software: Microsoft Internet Information Services 6.0; ?2 o- y" C' g5 s
#Version: 1.0* V0 \0 x+ w" Z/ a/ n# y
#Date: 2011-03-01 00:00:17! y, f H) E( z2 g7 T0 I
#Fields: date time s-sitename s-ip cs-method cs-uri-stem cs-uri-query s-port cs-username c-ip cs(User-Agent) sc-status sc-substatus sc-win32-status sc-bytes cs-bytes, X: m0 |0 [# F# z$ B# K
2011-03-01 02:44:37 W3SVC381 211.154.135.217 GET /news/news.asp id=200 80 – 203.208.60.169 Mozilla/5.0+(compatible;+Googlebot/2.1;++http://www.g o o g l e.com/bot.html) 200 0 0 29057 298
; u. k% l ?& _! M! s' i( q& o搜索引擎蜘蛛:
}- \3 k. P$ ?# n; b/ l百度:baiduspider Google:Googlebot Msn:msnbot
1 C0 d1 b3 M4 @) Dyahoo:Slurp yodao:YoudaoBot sogou:Sogou+get+spider
, D K. o. }2 e1 }搜索以上蜘蛛名称,就可以看到蜘蛛抓取的痕迹。我们重要的就是如何读懂后面的那些代码。我们称HTTP状态码。7 g5 k6 l5 D: L* A: c# U
date表示记录访问日期;
. B l- j2 q; n" g! b# @" Ytime访问时间;
/ s4 ^8 r; e6 ]# k: a/ Ds-sitename表示你的虚拟主机的代称。 ~. l7 [2 P) Q5 i% B5 m5 n
s-ip访问者IP;
; R2 ~/ k1 Y& w* ]3 V8 D8 o* jcs-method表示访问方法,常见的有两种,一是GET,就是平常我们打开一个URL访问的动作,二是POST,提交表单时的动作;. P. ~. O9 `( Q
cs-uri-stem就是访问哪一个文件;
! G& `7 l7 ^6 C& p4 ~cs-uri-query是指访问地址的附带参数,如asp文件?后面的字符串id=12等等,如果没有参数则用-表示;8 M( A$ S' @ [0 s, e
s-port 访问的端口3 f9 p7 |& [! M% b
cs-username 访问者名称- V0 P: b% N) g7 p! ?) F* |8 e
c-ip 来源ip2 P3 W' l$ E; J
cs(User-Agent)访问来源;" G+ f, s9 u# A# ?
sc-status状态,200表示成功,403表示没有权限,404表示打不到该页面,500表示程序有错;
% `" ]* O$ Y5 b, s0 y7 Z# _sc-substatus 服务端传送到客户端的字节大小;+ e5 e4 k0 A1 I: o' Z8 g" h
cs–win32-statu客户端传送到服务端的字节大小;, G- w$ o- @1 S
1**:请求收到,继续处理
/ z% W3 {2 u) f7 }6 v2**:操作成功收到,分析、接受
& i! a# D4 S' i6 {/ R3**:完成此请求必须进一步处理
& [! U' o! ^) ?# F6 G6 X4**:请求包含一个错误语法或不能完成& h/ a' l' V( }) B* M/ d- z: S
5**:服务器执行一个完全有效请求失败
( K) r1 r, j& Z" J& ~/ U4 X- n100——客户必须继续发出请求
* P3 T$ a7 g6 ^5 _6 l$ @) o/ G101——客户要求服务器根据请求转换HTTP协议版本
8 }* v+ y' X0 a9 n( S0 X, d200——交易成功
$ `7 x! b& T5 I201——提示知道新文件的URL$ ^* Q/ A, ]' [* \2 e
202——接受和处理、但处理未完成: f* y5 R0 y! U# @
203——返回信息不确定或不完整" r/ q( [+ V% s& S4 l
204——请求收到,但返回信息为空
9 R! D4 S( O5 o& D0 `205——服务器完成了请求,用户代理必须复位当前已经浏览过的文件, E% [1 \1 h' ?& ^* I+ g9 C
206——服务器已经完成了部分用户的GET请求
& k$ h( w9 ?/ [. W, w% S0 s300——请求的资源可在多处得到3 a1 H! [8 q/ s. U" m$ O
301——删除请求数据
! {# O# ~$ U z& m0 E9 A302——在其他地址发现了请求数据/ ?# N$ z1 C8 o
303——建议客户访问其他URL或访问方式
- L$ f# o8 y9 O3 n9 E& k304——客户端已经执行了GET,但文件未变化) d O" n4 z* R( C+ V( S
305——请求的资源必须从服务器指定的地址得到
# C `! D) C3 @, @% C4 n306——前一版本HTTP中使用的代码,现行版本中不再使用3 `, Q) M0 W" B+ X
307——申明请求的资源临时性删除
+ ?9 u' |" V' {! d5 w400——错误请求,如语法错误2 @& ^! U' O& h- w; ?& c( J& c0 h
401——请求授权失败
$ r- D0 V$ D3 i402——保留有效ChargeTo头响应& ?$ O9 g; n, d
403——请求不允许/ }% r9 ~! A$ _0 v$ B& h
404——没有发现文件、查询或URl
2 E9 `" z9 E; X/ s3 L! i* q" f405——用户在Request-Line字段定义的方法不允许& A) U4 \$ `2 v/ T6 a8 ^
406——根据用户发送的Accept拖,请求资源不可访问
+ p% [5 p l! z4 W) S3 x407——类似401,用户必须首先在代理服务器上得到授权$ \3 B* S ~/ G- J
408——客户端没有在用户指定的饿时间内完成请求
5 I$ b& x ]8 f2 I3 T( D6 c409——对当前资源状态,请求不能完成
& t N- f; L- v$ f410——服务器上不再有此资源且无进一步的参考地址
% T4 y1 e$ ~% w, W411——服务器拒绝用户定义的Content-Length属性请求
: m2 o* h# \/ f$ r5 o412——一个或多个请求头字段在当前请求中错误; \" p5 {2 ?, e! t7 ]4 y
413——请求的资源大于服务器允许的大小
% ^. `3 A' z' f8 z414——请求的资源URL长于服务器允许的长度) j' H* i$ i5 g. g7 L( R
415——请求资源不支持请求项目格式4 R: ^# ^" ]4 Q
416——请求中包含Range请求头字段,在当前请求资源范围内没有range指示值,请求也不包含If-Range请求头字段
9 H9 k8 @. p0 B/ c. l417——服务器不满足请求Expect头字段指定的期望值,如果是代理服务器,可能是下一级服务器不能满足请求2 K a0 y- I7 b2 e" H8 C
500——服务器产生内部错误$ s! F" F: c7 z+ c
501——服务器不支持请求的函数/ A s' o$ S) F
502——服务器暂时不可用,有时是为了防止发生系统过载
* C& a" P& Q7 @- `0 i9 J503——服务器过载或暂停维修1 H1 o: u' D6 w) {! ?# @
504——关口过载,服务器使用另一个关口或服务来响应用户,等待时间设定值较长
) E% s. j; e3 I$ d- j505——服务器不支持或拒绝支请求头中指定的HTTP版本
$ g. n( ^. n6 ~( T( K) b3 N我们站长朋友有时候非常关心的问题就是网站收录,特别是新站,我们也经常去site:www.hongtaoseo.com ,看看收录了哪些页面等等。如果是这种情况我们最好的方式就是去分析一下日志,有可能新站前期蜘蛛是有来我们网站的抓取,但是结果没有放出来,我们光靠前面那个命令是查不结果的,但是在网站日志里面会留下纪录。这个时候我们要做的事情,就是看看搜索引擎爬行我们网站上时,返回的一个状态码,是否正常。如果返回200说明抓取成功,如果返回404说明页面错误,或者页面不存在,就需要做301永久重定向或者302暂时重定向。如果基本是200信息,那我们不用担心,网站会很快放出来的。就这个收录问题红涛前几天写过一篇文章:新站如何让百度快速收录
/ v) b4 A$ m5 c. r, P7 b; w分析网站日志还是非常重要的,平时我们新站和被降权的网站,我们一般要多观察网站日志,这个里面就能看出网站真正的问题。只是日志有时候比较复杂,所以我们就不能懒手脚,要耐心的去看。本文由www.hspayy.com论坛发布,转载请注明出处!
/ Z* B1 U& s! I& @3 N& i) |
: o) P! ^. |0 B/ t& @$ t分析网站日志还是非常重要的,平时我们新站和被降权的网站,我们一般要多观察网站日志,这个里面就能看出网站真正的问题。只是日志有时候比较复杂,所以我们就不能懒手脚,要耐心的去看。( w0 q/ C2 @4 i2 U2 S U U9 o
0 h& K/ f8 k' \4 V8 [
" f3 _; ~% n5 q w2 ^+ R |