SEOER必修课——网站日志分析

ljpayy2012 · 发表于 2012-12-24 11:16:32

做为一个SEOER学会分析网站日志这是必修课，有很网站出现了问题，光看网站是看不出任何问题的，这个时候要想找原因就必须配合网站来分析，才能得到一个结果。因为日志记记录了网站被搜索引擎爬取的痕迹，给站长提供了蜘蛛是否来访的有力物证，站长朋友可以通过网站日志来分析搜索引擎蜘蛛的抓取情况，分析网站的是否存在收录异常问题。并且我们可以根据这个日志文件判断蜘蛛来访频率以及抓取规律，对于网站的一个长期SEO是非常有帮助的。那我们应该如何做网站日志分析呢？红涛前面推荐了一款工具：网站日志分析工具
网站所以有访问纪录都会存在这个网站日志上，包括搜索引擎的记录与访客的信息。一般都会生存在网站的根目录下，常见的形式名件夹名log、weblog或www_logs。我们一般分析就得先这个方件夹里面的内容下载到本地，然后可以用记事本去打开。以下是我空间的网站日志截图：

既然知道了日志存放在哪儿，那么我们又如何简单的入手去分析日志呢？下面我来找一段简单点的日志还看一下：
#Software: Microsoft Internet Information Services 6.0
#Version: 1.0
#Date: 2011-03-01 00:00:17
#Fields: date time s-sitename s-ip cs-method cs-uri-stem cs-uri-query s-port cs-username c-ip cs(User-Agent) sc-status sc-substatus sc-win32-status sc-bytes cs-bytes
2011-03-01 02:44:37 W3SVC381 211.154.135.217 GET /news/news.asp id=200 80 – 203.208.60.169 Mozilla/5.0+(compatible;+Googlebot/2.1;++http://www.g o o g l e.com/bot.html) 200 0 0 29057 298
搜索引擎蜘蛛：
百度：baiduspider Google：Googlebot Msn：msnbot
yahoo：Slurp yodao：YoudaoBot sogou：Sogou+get+spider
搜索以上蜘蛛名称，就可以看到蜘蛛抓取的痕迹。我们重要的就是如何读懂后面的那些代码。我们称HTTP状态码。
date表示记录访问日期；
time访问时间；
s-sitename表示你的虚拟主机的代称。
s-ip访问者IP；
cs-method表示访问方法，常见的有两种，一是GET，就是平常我们打开一个URL访问的动作，二是POST，提交表单时的动作；
cs-uri-stem就是访问哪一个文件；
cs-uri-query是指访问地址的附带参数，如asp文件?后面的字符串id=12等等，如果没有参数则用-表示；
s-port 访问的端口
cs-username 访问者名称
c-ip 来源ip
cs(User-Agent)访问来源；
sc-status状态，200表示成功，403表示没有权限，404表示打不到该页面，500表示程序有错；
sc-substatus 服务端传送到客户端的字节大小；
cs–win32-statu客户端传送到服务端的字节大小；
1**：请求收到，继续处理
2**：操作成功收到，分析、接受
3**：完成此请求必须进一步处理
4**：请求包含一个错误语法或不能完成
5**：服务器执行一个完全有效请求失败
100——客户必须继续发出请求
101——客户要求服务器根据请求转换HTTP协议版本
200——交易成功
201——提示知道新文件的URL
202——接受和处理、但处理未完成
203——返回信息不确定或不完整
204——请求收到，但返回信息为空
205——服务器完成了请求，用户代理必须复位当前已经浏览过的文件
206——服务器已经完成了部分用户的GET请求
300——请求的资源可在多处得到
301——删除请求数据
302——在其他地址发现了请求数据
303——建议客户访问其他URL或访问方式
304——客户端已经执行了GET，但文件未变化
305——请求的资源必须从服务器指定的地址得到
306——前一版本HTTP中使用的代码，现行版本中不再使用
307——申明请求的资源临时性删除
400——错误请求，如语法错误
401——请求授权失败
402——保留有效ChargeTo头响应
403——请求不允许
404——没有发现文件、查询或URl
405——用户在Request-Line字段定义的方法不允许
406——根据用户发送的Accept拖，请求资源不可访问
407——类似401，用户必须首先在代理服务器上得到授权
408——客户端没有在用户指定的饿时间内完成请求
409——对当前资源状态，请求不能完成
410——服务器上不再有此资源且无进一步的参考地址
411——服务器拒绝用户定义的Content-Length属性请求
412——一个或多个请求头字段在当前请求中错误
413——请求的资源大于服务器允许的大小
414——请求的资源URL长于服务器允许的长度
415——请求资源不支持请求项目格式
416——请求中包含Range请求头字段，在当前请求资源范围内没有range指示值，请求也不包含If-Range请求头字段
417——服务器不满足请求Expect头字段指定的期望值，如果是代理服务器，可能是下一级服务器不能满足请求
500——服务器产生内部错误
501——服务器不支持请求的函数
502——服务器暂时不可用，有时是为了防止发生系统过载
503——服务器过载或暂停维修
504——关口过载，服务器使用另一个关口或服务来响应用户，等待时间设定值较长
505——服务器不支持或拒绝支请求头中指定的HTTP版本
我们站长朋友有时候非常关心的问题就是网站收录，特别是新站，我们也经常去,看看收录了哪些页面等等。如果是这种情况我们最好的方式就是去分析一下日志，有可能新站前期蜘蛛是有来我们网站的抓取，但是结果没有放出来，我们光靠前面那个命令是查不结果的，但是在网站日志里面会留下纪录。这个时候我们要做的事情，就是看看搜索引擎爬行我们网站上时，返回的一个状态码，是否正常。如果返回200说明抓取成功，如果返回404说明页面错误，或者页面不存在，就需要做301永久重定向或者302暂时重定向。如果基本是200信息，那我们不用担心，网站会很快放出来的。就这个收录问题红涛前几天写过一篇文章：新站如何让百度快速收录做为一个SEOER学会分析网站日志这是必修课，有很网站出现了问题，光看网站是看不出任何问题的，这个时候要想找原因就必须配合网站来分析，才能得到一个结果。因为日志记记录了网站被搜索引擎爬取的痕迹，给站长提供了蜘蛛是否来访的有力物证，站长朋友可以通过网站日志来分析搜索引擎蜘蛛的抓取情况，分析网站的是否存在收录异常问题。并且我们可以根据这个日志文件判断蜘蛛来访频率以及抓取规律，对于网站的一个长期SEO是非常有帮助的。那我们应该如何做网站日志分析呢？红涛前面推荐了一款工具：网站日志分析工具
网站所以有访问纪录都会存在这个网站日志上，包括搜索引擎的记录与访客的信息。一般都会生存在网站的根目录下，常见的形式名件夹名log、weblog或www_logs。我们一般分析就得先这个方件夹里面的内容下载到本地，然后可以用记事本去打开。以下是我空间的网站日志截图：

既然知道了日志存放在哪儿，那么我们又如何简单的入手去分析日志呢？下面我来找一段简单点的日志还看一下：
#Software: Microsoft Internet Information Services 6.0
#Version: 1.0
#Date: 2011-03-01 00:00:17
#Fields: date time s-sitename s-ip cs-method cs-uri-stem cs-uri-query s-port cs-username c-ip cs(User-Agent) sc-status sc-substatus sc-win32-status sc-bytes cs-bytes
2011-03-01 02:44:37 W3SVC381 211.154.135.217 GET /news/news.asp id=200 80 – 203.208.60.169 Mozilla/5.0+(compatible;+Googlebot/2.1;++http://www.g o o g l e.com/bot.html) 200 0 0 29057 298
搜索引擎蜘蛛：
百度：baiduspider Google：Googlebot Msn：msnbot
yahoo：Slurp yodao：YoudaoBot sogou：Sogou+get+spider
搜索以上蜘蛛名称，就可以看到蜘蛛抓取的痕迹。我们重要的就是如何读懂后面的那些代码。我们称HTTP状态码。
date表示记录访问日期；
time访问时间；
s-sitename表示你的虚拟主机的代称。
s-ip访问者IP；
cs-method表示访问方法，常见的有两种，一是GET，就是平常我们打开一个URL访问的动作，二是POST，提交表单时的动作；
cs-uri-stem就是访问哪一个文件；
cs-uri-query是指访问地址的附带参数，如asp文件?后面的字符串id=12等等，如果没有参数则用-表示；
s-port 访问的端口
cs-username 访问者名称
c-ip 来源ip
cs(User-Agent)访问来源；
sc-status状态，200表示成功，403表示没有权限，404表示打不到该页面，500表示程序有错；
sc-substatus 服务端传送到客户端的字节大小；
cs–win32-statu客户端传送到服务端的字节大小；
1**：请求收到，继续处理
2**：操作成功收到，分析、接受
3**：完成此请求必须进一步处理
4**：请求包含一个错误语法或不能完成
5**：服务器执行一个完全有效请求失败
100——客户必须继续发出请求
101——客户要求服务器根据请求转换HTTP协议版本
200——交易成功
201——提示知道新文件的URL
202——接受和处理、但处理未完成
203——返回信息不确定或不完整
204——请求收到，但返回信息为空
205——服务器完成了请求，用户代理必须复位当前已经浏览过的文件
206——服务器已经完成了部分用户的GET请求
300——请求的资源可在多处得到
301——删除请求数据
302——在其他地址发现了请求数据
303——建议客户访问其他URL或访问方式
304——客户端已经执行了GET，但文件未变化
305——请求的资源必须从服务器指定的地址得到
306——前一版本HTTP中使用的代码，现行版本中不再使用
307——申明请求的资源临时性删除
400——错误请求，如语法错误
401——请求授权失败
402——保留有效ChargeTo头响应
403——请求不允许
404——没有发现文件、查询或URl
405——用户在Request-Line字段定义的方法不允许
406——根据用户发送的Accept拖，请求资源不可访问
407——类似401，用户必须首先在代理服务器上得到授权
408——客户端没有在用户指定的饿时间内完成请求
409——对当前资源状态，请求不能完成
410——服务器上不再有此资源且无进一步的参考地址
411——服务器拒绝用户定义的Content-Length属性请求
412——一个或多个请求头字段在当前请求中错误
413——请求的资源大于服务器允许的大小
414——请求的资源URL长于服务器允许的长度
415——请求资源不支持请求项目格式
416——请求中包含Range请求头字段，在当前请求资源范围内没有range指示值，请求也不包含If-Range请求头字段
417——服务器不满足请求Expect头字段指定的期望值，如果是代理服务器，可能是下一级服务器不能满足请求
500——服务器产生内部错误
501——服务器不支持请求的函数
502——服务器暂时不可用，有时是为了防止发生系统过载
503——服务器过载或暂停维修
504——关口过载，服务器使用另一个关口或服务来响应用户，等待时间设定值较长
505——服务器不支持或拒绝支请求头中指定的HTTP版本
我们站长朋友有时候非常关心的问题就是网站收录，特别是新站，我们也经常去site:www.hongtaoseo.com ,看看收录了哪些页面等等。如果是这种情况我们最好的方式就是去分析一下日志，有可能新站前期蜘蛛是有来我们网站的抓取，但是结果没有放出来，我们光靠前面那个命令是查不结果的，但是在网站日志里面会留下纪录。这个时候我们要做的事情，就是看看搜索引擎爬行我们网站上时，返回的一个状态码，是否正常。如果返回200说明抓取成功，如果返回404说明页面错误，或者页面不存在，就需要做301永久重定向或者302暂时重定向。如果基本是200信息，那我们不用担心，网站会很快放出来的。就这个收录问题红涛前几天写过一篇文章：新站如何让百度快速收录
分析网站日志还是非常重要的，平时我们新站和被降权的网站，我们一般要多观察网站日志，这个里面就能看出网站真正的问题。只是日志有时候比较复杂，所以我们就不能懒手脚，要耐心的去看。本文由www.hspayy.com论坛发布，转载请注明出处！

分析网站日志还是非常重要的，平时我们新站和被降权的网站，我们一般要多观察网站日志，这个里面就能看出网站真正的问题。只是日志有时候比较复杂，所以我们就不能懒手脚，要耐心的去看。

怃懙伦ㄣ仳 · 发表于 2026-04-09 10:31:48

这个思路很新颖，打开了新世界的大门，谢谢分享

踏青之路 · 发表于 2026-05-22 07:18:26

这个分享太实用了，刚好能用到，感谢楼主！

莫七七 · 发表于 2026-05-26 01:32:30

分析得很透彻，很多细节都说到点子上了～

		自动登录	找回密码
密码			加入怎通

[其他] SEOER必修课——网站日志分析