1、使用文本浏览器来检查你的网页,看网页中重要的URL链接是否能够被文本浏览器抓取得到- m# F- D* l# l! e, U" s
3 U6 u7 s, }8 M$ K8 {9 x6 l( B- e& F9 r5 r/ q$ z
常用的文本浏览器是lynx,大家可以在linux环境下安装它,它在浏览器你的网页时,几乎与搜索引擎蜘蛛看到的内容一致,所以大家常常使用它来测试网页的可抓取性,如果你的页面中重要的链接使用了JS、AJAX等技术,lynx浏览器是看不到这些链接的,同样的搜索引擎也抓取不到这些链接。因此在网站上线前,可以先用文本浏览器检查一下主要的网页,看是否用了对搜索引擎不友好的技术0 H& L; _# k+ f" J7 m8 }
/ i4 o5 q# S* A; J
" F2 l% m, c1 A& }, X 2、允许搜索引擎蜘蛛在不使用可跟踪其网站访问路径的会话 ID 或参数的情况下抓取您的网站
" O0 t/ y L% N2 x+ D1 ~( z; h5 ?, v6 U* K9 w
3 u& \ N( x9 p% e
一些session id对于跟踪用户的访问行为来说是很有效的,但是对于搜索引擎来说,就不是好的作法了,如果使用了这些技术,你的网页可能被索引得不完整,因为搜索引擎程序还不能排除那一些从URL上看上来不同,但是网页内容却完全相同的网页。对于收录是不友好的。
, i3 B0 F, P9 Z4 M1 G. p% ~0 A9 [/ ^3 Y, v0 }( u
$ o" ?) k' ] D- M 3、确保您的网络服务器支持 If-Modified-Since HTTP 标头6 p. W7 e; }6 m: b
" M. B% w- M% s& G1 ]4 w6 X2 Y5 }% N4 \& P* ]) U1 ^$ l9 Y/ c- O
如果你的服务器支持if-modified-since-HTTP标头的话,当搜索引擎蜘蛛程序抓取到你的网页的时候,会首先检查这个If-Modified-Since HTTP 标头值,通过这个值,搜索引擎爬虫程序可以判断出来你的网页自从它上次抓取后,是否有所变化,如果没有变化,它便可以不用下载相同的页面内容,节约蜘蛛资源,也节约你的服务器带宽,这样蜘蛛就可以抓取更多其他的页面。8 z8 V& H6 f/ R N
p% d) a9 |/ k* P8 n \& r1 T( W& S
( P, j, j! `. Z 4、设置合理的robots文件
0 y! c$ g$ Q" ]1 Y9 a0 w- @4 r) j2 |5 ?
( ^$ Y# F2 v; G+ K( j5 W
每个网站最好都设置一个robots文件,如果你的网站没有任何内容不想被搜索引擎索引,那么可以建立一个空的以robots为命名的文件,上传到你网站的根目录下,通过robots文件,我们可以让搜索引擎抓取某些目录,而不抓取某些目录,例如一些模板文件,可以禁止搜索引擎抓取,一些后台登录文件,也可以利用robots文件加以禁止收录,在设置robots文件时,一定要小心,以避免把一些重要的文件给禁止了,我们可以使用谷歌网站管理员工具进行测试。
- K- @ h; R6 U$ h1 j
. U% M; A- z' w+ f
% O! ^% s. w2 U! z, K 5、对网站进行兼容性测试,以确保在每个浏览器中都可以正确显示
4 I4 X3 p8 J3 B6 Q( x% a) Q
5 v; l- r; l! Q2 g; J e3 I h& v2 P) t) w
我们在网站上线前,最好先做大量的浏览试验,确保网页内容可以正确的显示在所有的浏览器上边,例如IE的有一个IE工具测试,可以测试各个IE版本的显示效果,谷歌浏览器也有类似的插件,可以对浏览器的兼容性进行测试,等检测完都能正常显示时,再上线,在平时的维护中,也可以经常去测试页面显示的兼容性
& E* f3 ?& Y. B
+ n- J# x1 v, K* n# }: Y5 }5 X! h( J- R
6、经常使用一些前端测试工具来测试网页的性能
- W9 ?8 c9 T) {0 G
( `# ^1 G/ K7 S# m- H# H" z; S8 H! T- f7 a
例如我们可以使用谷歌的page speed工具以及yahoo的yslow对网页进行性能的测试,这两个工具还可以指出你的网站中页面需要改进的地方,我们可以按照里边描述的步骤进行前端页面优化,例如启用GZIP、启用keep-alive、使用css sprites技术、合并JS与CSS等。# R ?, ~4 m; |) z2 T% c
) Q/ }. i! K' b. M/ d( L
|