一、什么是robots.txtrobots.txt是搜索引擎中访问网站的时候要查看的第一个文件。robots.txt文件告诉蜘蛛程序在服务器上什么文件是可以被查看的。当一个搜索蜘蛛访问一个站点时,它会首先检查该站点根目录下是否存在robots.txt,如果存在,搜索机器人就会按照该文件中的内容来确定访问的范围;如果该文件不存在,所有的搜索蜘蛛将能够访问网站上所有没有被口令保护的页面,所以如果你的网站没有需要被搜素引擎禁止访问的东西就可以不必写robots.txt。
0 d6 \7 J$ t3 L6 {' T p& z* c 二、robots.txt的使用注意事项
' _' S$ C& V# T5 W( I 1.合理的使用robots.txt文件,可以有效的避免用户从搜索引擎进入网站,不经过登录就能进行各种操作,因为有些网站需求必须登录才能操作,这样也方便管理用户。
; }' {7 A1 q% h. S 2.allow,disallow,及通配符的匹配方式6 z8 I- z: H$ N, C! z: K" V
我们把/也看做路径的一部分而不是分隔符 , 且不提目录的概念 , 则理解起来简单统一 , 即 以allow或disallow中路径开始的URL , 则匹配成功。例:disallow:/help/help/index.php匹配成功 , 因为URL是以/help/开始的 , 而/help、html刚匹配不成功 , 因为前缀没有和/help/相同。 ( F0 T& S" z( ~! `
3.Robots.txt编写的meta问题( O) j+ K* J3 s8 `9 C. ?4 N
在 Robots.txt编写规则中,有一个取最强参数法则,而且如果网站以及页面标签上同时出现robots.txt文件和meta标签,那么搜索引擎就会服从两个规则中较为严格的一个,即禁止搜索引擎对于某个页面的索引,当然如果robots.txt文件和meta标签不是出现一个文件中,那么搜索引擎就会遵循就近原则,就会索引meta标签前的所有文件。2 C) t1 ^3 R5 W9 S# \
4. Disallow: 描述不需要被索引的网址或者是目录。比如Disallow:/wp-不允许抓取url中带wp-的网址;要注意的是Disallow: /date/与Disallow: /date是不一样的;前者仅仅是不允许抓取date目录下的网址,如果data目录下还有子文件夹,那么子目录是允许抓取的,后者可以屏蔽date目录 下所有文件,包括起子文件夹。* O1 U# g, s0 q" U; \- d: D+ u3 x
5.对于一些初学者来说,robots.txt的语法不怎么熟悉,写的不正确或者不规范,可以直接在网站的根目录下上传一个空的文本文档 ,把文档的名称写为小写的robots.txt。" }+ ^$ F' |+ |$ ?9 z1 H' E q( H
C0 ^" R8 {2 a8 A文章摘自 奇闻趣事www.7zhan.com 转载需保留链接
; t+ W# W- u3 f1 M) e( { |