robots文件主要是为了防止搜索引擎收录和索引特定的页面。减小复制内容的出现。如seohu.net,同时具有动态URL和静态URL,它们同时指向相同的页面。如果搜索引擎同时收录就会造成复制页面。
# g# @: w1 P" i8 _
+ W- a4 l6 J2 {2 D/ Y; Q3 K0 ? 1.robots文件放在哪里. n: F* Z: n0 G0 C" v
! L' X6 y6 j8 m
robots文件放在网站根目录下,搜索引擎进入网站查看的第一个文件就是 robots文件。 robots文件是规定搜索引擎抓取范围的文件。如果我们希望网站某些页面不被抓取,只需要创建一个 robot.txt,写入禁止收录的页面并上传到网站根目录下。
: C; ?) x- t$ _/ {+ X( n4 N+ c1 ~% s& b/ o. ]9 \! N
2.robots文件怎么写
+ k5 ` p) [7 E) x$ a1 w8 t; A7 y$ v3 |/ Y& [7 b( e
robots文件由记录组成,记录之间以空行分开,记录格式为:<域>可选空格><域值><可选空格>
+ f0 x: q2 h# `9 x$ p8 q0 W& @3 l* ~. t/ s7 r( S
如: User-agent) ~. u; t+ Q: Y; b- X* w
/ |0 Z6 L$ z( ~ W" D, l
Disallow:/) E+ w6 r% E4 E0 p9 o: e; n: g/ V
6 P+ @9 V9 z; n7 j% w
这面的这个robots文件代表禁止任何搜索引擎抓取网站任何页面。只针对百度蜘蛛则用:7 c1 _4 A, H, F( B4 P4 J
$ L% o1 b _) F2 R0 Y
User-agent:Baiduspider
/ T! }8 o% Q) K; k* t( s. x8 ~3 N0 ]$ Y! p/ g7 g; g4 F4 a
针对谷歌则用:/ A b" }8 n8 A2 [6 m
, w0 q1 {4 t4 `7 u: k9 [
User-agentooglebot* p. B; Q$ m1 M: R% j8 w: a
. Y5 ?; T1 {! q& T4 y
如下面的robots代表禁止百度抓取动态URL和文件夹temp下的文件: S) C& k, E5 [: ^" g0 n2 i: u2 p" n
9 e' S8 W( n6 q5 e1 }. J. c, h User-agent:Baiduspider9 v! u" e* s/ z X# A! u
: {3 }8 {- K# F* g Disallow?*1 X4 X8 J5 e" g, S2 J/ h
- @ k3 i: F7 p9 R' T0 z# @
Disallow:/temp/
+ H* m+ F# w& h6 D/ @% v0 C* q0 p+ d' b8 Q {7 h
其中*为通配符,可以代表任何一段代码。详细匹配可以看:
2 m7 b& {( n! T( P! n& O+ j2 v; z0 {) E' A" T' y d, v! g5 i
Seohu:主流搜索引擎都支持robots文件禁止收录机制。但如果有外部链接指向禁止收录的页面,这个页面还是可能出现在搜索结果中。其表现形式一般为导入链接的锚文字显示为标题和描述。本文写的很简单,如果还想深入了解,请在后面回帖留言。我会给大家解答。 |