robots文件主要是为了防止搜索引擎收录和索引特定的页面。减小复制内容的出现。如seohu.net,同时具有动态URL和静态URL,它们同时指向相同的页面。如果搜索引擎同时收录就会造成复制页面。
) Q) [# d: r3 L6 Q- O' \$ C/ D( _
1.robots文件放在哪里" w* ?. \; ]( J( D$ U7 ^
4 C9 q: F* y) R" N3 I r
robots文件放在网站根目录下,搜索引擎进入网站查看的第一个文件就是 robots文件。 robots文件是规定搜索引擎抓取范围的文件。如果我们希望网站某些页面不被抓取,只需要创建一个 robot.txt,写入禁止收录的页面并上传到网站根目录下。! d1 W% v4 A/ G; c
0 f! o" I |7 n 2.robots文件怎么写6 ?1 w* }* \9 S; e
) y9 {2 I" H& e' R' Y( j
robots文件由记录组成,记录之间以空行分开,记录格式为:<域>可选空格><域值><可选空格>
3 p! ]9 o& L! ]* f. l$ Z6 G, x( {, p5 a4 w" w
如: User-agent* W, z& j: X" P
" x" X- S% Q k: j( s Disallow:/* ~0 N! F( S% s6 U7 u3 ?% @: h8 k, p, O9 G
! k# o% Q6 x( u: S$ p5 C
这面的这个robots文件代表禁止任何搜索引擎抓取网站任何页面。只针对百度蜘蛛则用:
- O. ?( w2 Y0 s0 C9 @, |* z2 t# q( k/ M& @' W& Z# k& }$ Y
User-agent:Baiduspider/ w( e; K* {+ n$ ?6 @/ o. C
: T4 g' A7 E! s6 w2 z. |7 n 针对谷歌则用:
8 R# F1 o- \6 \/ _6 e1 j9 ?; p8 m7 o/ m- o/ A, f
User-agentooglebot$ G' L8 V' ^) v9 F0 O' H% r- H
( l/ l6 c; @8 E$ I+ ]1 K0 ^
如下面的robots代表禁止百度抓取动态URL和文件夹temp下的文件
- Y; z2 x/ }+ \# X( z; M7 \' V) ~# W
User-agent:Baiduspider# w/ L5 ^1 j6 O# E" p; O& ]
- X, s, O8 d) W( m Disallow?*
- B5 X2 E( _, v+ w
) u, ~" P" \4 X' x Disallow:/temp/
5 S/ Z4 ~$ S6 [' h1 {9 W* c' j X
其中*为通配符,可以代表任何一段代码。详细匹配可以看:2 c6 z( C# }% \( x! j
2 R1 K. h& l" s9 A2 U* `0 Z
Seohu:主流搜索引擎都支持robots文件禁止收录机制。但如果有外部链接指向禁止收录的页面,这个页面还是可能出现在搜索结果中。其表现形式一般为导入链接的锚文字显示为标题和描述。本文写的很简单,如果还想深入了解,请在后面回帖留言。我会给大家解答。 |