robots文件主要是为了防止搜索引擎收录和索引特定的页面。减小复制内容的出现。如seohu.net,同时具有动态URL和静态URL,它们同时指向相同的页面。如果搜索引擎同时收录就会造成复制页面。
* |/ t- f7 |. d. p/ J2 `
1 @4 Y0 |+ O6 u/ M0 a 1.robots文件放在哪里
( a( o; q/ y% R6 ?6 z# A9 u& R: h3 j: X7 n- F9 N6 E; M9 W
robots文件放在网站根目录下,搜索引擎进入网站查看的第一个文件就是 robots文件。 robots文件是规定搜索引擎抓取范围的文件。如果我们希望网站某些页面不被抓取,只需要创建一个 robot.txt,写入禁止收录的页面并上传到网站根目录下。5 |6 `) W7 g+ ^4 A1 `2 F8 Z/ T
2 R1 U' E# p& ~, j2 D( } 2.robots文件怎么写
7 r+ f0 C, ~0 b' J6 b. a/ }7 U9 x4 z: U4 B( U/ Y0 g8 ?
robots文件由记录组成,记录之间以空行分开,记录格式为:<域>可选空格><域值><可选空格>* ?1 v: h6 v3 g+ U
9 _; R4 [2 c7 d) Y
如: User-agent* r. e/ k/ y" }7 e+ @1 M
1 u/ }& d8 t- j7 D0 p4 R Disallow:/
/ I, B7 E) Q4 d8 l! ]* W
5 Z5 p! w0 d* M6 ~6 P$ E 这面的这个robots文件代表禁止任何搜索引擎抓取网站任何页面。只针对百度蜘蛛则用:0 T$ r# v6 I3 ]! z$ ]
) g! S2 {4 U) ?5 N$ I
User-agent:Baiduspider$ v+ o3 b1 m4 x, S. S, B
7 Z o l% s' w0 S; m 针对谷歌则用:
" t! O% H; t* s- T1 w7 m: r; `; L3 ]
4 T: d; x( N; E3 V, s User-agentooglebot
0 y4 I6 f8 X2 W6 f- w
f. s& {3 E3 { 如下面的robots代表禁止百度抓取动态URL和文件夹temp下的文件
2 a; b5 B% _/ j8 E! ? j: [! _- i/ z3 `. P# ?' ]1 ^
User-agent:Baiduspider
, o. J% m7 ? u8 a4 c" v3 F
' P7 n# f9 Q4 x9 H7 s Disallow?*, [2 v! h N* n* y
9 l; d5 P" O4 F2 Q) s6 q
Disallow:/temp/
1 G+ I6 Y7 T w6 k
0 R; R$ d( A4 L 其中*为通配符,可以代表任何一段代码。详细匹配可以看:
1 ? r, U( T- N3 E9 W- b2 p! l6 A# t7 ?4 I4 `6 p9 y c, @
Seohu:主流搜索引擎都支持robots文件禁止收录机制。但如果有外部链接指向禁止收录的页面,这个页面还是可能出现在搜索结果中。其表现形式一般为导入链接的锚文字显示为标题和描述。本文写的很简单,如果还想深入了解,请在后面回帖留言。我会给大家解答。 |