robots文件主要是为了防止搜索引擎收录和索引特定的页面。减小复制内容的出现。如seohu.net,同时具有动态URL和静态URL,它们同时指向相同的页面。如果搜索引擎同时收录就会造成复制页面。
8 J8 A+ m( c5 I4 t# g8 r* p# U% y, C. X+ \$ K
1.robots文件放在哪里
7 G: f1 q5 M$ }: k" E( V. ~7 `; A
* t2 D2 ]- W- v% {$ c$ o robots文件放在网站根目录下,搜索引擎进入网站查看的第一个文件就是 robots文件。 robots文件是规定搜索引擎抓取范围的文件。如果我们希望网站某些页面不被抓取,只需要创建一个 robot.txt,写入禁止收录的页面并上传到网站根目录下。; O3 L; }1 o v( D. O( }# i; u- m; h
) d1 Z, L- `( t 2.robots文件怎么写% ~: y; q9 U& K9 ?2 G
7 Q+ U; M, i$ @: ?# c X- R7 C+ [1 r
robots文件由记录组成,记录之间以空行分开,记录格式为:<域>可选空格><域值><可选空格>
' k( m/ A, }5 F, Y7 d! ]: D. I! `2 G% \4 v# Z; b
如: User-agent3 S9 q5 U' `9 r
, Y' S6 Q0 ]6 g5 S9 {
Disallow:/* N4 r+ E" J& X4 I. b* _
- ?" r0 t k9 R9 S3 d# \
这面的这个robots文件代表禁止任何搜索引擎抓取网站任何页面。只针对百度蜘蛛则用:4 a2 R0 K8 o6 `1 p- _3 S6 A
, j* [7 |% ?7 l. Q$ g1 h) ~ User-agent:Baiduspider4 C- N6 W5 C. r/ X0 P, c$ P
0 |6 }* m9 p& ]( g 针对谷歌则用:9 y) B0 |$ T& h: j3 x
+ j* Y+ ]. q+ g, }/ O
User-agentooglebot7 w* M- T! k! G' ?7 S6 n
7 D5 s. u" G& G2 b$ I; j 如下面的robots代表禁止百度抓取动态URL和文件夹temp下的文件, @: \) u: ^! i& l
$ Y9 @/ b) C- u+ r0 R1 \8 Y
User-agent:Baiduspider
+ Y% h W7 ?- n( y. Y6 L% c5 l' Q6 g6 |, U) T: \6 \; w/ d
Disallow?*4 n* x( u5 z' K/ W% W4 e
' V9 c; h- }- e: D4 U$ q+ @ Disallow:/temp/
" j' H0 B7 G& Z5 K" W
' w: u2 {$ p! G* k/ d* z: t 其中*为通配符,可以代表任何一段代码。详细匹配可以看:
: @, d* Y2 w: b& l1 c& W7 l5 }* S4 I, e. K
Seohu:主流搜索引擎都支持robots文件禁止收录机制。但如果有外部链接指向禁止收录的页面,这个页面还是可能出现在搜索结果中。其表现形式一般为导入链接的锚文字显示为标题和描述。本文写的很简单,如果还想深入了解,请在后面回帖留言。我会给大家解答。 |