热门需求search.zbj.com/task/8 J( v. f, A1 d+ x& \# k
2 B) H$ l/ P* U3 ^ L+ }' l5 U. w) f
搜索引擎三巨头支持的robots文件记录包括:
& L& m, p9 G$ y- s+ K/ t& A, j" n+ Q6 L' u5 [2 x- M# o
Disallow – 告诉蜘蛛不要抓取某些文件或目录。如下面代码将阻止蜘蛛抓取所有的网站文件:. n% \6 [# F+ j" n0 d
6 z9 u2 l- r; u0 ` H User-agent: *& j( z; I; q- H; t( ^/ N
5 J1 l+ m& z6 A
Disallow: /- u. `# @: W" S, E. b3 `* H& y
% y5 |3 j' K" m4 R
Allow – 告诉蜘蛛应该抓取某些文件。Allow和Disallow配合使用,可以告诉蜘蛛某个目录下,大部分都不抓取,只抓取一部分。如下面代码将使蜘蛛不抓取ab目录下其他文件,而只抓取其中cd下的文件:( q9 d1 C' l3 h2 r6 J* e' i
0 X; P' z( c! p9 \ User-agent: *
# @1 y# Z2 b9 ] z0 o$ T
! z2 d9 }. I- l" ?$ d Disallow: /ab/& M% X3 j8 H/ n* `9 M" V1 I
% h) Q4 z- q$ B
Allow: /ab/cd' {1 f; A V9 e9 t; S
: X" t- B" c& D $通配符 – 匹配URL结尾的字符。如下面代码将允许蜘蛛访问以.htm为后缀的URL:7 ^/ [; _; d5 k
4 A) s6 C0 R/ ]( F9 {
User-agent: *
/ Y9 y D* r' W' i0 C7 g# `5 h1 c) Z
Allow: .htm$' a+ |3 J& E& L
; R. l1 O' j) R1 o" @ *通配符 – 告诉蜘蛛匹配任意一段字符。如下面一段代码将禁止蜘蛛抓取所有htm文件:- y! K6 C X$ i2 M! ^
8 w: R8 P% o) w. B; L! r& H& q User-agent: *7 X& b, j/ p) o! c
5 N4 T" g D" L2 t Disallow: /*.htm, @6 P" N- |, c( D; p/ [
: q) G1 q- _' \
Sitemaps位置 – 告诉蜘蛛你的网站地图在哪里,格式为:
2 v- e, i$ f I8 I/ i
! Z/ E7 [/ c* W* Q8 A! ? a Sitemap: <sitemap_location>
) c8 y" g2 N- T$ k; a. O
! M/ f: l: [& r) [ 三家都支持的Meta标签包括:1 h" |4 _" R' s; j
4 f' Y9 f, T; Q% s% u NOINDEX – 告诉蜘蛛不要索引某个网页。
6 Q3 A6 |& Z6 h* J2 X/ @
$ s, X& n4 R; D/ ^, E1 |% _" C NOFOLLOW – 告诉蜘蛛不要跟踪网页上的链接。
- z" j% N- V* F" c8 g! `' T; u* ?; O& D, T' A
NOSNIPPET – 告诉蜘蛛不要在搜索结果中显示说明文字。
) n0 |. R. x- z) p" [( H4 d- A) @/ d4 a6 ?; j0 F5 r5 F8 ?
NOARCHIVE – 告诉蜘蛛不要显示快照。
; c- I6 R3 o6 P f' b) l% N4 E4 |. |) A# W+ v
NOODP – 告诉蜘蛛不要使用开放目录中的标题和说明。
. b* O8 \2 C" ~- J4 a. T
, I4 X5 q/ Z* e, \ 上面这些记录或标签,现在三家都共同支持。其中通配符好像以前雅虎微软并不支持。百度现在也支持Disallow,Allow及两种通配符。Meta标签我没有找到百度是否支持的官方说明。4 | j* E) |8 D) {# L. f. ]$ j
: b. T$ p0 x3 T8 c
只有Google支持的Meta标签有:
1 l! Y; U* \) |1 ?
- X9 {8 \: f2 m# w: F0 B1 |( m UNAVAILABLE_AFTER – 告诉蜘蛛网页什么时候过期。在这个日期之后,不应该再出现在搜索结果中。1 h, c# U* e. f* |# C
$ q- K) S& G8 Y2 {0 C d
NOIMAGEINDEX – 告诉蜘蛛不要索引页面上的图片。
$ A8 F% @) w0 I: S' ^, w, [$ _8 C$ L2 i8 i) S
NOTRANSLATE – 告诉蜘蛛不要翻译页面内容。
& o8 T) ?8 h$ M+ \
8 G! K2 l$ L/ u: p 雅虎还支持Meta标签:, s& H8 k& m( u1 _9 ^
8 D# g: h( t9 Y! _0 v Crawl-Delay – 允许蜘蛛延时抓取的频率。
4 X; s8 F& T$ A' f+ v7 @/ _
k+ i6 f: H; u Z9 I- I5 M1 ~. P NOYDIR – 和NOODP标签相似,但是指雅虎目录,而不是开放目录。# c- ?6 m0 z" i7 @) O; f, V
O- F9 a2 P# c% [) ]2 v, i Robots-nocontent – 告诉蜘蛛被标注的部分html不是网页内容的一部分,或者换个角度,告诉蜘蛛哪些部分是页面的主要内容(想被检索的内容)。( k; a, `! n, G1 Q$ H
% V- u! y% x3 ]4 O- _7 X8 h
MSN还支持Meta标签:
9 w; D! s2 f: `; u5 U% d+ |: ^% ?6 ]$ _' ?9 t Q
Crawl-Delay# b+ k9 L9 w' ^2 ?
. l# i0 o; [9 j( v6 i8 C7 f1 b
另外提醒大家注意的是,robots.txt文件可以不存在,返回404错误,意味着允许蜘蛛抓取所有内容。但抓取robots.txt文件时却发生超时之类的错误,可能导致搜索引擎不收录网站,因为蜘蛛不知道robots.txt文件是否存在或者里面有什么内容,这与确认文件不存在是不一样的。
& m) U/ c3 u& C5 k+ Y$ [) t ~! {5 v1 M$ Y+ x/ i" o ]5 N3 {
|