热门需求search.zbj.com/task/9 l# s& e7 x7 a# G9 v" |
' {! G+ V, ^+ w* B% i% r
搜索引擎三巨头支持的robots文件记录包括:: s* |- S1 V- T- `0 T1 a; C/ A* t
! e% M( T3 D" I
Disallow – 告诉蜘蛛不要抓取某些文件或目录。如下面代码将阻止蜘蛛抓取所有的网站文件:
" r, k/ l) T8 S+ T7 M3 V7 v& |# C: @
, j, V6 s6 \' w+ t5 E) Q User-agent: *
& F$ }7 M9 s7 Z$ w
7 A. I- h/ S! J' s. d& S Disallow: /; k3 b; ?5 F |3 J% h; g
# m5 D$ @) r- n- @+ Q
Allow – 告诉蜘蛛应该抓取某些文件。Allow和Disallow配合使用,可以告诉蜘蛛某个目录下,大部分都不抓取,只抓取一部分。如下面代码将使蜘蛛不抓取ab目录下其他文件,而只抓取其中cd下的文件:
( C9 n0 L5 c6 G& }+ U
, F; j. L) o9 c! T4 R User-agent: *- G2 n2 H. p# @: A/ ], o- I
0 m' H9 M7 y3 ]& c1 @" r Disallow: /ab/
5 n5 S1 ?4 B& [1 ^! q' r/ k* C E- N0 D; T+ o2 @
Allow: /ab/cd
; b. l c5 q9 M. G/ U, y' C7 Q1 _$ z& F9 o+ V
$通配符 – 匹配URL结尾的字符。如下面代码将允许蜘蛛访问以.htm为后缀的URL:
: H& V/ f' N8 x
% L) u" P* s/ k! n5 s, Y User-agent: *
9 B; n8 C5 T. N; G9 E' i0 m. s& f$ ^
- E: h8 t" K0 r; S* k8 z Allow: .htm$( g, c: n" S: a- P, T
R* x2 ]# `; z3 K+ U *通配符 – 告诉蜘蛛匹配任意一段字符。如下面一段代码将禁止蜘蛛抓取所有htm文件:
) {2 S3 L# |+ S/ J q" j$ U8 A/ w
" q; Z, d, F: a; ~# Q k User-agent: *5 e# y- @8 ~" C- H5 L* |
2 J! t8 `% c6 j6 L1 k
Disallow: /*.htm% s, ~$ w0 q, f+ L$ \
; q8 u+ k# ^% M$ @% d' D Sitemaps位置 – 告诉蜘蛛你的网站地图在哪里,格式为:* G9 f$ l3 V$ F# w$ @4 i! E
( ]3 p* N5 K. ^; x1 e: K; T Sitemap: <sitemap_location>
4 K# k; J: j: r, t. |, ?- Z( d+ A; [8 ]3 x
三家都支持的Meta标签包括:& L$ L. c y! s' `3 i$ j+ P
9 f e5 F, Y+ n7 M6 ]; X; z NOINDEX – 告诉蜘蛛不要索引某个网页。5 e7 r7 |& ? x. R6 ?
t" O/ S5 m- Q7 M$ x7 Q( T
NOFOLLOW – 告诉蜘蛛不要跟踪网页上的链接。$ z# H! W5 d) y& m. x
, w) R7 z. I1 L; l& F
NOSNIPPET – 告诉蜘蛛不要在搜索结果中显示说明文字。
" \- T( w8 C/ u4 _0 m) b: u6 ~# D( L2 J, p
NOARCHIVE – 告诉蜘蛛不要显示快照。
0 G5 M( X2 N2 g# ?: [1 w- ~* \' h1 f
NOODP – 告诉蜘蛛不要使用开放目录中的标题和说明。. v- r2 l2 b5 @$ S/ Z
* U! V; t; {5 x 上面这些记录或标签,现在三家都共同支持。其中通配符好像以前雅虎微软并不支持。百度现在也支持Disallow,Allow及两种通配符。Meta标签我没有找到百度是否支持的官方说明。" k2 k3 u+ Q. I; m* x% q
6 n- }1 L( `- y) E* k0 E 只有Google支持的Meta标签有:
2 Z: M& P# x9 a" |/ G4 ~/ M8 M0 ^6 u
UNAVAILABLE_AFTER – 告诉蜘蛛网页什么时候过期。在这个日期之后,不应该再出现在搜索结果中。
/ l& R4 c d0 c8 w" m; {# W( q9 U& V4 N
NOIMAGEINDEX – 告诉蜘蛛不要索引页面上的图片。# b: y5 |# O- Z1 j( H3 |& N
% v7 p- _/ r9 ?/ C0 A NOTRANSLATE – 告诉蜘蛛不要翻译页面内容。
' Z0 K! S9 B1 V. i+ I( `: c$ S- @& t9 X; ^% r A
雅虎还支持Meta标签:6 ?0 y% c' W- T! ~0 P! U2 i9 S
2 C+ {( C: D3 N: i6 a Crawl-Delay – 允许蜘蛛延时抓取的频率。$ r- M1 g$ k; ?/ p
! E9 b$ b- h' o: ^! l% o6 J
NOYDIR – 和NOODP标签相似,但是指雅虎目录,而不是开放目录。
& Q! {' N( w1 R
0 C: i: |8 c' H8 S9 w. J Robots-nocontent – 告诉蜘蛛被标注的部分html不是网页内容的一部分,或者换个角度,告诉蜘蛛哪些部分是页面的主要内容(想被检索的内容)。6 q' {% |' ]. N' s; I
B' H" e) b0 `
MSN还支持Meta标签:/ f: Z9 m2 P* K& p/ w1 p9 A
, R- {& T* k/ I V3 l Crawl-Delay, Y; @& J- q3 F
% X$ `# H* Z4 u K8 V3 w5 o 另外提醒大家注意的是,robots.txt文件可以不存在,返回404错误,意味着允许蜘蛛抓取所有内容。但抓取robots.txt文件时却发生超时之类的错误,可能导致搜索引擎不收录网站,因为蜘蛛不知道robots.txt文件是否存在或者里面有什么内容,这与确认文件不存在是不一样的。
/ D$ n( I. |! }: v7 L( f* F2 q) H- L, W: ?
|