站建设好了,当然是希望网页被搜索引擎收录的越多越好,但有时候我们也会碰到网站不需要被搜索引擎收录的情况。% v( }1 A9 f: `
比如,你要启用一个新的域名做镜像网站,主要用于PPC 的推广,这个时候就要想办法屏蔽搜索引擎蜘蛛抓取和索引我们镜像网站的所有网页。因为如果镜像网站也被搜索引擎收录的话,很有可能会影响官网在搜索引擎的权重,这肯定是我们不想看到的结果。www.labtt.com& V, p9 A% R( z" A% ]. e
以下列举了屏蔽主流搜索引擎爬虫(蜘蛛)抓取/索引/收录网页的几种思路。注意:是整站屏蔽,而且是尽可能的屏蔽掉所有主流搜索引擎蜘蛛。 K# \- G. s6 T
1、通过 robots.txt 文件屏蔽3 H7 s) D( b" o" s2 f5 T
可以说 robots.txt 文件是最重要的一种渠道(能和搜索引擎建立直接对话)。我通过分析我自己博客的服务器日志文件,给出以下建议(同时欢迎网友补充):1 ~6 u c1 a+ t" U( r# u
User-agent: Baiduspider
! }" ^! I& @* i9 N% N/ YDisallow: /
7 S6 V; f2 S' j0 NUser-agent: Googlebot7 X' `+ g4 u" q( u/ g# A
Disallow: /
1 J) E7 H+ T3 Y+ DUser-agent: Googlebot-Mobile2 A M# {! j& r# }# ?
Disallow: /
, K* [1 Y' e; p" jUser-agent: Googlebot-Image
/ P7 W6 G2 f Q1 F4 y7 r; aDisallow: /
. ~- X+ b& [8 r3 UUser-agent: Mediapartners-Google
7 _" t' o& o, R/ B9 TDisallow: /# q2 x) }" F* s5 M
User-agent: Adsbot-Google
2 E1 C4 Q k& R# S. zDisallow: /
% M& s V7 z: I+ qUser-agent: Feedfetcher-Google
' u* J- u& G& u+ _Disallow: /5 X+ ]; Z# f( h' h6 ]
User-agent: Yahoo! Slurp
, q- B. ~6 t$ v2 o/ {, \Disallow: /$ J# N2 R% q' K( z; E
User-agent: Yahoo! Slurp China4 o; ?. n" k, h0 ]9 M. `4 R8 ~
Disallow: /
& m A* P' o( J# ^; aUser-agent: Yahoo!-AdCrawler/ \5 \# U& o* g: C0 k
Disallow: /- g4 Y) a5 j0 a g, Q3 U1 d
User-agent: YoudaoBot
/ j8 T, k7 j& P6 _$ xDisallow: /2 D( E1 ~$ g0 R# O8 Y9 }, I
User-agent: Sosospider
. W7 m& ?# R7 V' E2 ~, ^: GDisallow: /
: O- ^" Y4 Y: ^$ h. A* A1 FUser-agent: Sogou spider7 _, p9 c8 ?6 r: D6 L; q/ s
Disallow: /2 Q; m% p7 j* ~8 e
User-agent: Sogou web spider
& N1 J$ l6 \& U0 c* @, P }& BDisallow: /
3 I: g0 O" T% R) D- r1 XUser-agent: MSNBot
8 i! d7 }% M& ^& ?% e" ?Disallow: /% U1 ?+ j/ {" r5 `$ V
User-agent: ia_archiver$ o1 B( X8 j- Z1 Z. M6 N
Disallow: /
+ r x% T, j+ xUser-agent: Tomato Bot
0 l! w4 _2 W. B3 x; D( O0 C' cDisallow: /+ ^$ c, a& v9 ~) E8 c4 b. L) F
User-agent: *- Q/ U' B u, r' z
Disallow: /
4 I8 M( A5 p+ u2、通过 meta tag 屏蔽
3 A# L, ?/ ^" r/ U4 ~9 V1 N在所有的网页头部文件添加,添加如下语句:
2 J" u9 _1 P5 `' H/ A<meta name=”robots” content=”noindex, nofollow”>+ W/ L" H' U! X' g
3、通过服务器(如:Linux/nginx )配置文件设置
; M' _0 p% E; F/ ^' Z直接过滤 spider/robots 的IP 段。www.labtt.com
( U( g! c* ]; b$ T' P4 V小注:第1招和第2招只对“君子”有效,防止“小人”要用到第3招(“君子”和“小人”分别泛指指遵守与不遵守 robots.txt 协议的 spider/robots),所以网站上线之后要不断跟踪分析日志,筛选出这些 badbot 的ip,然后屏蔽之。# y9 O9 J; s8 o* I( ]0 {. Q
这里有一个 badbot ip 数据库:www.labtt.com转载说明出处4 ]* m; k2 |6 K5 q, ]1 @. Z( o/ S+ \
( H# C: _/ N' B& I |