User-agent: * 这里的*代表的所有的搜索引擎种类,*是一个通配符

Disallow: /admin/ 这里定义是禁止爬寻admin目录下面的目录

Disallow:/A 是屏蔽A目录下的所有文件,包括文件和子目录,还屏蔽 /A*.*的文件

Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录

Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录

Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以“。htm”为后缀的URL(包含子目录)。

Disallow: /*?* 禁止访问网站中所有包含问号 (?) 的网址(动态页面)

Disallow: /.jpg$ 禁止抓取网页所有的。jpg格式的图片

Disallow:/ab/adc.html 禁止爬取ab文件夹下面的adc.html文件。

Allow: /cgi-bin/ 这里定义是允许爬寻cgi-bin目录下面的目录

Allow: /tmp 这里定义是允许爬寻tmp的整个目录

Allow: /*.htm$ 仅允许访问以“。htm”为后缀的URL。

Allow: /*.gif$ 允许抓取网页和gif格式图片

Sitemap: 网站地图 告诉爬虫这个页面是网站地图。如,Sitemap: http://www.***.com/sitemap.xml(此处请填写XML地图的绝对路径,即完整URL,如果按习惯填写Sitemap: /sitemap.xml,提交后会提示:检测到无效的 Sitemap 网址;语法错误。XML地图必须在网站根目录下才有效。)

注:我们常用的搜索引擎类型有:(User-agent区分大小写)

google蜘蛛:Googlebot

百度蜘蛛:Baiduspider

360蜘蛛:360Spider

sogou蜘蛛:Sogou Web Spider

yahoo蜘蛛:Yahoo!slurp

alexa蜘蛛:ia_archiver

bing蜘蛛:MSNbot

altavista蜘蛛:scooter

lycos蜘蛛:lycos_spider_(t-rex)

alltheweb蜘蛛:fast-webcrawler

inktomi蜘蛛:slurp

Soso蜘蛛:Sosospider

Google Adsense蜘蛛:Mediapartners-Google

有道蜘蛛:YoudaoBot

泽许蜘蛛: Zexuwhte

声明:本站所有文章,如无特殊说明或标注,均为本站原创发布。任何个人或组织,在未征得本站同意时,禁止复制、盗用、采集、发布本站内容到任何网站、书籍等各类媒体平台。如若本站内容侵犯了原著者的合法权益,可联系我们进行处理。