网站robots协议使用教程-robots文件
网站robots协议使用教程
robots协议可以说是各种网络爬虫程序与网站之间的一种约定,前段时间etao和京东就360buy内容的抓取闹得像两个孩子(PS:这篇文章写了一段时间了),且不论京东与etao的对错是非,从中我们可以知道robots可以将一些内容不开放给网络爬虫抓取,网络爬虫呢也完全可以不理会robots协议,按照自己的喜好获取你的信息,纵然是需要登录的网站爬虫也能注册账号登录,只是看想与不想。
也许有人说这样看robots协议一点作用也没有了,zhihu也曾讨论过robots是否涉及法律,协议的存在有其一定的约束力,但对于流氓行径连法律都不能完全阻止更别说协议了。
robots协议在遵守其约束的行为中能对SEO帮助很大的,下面看下都能做些什么?
第一:robots能规范网站的URL
网站有两种甚至3种以上地址的时候,该协议就能禁止蜘蛛爬去你不想展示的几种URL,而使网站解决站内重复问题集中权重。
网站有时候为了数据分析会在url接受后添加一些参数以区分来路,这样也是能用该协议解决的
第二:鉴于网站不想通过搜索引擎展示给用户的一些内容,也可以使用 robots.txt解决
第三:控制蜘蛛抓取,以减轻服务器负担,对于内容数量比较大的网站 蜘蛛抓取对于服务器资源的消耗是十分大的。
第四:和nofollow配合控制蜘蛛对网站的充分抓取
第五:robots.txt 支持添加网站地址以促进网站抓取和收录,语法:Sitemap:http://www.snlvyou.com/sitemap.xml
robots.txt文件用法举例
例1.禁止所有搜索引擎访问网站的任何部分 | User-agent: *Disallow: / |
例2.允许所有的robot访问(或者也可以建一个空文件 “/robots.txt”) | User-agent: *Allow: /另一种写法是User-agent: *Disallow: |
例3. 仅禁止Baiduspider访问您的网站 | User-agent: BaiduspiderDisallow: / |
例4. 仅允许Baiduspider访问您的网站 | User-agent: BaiduspiderAllow:/ |
例5. 禁止spider访问特定目录在这个例子中,该网站有三个目录对搜索引擎的访问做了限制,即robot不会访问这三个目录。需要注意的是对每一个目录必须分开声明,而不能写成 “Disallow: /cgi-bin/ /tmp/”。 | User-agent: *Disallow: /cgi-bin/Disallow: /tmp/Disallow: /~joe/ |
例6. 允许访问特定目录中的部分url | User-agent: *Allow: /cgi-bin/seeAllow: /tmp/hiAllow: /~joe/look |
例7. 使用”*”限制访问url禁止访问/cgi-bin/目录下的所有以”.htm”为后缀的URL(包含子目录)。 | User-agent: *Disallow: /cgi-bin/*.htm |
例8. 使用”$”限制访问url仅允许访问以”.htm”为后缀的URL。 | User-agent: *Allow:/ .htm$ |
例9. 禁止访问网站中所有的动态页面 | User-agent: *Disallow: /*?* |
例10. 禁止Baiduspider抓取网站上所有图片仅允许抓取网页,禁止抓取任何图片。 | User-agent: BaiduspiderDisallow: /*.webp$Disallow: /* .webp$Disallow:/* .webp$Disallow:/* .webp$Disallow: /*.bmp$ |
例11. 仅允许Baiduspider抓取网页和。gif格式图片允许抓取网页和gif格式图片,不允许抓取其他格式图片 | User-agent: BaiduspiderAllow: .webp$Disallow: /.webp$Disallow:/ .webp$Disallow:/ .webp$Disallow: /.bmp$ |
例12. 仅禁止Baiduspider抓取。jpg格式图片 | User-agent: /BaiduspiderDisallow:/ .webp$ |
robots.txt的写法是否正确可以使用google网站管理员工具后台测试。
SEO研究协会网是国内首家跨部门、跨行业、跨领域,由从事SEO研究、SEO培训、SEO服务的个人和企业团体自发组织创建的纯SEO技术研究平台。
相关内容
-
在wps中粘贴保留原格式化|wps中复制文件保留原
在wps中粘贴保留原格式化|wps中复制文件保留原有格式,格式化,...
-
什么是boot.ini文件错误ini的非法解决方案
什么是boot.ini文件错误ini的非法解决方案,,千奇百怪的电脑问...
-
鼠标不能拖动文件了
鼠标不能拖动文件了,鼠标,拖动,本文目录鼠标不能拖动文件了电...
-
Outlook的PST文件损坏的修复方法
Outlook的PST文件损坏的修复方法,文件, ...
-
电脑什么文件不能删除文件|电脑中哪些文件不能
电脑什么文件不能删除文件|电脑中哪些文件不能删除,,电脑中哪...
-
电脑上怎样打文件|电脑上怎样打文件符号
电脑上怎样打文件|电脑上怎样打文件符号,,电脑上怎样打文件符...
-
将wps转为EX|把WPS文件转为excel表格
将wps转为EX|把WPS文件转为excel表格,转为,如何将,wps,1.怎么...
-
电脑字幕手机怎么载入|电脑字幕手机怎么载入文
电脑字幕手机怎么载入|电脑字幕手机怎么载入文件,,电脑字幕手...
-
u盘看不到文件其他电脑可以看到|电脑里看不到u
u盘看不到文件其他电脑可以看到|电脑里看不到u盘,,1. 电脑里看...
-
电脑服务器在哪里找|怎么找到电脑服务器地址
电脑服务器在哪里找|怎么找到电脑服务器地址,,电脑服务器在哪...
-
金蝶系统管理员删除|金蝶用户管理员删了怎么办
金蝶系统管理员删除|金蝶用户管理员删了怎么办,,1.金蝶用户管...
-
斑马打印机官方网站|斑马标签打印机官网
斑马打印机官方网站|斑马标签打印机官网,,斑马标签打印机官网...
-
联想笔记本电脑主板颜色|联想笔记本颜色配置文
联想笔记本电脑主板颜色|联想笔记本颜色配置文件,,联想笔记本...
-
Win7系统如何架设代理服务器
Win7系统如何架设代理服务器,代理服务器,端口,本文目录Win7系...
-
电脑文件或丢失开不了机|电脑文件或丢失开不了
电脑文件或丢失开不了机|电脑文件或丢失开不了机,还没有键盘...