在线robots.txt生成工具,用于快速生成标准格式的robots.txt文件。支持一键导出,上传至网站根目录即可使用。
建议每个站点均在根目录放置一个robots.txt文件(留空即可),以避免因程序问题导致对该文件的请求返回错误响应,从而引发搜索引擎不收录等不可预期的后果。
Robots协议(即爬虫协议)是国际互联网通行的技术规范,通过在网站根目录放置robots.txt文件,向搜索引擎声明哪些页面允许被抓取、哪些不允许。 通过该文件,可屏蔽图片、音乐、视频等大体积资源以节省服务器带宽,屏蔽站内死链接以避免无效抓取,同时可设置网站地图链接以引导爬虫更有效地遍历页面。
robots.txt基本用法
User-agent
User-agent是用来匹配爬虫的,每个爬虫都会有一个名字,如果你有安装awstats统计工具,你就能查看到爬虫的名字,比如百度的爬虫叫BaiDuSpider,Google的爬虫叫Googlebot,*表示所有爬虫。
Disallow
Disallow表示禁止爬虫访问的目录。Disallow: / 表示拦截整站。
Allow
Allow表示允许爬虫访问的目录。Allow: / 表示允许整站。
Sitemap
Sitemap用来指定sitemap的位置。
Crawl-delay
Crawl-delay 用于告知爬虫两次访问之间的间隔时长,单位为秒。对动态网站而言,爬虫抓取过于频繁可能导致服务器负载升高、用户访问速度下降,设置适当的 Crawl-delay 可缓解这一压力。
还可以使用通配符
*:匹配任意多个字符
$:表示URL的结尾
Robots.txt举例
不管是Disallow,Allow还是Sitemap,每行只能写一条规则。
拦截部分文件或目录
User-agent: *
Disallow: /cgi-bin/
Disallow: /aaa.html
允许爬虫访问所有的目录,有两种写法
User-agent: *
Disallow:
User-agent: *
Allow: /
通配符的使用,拦截.gif文件
User-agent: *
Disallow: /*.gif$
拦截带有?的文件
User-agent: *
Disallow: /*?
Sitemap例子
Sitemap: https://www.2gj.cn/too/sitemap.xml