English | 简体中文 | 繁體中文

Robots.txt文件在线生成工具

限制目录 (每个目录必须以/开头)
Sitemap 文件 (留空为无)
检索间隔 (单位秒)留空为不限
所有搜索引擎
国内搜索引擎
百度爬虫
搜狗爬虫
有道爬虫
SOSO爬虫
头条爬虫
神马爬虫
国外搜索引擎
Google爬虫
Bing爬虫
雅虎爬虫
Ask/Teoma爬虫
Alexa爬虫
MSN爬虫
Scrub The Web爬虫
DMOZ爬虫
GigaBlast爬虫
MJ12 爬虫
Maui 爬虫
BLEX 爬虫
Ahrefs 爬虫
Dot 爬虫
Semrush 爬虫
MegaIndex.ru 爬虫
华为花瓣 爬虫
Zoominfo 爬虫
ExtLinks 爬虫
俄罗斯 爬虫
特殊搜索引擎
Google Image爬虫
Google Mobile爬虫
Yahoo MM爬虫
Yahoo Blogs爬虫
MSN PicSearch爬虫
Robots.txt文件在线生成

在线robots.txt生成工具,用于快速生成标准格式的robots.txt文件。支持一键导出,上传至网站根目录即可使用。

建议每个站点均在根目录放置一个robots.txt文件(留空即可),以避免因程序问题导致对该文件的请求返回错误响应,从而引发搜索引擎不收录等不可预期的后果。

Robots协议(即爬虫协议)是国际互联网通行的技术规范,通过在网站根目录放置robots.txt文件,向搜索引擎声明哪些页面允许被抓取、哪些不允许。 通过该文件,可屏蔽图片、音乐、视频等大体积资源以节省服务器带宽,屏蔽站内死链接以避免无效抓取,同时可设置网站地图链接以引导爬虫更有效地遍历页面。

robots.txt基本用法

User-agent

User-agent是用来匹配爬虫的,每个爬虫都会有一个名字,如果你有安装awstats统计工具,你就能查看到爬虫的名字,比如百度的爬虫叫BaiDuSpider,Google的爬虫叫Googlebot,*表示所有爬虫。

Disallow

Disallow表示禁止爬虫访问的目录。Disallow: / 表示拦截整站。

Allow

Allow表示允许爬虫访问的目录。Allow: / 表示允许整站。

Sitemap

Sitemap用来指定sitemap的位置。

Crawl-delay

Crawl-delay 用于告知爬虫两次访问之间的间隔时长,单位为秒。对动态网站而言,爬虫抓取过于频繁可能导致服务器负载升高、用户访问速度下降,设置适当的 Crawl-delay 可缓解这一压力。

还可以使用通配符

*:匹配任意多个字符

$:表示URL的结尾

Robots.txt举例

不管是Disallow,Allow还是Sitemap,每行只能写一条规则。

拦截部分文件或目录

User-agent: *

Disallow: /cgi-bin/

Disallow: /aaa.html

允许爬虫访问所有的目录,有两种写法

User-agent: *

Disallow:

User-agent: *

Allow: /

通配符的使用,拦截.gif文件

User-agent: *

Disallow: /*.gif$

拦截带有?的文件

User-agent: *

Disallow: /*?

Sitemap例子

Sitemap: https://www.2gj.cn/too/sitemap.xml

分享链接