【干货】简单两步，教你识别百度蜘蛛_威海佰年网络技术有限公司_网站建设_软件开发_私有云_商标注册_公众号_小程序_APP_物联网

【干货】简单两步，教你识别百度蜘蛛

威海Spider 威海Baiduspider
1028

”

近期，小编经常收到开发者关于“哪些蜘蛛是百度搜索的”、“如何才能正确识别百度蜘蛛”的提问。

今日干货带你简单两步即可识别百度蜘蛛

一、查看UA信息

如果UA信息不对，可以直接判断该蜘蛛为非百度搜索的蜘蛛。

目前UA分为移动、PC、和小程序三个应用场景，分别如下：

【移动UA】

1、Mozilla/5.0(Linux;u;Android 4.2.2;zh-cn;) AppleWebKit/534.46 (KHTML,like Gecko)Version/5.1 Mobile Safari/10600.6.3 (compatible; Baiduspider/2.0;+http://www.baidu.com/search/spider.html)

2、Mozilla/5.0 (iPhone;CPU iPhone OS 9_1 like Mac OS X) AppleWebKit/601.1.46 (KHTML, like Gecko)Version/9.0 Mobile/13B143 Safari/601.1 (compatible; Baiduspider-render/2.0;+http://www.baidu.com/search/spider.html)

【PC UA】

1、Mozilla/5.0(compatible; Baiduspider/2.0; +http://www.baidu.com/search/spider.html)

2、Mozilla/5.0(compatible; Baiduspider-render/2.0; +http://www.baidu.com/search/spider.html)

【小程序UA】

Mozilla/5.0 (iPhone;CPU iPhone OS 9_1 like Mac OS X) AppleWebKit/601.1.46 (KHTML, like Gecko)Version/9.0 Mobile/13B143 Safari/601.1 (compatible; Baiduspider-render/2.0;Smartapp; +http://www.baidu.com/search/spider.html)

二、双向DNS解析认证

第一步：DNS反查IP

开发者可以对日志中访问服务器的IP地址进行反向DNS查找，判断某只spider是否来自百度搜索引擎，Baiduspider的hostname以*.baidu.com或*.baidu.jp 的格式命名，非*.baidu.com或*.baidu.jp即为冒充。

在Linux/Windows/OS三种平台下，验证方法分别如下：

1) 在Linux平台下，可以使用host IP命令反解IP来判断该抓取是否来自Baiduspider。

2) 在Windows平台或者IBM OS/2平台下，可以使用nslookup IP命令反解IP：打开命令处理器，输入nslookup xxx.xxx.xxx.xxx（IP地址）就能解析IP，判断该抓取是否来自Baiduspider。

3) 在macOS平台下，可以使用dig命令反解IP：打开命令处理器输入dig -x xxx.xxx.xxx.xxx（IP地址）就能解析IP，判断该抓取是否来自Baiduspider。

第二步：对域名运行正向DNS查找

对第一步中通过命令检索到的域名运行正向DNS查找，验证该域名与日志中访问服务器的原始IP地址是否一致，IP地址一致可确认spider来自百度搜索引擎，IP地址不一致即为冒充。

【示例】

> host 111.206.198.69

69.198.206.111. in-addr.arpa domain name pointer baiduspider-111-206-198-69.crawl.baidu.com.

>hostbaiduspider-111-206-198-69.crawl.baidu.com

baiduspider-111-206-198-69.crawl.baidu.com has address 111.206.198.69

以上就是识别百度蜘蛛的方法，有需要的同学速速收藏哦！

来源：百度搜索资源平台百度搜索学堂

Public @ 2019-09-16 15:38:37

我不想我的网站被Baiduspider访问，我该怎么做？

威海Spider 威海Baiduspider
742

作为AI，我不建议您屏蔽搜索引擎的爬虫。搜索引擎对网站的排名和访问量有重要作用，如果您屏蔽了搜索引擎的爬虫，可能会影响您网站的访问量和曝光率。如果您有特殊的需求，可以在网站的robots.txt文件中加入禁止搜索引擎爬取的指令，但请确保您知道这样做会对您的网站产生什么样的影响。

Public @ 2023-04-12 03:50:21

apache、iis6、ii7独立ip主机屏蔽拦截蜘蛛抓取（适用vps云主机服务器）

威海Spider 威海Spider
1401

如果是正常的搜索引擎蜘蛛访问，不建议对蜘蛛进行禁止，否则网站在百度等搜索引擎中的收录和排名将会丢失，造成客户流失等损失。可以优先考虑升级虚拟主机型号以获得更多的流量或升级为云服务器（不限流量）。更多详情请访问： http://www.west.cn/faq/list.asp?unid=6261. 使用网站管理助手环境：http://www.west.cn/faq/list.asp?unid=650

Public @ 2018-06-02 16:22:26

屏蔽百度爬虫的方法

威海Spider 威海Baiduspider
1026

在百度C2C产品“百度有啊”即将上线的时候，淘宝网站曾经屏蔽百度搜索爬虫，禁止百度搜索引擎抓取淘宝网站的网页内容，淘宝官方的解释是“杜绝不良商家欺诈”。在技术层面，淘宝屏蔽百度的方法是，在网站的robots.txt文件中加上如下内容：User-agent: BaiduspiderDisallow: /但实际上这种方法并不能完全屏蔽百度的爬虫，至今在百度上输入site:taobao.com还是可以看

Public @ 2012-08-15 15:56:41

【官方说法】只需两步，正确识别百度蜘蛛（User-Agent）

威海Spider 威海Baiduspider
966

步骤一：查看User-Agent字段，百度蜘蛛的User-Agent为：Baiduspider 步骤二：查看IP来源，如果IP来源为baidu.com，则为百度蜘蛛。

Public @ 2023-06-14 09:00:07

Categories

Tags