淘宝为什么禁止搜索引擎蜘蛛抓取



  网站的内容只有收录了才有机会被别人看到,但是淘宝就不一样,淘宝除了首页其它页面都屏蔽了搜索引擎蜘蛛的抓取,这是为什么呢?


QQ截图20180615151024.jpg


  淘宝网在网站根目录下的robots.txt文件中设置相关命令,禁止搜索引擎蜘蛛获取网页信息。


QQ截图20180615150558.jpg


  这个“robots.txt”是什么呢?

  robots.txt(小写字母)是一种存放在一些网站的服务器根目录下的ASCII编码的文本文件。它的作用是告诉搜索引擎的爬虫机器人(又称网络蜘蛛、漫游器)该网站中的哪些内容是不允许被搜索引擎爬虫抓取的,哪些是允许被抓取的。由于在一些系统中URL大小写敏感,因此robots.txt的文件名均统一为小写。robots.txt放置在网站的根目录下。

  淘宝为什么要这样做呢?

  网上的说法有很多种,在我看来有2个重要的原因:

  1、保护用户的信息

  搜索引擎对动态页面的抓取技术越来越成熟,在没屏蔽爬虫的情况下,爬虫是可以抓取到用户登陆之后的信息的,抓取之后是有可能在搜索引擎中搜索时候展现出来的,基于这种前提淘宝考虑屏蔽。

  2、抢夺流量入口

  可以试想一下如果在百度搜索中,搜索淘宝的一家店铺名字能够展现出来这个淘宝店铺的话,会有多少人直接用百度搜索淘宝店铺购买想要的东西了,而不会先进入到淘宝网再对淘宝店铺进行搜索了?那么这一部分本来就属于淘宝的流量被百度给抢走了,淘宝能干嘛?

  再试想一下,这些流量都被百度抢走之后淘宝网首页的大图推荐还能卖多少钱?淘宝的直通车还能赚钱吗?淘宝自己开发的那么多产品不都是通过流量来变现的吗?这些流量被百度拿走了对淘宝来说是一个巨大的损失。

  综合这2点重要的因素我们了解到淘宝通过禁止搜索引擎爬虫的抓取,抢夺到一大批的流量,同时淘宝还在搜索引擎上购买流量,如下图:


QQ截图20180615150825.jpg


  天猫本身是屏蔽蜘蛛抓取的,但是他们在百度付费推广做广告,等于是在付费购买百度搜索引擎的流量。

  淘宝在拥有大流量大数据的情况下开发出各种针对商家的产品,让商家对这自己需要的部分流量进行付费买单,从而实现流量变现。

  星若传媒(xingruocm.com)专注深圳网站建设、网站seo优化、全网营销推广外包等领域,行业经验丰富,专业的服务团队,致力成为行业引领者。

深圳市星若文化传媒有限公司

公司网址:http://www.xingruocm.com

地址:深圳市福田区深南路与彩田路交汇处嘉麟豪庭B座2601

邮编:518000

官方微信:xingruocm

建议及投诉电话:0755-82842769

全国免费热线

0755-82842769

手机号码:15817491573