免费阅读
返回
菜单
上一章查看最新章节下一章

第279章 未雨绸缪

作品:此生应无憾作者:史提芬T
如果本章错误,请点击报错10秒纠正

盛在国内面对的搜索引擎除了自家的寻知,就剩下百度,未来可能会有360搜索引擎,如果自己没来得及彻底剿灭周教主的话。

不论是百度搜索引擎还是360搜素引擎,在陆道升看来都不是什么好鸟,提前防范一下很有必要。

要提供搜索引擎服务,需要解决数据的搜集和数据的组织两个大问题。

其中数据的搜集即指的是使用爬虫来对互联网网站内容进行爬取,搜集到自家的后台中。

数据的组织即如何将爬取下的海量数据进行处理,以使得用户能通过搜索快速获得高相关性的结果。

陆道升要提前做好针对准备的就是百度的数据搜集过程,即通过反爬虫机制来限制百度对嘉盛旗下网站的内容爬取。

这并不是对百度的进攻性策略,而是一种自保的防御手段。

前世曾爆出国内某搜索引擎大量采用快照的形式来承接用户的点击跳转,大量屏蔽了用户对原网站的访问的事件。

快照本来是搜索引擎为了应对一些网络连接或是网站失效等问题,将网站内容缓存在搜索引擎服务器上提供给用户,以保障用户搜索体验的方式。

但是刻意的滥用,就会变成对原网站的剥削吸血,用了你的内容还不给你流量,把流量带来的各类收益(例如业务推广、广告收入等)全部拦截。

也许有人会问,那既然这样,能不能就不让搜索引擎爬取网站内容,这样就没有快照,用户也只能来到网站进行访问。

这么干不是不行,可以采取robots协议实现。

简单来说,在搜索行业里存在一种robots协议,按照协议规范在网站的目录下部署xt文件,告知搜索引擎的爬虫哪些内容不应被爬取。

即便有robots协议,爬虫还是可以爬取网站内容,但是搜索引擎服务却不能将爬取到的内容进行展现,否则就可以直接去法院把搜索引擎公司告得灰头土脸。

但由于在PC互联网时代的中后期,搜索引擎就是最大的互联网流量入口,拥有互联网上最强大的话语权。

中小网站如果拒绝搜索引擎的爬取,其实和自绝于互联网没啥两样。

如果网站的拥有者还希望网站能被人们访问到的话,就只能乖乖接受搜索引擎的爬取,并祈祷搜索引擎公司足够讲道理,不过分使用快照等方式进行截流。

其实robots协议里存在白名单的机制,看上去嘉盛可以只允许自家的搜索引的爬虫

…。。
   本章没完,请点击下—页继续阅读!如果被转码了请退出转码或者更换浏揽器即可。
  温馨提示:亲爱的读者,如果你觉得本站还好,为了避免丢失和转马,请勿依赖搜索访问,建议你使用[华为刘揽器]或[Firefox火狐刘揽器]访问并收蔵【书控书吧】 m.shkuangneng.com。我们将会持续为你更新,还建议你注册会员使用书架功能追书阅读更方便。
上一页 123下一页
上一章查看最新章节下一章
临时书架加入书签回顶部↑

看了《此生应无憾》的书友还喜欢看

末日先斩学姐,无限神级选择!
作者:零八零一
简介: 【末日+爆杀+女神+资源+囤货+校花+种田+全民+求生】\n一觉睡醒,末世降临,人类...
更新时间:2026-03-03 23:39:43
最新章节:第777章 炮轰血巢,全面战争打响
抗战:从东北军开始全面战争
作者:炫龙童学
简介: 那一天,身为华夏陆军特种部队的他,重生1932年!\n国之沦陷,东北岌岌可危!
更新时间:2026-03-03 23:44:17
最新章节:第2125章 老北风:我错了
公路求生,开玩具车也能当榜一?
作者:老酒抽到上上签
简介: 【公路求生?无CP?微群像】一睁眼,花浅穿着睡衣抱着猫,被丢进了公路求生游戏。
更新时间:2026-03-03 23:16:00
最新章节:第九十四章预知
七零娇小姐随军,惊艳家属院
作者:商格格
简介: 【年代+穿书+空间+掏空家产+先婚后爱】明熙意外穿越了,成了年代文里肤白貌美,明艳动...
更新时间:2026-03-03 23:28:00
最新章节:第244章 一夜爆火
直播相亲:我的情报无限刷新
作者:一剑斩南天
简介: 网友:“张哥,我的相亲对象说自己是库里那样的球员,一人一城,但是我调查发现,她其实是...
更新时间:2026-03-03 23:14:57
最新章节:第531章 灵魂伴侣不等于婚姻幸福
恶毒女配勾勾手,男主跪下叫主人
作者:夭妖铃
简介: 【快穿+甜宠1v1+微万人迷+恶女训狗+男主发疯只听女主话+雄竞修罗场+一见钟情HE...
更新时间:2026-03-03 23:42:07
最新章节:第261章 禁欲佛子偏执溺宠娇弱妹妹(55)
书名:

本站若有图片广告属于第三方接入,非本站所为,广告内容与本站无关,不代表本站立场,请谨慎阅读。

Copyright © 2020 书控书吧 All Rights Reserved.kk

SiteMap