您现在的位置是:首页 > 站长新闻站长新闻
【白皮书解读搜索引擎的工作原理】建库
2021-01-21【站长新闻】人已围观
简介本文解读的是:《百度官方课程抓取建库》1、spider抓取系统2、spider抓取指标一、spider抓取系统百度蜘蛛抓取建库是个极其复杂的系统工程,光是抓取系统就分为链接存储系统、链接选取系统、DNS解析服务系统、抓取调度系统、网页分析系统
本文解读的是:《百度官方课程抓取建库》
1、spider抓取系统
2、spider抓取指标
一、spider抓取系统
百度蜘蛛抓取建库是个极其复杂的系统工程,光是抓取系统就分为链接存储系统、链接选取系统、DNS解析服务系统、抓取调度系统、网页分析系统、链接提取系统、链接分析系统、网页存储系统。
如果不好理解的话,你可以理解为一个抓取程序,分为以上几个功能模块,功能相互配合完成抓取程序,我个人分析,根据百度蜘蛛的情况来看,目前百度抓取的IP段在220,116段,116开头IP在于阳泉(李彦宏老家),因此我们不妨推测出这样一个观点,我们看到一个个的蜘蛛IP,就是对应的这些电脑主机,而这些电脑上就装着抓取程序。
二、spider抓取指标
我们按照蜘蛛抓取流程来说,一个蜘蛛爬到网站后,首先去访问robots.txt的协议文件,遵循协议中的规则,该爬哪里不该爬哪里,然后通过抓取后通过抓取返回码去做下一步动作,比如抓取a.com/123.html,返回码是404,那么此条信息就告诉百度这条信息已经失效,如果此条已收录,就从库中删除,同时蜘蛛再次访问url也不会抓取此链接。在百度蜘蛛抓取的过程中,如果你实时监测蜘蛛的时间就会发现一点,有的站内蜘蛛爬取很频繁,有的站内很久才有蜘蛛访问,造成这种结果有两个原因,一个是百度服务器任务处理采取分布式处理,所以蜘蛛抓取通道有阻塞,因此有时间上的差异,排除通道阻塞,站内内容多少和外链引入蜘蛛也是一个影响蜘蛛爬取的一个关键因素。
spider在抓取页面过程需判断页面是否抓取,没有抓取就会被放到抓取序列中处理,已抓取就会对比库中是否有同样并归一处理。
在公认的spider指标中,有四大指标:
1、网站更新频率,更新快多来,更新慢少来,这也是为什么很多站一天更新上万篇的原因,一定程度上可以直接提高收录几率。
2、网站内容质量高低。优质内容爬取频繁,低不爬或少爬。什么是优质内容?之前一篇文章有提到过。
3、服务器稳定、不卡顿和打开流畅。
4、站点评级。(已实锤不是权重,而是更高级的站点评级)评级是动态参数,是配合其他因子进行算法计算到阈值变化的变量。评级会影响网站的收录和排序。
很赞哦! ()
相关文章
随机图文
-
同一篇文章,为什么关键词排名有高有低?
在做SEO的过程中,我们总是会遇到SEO十万个为什么,而对于一些SEO新手而言,我们总是会有这样的思考:同一篇文章,在不同的网站发布,在搜索结果中排名确不同。很多SEO从业者,刚开始并不能理解这个原因,甚至总是在“抱怨”我明明是原创,怎么排 -
关键词优化三个词19000,这个可信吗?
在很多相关SEO机构的网站,我们经常会看到这句话:关键词优化三个词19000,而且对于关键词的属性,没有任何限制,通常对方还会承诺在多长时间周期内,完成你的目标。 并且利用各种相关案例,用于证明其操作的可行性,很多没有相关经验的企业负责人, -
企业网站建设友链与排名,之间到底什么关系?
在做企业网站建设SEO的过程中,我们很少谈及友链相关的问题,大量的SEO机构,通常都会给SEO从业者灌输一个概念,那就是建议大家不停的进行友情链接交换,但有的时候,我们认为这是一种双刃剑,甚至可能引起连锁反应,俗话说的好,盈满则亏。那么,网站 -
网页长时间没收录,是否应该被删除?
在SEO日常工作中,我们每天都会审查网站的收录情况,有的时候你会发现,某些页面在一个特别长周期内,都没有得到有效的收录。这个时候,就有SEO人员提出:我们是否可以删除这些,长期不收录的页面。那么,网页长时间没收录,是否应该被删除?根据百度不收