1Next >
zhj1681755 | 发表于:13-04-17 00:04 [添加收藏] 楼主 [回复] #Top# |
---|---|
![]() ![]() |
今天跟大家分享一下有关搜索引擎蜘蛛的相关内容。我们都知道互联网上的页面都是又蜘蛛抓取的,其实蜘蛛是一段代码程序,当互联网出现新页面产生时蜘蛛就会过来爬。由于互联网每天将产生几千亿页面,那么一个蜘蛛是绝对无法在短时间内爬完,所以搜索引擎会产生大量的蜘蛛尽可能的爬完整个互联网。每个蜘蛛代表的意义又不同,那么我们怎么知道哪些蜘蛛是抓取首页,哪些是抓取内页呢?
本文仅供参考让大家对IIS日记各引擎的蜘蛛IP有个更深的了解,根据不同的IP我们可以分析网站是个怎样的状态.下面就按照IIS日记上的百度蜘蛛IP为例: 123.125.68.* 这个蜘蛛经常来,别的来的少,表示网站可能要进入沙盒了,或被者降权。 220.181.68.* 每天这个IP 段只增不减很有可能进沙盒或K站。 220.181.7.*、123.125.66.* 代表百度蜘蛛IP造访,准备抓取你东西。 121.14.89.* 这个ip段作为度过新站考察期。 203.208.60.* 这个ip段出现在新站及站点有不正常现象后。 210.72.225.* 这个ip段不间断巡逻各站。 125.90.88.* 广东茂名市电信也属于百度蜘蛛IP 主要造成成分,是新上线站较多,还有使用过站长工具,或SEO综合检测造成的。 220.181.108.95 这个是百度抓取首页的专用IP,如是220.181.108段的话,基本来说你的网站会天天隔夜快照,绝对错不了的,我保证。 220.181.108.92 同上98%抓取首页, 可能还会抓取其他 (不是指内页)220.181段属于权重IP段此段爬过的文章或首页基本24小时放出来。 123.125.71.106 抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。 220.181.108.91 属于综合的,主要抓取首页和内页或其他,属于权重IP 段,爬过的文章或首页基本24小时放出来。 220.181.108.75 重点抓取更新文章的内页达到90%,8%抓取首页,2%其他。权重IP 段,爬过的文章或首页基本24小时放出来。 220.181.108.86 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 123.125.71.95 抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。 123.125.71.97 抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。 220.181.108.89 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 220.181.108.94 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 220.181.108.97 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 220.181.108.80 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 220.181.108.77 专用抓首页IP 权重段,一般返回代码是304 0 0 代表未更新。 123.125.71.117 抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。 僵尸电影吧 www.jsdy8.com 供稿
Ta最近还发表过
[分享]
百度不同IP段蜘蛛代表的意思
(13-04-17)
随机阅读
[分享]
[德阳123]地方门户版实现论坛帖子定位教程
(17-04-24)
[错误]
KC BLUE 蓝色模板下 分类信息里面 都点不进去了
(14-09-05)
[模板]
模板放上来了,小的BUG大家自己来修正吧。
(14-05-05)
[建议]
企业版IIS伪静态如何怎么写?
(13-04-12)
[使用]
不错!简单
(11-04-14)
|
1Next >