1Next >
zhj1681755 | 发表于:13-04-17 00:04 [添加收藏] 楼主 [回复] #Top# |
---|---|
人气:1
积分:6
金币:72
|
今天跟大家分享一下有关搜索引擎蜘蛛的相关内容。我们都知道互联网上的页面都是又蜘蛛抓取的,其实蜘蛛是一段代码程序,当互联网出现新页面产生时蜘蛛就会过来爬。由于互联网每天将产生几千亿页面,那么一个蜘蛛是绝对无法在短时间内爬完,所以搜索引擎会产生大量的蜘蛛尽可能的爬完整个互联网。每个蜘蛛代表的意义又不同,那么我们怎么知道哪些蜘蛛是抓取首页,哪些是抓取内页呢?
本文仅供参考让大家对IIS日记各引擎的蜘蛛IP有个更深的了解,根据不同的IP我们可以分析网站是个怎样的状态.下面就按照IIS日记上的百度蜘蛛IP为例: 123.125.68.* 这个蜘蛛经常来,别的来的少,表示网站可能要进入沙盒了,或被者降权。 220.181.68.* 每天这个IP 段只增不减很有可能进沙盒或K站。 220.181.7.*、123.125.66.* 代表百度蜘蛛IP造访,准备抓取你东西。 121.14.89.* 这个ip段作为度过新站考察期。 203.208.60.* 这个ip段出现在新站及站点有不正常现象后。 210.72.225.* 这个ip段不间断巡逻各站。 125.90.88.* 广东茂名市电信也属于百度蜘蛛IP 主要造成成分,是新上线站较多,还有使用过站长工具,或SEO综合检测造成的。 220.181.108.95 这个是百度抓取首页的专用IP,如是220.181.108段的话,基本来说你的网站会天天隔夜快照,绝对错不了的,我保证。 220.181.108.92 同上98%抓取首页, 可能还会抓取其他 (不是指内页)220.181段属于权重IP段此段爬过的文章或首页基本24小时放出来。 123.125.71.106 抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。 220.181.108.91 属于综合的,主要抓取首页和内页或其他,属于权重IP 段,爬过的文章或首页基本24小时放出来。 220.181.108.75 重点抓取更新文章的内页达到90%,8%抓取首页,2%其他。权重IP 段,爬过的文章或首页基本24小时放出来。 220.181.108.86 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 123.125.71.95 抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。 123.125.71.97 抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。 220.181.108.89 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 220.181.108.94 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 220.181.108.97 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 220.181.108.80 专用抓取首页IP 权重段,一般返回代码是304 0 0 代表未更新。 220.181.108.77 专用抓首页IP 权重段,一般返回代码是304 0 0 代表未更新。 123.125.71.117 抓取内页收录的,权重较低,爬过此段的内页文章不会很快放出来,因不是原创或采集文章。 僵尸电影吧 www.jsdy8.com 供稿
Ta最近还发表过
[分享]
百度不同IP段蜘蛛代表的意思
(13-04-17)
随机阅读
[分享]
分享优化地方门户帮助中心精确只搜索帮助中心的文章
(16-11-15)
[分享]
地方门户实现【QQ群推送】方法(修改自PW)
(12-02-17)
[疑问]
PHP版企业站的上一页下一页代码很不好用啊
(12-01-09)
[疑问]
有没有谁用企业版(PHP) 6.0.813 做过完整的网站啊
(11-08-29)
[使用]
为什么我的网站上传到服务器了就没修改
(11-08-05)
|
1Next >