|
|
◎ 0516-83753688 QQ: |
|
◎ 0516-83752225 QQ:
|
|
◎ 18952189388 QQ:
|
|
|
|
 |
您现在的位置: 徐州金网 广西快乐十分开奖号码 www.b8ll.cn 首页 → 最新动态 |
 |
公司动态 |
COMPANY NEWS |
百度蜘蛛抓取原理
发布时间:2014年4月22日 此新闻已被浏览 3284 次 来源:徐州金网 |
|
广西快乐十分开奖号码 www.b8ll.cn 网络蜘蛛即Web Spider,是一个比喻得很形象的名字。把互联网比喻成一个蜘蛛网,那么Spider就是在网上爬来爬去的蜘蛛。网络蜘蛛是通过网页的链接地址来寻找网页,从网站某一个页面(通常是首页)开始,读取网页的内容,找到在网页中的其它链接地址,然后通过这些链接地址寻找下一个网页,这样一直循环下去,直到把这个网站所有的网页都抓取完为止。如果把整个互联网当成一个网站,那么网络蜘蛛就可以用这个原理把互联网上所有的网页都抓取下来。 在抓取网页的时候,网络蜘蛛一般有两种策略:广度优先和深度优先 广度优先是指网络蜘蛛会先抓取起始网页中链接的所有网页,然后再选择其中的一个链接网页,继续抓取在此网页中链接的所有网页。这是最常用的方式,因为这个方法可以让网络蜘蛛并行处理,提高其抓取速度。 深度优先是指网络蜘蛛会从起始页开始,一个链接一个链接跟踪下去,处理完这条线路之后再转入下一个起始页,继续跟踪链接。这个方法有个优点是网络蜘蛛在设计的时候比较容易。
|
|
|