眾所周知,隨著計(jì)算機(jī)、互聯(lián)網(wǎng)、物聯(lián)網(wǎng)、云計(jì)算等網(wǎng)絡(luò)技術(shù)的風(fēng)起云涌,網(wǎng)絡(luò)上的信息呈爆炸式增長(zhǎng)。毋庸置疑,互聯(lián)網(wǎng)上的信息幾乎囊括了社會(huì)、文化、政治、經(jīng)濟(jì)、娛樂(lè)等所有話題。使用傳統(tǒng)數(shù)據(jù)收集機(jī)制(如問(wèn)卷調(diào)查法、訪談法)進(jìn)行捕獲和采集數(shù)據(jù),往往會(huì)受經(jīng)費(fèi)和地域范圍所限,而且還會(huì)因其樣本容量小、信度低等因素導(dǎo)致收集的數(shù)據(jù)往往與客觀事實(shí)有所偏頗,有著較大的局限性。
網(wǎng)絡(luò)爬蟲通過(guò)統(tǒng)一資源定位符URL (Uniform ResourceLocator)來(lái)查找目標(biāo)網(wǎng)頁(yè),將用戶所關(guān)注的數(shù)據(jù)內(nèi)容直接返回給用戶,并不需要用戶以瀏覽網(wǎng)頁(yè)的形式去獲取信息,為用戶節(jié)省了時(shí)間和精力,并提高了數(shù)據(jù)采集的準(zhǔn)確度,使用戶在海量數(shù)據(jù)中游刃有余。網(wǎng)絡(luò)爬蟲的最終目的就是從網(wǎng)頁(yè)中獲取自己所需的信息。雖然利用urllib、urllib2、re等一些爬蟲基本庫(kù)可以開發(fā)一個(gè)爬蟲程序,獲取到所需的內(nèi)容,但是所有的爬蟲程序都以這種方式進(jìn)行編寫,工作量未免太大了些,所有才有了爬蟲框架。使用爬蟲框架可以大大提高效率,縮短開發(fā)時(shí)間。
網(wǎng)絡(luò)爬蟲(web crawler)又稱為網(wǎng)絡(luò)蜘蛛(web spider)或網(wǎng)絡(luò)機(jī)器人(web robot),另外一些不常使用的名字還有螞蟻、自動(dòng)索引、模擬程序或蠕蟲,同時(shí)它也是“物聯(lián)網(wǎng)”概念的核心之一。網(wǎng)絡(luò)爬蟲本質(zhì)上是一段計(jì)算機(jī)程序或腳本,其按照一定的邏輯和算法規(guī)則自動(dòng)地抓取和下載萬(wàn)維網(wǎng)的網(wǎng)頁(yè),是搜索引擎的一個(gè)重要組成部分。
網(wǎng)絡(luò)爬蟲一般是根據(jù)預(yù)先設(shè)定的一個(gè)或若干個(gè)初始網(wǎng)頁(yè)的URL開始,然后按照一定的規(guī)則爬取網(wǎng)頁(yè),獲取初始網(wǎng)頁(yè)上的URL列表,之后每當(dāng)抓取一個(gè)網(wǎng)頁(yè)時(shí),爬蟲會(huì)提取該網(wǎng)頁(yè)新的URL并放入到未爬取的隊(duì)列中去,然后循環(huán)的從未爬取的隊(duì)列中取出一個(gè)URL再次進(jìn)行新一輪的爬取,不斷的重復(fù)上述過(guò)程,直到隊(duì)列中的URL抓取完畢或者達(dá)到其他的既定條件,爬蟲才會(huì)結(jié)束。具體流程如下圖所示。
隨著互聯(lián)網(wǎng)信息的與日俱增,利用網(wǎng)絡(luò)爬蟲工具來(lái)獲取所需信息必有用武之地。使用網(wǎng)絡(luò)爬蟲來(lái)采集信息,不僅可以實(shí)現(xiàn)對(duì)web上信息的高效、準(zhǔn)確、自動(dòng)的獲取,還利于公司或者研究人員等對(duì)采集到的數(shù)據(jù)進(jìn)行后續(xù)的挖掘分析。
-
網(wǎng)絡(luò)爬蟲
+關(guān)注
關(guān)注
1文章
52瀏覽量
9158 -
python
+關(guān)注
關(guān)注
57文章
4876瀏覽量
90039 -
智能計(jì)算
+關(guān)注
關(guān)注
0文章
199瀏覽量
17076
發(fā)布評(píng)論請(qǐng)先 登錄
E5071C矢量網(wǎng)絡(luò)分析儀的工作原理
京東關(guān)鍵詞搜索商品列表的Python爬蟲實(shí)戰(zhàn)
騰柱無(wú)橋PFC電路的工作原理和拓?fù)浣Y(jié)構(gòu)
# 深度解析:爬蟲技術(shù)獲取淘寶商品詳情并封裝為API的全流程應(yīng)用
什么是SD-WAN?它的優(yōu)勢(shì)有哪些?如何搭建SD-WAN?
Nginx限流與防爬蟲配置方案
解析基帶和射頻的工作原理
正弦波逆變器的工作原理與控制方式
波長(zhǎng)的基本概念及其在光網(wǎng)絡(luò)中的重要性
GPS網(wǎng)絡(luò)同步時(shí)鐘工作原理及應(yīng)用
GPIO配置的工作原理是什么?
光學(xué)傳感器的工作原理與應(yīng)用
ADC的五大架構(gòu)及其工作原理
網(wǎng)絡(luò)爬蟲的概念及其工作原理說(shuō)明
評(píng)論