當前位置：首頁 > 编程资源 > 编程问答 >内容正文

编程问答

爬虫分类——通用网络爬虫、聚焦网络爬虫、增量式网络爬虫、深层网络爬虫

發布時間：2025/4/16 编程问答 26 豆豆

生活随笔收集整理的這篇文章主要介紹了爬虫分类——通用网络爬虫、聚焦网络爬虫、增量式网络爬虫、深层网络爬虫小編覺得挺不錯的,現在分享給大家,幫大家做個參考.

網絡爬蟲按照系統結構和實現技術，大致可以分為以下幾種類型：通用網絡爬蟲、聚焦網絡爬蟲、增量式網絡爬蟲、深層網絡爬蟲。實際的網絡爬蟲系統通常是幾種爬蟲技術相結合實現的

通用網絡爬蟲又稱全網爬蟲（Scalable Web Crawler），爬行對象從一些種子 URL 擴充到整個 Web，主要為門戶站點搜索引擎和大型 Web 服務提供商采集數據。

這類網絡爬蟲的爬行范圍和數量巨大，對于爬行速度和存儲空間要求較高，對于爬行頁面的順序要求相對較低，同時由于待刷新的頁面太多，通常采用并行工作方式，但需要較長時間才能刷新一次頁面。

簡單的說就是互聯網上抓取所有數據。

聚焦網絡爬蟲（Focused Crawler），又稱主題網絡爬蟲（Topical Crawler），是指選擇性地爬行那些與預先定義好的主題相關頁面的網絡爬蟲。

和通用網絡爬蟲相比，聚焦爬蟲只需要爬行與主題相關的頁面，極大地節省了硬件和網絡資源，保存的頁面也由于數量少而更新快，還可以很好地滿足一些特定人群對特定領域信息的需求。

簡單的說就是互聯網上只抓取某一種數據。

增量式網絡爬蟲（Incremental Web Crawler）是指 對已下載網頁采取增量式更新和只爬行新產生的或者已經發生變化網頁的爬蟲，它能夠在一定程度上保證所爬行的頁面是盡可能新的頁面。

和周期性爬行和刷新頁面的網絡爬蟲相比，增量式爬蟲只會在需要的時候爬行新產生或發生更新的頁面，并不重新下載沒有發生變化的頁面，可有效減少數據下載量，及時更新已爬行的網頁，減小時間和空間上的耗費，但是增加了爬行算法的復雜度和實現難度。

簡單的說就是互聯網上只抓取剛剛更新的數據。

Web 頁面按存在方式可以分為表層網頁（Surface Web）和深層網頁（Deep Web，也稱 Invisible Web Pages 或 Hidden Web）。

表層網頁是指傳統搜索引擎可以索引的頁面，以超鏈接可以到達的靜態網頁為主構成的 Web 頁面。

Deep Web 是那些大部分內容不能通過靜態鏈接獲取的、隱藏在搜索表單后的，只有用戶提交一些關鍵詞才能獲得的 Web 頁面。

如果覺得生活随笔網站內容還不錯，歡迎將生活随笔推薦給好友。