python爬虫从入门到放弃(一)之初识爬虫
生活随笔
收集整理的這篇文章主要介紹了
python爬虫从入门到放弃(一)之初识爬虫
小編覺得挺不錯的,現在分享給大家,幫大家做個參考.
?
什么是爬蟲?
網絡爬蟲(又被稱為網頁蜘蛛,網絡機器人,在FOAF社區中間,更經常的稱為網頁追逐者),是一種按照一定的規則,自動地抓取萬維網信息的程序或者腳本。另外一些不常使用的名字還有螞蟻、自動索引、模擬程序或者蠕蟲。
其實通俗的講就是通過程序去獲取web頁面上自己想要的數據,也就是自動抓取數據
爬蟲可以做什么?
你可以爬去妹子的圖片,爬取自己想看看的視頻。。等等你想要爬取的數據,只要你能通過瀏覽器訪問的數據都可以通過爬蟲獲取
爬蟲的本質是什么?
模擬瀏覽器打開網頁,獲取網頁中我們想要的那部分數據
瀏覽器打開網頁的過程:
當你在瀏覽器中輸入地址后,經過DNS服務器找到服務器主機,向服務器發送一個請求,服務器經過解析后發送給用戶瀏覽器結果,包括html,js,css等文件內容,瀏覽器解析出來最后呈現給用戶在瀏覽器上看到的結果
所以用戶看到的瀏覽器的結果就是由HTML代碼構成的,我們爬蟲就是為了獲取這些內容,通過分析和過濾html代碼,從中獲取我們想要資源(文本,圖片,視頻.....)
所有的努力都值得期許,每一份夢想都應該灌溉!
原文地址:?http://www.cnblogs.com/zhaof/p/6897393.html
總結
以上是生活随笔為你收集整理的python爬虫从入门到放弃(一)之初识爬虫的全部內容,希望文章能夠幫你解決所遇到的問題。
- 上一篇: python︱HTML网页解析Beaut
- 下一篇: python爬虫从入门到放弃(二)之爬虫