Python爬蟲(chóng)毁腿,一般用于抓取特定的內(nèi)容辑奈,最近想學(xué)學(xué)苛茂,通過(guò)網(wǎng)絡(luò)抓取自己想要的內(nèi)容,于是乎學(xué)習(xí)了一下Python身害,用一個(gè)小案例來(lái)紀(jì)念一下學(xué)習(xí)的成果味悄。
案例程序主要功能:抓取我們學(xué)校校園網(wǎng)新聞中的圖片
#coding=utf-8
import urllib
import re
# 定義個(gè)函數(shù) 抓取網(wǎng)頁(yè)內(nèi)容
def getHtml(url):
webPage = urllib.urlopen(url)
html = webPage.read()
return html
# 定義一個(gè)函數(shù) 抓取網(wǎng)頁(yè)中的圖片
def getNewsImgs(html):
# 正則表達(dá)式
reg = r'src="(.+?\.jpg)"'
img = re.compile(reg)
# 獲取網(wǎng)頁(yè)中所有符合條件的圖片url
imglist = re.findall(img,html)
x = 0
# 根據(jù)圖片地址下載圖片并重命名
for imgUrl in imglist:
urllib.urlretrieve("http://www.abc.edu.cn/news/"+imgUrl,'news-%s.jpg' % x)
x += 1
# 獲取網(wǎng)頁(yè)
html = getHtml("http://www.abc.edu.cn/news/show.aspx?id=21413&cid=5")
# 抓取圖片
print getNewsImgs(html)
效果:成功抓取了新聞中的兩張圖片O(∩_∩)O~
爬蟲(chóng)抓圖片.gif