python爬蟲案例(Scrapy版)

以爬取各城市每天的空氣質(zhì)量數(shù)據(jù)為例
  • 安裝好scrapy后(可用conda安裝)在cmd中輸入以下代碼完成爬蟲準(zhǔn)備工作
cd Desktop
:: 創(chuàng)建projiect
scrapy startproject wheather
cd wheather
:: 需要爬取的網(wǎng)址轴踱,以真氣網(wǎng)為例
scrapy genspider Wheather www.aqistudy.cn
:: 查看需要爬取的具體網(wǎng)址
scrapy shell https://www.aqistudy.cn/historydata/
view(response)
  1. 編輯wheather文件夾中的items.py文件梨水,確定爬取的變量
  • 修改(或新增)WheatherItem的內(nèi)容,該案例只爬取3個(gè)變量楼入,結(jié)果如下
class WheatherItem(scrapy.Item):
    city = scrapy.Field(serializer=lambda x: x[8:])  # 城市
    date = scrapy.Field()  # 日期
    quality = scrapy.Field()  # 空氣質(zhì)量
    # location = scrapy.Field()  # 地點(diǎn)
  1. 編輯Pipelines.py文件,增加輸出格式(可忽略該部分)
  • 該案例添加json輸出格式
# 輸出json.............................................
import json
class WheatherPipeline(object):
    def __init__(self):
        self.f = open('spdr.json', 'w+', encoding='utf-8')
    def process_item(self, item, spider):
        content = json.dumps(dict(item), ensure_ascii=False) + '\n'
        self.f.write(content)
        return item
    def close_spider(self, spider):
        self.f.close()
  1. 編輯settings.py文件
#..............................................
# 改為False
ROBOTSTXT_OBEY = False
# 加代理
USER_AGENT ='Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_1) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/68.0.3440.106 Safari/537.36' 
# log級(jí)別設(shè)為warning
LOG_LEVEL='WARNING' 
# 導(dǎo)出json
ITEM_PIPELINES = {
   'wheather.pipelines.WheatherPipeline': 300,
}
# 涉及到動(dòng)態(tài)加載优炬,該案例用scrapy-selenium包來嫁接scrapy和selenium怨喘。
# 網(wǎng)上有不少教程自己寫中間件來引入selenium,可以但是沒有必要I轿小5探帷!
DOWNLOADER_MIDDLEWARES  = {
     'scrapy_selenium.SeleniumMiddleware':800
}
SELENIUM_DRIVER_NAME= 'chrome'  # 用chromedriver
SELENIUM_DRIVER_EXECUTABLE_PATH = r"C:/Anaconda3/chromedriver.exe"
SELENIUM_DRIVER_ARGUMENTS = ['--headless',]  # '--start-maximized'
# 原包不提供無圖模式鸭丛,該案例對(duì)包的代碼進(jìn)行了修改
# 若不需要無圖模式竞穷,可忽略余下部分
SELENIUM_DRIVER_EXP_ARGUMENTS=[{"profile.managed_default_content_settings.images": 2}] 
# 修改部分如下
'''
browser_executable_path,driver_exp_arguments):  #.........wdy
or exp_argument in driver_exp_arguments: #..................... wdy
     driver_options.add_experimental_option("prefs", exp_argument) # ...wdy
driver_exp_arguments = crawler.settings.get('SELENIUM_DRIVER_EXP_ARGUMENTS')  #...............wdy
driver_exp_arguments=driver_exp_arguments #............wdy
'''
  1. 編輯爬蟲文件Wheather.py
# -*- coding: utf-8 -*-
# 爬取中國各個(gè)城市的歷史天氣數(shù)據(jù)
import scrapy
import re
from scrapy.linkextractors import LinkExtractor
from ..items import WheatherItem
from scrapy_selenium import SeleniumRequest
from selenium.webdriver.common.by import By
from selenium.webdriver.support import expected_conditions as EC

class WheatherSpider(scrapy.Spider):
    '''
    start_requests,用selenium代替request
    parse鳞溉,獲取城市鏈接
    parse_month瘾带,獲取各城市的各日期鏈接
    parse_final,爬
    '''
    name = 'Wheather'
    allowed_domains = ['www.aqistudy.cn']

    def start_requests(self): # 注意名字不要隨意改J旆啤?凑F涌摇!T黍肌于颖!
        start_urls = 'https://www.aqistudy.cn/historydata/'
        yield SeleniumRequest(url=start_urls, callback=self.parse)
    
    def parse(self, response):
        i=0
        citylink = LinkExtractor(restrict_xpaths='/html/body/div[3]/div/div[1]/div[2]/div[2]')
        citylinks = citylink.extract_links(response)  # 各個(gè)城市的天氣數(shù)據(jù)鏈接   
        for cityurl in citylinks: 
            i+=1
            yield scrapy.Request(url=cityurl.url,meta={'i':i}, callback=self.parse_month)
    
    def parse_month(self, response):
        print(response.meta['i'])  # meta傳遞數(shù)值(對(duì)整體沒有影響,作者自己看的)
        monthlink = LinkExtractor(restrict_xpaths='/html/body/div[3]/div[1]/div[2]/div[2]/div[2]')
        monthlinks = monthlink.extract_links(response)  # 每個(gè)城市各個(gè)月的天氣數(shù)據(jù)鏈接
        for monthurl in monthlinks:
            if int(str(monthurl.url)[-6:]) == 201712:  # 簡單起見嚷兔,只選取了2017年12月的數(shù)據(jù)
                yield SeleniumRequest(url=monthurl.url,wait_time=4,wait_until=EC.presence_of_element_located((By.XPATH, '/html/body/div[3]/div[1]/div[1]/table/tbody/tr[29]/td[2]')),callback=self.parse_final)
    
    def parse_final(self,response):
        long = len(response.selector.xpath('/html/body/div[3]/div[1]/div[1]/table/tbody/tr'))  # 計(jì)算每頁一共這么多條
        dit = WheatherItem()
        # response.request.meta['driver'].current_url)[0]
        for line in range(2, long+1):
            dit['city'] = re.findall('(.+?)空氣質(zhì)量',response.selector.xpath('//*[@id="title"]/text()').extract_first())[0]
            dit['date'] = response.selector.xpath('/html/body/div[3]/div[1]/div[1]/table/tbody/tr[%s]/td[1]/text()' % str(line)).extract_first()
            dit['quality'] = response.selector.xpath('/html/body/div[3]/div[1]/div[1]/table/tbody/tr[%s]/td[3]/span/text()' % str(line)).extract_first()
            yield dit
# scrapy crawl somespider -s JOBDIR=crawls/somespider-1 (作者自己看的)
  1. 運(yùn)行和輸出
  • 在cmd中輸入以下代碼可運(yùn)行代碼和輸出csv格式的文件
cd wheather
scrapy crawl Wheather -o books.csv
最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請(qǐng)聯(lián)系作者
  • 序言:七十年代末森渐,一起剝皮案震驚了整個(gè)濱河市,隨后出現(xiàn)的幾起案子谴垫,更是在濱河造成了極大的恐慌章母,老刑警劉巖,帶你破解...
    沈念sama閱讀 211,290評(píng)論 6 491
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件翩剪,死亡現(xiàn)場離奇詭異,居然都是意外死亡彩郊,警方通過查閱死者的電腦和手機(jī)前弯,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 90,107評(píng)論 2 385
  • 文/潘曉璐 我一進(jìn)店門,熙熙樓的掌柜王于貴愁眉苦臉地迎上來秫逝,“玉大人恕出,你說我怎么就攤上這事∥シ” “怎么了浙巫?”我有些...
    開封第一講書人閱讀 156,872評(píng)論 0 347
  • 文/不壞的土叔 我叫張陵,是天一觀的道長刷后。 經(jīng)常有香客問我的畴,道長,這世上最難降的妖魔是什么尝胆? 我笑而不...
    開封第一講書人閱讀 56,415評(píng)論 1 283
  • 正文 為了忘掉前任丧裁,我火速辦了婚禮,結(jié)果婚禮上含衔,老公的妹妹穿的比我還像新娘煎娇。我一直安慰自己,他們只是感情好贪染,可當(dāng)我...
    茶點(diǎn)故事閱讀 65,453評(píng)論 6 385
  • 文/花漫 我一把揭開白布缓呛。 她就那樣靜靜地躺著,像睡著了一般杭隙。 火紅的嫁衣襯著肌膚如雪哟绊。 梳的紋絲不亂的頭發(fā)上,一...
    開封第一講書人閱讀 49,784評(píng)論 1 290
  • 那天寺渗,我揣著相機(jī)與錄音匿情,去河邊找鬼兰迫。 笑死,一個(gè)胖子當(dāng)著我的面吹牛炬称,可吹牛的內(nèi)容都是我干的汁果。 我是一名探鬼主播,決...
    沈念sama閱讀 38,927評(píng)論 3 406
  • 文/蒼蘭香墨 我猛地睜開眼玲躯,長吁一口氣:“原來是場噩夢啊……” “哼据德!你這毒婦竟也來了?” 一聲冷哼從身側(cè)響起跷车,我...
    開封第一講書人閱讀 37,691評(píng)論 0 266
  • 序言:老撾萬榮一對(duì)情侶失蹤棘利,失蹤者是張志新(化名)和其女友劉穎,沒想到半個(gè)月后朽缴,有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體善玫,經(jīng)...
    沈念sama閱讀 44,137評(píng)論 1 303
  • 正文 獨(dú)居荒郊野嶺守林人離奇死亡,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點(diǎn)故事閱讀 36,472評(píng)論 2 326
  • 正文 我和宋清朗相戀三年密强,在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了茅郎。 大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片。...
    茶點(diǎn)故事閱讀 38,622評(píng)論 1 340
  • 序言:一個(gè)原本活蹦亂跳的男人離奇死亡或渤,死狀恐怖系冗,靈堂內(nèi)的尸體忽然破棺而出,到底是詐尸還是另有隱情薪鹦,我是刑警寧澤掌敬,帶...
    沈念sama閱讀 34,289評(píng)論 4 329
  • 正文 年R本政府宣布,位于F島的核電站池磁,受9級(jí)特大地震影響奔害,放射性物質(zhì)發(fā)生泄漏。R本人自食惡果不足惜框仔,卻給世界環(huán)境...
    茶點(diǎn)故事閱讀 39,887評(píng)論 3 312
  • 文/蒙蒙 一舀武、第九天 我趴在偏房一處隱蔽的房頂上張望。 院中可真熱鬧离斩,春花似錦银舱、人聲如沸。這莊子的主人今日做“春日...
    開封第一講書人閱讀 30,741評(píng)論 0 21
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽。三九已至核偿,卻和暖如春诚欠,著一層夾襖步出監(jiān)牢的瞬間,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 31,977評(píng)論 1 265
  • 我被黑心中介騙來泰國打工轰绵, 沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留粉寞,地道東北人。 一個(gè)月前我還...
    沈念sama閱讀 46,316評(píng)論 2 360
  • 正文 我出身青樓左腔,卻偏偏與公主長得像唧垦,于是被迫代替她去往敵國和親。 傳聞我的和親對(duì)象是個(gè)殘疾皇子液样,可洞房花燭夜當(dāng)晚...
    茶點(diǎn)故事閱讀 43,490評(píng)論 2 348