2020-04-18 淘寶商品價(jià)格定向爬蟲

功能描述

  • 目標(biāo):獲取淘寶搜索頁面的信息,提取其中的關(guān)鍵信息章办。
  • 理解:
    淘寶的搜索接口
    翻頁的處理
  • 技術(shù)路線:
    requests-re
    (使用正則表達(dá)式來提取信息)
import requests
import re

def getHTMLText(url):
    kv = {'cookie' : 'miid=413241011674319298; cna=bzhfE71XryECATo6NDSjkj6C; hng=CN%7Czh-CN%7CCNY%7C156; thw=cn; tracknick=%5Cu9759%5Cu5019%5Cu7075%5Cu5F52520370; tg=0; enc=yJqBSdMue2TKATKCxQ5nNmbUHL82jBeGpw%2BhqDIRlcL%2FVHFFQQ9sFshL4l8YJoS%2F5g%2F%2BV2gV3NoT9YYn30kbnQ%3D%3D; _m_h5_tk=b1f75d048d6aeed57d814f7a50d66641_1586700106396; _m_h5_tk_enc=0bdf063ab77a2936ccb2e059d6db64c0; t=8e80b386bca784fb223e0f83f73cebda; v=0; cookie2=1847beaf312bd87963ff8272d0b8d0b7; _tb_token_=5e7353571ad1e; alitrackid=www.taobao.com; _samesite_flag_=true; sgcookie=EKJ4L5czU7sbync8UgcsK; unb=2355217709; uc3=lg2=U%2BGCWk%2F75gdr5Q%3D%3D&id2=UUtO%2FVqSVpj5eg%3D%3D&nk2=3Wy5AkoyvJZ%2BX5%2FSa5Y%3D&vt3=F8dBxdGLZSg9H8AFy1U%3D; csg=5b481f1c; lgc=%5Cu9759%5Cu5019%5Cu7075%5Cu5F52520370; cookie17=UUtO%2FVqSVpj5eg%3D%3D; dnk=%5Cu9759%5Cu5019%5Cu7075%5Cu5F52520370; skt=f9711d0519a0fdcd; existShop=MTU4NzE3NzM4OA%3D%3D; uc4=id4=0%40U2l0uKuhTOtMhU1bieJbpIsIPhXN&nk4=0%403%2BcBjITjn0CCuBQVdwk4JLVExOAMNgh%2FfA%3D%3D; _cc_=U%2BGCWk%2F7og%3D%3D; _l_g_=Ug%3D%3D; sg=092; _nk_=%5Cu9759%5Cu5019%5Cu7075%5Cu5F52520370; cookie1=V33DIdASji0W00xDbJVy0fvJaNbu6aAZ2v0LJi537Ss%3D; JSESSIONID=531AFDD871D866503438DC04A71EB67E; lastalitrackid=login.taobao.com; tfstk=cQ_CByvhtvDCt6bE7TNwYOO1swKPawr66k9NOGQhIF1rwAfeBsjmuKvLcgDsWnd1.; uc1=cookie16=VFC%2FuZ9az08KUQ56dCrZDlbNdA%3D%3D&cookie21=URm48syIYB3rzvI4Dim4&cookie15=VT5L2FSpMGV7TQ%3D%3D&existShop=false&pas=0&cookie14=UoTUPc3rdfGOww%3D%3D; mt=ci=45_1; isg=BA8PUHFyjZyKVomRPVnYAHqfnqMZNGNWFeQ1eyEcQn6L8C7yKASepoeq8iDO7DvO; l=eBPjk4lnQH8FVhdQBO5wlJ4FzbbTCIRb8uPr-CjsIIHca1oCtebG9NQcQeZDSdtjgtCXyeKPFFZ7gRB4r34dTxDDBexrCyConxvO.',
          'user-agent' : 'Mozilla/5.0'}

    try:
        r = requests.get(url, headers = kv, timeout=30)
        r.raise_for_status()
        r.encoding = r.apparent_encoding
        return r.text
    except:
        return ""


#關(guān)鍵代碼區(qū):用正則表達(dá)式實(shí)現(xiàn)所需信息的提取
def parsePage(ilt, html):
    try:
    #這些正則表達(dá)式都沒有加轉(zhuǎn)義字符‘\’
        plt = re.findall(r'"view_price":"[\d.]*"', html) #找到所有的價(jià)格信息
        tlt = re.findall(r'"raw_title":".*?"', html)
        flt = re.findall(r'"view_fee":"[\d.]*"', html)
        slt = re.findall(r'"view_sales":".*?"', html)
    #這一步完成趴久,提取出來的信息都是鍵值對形式廷臼?蝗柔??(如:"view_price":"127.00")情龄,所以要做進(jìn)一步的處理迄汛,只取出值
        for i in range(len(plt)):
    #  eval()函數(shù)
            price = eval(plt[i].split(':')[1])
            title = eval(tlt[i].split(':')[1])
            fee = eval(flt[i].split(':')[1])
            sales = eval(slt[i].split(':')[1])
   
    #將列表元素([price, fee, sales, title]),存入ilt列表中
            ilt.append([price, fee, sales, title])
    except:
        print("")


#打印爬取到的信息骤视,完成輸出格式的定義
def printGoodsList(ilt):
    tplt = "{:4}\t{:8}\t{:8}\t{:10}\t{:16}"
    print(tplt.format("序號(hào)", "價(jià)格", "郵費(fèi)", "已購人數(shù)", "商品名稱"))
    count = 0
    for g in ilt:
        count = count + 1
        print(tplt.format(count, g[0], g[1], g[2], g[3]))


def main():
    goods = '子時(shí)當(dāng)歸同款茶壺'   #淘寶檢索關(guān)鍵字
    depth = 2  #需求頁數(shù)
    start_url = 'https://s.taobao.com/search?q=' + goods
    infoList = []  #定義一個(gè)列表鞍爱,保存爬取回來的數(shù)據(jù)
    for i in range(depth):
        try:
            url = start_url + '&s=' + str(44 * i)
            html = getHTMLText(url)
            parsePage(infoList, html)
        except:
            continue
    printGoodsList(infoList)
main()
  • 總結(jié):
  1. 當(dāng)爬不出數(shù)據(jù),并且程序并無報(bào)錯(cuò)時(shí)专酗,查看一下網(wǎng)頁的提交數(shù)據(jù)(headers)是不是包含cookie和user-agent睹逃。
  2. 正則表達(dá)式的使用一定要規(guī)范。
  3. 翻頁的實(shí)現(xiàn)主要是靠:觀察網(wǎng)頁url幾頁之間參數(shù)的不同笼裳,合理假設(shè)大膽判斷唯卖。
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者
  • 序言:七十年代末粱玲,一起剝皮案震驚了整個(gè)濱河市躬柬,隨后出現(xiàn)的幾起案子,更是在濱河造成了極大的恐慌抽减,老刑警劉巖允青,帶你破解...
    沈念sama閱讀 211,948評論 6 492
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件,死亡現(xiàn)場離奇詭異卵沉,居然都是意外死亡颠锉,警方通過查閱死者的電腦和手機(jī)法牲,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 90,371評論 3 385
  • 文/潘曉璐 我一進(jìn)店門,熙熙樓的掌柜王于貴愁眉苦臉地迎上來琼掠,“玉大人拒垃,你說我怎么就攤上這事〈赏埽” “怎么了悼瓮?”我有些...
    開封第一講書人閱讀 157,490評論 0 348
  • 文/不壞的土叔 我叫張陵,是天一觀的道長艰猬。 經(jīng)常有香客問我横堡,道長,這世上最難降的妖魔是什么冠桃? 我笑而不...
    開封第一講書人閱讀 56,521評論 1 284
  • 正文 為了忘掉前任命贴,我火速辦了婚禮,結(jié)果婚禮上食听,老公的妹妹穿的比我還像新娘胸蛛。我一直安慰自己,他們只是感情好樱报,可當(dāng)我...
    茶點(diǎn)故事閱讀 65,627評論 6 386
  • 文/花漫 我一把揭開白布胚泌。 她就那樣靜靜地躺著,像睡著了一般肃弟。 火紅的嫁衣襯著肌膚如雪玷室。 梳的紋絲不亂的頭發(fā)上,一...
    開封第一講書人閱讀 49,842評論 1 290
  • 那天笤受,我揣著相機(jī)與錄音穷缤,去河邊找鬼。 笑死箩兽,一個(gè)胖子當(dāng)著我的面吹牛津肛,可吹牛的內(nèi)容都是我干的。 我是一名探鬼主播汗贫,決...
    沈念sama閱讀 38,997評論 3 408
  • 文/蒼蘭香墨 我猛地睜開眼身坐,長吁一口氣:“原來是場噩夢啊……” “哼!你這毒婦竟也來了落包?” 一聲冷哼從身側(cè)響起部蛇,我...
    開封第一講書人閱讀 37,741評論 0 268
  • 序言:老撾萬榮一對情侶失蹤,失蹤者是張志新(化名)和其女友劉穎咐蝇,沒想到半個(gè)月后涯鲁,有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體,經(jīng)...
    沈念sama閱讀 44,203評論 1 303
  • 正文 獨(dú)居荒郊野嶺守林人離奇死亡,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點(diǎn)故事閱讀 36,534評論 2 327
  • 正文 我和宋清朗相戀三年抹腿,在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了岛请。 大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片。...
    茶點(diǎn)故事閱讀 38,673評論 1 341
  • 序言:一個(gè)原本活蹦亂跳的男人離奇死亡警绩,死狀恐怖崇败,靈堂內(nèi)的尸體忽然破棺而出,到底是詐尸還是另有隱情肩祥,我是刑警寧澤僚匆,帶...
    沈念sama閱讀 34,339評論 4 330
  • 正文 年R本政府宣布,位于F島的核電站搭幻,受9級特大地震影響咧擂,放射性物質(zhì)發(fā)生泄漏。R本人自食惡果不足惜檀蹋,卻給世界環(huán)境...
    茶點(diǎn)故事閱讀 39,955評論 3 313
  • 文/蒙蒙 一松申、第九天 我趴在偏房一處隱蔽的房頂上張望。 院中可真熱鬧俯逾,春花似錦贸桶、人聲如沸。這莊子的主人今日做“春日...
    開封第一講書人閱讀 30,770評論 0 21
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽。三九已至坠七,卻和暖如春水醋,著一層夾襖步出監(jiān)牢的瞬間,已是汗流浹背彪置。 一陣腳步聲響...
    開封第一講書人閱讀 32,000評論 1 266
  • 我被黑心中介騙來泰國打工拄踪, 沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留,地道東北人拳魁。 一個(gè)月前我還...
    沈念sama閱讀 46,394評論 2 360
  • 正文 我出身青樓惶桐,卻偏偏與公主長得像,于是被迫代替她去往敵國和親潘懊。 傳聞我的和親對象是個(gè)殘疾皇子姚糊,可洞房花燭夜當(dāng)晚...
    茶點(diǎn)故事閱讀 43,562評論 2 349

推薦閱讀更多精彩內(nèi)容

  • Requests庫 以管理員身份運(yùn)行cmd,輸入pip install requests授舟,等待安裝救恨。安裝成功后,可...
    anRank閱讀 911評論 0 1
  • HTTP基本原理 URI岂却、URL忿薇、URN(Uninform Resource) URI(Identifier):統(tǒng)...
    GHope閱讀 2,070評論 2 26
  • 上網(wǎng)原理 1裙椭、爬蟲概念 爬蟲是什麼躏哩? 蜘蛛署浩,蛆,代碼中扫尺,就是寫了一段代碼筋栋,代碼的功能從互聯(lián)網(wǎng)中提取數(shù)據(jù) 互聯(lián)網(wǎng): ...
    riverstation閱讀 8,036評論 1 2
  • 在你看這篇文章以前,我建議你最好把其它程序關(guān)掉正驻。(ps:我知道這是不太可能的啦~)所以繼續(xù)往下看吧弊攘。 每...
    5fc1bc4f8056閱讀 629評論 0 2
  • 魚苗基礎(chǔ)寫作班,第二次作業(yè)姑曙,對于自己未來的規(guī)劃襟交。給兩篇例子仿寫,其中一篇《寫在25歲零14天》未來夢想清單對我感觸...
    芳彩閱讀 182評論 0 1