反爬必修課之----(3)極驗(yàn)滑動驗(yàn)證碼識別

? ? ? ?驗(yàn)證碼識別成為了對抗反爬蟲的必修課之一饮醇,看了崔慶才著的《python3網(wǎng)絡(luò)爬蟲開發(fā)實(shí)戰(zhàn)》后受益匪淺,本專題將著重學(xué)習(xí)記錄不同的驗(yàn)證碼識別方式:圖像驗(yàn)證碼浪漠、宮格驗(yàn)證碼陕习、極驗(yàn)滑動驗(yàn)證碼、點(diǎn)觸驗(yàn)證碼址愿。


? ? ? ?[2019.3.6更新] 測試了下發(fā)現(xiàn)以下的版本識別率比較低该镣,稍微改動了下代碼。
? ? ? ?放到了GitHub


極驗(yàn)滑動驗(yàn)證碼識別

先看看效果:

  • 識別思路:

  1. 模擬點(diǎn)擊切換為滑動驗(yàn)證响谓、并顯示驗(yàn)證界面拌牲。
  2. 識別滑動缺口的位置,計(jì)算位移
  3. 模擬拖動滑塊
  4. 若認(rèn)證失敗歌粥,重復(fù)調(diào)用

詳細(xì)過程及代碼如下:

  • 初始化

from selenium.webdriver.support import expected_conditions as EC    
from selenium import webdriver
from selenium.webdriver.support.wait import WebDriverWait
from selenium.webdriver.common.by import By
from selenium.webdriver import ActionChains
from PIL import Image
from io import BytesIO
import time

BORDER = 6

class CrackGeetest():
    def __init__(self):
        self.url = 'https://www.geetest.com/type/'
        self.browser = webdriver.Chrome()
        self.wait = WebDriverWait(self.browser,10)

    def open(self):
        '''
        打開網(wǎng)頁
        :return None 
        '''
        self.browser.get(self.url)

    def close(self):
        '''
        關(guān)閉網(wǎng)頁
        :return None
        '''
        self.browser.close()
        self.browser.quit()

? ? ? ?定義了一個(gè) CrackGeetest 類,初始化selenium對象和一些參數(shù)配置拍埠,網(wǎng)址是極驗(yàn)的驗(yàn)證碼測試頁面失驶。

  • 模擬點(diǎn)擊

? ? ? ?首先模擬點(diǎn)擊切換為滑動驗(yàn)證,然后模擬點(diǎn)擊彈出驗(yàn)證圖片枣购。

    def change_to_slide(self):
        '''
        切換為滑動認(rèn)證
        :return 滑動選項(xiàng)對象
        '''
        huadong = self.wait.until(
            EC.element_to_be_clickable((By.CSS_SELECTOR,'.products-content ul > li:nth-child(2)'))
        )
        return huadong

    def get_geetest_button(self):
        '''
        獲取初始認(rèn)證按鈕
        :return 按鈕對象
        '''
        button = self.wait.until(
            EC.element_to_be_clickable((By.CSS_SELECTOR,'.geetest_radar_tip'))
        )
        return button

? ? ? ?該步驟定義了兩個(gè)方法嬉探,均利用顯示等待的方法實(shí)現(xiàn)。并返回按鈕對象棉圈,后用click()方法模擬點(diǎn)擊涩堤。
效果如下:

  • 獲取背景圖

? ? ? ?首先等待驗(yàn)證碼加載完成(wait_pic),獲取網(wǎng)頁截圖(get_screenshot)分瘾,然后獲取驗(yàn)證背景圖所在的位置及大小參數(shù)(get_position)和滑塊對象(get_slider)胎围。

    def wait_pic(self):
        '''
        等待驗(yàn)證圖片加載完成
        :return None
        '''
        self.wait.until(
            EC.presence_of_element_located((By.CSS_SELECTOR,'.geetest_popup_wrap'))
        ) 

    def get_screenshot(self):
        """
        獲取網(wǎng)頁截圖
        :return: 截圖對象
        """
        screenshot = self.browser.get_screenshot_as_png()
        screenshot = Image.open(BytesIO(screenshot))
        return screenshot

    def get_position(self):
        '''
        獲取驗(yàn)證碼位置
        :return: 位置元組
        '''
        img = self.wait.until(EC.presence_of_element_located((By.CLASS_NAME,'geetest_canvas_img')))
        time.sleep(2)
        location = img.location
        size = img.size
        top, bottom = location['y'], location['y'] + size['height']
        left, right = location['x'], location['x'] + size['width'] 
        return (top, bottom, left, right) 

    def get_slider(self):
        '''
        獲取滑塊
        :return: 滑塊對象
        '''
        slider = self.wait.until(EC.element_to_be_clickable((By.CLASS_NAME,'geetest_slider_button')))
        return slider

? ? ? ?再通過上述返回的背景圖位置和大小參數(shù),對網(wǎng)頁截圖進(jìn)行切片(get_geetest_image)德召,最后獲取背景圖白魂。

    def get_geetest_image(self,name='captcha.png'):
        '''
        獲取驗(yàn)證碼圖片
        :return: 圖片對象
        '''      
        top, bottom, left, right = self.get_position()
        print('驗(yàn)證碼位置',top, bottom, left, right)
        screenshot = self.get_screenshot()
        captcha = screenshot.crop((left, top, right, bottom))
        captcha.save(name)
        return captcha

? ? ? ?到這里,已經(jīng)獲取了帶缺口的背景圖上岗,那怎么樣才可以獲取不帶缺口滑塊的原圖呢福荸?

? ? ? ?網(wǎng)上提供的方法中,我篩選出了兩種實(shí)測可行的方法肴掷,一種是通過改變CSS樣式獲得原圖敬锐,另一種是將源碼返回的亂序圖還原背传,這里著重介紹第一種,另一種在日后的文章中將補(bǔ)充台夺。

? ? ? ?在《python3網(wǎng)絡(luò)爬蟲開發(fā)實(shí)戰(zhàn)》中径玖,由于寫書的時(shí)間距今有一段時(shí)間,所以極驗(yàn)的驗(yàn)證碼也存在更新谒养,截至到今天(2018-11-30)無法直接先獲取無缺口的原圖挺狰,在通過點(diǎn)擊獲得帶缺口背景圖了。觀察一下驗(yàn)證碼頁面的源代碼买窟,可以發(fā)現(xiàn):


? ? ? ?將該canvas標(biāo)簽的style刪除之后丰泊,滑塊和陰影果然不見了,這樣我們只需要通過js操作css樣式屬性始绍,便可以繼續(xù)分析了瞳购。這里用到了execute_script()方法,基本上Selenium API沒有提供的功能都可以通過它執(zhí)行JavaScript的方式來實(shí)現(xiàn)亏推。不得不說這個(gè)功能還是挺好用的学赛,可以類比Splash執(zhí)行Lua腳本。
? ? ? ?執(zhí)行js腳本之后(delete_style)獲得了無缺口的原圖吞杭,再調(diào)用之前的截圖方法盏浇,就可以獲取同大小的背景圖了。

    def delete_style(self):
        '''
        執(zhí)行js腳本芽狗,獲取無滑塊圖
        :return None
        '''
        js = 'document.querySelectorAll("canvas")[2].style=""'
        self.browser.execute_script(js)

不帶缺口的背景圖

帶缺口和陰影的背景圖
  • 識別缺口

? ? ? ?我們得到了兩張圖绢掰,接下來就要對比他們來獲取缺口位置。
? ? ? ?遍歷圖片的每個(gè)坐標(biāo)點(diǎn)童擎,獲取兩張圖片的RGB數(shù)據(jù)滴劲,若差距在一定范圍內(nèi),則認(rèn)為兩個(gè)像素相同顾复,繼續(xù)往下比對班挖。若超過一定范圍,則代表像素點(diǎn)不同芯砸,當(dāng)且位置即為缺口位置萧芙。? ? ? ?is_pixel_equal()中定義了一個(gè)閾值范圍threshold,為60假丧,原因是缺口圖中不僅有缺口部分的像素不同末购,其中還設(shè)置了一個(gè)干擾陰影塊,和缺口大小類似虎谢,所以我們需要將范圍適當(dāng)提高盟榴。

    def is_pixel_equal(self, img1, img2, x, y):
        '''
        判斷兩個(gè)像素是否相同
        :param img1: 不帶缺口圖片
        :param img2: 帶缺口圖
        :param x: 位置x
        :param y: 位置y
        :return: 像素是否相同
        '''
        # 取兩個(gè)圖片的像素點(diǎn)
        pix1 = img1.load()[x, y]
        pix2 = img2.load()[x, y]
        threshold = 60
        if abs(pix1[0] - pix2[0]) < threshold \
        and abs(pix1[1] - pix2[1]) < threshold \
        and abs(pix1[2] - pix2[2]) < threshold:
            return True
        else:
            return False

? ? ? ?get_gap()方法遍歷兩張圖片的每個(gè)像素,再利用is_pixel_equal()方法判斷兩張圖片同一位置的像素婴噩。get_gap()中擎场,left為起始橫坐標(biāo)羽德,即是從滑塊的右邊開始尋找缺口位置。

    def get_gap(self, img1, img2):
        '''
        獲取缺口偏移量
        :param img1: 不帶缺口圖片
        :param img2: 帶缺口圖
        :return 缺口位置
        '''
        left = 60 
        for i in range(left, img1.size[0]):
            for j in range(img1.size[1]):
                if not self.is_pixel_equal(img1, img2, i, j):
                    left = i
                    return left
        return left

  • 模擬拖動迅办。

? ? ? ?上面我們獲得了滑塊的位置宅静,現(xiàn)在只需要計(jì)算距離并且模擬拖動即可。
? ? ? ?不難想到站欺,將滑塊勻速運(yùn)動或者直接閃到缺口位置是肯定不行的姨夹,我們要盡量模擬人手拖動鼠標(biāo)的情況。所以我在崔大給的方案的基礎(chǔ)上做了一點(diǎn)改進(jìn)矾策。

大致過程:
? ? ? ?首先加速拖動滑塊磷账,當(dāng)快接近缺口時(shí),開始減速拖動贾虽,超過缺口一點(diǎn)距離后再往回拖拽對齊逃糟,由于人手可能不能對得非常整齊,所以我設(shè)置了1到2個(gè)像素的誤差蓬豁,并且再最后加入了3個(gè)像素距離的左右滑動來模擬釋放鼠標(biāo)時(shí)的抖動情況绰咽。

效果如下:

利用中學(xué)時(shí)期的物理公式,即可構(gòu)造軌跡移動算法地粪。
? ? ? ?x = v0*t + 1/2*a*t^2
? ? ? ?v = v0 + a*t

    def get_track(self, distance):
        '''
        根據(jù)偏移量獲取移動軌跡
        :param distance: 偏移量
        :return: 移動軌跡
        '''
        #移動軌跡
        track = []
        #當(dāng)前位移
        current = 0
        #減速閾值
        mid = distance * 3 / 5
        #計(jì)算間隔
        t = 0.2
        #初速度
        v = 0
        #滑超過過一段距離
        distance += 14
        while current < distance:
            if current < mid:
                #加速度為正
                a = 2
            else:
                #加速度為負(fù)
                a = -1.5
            #初速度 v0
            v0 = v
            #當(dāng)前速度 v
            v = v0 + a * t
            #移動距離 move-->x
            move = v0 * t + 1 / 2 * a * t * t
            #當(dāng)前位移
            current += move
            #加入軌跡
            track.append(round(move))
        return track

? ? ? ?前3/5路程加速取募,后面減速,track返回的是一個(gè)列表蟆技,其中每個(gè)元素代表的是每次移動的距離玩敏。然后模擬釋放鼠標(biāo)時(shí)的人手抖動(shake_mouse)。
? ? ? ?最后根據(jù)之前所得到的運(yùn)動軌跡拖動滑塊(move_to_gap)即可付魔。

    def shake_mouse(self):
        '''
        模擬人手釋放鼠標(biāo)時(shí)的抖動
        :return: None
        '''
        ActionChains(self.browser).move_by_offset(xoffset=-3, yoffset=0).perform()
        ActionChains(self.browser).move_by_offset(xoffset=2, yoffset=0).perform()

    def move_to_gap(self, slider, tracks):
        '''
        拖動滑塊到缺口處
        :param slider: 滑塊
        :param tracks: 軌跡
        :return
        '''
        back_tracks = [-1, -1, -2, -2, -3, -2, -2, -1, -1]
        ActionChains(self.browser).click_and_hold(slider).perform()
        #正向
        for x in tracks:
            ActionChains(self.browser).move_by_offset(xoffset=x, yoffset=0).perform()
        #逆向
        for x in back_tracks:
            ActionChains(self.browser).move_by_offset(xoffset=x, yoffset=0).perform()
        #模擬抖動
        self.shake_mouse()
        time.sleep(0.5)
        ActionChains(self.browser).release().perform()

其整個(gè)控制流程,如下:
? ? ? ?執(zhí)行主體流程飞蹂,若驗(yàn)證失敗几苍, 則再次調(diào)用crack()進(jìn)行識別,直至成功陈哑。

    def crack(self):
        try:
            #打開網(wǎng)頁
            self.open()
            #轉(zhuǎn)換驗(yàn)證方式妻坝,點(diǎn)擊認(rèn)證按鈕
            s_button = self.change_to_slide()
            s_button.click()
            g_button = self.get_geetest_button()
            g_button.click()
            #確認(rèn)圖片加載完成
            self.wait_pic()
            #獲取滑塊
            slider = self.get_slider()
            #獲取帶缺口的驗(yàn)證碼圖片
            image1 = self.get_geetest_image('captcha1.png')
            self.delete_style()
            image2 = self.get_geetest_image('captcha2.png')
            gap = self.get_gap(image1,image2)
            print('缺口位置',gap)
            gap -= BORDER
            track = self.get_track(gap)
            self.move_to_gap(slider, track)
            success =  self.wait.until(
                EC.text_to_be_present_in_element((By.CLASS_NAME,'geetest_success_radar_tip_content'),'驗(yàn)證成功')
            )
            print(success)
            time.sleep(5)
            self.close()
        except:
            print('Failed-Retry')
            self.crack()


    
if __name__ == '__main__':
    crack = CrackGeetest()
    crack.crack()

? ? ? ?至此,極驗(yàn)滑動驗(yàn)證碼識別——網(wǎng)頁截圖對比方法已經(jīng)記錄完畢惊窖。


  • 關(guān)鍵字總結(jié)

  1. webdriver():
    ? ? ? ?support.expected_conditions as EC
    ? ? ? ?support.wait.WebDriverWait
    ? ? ? ?ActionChains
    ? ? ? ?common.by.By
  2. BytesIO
  3. 代碼風(fēng)格
  4. 驗(yàn)證碼分析思路
最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者
  • 序言:七十年代末刽宪,一起剝皮案震驚了整個(gè)濱河市,隨后出現(xiàn)的幾起案子界酒,更是在濱河造成了極大的恐慌圣拄,老刑警劉巖,帶你破解...
    沈念sama閱讀 206,968評論 6 482
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件毁欣,死亡現(xiàn)場離奇詭異庇谆,居然都是意外死亡岳掐,警方通過查閱死者的電腦和手機(jī),發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 88,601評論 2 382
  • 文/潘曉璐 我一進(jìn)店門饭耳,熙熙樓的掌柜王于貴愁眉苦臉地迎上來串述,“玉大人,你說我怎么就攤上這事寞肖「傩铮” “怎么了?”我有些...
    開封第一講書人閱讀 153,220評論 0 344
  • 文/不壞的土叔 我叫張陵新蟆,是天一觀的道長觅赊。 經(jīng)常有香客問我,道長栅葡,這世上最難降的妖魔是什么茉兰? 我笑而不...
    開封第一講書人閱讀 55,416評論 1 279
  • 正文 為了忘掉前任,我火速辦了婚禮欣簇,結(jié)果婚禮上规脸,老公的妹妹穿的比我還像新娘。我一直安慰自己熊咽,他們只是感情好莫鸭,可當(dāng)我...
    茶點(diǎn)故事閱讀 64,425評論 5 374
  • 文/花漫 我一把揭開白布。 她就那樣靜靜地躺著横殴,像睡著了一般被因。 火紅的嫁衣襯著肌膚如雪。 梳的紋絲不亂的頭發(fā)上衫仑,一...
    開封第一講書人閱讀 49,144評論 1 285
  • 那天梨与,我揣著相機(jī)與錄音,去河邊找鬼文狱。 笑死粥鞋,一個(gè)胖子當(dāng)著我的面吹牛,可吹牛的內(nèi)容都是我干的瞄崇。 我是一名探鬼主播呻粹,決...
    沈念sama閱讀 38,432評論 3 401
  • 文/蒼蘭香墨 我猛地睜開眼,長吁一口氣:“原來是場噩夢啊……” “哼苏研!你這毒婦竟也來了等浊?” 一聲冷哼從身側(cè)響起,我...
    開封第一講書人閱讀 37,088評論 0 261
  • 序言:老撾萬榮一對情侶失蹤摹蘑,失蹤者是張志新(化名)和其女友劉穎筹燕,沒想到半個(gè)月后,有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體,經(jīng)...
    沈念sama閱讀 43,586評論 1 300
  • 正文 獨(dú)居荒郊野嶺守林人離奇死亡庄萎,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點(diǎn)故事閱讀 36,028評論 2 325
  • 正文 我和宋清朗相戀三年踪少,在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了。 大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片糠涛。...
    茶點(diǎn)故事閱讀 38,137評論 1 334
  • 序言:一個(gè)原本活蹦亂跳的男人離奇死亡援奢,死狀恐怖,靈堂內(nèi)的尸體忽然破棺而出忍捡,到底是詐尸還是另有隱情集漾,我是刑警寧澤,帶...
    沈念sama閱讀 33,783評論 4 324
  • 正文 年R本政府宣布砸脊,位于F島的核電站具篇,受9級特大地震影響,放射性物質(zhì)發(fā)生泄漏凌埂。R本人自食惡果不足惜驱显,卻給世界環(huán)境...
    茶點(diǎn)故事閱讀 39,343評論 3 307
  • 文/蒙蒙 一、第九天 我趴在偏房一處隱蔽的房頂上張望瞳抓。 院中可真熱鬧埃疫,春花似錦、人聲如沸孩哑。這莊子的主人今日做“春日...
    開封第一講書人閱讀 30,333評論 0 19
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽横蜒。三九已至胳蛮,卻和暖如春,著一層夾襖步出監(jiān)牢的瞬間丛晌,已是汗流浹背仅炊。 一陣腳步聲響...
    開封第一講書人閱讀 31,559評論 1 262
  • 我被黑心中介騙來泰國打工, 沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留澎蛛,地道東北人抚垄。 一個(gè)月前我還...
    沈念sama閱讀 45,595評論 2 355
  • 正文 我出身青樓,卻偏偏與公主長得像瓶竭,于是被迫代替她去往敵國和親督勺。 傳聞我的和親對象是個(gè)殘疾皇子渠羞,可洞房花燭夜當(dāng)晚...
    茶點(diǎn)故事閱讀 42,901評論 2 345

推薦閱讀更多精彩內(nèi)容

  • 1.滑動驗(yàn)證碼 前面介紹了利用 tesserocr 來識別簡單的圖形驗(yàn)證碼,和利用openCV識別滑動驗(yàn)證碼的缺口...
    浩成聊技術(shù)閱讀 22,780評論 6 15
  • 2017-08-30次询,二兩 詩人荧恍,總善于 把自己 歸于特立獨(dú)行的一類 并且 自覺不自覺的 暗示和強(qiáng)化 甚至動用傳媒...
    閆安閱讀 236評論 0 0
  • 舊的一年過去,新的一年又已經(jīng)來到了我們的身邊,帶著對我們的祝福和期盼送巡,帶著我們新的氣象和氣息摹菠。 歲歲年年,年年歲歲...
    阿俊xi閱讀 198評論 0 0
  • 不知什么風(fēng) 把你捧上一片如絮的白云 席云而坐 羽扇綸巾 上看浩瀚長空 下瞧眾生蕓蕓 自鳴得意 聲若洪鐘 我是詩...
    小小佘閱讀 230評論 0 1
  • 著名小說家R·到山里去進(jìn)行了一次為時(shí)三天的郊游之后骗爆,這天清晨返回維也納次氨,在火車站買了一份報(bào)紙。他看了一眼日期摘投,突然...
    一只大柚子閱讀 355評論 2 1