這幾天在學(xué)習(xí)模擬登陸,而登陸離不開http中Cookie技術(shù)
Cookie
由于HTTP是一種無狀態(tài)的協(xié)議吮螺,服務(wù)器單從網(wǎng)絡(luò)連接上無從知道客戶身份庇配。怎么辦呢越锈?就給客戶端們頒發(fā)一個通行證吧,每人一個可训,無論誰訪問都必須攜帶自己通行證昌妹。這樣服務(wù)器就能從通行證上確認(rèn)客戶身份了。這就是Cookie的工作原理握截。

分析網(wǎng)頁數(shù)據(jù)
我們用Chrome來打開豆瓣(F12開發(fā)者工具)飞崖,先輸入一個錯誤的賬戶信息來觀察瀏覽器是如何發(fā)送請求的
從瀏覽器的請求可以發(fā)現(xiàn)幾個關(guān)鍵的信息
- 登錄的 URL 地址是 https://accounts.douban.com/login
- 登錄需要提供的表單數(shù)據(jù)有7個:
- source:index_nav
- redir:https://www.douban.com/
- form_email:286210002@qq.com
- form_password:123
- captcha-solution:errfdf
- captcha-id:lWtHfckzUAF4PoAtFtQdsyZy:en
- login:登錄
我們還需要獲取驗證碼元素,我們在開發(fā)者工具中切換到Elements一欄
從中我們得到了驗證碼元素在img標(biāo)簽內(nèi)
img id="captcha_image"
最后我們還需要captcha-id元素谨胞,Ctrl+U打開頁面源碼(在登陸頁面打開)固歪,Ctrl+F搜索captcha-id
好了,到了這一步所需的數(shù)據(jù)全部獲取完畢
實戰(zhàn)應(yīng)用
登陸所需要的模塊
- Requests
- BeautifulSoup4
pip install requests
pip install BeautifulSoup4
http.cookiejar 模塊可用于自動處理HTTP Cookie畜眨,LWPCookieJar 對象就是對 cookies 的封裝昼牛,它支持把 cookies 保存到文件以及從文件中加載。
而 session 對象 提供了 Cookie 的持久化康聂,連接池功能贰健,可以通過 session 對象發(fā)送請求
首先從cookies 文件中加載 cookie信息,因為首次運行還沒有cookie恬汁,會出現(xiàn) LoadError 異常伶椿。
import requests
from http import cookiejar
session = requests.session()
session.cookies = cookiejar.LWPCookieJar(filename='cookies')
try:
print(session.cookies)
session.cookies.load(ignore_discard=True)
except LoadError:
print('no cookie')
獲取驗證碼
def get_captcha():
'''
把驗證碼圖片保存到當(dāng)前目錄,手動識別驗證碼
:return:
'''
r = requests.post(download_url, data=data, headers=headers)
page = r.text
soup = BeautifulSoup(page, 'html.parser')
image = soup.find('img', attrs={'id': 'captcha_image'}).get('src')
s = session.get(captcha_url, headers=headers)
with open('captcha.jpg', 'wb') as f:
f.write(s.content)
captcha = input('Please input the captcha: ')
captcha_id = soup.find('input', {'type': 'hidden', 'name': 'captcha-id' }).get('value')
return captcha, captcha_id
登陸
def login():
captcha, captcha_id = get_captcha()
# 增加表數(shù)據(jù)
data['captcha-solution'] = captcha
data['captcha-id'] = captcha_id
response = session.post(download_url, data=data, headers=headers)
page = response.text
print(page)
session.cookies.save()
第一次登陸后session 會自動把 服務(wù)端的返回的cookie 信息填充到 session.cookies 對象中氓侧,下次登陸時就不需要再輸入賬號密碼
完整代碼
歡迎訪問我的博客Treehl的博客