Day10IO編程

讀文件

Python引入了with語句來自動(dòng)幫我們調(diào)用close()方法:

with open('/path/to/file', 'r') as f:
    print(f.read())

調(diào)用read()會(huì)一次性讀取文件的全部?jī)?nèi)容,如果文件有10G伤溉,內(nèi)存就爆了般码,所以,要保險(xiǎn)起見乱顾,可以反復(fù)調(diào)用read(size)方法板祝,每次最多讀取size個(gè)字節(jié)的內(nèi)容。另外糯耍,調(diào)用readline()可以每次讀取一行內(nèi)容扔字,調(diào)用readlines()一次讀取所有內(nèi)容并按行返回list。因此温技,要根據(jù)需要決定怎么調(diào)用革为。

for line in f.readlines():
    print(line.strip()) # 把末尾的'\n'刪掉

file-like Object

open()函數(shù)返回的這種有個(gè)read()方法的對(duì)象,在Python中統(tǒng)稱為file-like Object舵鳞。除了file外震檩,還可以是內(nèi)存的字節(jié)流,網(wǎng)絡(luò)流,自定義流等等抛虏。file-like Object不要求從特定類繼承博其,只要寫個(gè)read()方法就行。
StringIO就是在內(nèi)存中創(chuàng)建的file-like Object迂猴,常用作臨時(shí)緩沖慕淡。

二進(jìn)制文件

要讀取二進(jìn)制文件,比如圖片沸毁、視頻等等峰髓,可以用'rb'模式打開文件:

>>> f = open('/Users/michael/test.jpg', 'rb')
>>> f.read()
b'\xff\xd8\xff\xe1\x00\x18Exif\x00\x00...' # 十六進(jìn)制表示的字節(jié)

字符編碼

要讀取非UTF-8編碼的文本文件,需要給open()函數(shù)傳入encoding參數(shù)息尺,例如携兵,讀取GBK編碼的文件:

>>> f = open('/Users/michael/gbk.txt', 'r', encoding='gbk')
>>> f.read()
'測(cè)試'

遇到有些編碼不規(guī)范的文件,你可能會(huì)遇到UnicodeDecodeError搂誉,因?yàn)樵谖谋疚募锌赡軍A雜了一些非法編碼的字符徐紧。遇到這種情況,open()函數(shù)還接收一個(gè)errors參數(shù)炭懊,表示如果遇到編碼錯(cuò)誤后如何處理并级。最簡(jiǎn)單的方式是直接忽略:

>>> f = open('/Users/michael/gbk.txt', 'r', encoding='gbk', errors='ignore')

寫文件

傳入標(biāo)識(shí)符'w'或者'wb'表示寫文本文件或?qū)懚M(jìn)制文件:

with open('/Users/michael/test.txt', 'w') as f:
    f.write('Hello, world!')

要寫入特定編碼的文本文件,請(qǐng)給open()函數(shù)傳入encoding參數(shù)侮腹,將字符串自動(dòng)轉(zhuǎn)換成指定編碼死遭。
'w'模式寫入文件時(shí),如果文件已存在凯旋,會(huì)直接覆蓋(相當(dāng)于刪掉后新寫入一個(gè)文件)呀潭。可以傳入'a'以追加(append)模式寫入。

StringIO

很多時(shí)候至非,數(shù)據(jù)讀寫不一定是文件钠署,也可以在內(nèi)存中讀寫。
StringIO顧名思義就是在內(nèi)存中讀寫str荒椭。
要把str寫入StringIO谐鼎,我們需要先創(chuàng)建一個(gè)StringIO,然后趣惠,像文件一樣寫入即可:

>>> from io import StringIO
>>> f = StringIO()
>>> f.write('hello')
5
>>> f.write(' ')
1
>>> f.write('world!')
6
>>> print(f.getvalue())
hello world!

要讀取StringIO狸棍,可以用一個(gè)str初始化StringIO,然后味悄,像讀文件一樣讀炔莞辍:

>>> from io import StringIO
>>> f = StringIO('Hello\nHi!\nGoodbye!')
>>> while True:
    s = f.readline()
    if s == '':
        break
    print(s.strip())

    
Hello
Hi!
Goodbye!

BytesIO

StringIO操作的只能是str,如果要操作二進(jìn)制數(shù)據(jù)侍瑟,就需要使用BytesIO唐片。
BytesIO實(shí)現(xiàn)了在內(nèi)存中讀寫bytes丙猬,我們創(chuàng)建一個(gè)BytesIO,然后寫入一些bytes:

>>> from io import BytesIO
>>> f = BytesIO()
>>> f.write('中文'.encode('utf-8'))
6
>>> print(f.getvalue())
b'\xe4\xb8\xad\xe6\x96\x87'

寫入的是經(jīng)過UTF-8編碼的bytes费韭。
和StringIO類似茧球,可以用一個(gè)bytes初始化BytesIO,然后星持,像讀文件一樣讀惹缆瘛:

>>> from io import BytesIO
>>> f = BytesIO(b'\xe4\xb8\xad\xe6\x96\x87')
>>> f.read()
b'\xe4\xb8\xad\xe6\x96\x87'

操作文件和目錄

>>> import os
>>> os.name # 操作系統(tǒng)類型
'nt'

環(huán)境變量

在操作系統(tǒng)中定義的環(huán)境變量,全部保存在os.environ這個(gè)變量中督暂,可以直接查看:

>>> os.environ    #字典形式

要獲取某個(gè)環(huán)境變量的值羹令,可以調(diào)用os.environ.get('key')

>>> os.environ.get('PATH')
'C:\\ProgramData\\Oracle\\Java\\javapath;
C:\\WINDOWS\\system32;
C:\\WINDOWS;
C:\\WINDOWS\\System32\\Wbem;
C:\\WINDOWS\\System32\\WindowsPowerShell\\v1.0\\;
C:\\Program Files\\MATLAB\\R2016b\\runtime\\win64;
C:\\Program Files\\MATLAB\\R2016b\\bin;
C:\\ProgramFiles\\MATLAB\\R2016b\\polyspace\\bin;
C:\\Python36x32bit\\Scripts\\;
C:\\Python36x32bit\\;
C:\\Users\\hasee\\AppData\\Local\\Microsoft\\WindowsApps;'

操作文件和目錄

操作文件和目錄的函數(shù)一部分放在os模塊中,一部分放在os.path模塊中损痰,這一點(diǎn)要注意一下。查看酒来、創(chuàng)建和刪除目錄可以這么調(diào)用:

# 查看當(dāng)前目錄的絕對(duì)路徑:
>>> os.path.abspath('.')
'C:\\Python36x32bit'
# 在某個(gè)目錄下創(chuàng)建一個(gè)新目錄卢未,首先把新目錄的完整路徑表示出來:
>>> os.path.join('C:\\Python36x32bit','testdir')
'C:\\Python36x32bit\\testdir'
# 然后創(chuàng)建一個(gè)目錄:
>>> os.mkdir('C:\\Python36x32bit\\testdir')
# 刪掉一個(gè)目錄:
>>> os.rmdir('C:\\Python36x32bit\\testdir')

把兩個(gè)路徑合成一個(gè)時(shí),不要直接拼字符串堰汉,而要通過os.path.join()函數(shù)辽社,這樣可以正確處理不同操作系統(tǒng)的路徑分隔符。在Windows下翘鸭,os.path.join()返回這樣的字符串:
part-1\part-2
同樣的道理滴铅,要拆分路徑時(shí),也不要直接去拆字符串就乓,而要通過os.path.split()函數(shù)汉匙,這樣可以把一個(gè)路徑拆分為兩部分,后一部分總是最后級(jí)別的目錄或文件名:

>>> os.path.split('/Users/michael/testdir/file.txt')
('/Users/michael/testdir', 'file.txt')

os.path.splitext()可以直接得到文件擴(kuò)展名:

>>> os.path.splitext('/path/to/file.txt')
('/path/to/file', '.txt')

這些合并生蚁、拆分路徑的函數(shù)并不要求目錄和文件要真實(shí)存在噩翠,它們只對(duì)字符串進(jìn)行操作。
文件操作使用下面的函數(shù)邦投。假定當(dāng)前目錄下有一個(gè)test.txt文件:

# 對(duì)文件重命名:
>>> os.rename('test.txt', 'test.py')
# 刪掉文件:
>>> os.remove('test.py')

但是復(fù)制文件的函數(shù)居然在os模塊中不存在伤锚!原因是復(fù)制文件并非由操作系統(tǒng)提供的系統(tǒng)調(diào)用。理論上講志衣,我們通過上一節(jié)的讀寫文件可以完成文件復(fù)制屯援,只不過要多寫很多代碼。
幸運(yùn)的是shutil模塊提供了copyfile()的函數(shù)念脯,你還可以在shutil模塊中找到很多實(shí)用函數(shù)狞洋,它們可以看做是os模塊的補(bǔ)充。
利用Python的特性來過濾文件绿店。比如我們要列出當(dāng)前目錄下的所有目錄徘铝,只需要一行代碼:

>>> [x for x in os.listdir('.') if os.path.isdir(x)]
['DLLs', 'Doc', 'include', 'Lib', 'libs', 'python36', 'Scripts', 'tcl', 'Tools', '__pycache__']

要列出所有的.py文件,也只需一行代碼:

>>> [x for x in os.listdir('.') if os.path.isfile(x) and os.path.splitext(x)[1] == '.py']
['practice.py']

序列化

把變量從內(nèi)存中變成可存儲(chǔ)或傳輸?shù)倪^程稱之為序列化
Python提供了pickle模塊來實(shí)現(xiàn)序列化。
首先惕它,我們嘗試把一個(gè)對(duì)象序列化并寫入文件:

>>> import pickle
>>> d = dict(name='Bob', age=20, score=88)
>>> pickle.dumps(d)
b'\x80\x03}q\x00(X\x03\x00\x00\x00ageq\x01K\x14X\x05\x00\x00\x00scoreq\x02KXX\x04\x00\x00\x00nameq\x03X\x03\x00\x00\x00Bobq\x04u.'

pickle.dumps()方法把任意對(duì)象序列化成一個(gè)bytes怕午,然后,就可以把這個(gè)bytes寫入文件。或者用另一個(gè)方法pickle.dump()直接把對(duì)象序列化后寫入一個(gè)file-like Object:

>>> f = open('dump.txt', 'wb')
>>> pickle.dump(d, f)
>>> f.close()

看看寫入的dump.txt文件穴墅,一堆亂七八糟的內(nèi)容匣吊,這些都是Python保存的對(duì)象內(nèi)部信息。

Dump.txt

當(dāng)我們要把對(duì)象從磁盤讀到內(nèi)存時(shí)昧穿,可以先把內(nèi)容讀到一個(gè)bytes,然后用pickle.loads()方法反序列化出對(duì)象,也可以直接用pickle.load()方法從一個(gè)file-like Object中直接反序列化出對(duì)象虎韵。我們打開另一個(gè)Python命令行來反序列化剛才保存的對(duì)象:

>>> f = open('dump.txt','rb')
>>> d = pickle.load(f)
>>> f.close()
>>> d
{'name': 'Bob', 'age': 20, 'score': 80}

變量的內(nèi)容又回來了!
當(dāng)然缸废,這個(gè)變量和原來的變量是完全不相干的對(duì)象包蓝,它們只是內(nèi)容相同而已。

JSON

如果我們要在不同的編程語言之間傳遞對(duì)象企量,就必須把對(duì)象序列化為標(biāo)準(zhǔn)格式测萎,比如XML,但更好的方法是序列化為JSON届巩,因?yàn)镴SON表示出來就是一個(gè)字符串硅瞧,可以被所有語言讀取,也可以方便地存儲(chǔ)到磁盤或者通過網(wǎng)絡(luò)傳輸恕汇。JSON不僅是標(biāo)準(zhǔn)格式腕唧,并且比XML更快,而且可以直接在Web頁面中讀取瘾英,非常方便四苇。
JSON表示的對(duì)象就是標(biāo)準(zhǔn)的JavaScript語言的對(duì)象,JSON和Python內(nèi)置的數(shù)據(jù)類型對(duì)應(yīng)如下:

JSON <==> Python

Python內(nèi)置的json模塊提供了非常完善的Python對(duì)象到JSON格式的轉(zhuǎn)換方咆。我們先看看如何把Python對(duì)象變成一個(gè)JSON:

>>> import json
>>> d = dict(name = 'Bob', age = 20, score = 80)
>>> json.dumps(d)
'{"name": "Bob", "age": 20, "score": 80}'

dumps()方法返回一個(gè)str月腋,內(nèi)容就是標(biāo)準(zhǔn)的JSON。類似的瓣赂,dump()方法可以直接把JSON寫入一個(gè)file-like Object榆骚。
要把JSON反序列化為Python對(duì)象,用loads()或者對(duì)應(yīng)的load()方法煌集,前者把JSON的字符串反序列化妓肢,后者從file-like Object中讀取字符串并反序列化:

>>> json_str = '{"age":20,"score":80,"name":"Bob"}'
>>> json.loads(json_str)
{'age': 20, 'score': 80, 'name': 'Bob'}

JSON進(jìn)階

Python的dict對(duì)象可以直接序列化為JSON的{},不過苫纤,很多時(shí)候碉钠,我們更喜歡用class表示對(duì)象纲缓,比如定義Student類,然后序列化:

import json

class Student(object):
    def __init__(self, name, age, score):
        self.name = name
        self.age = age
        self.score = score

s = Student('Bob', 20, 88)
print(json.dumps(s))
Traceback (most recent call last):
  ...
TypeError: <__main__.Student object at 0x10603cc50> is not JSON serializable

錯(cuò)誤的原因是Student對(duì)象不是一個(gè)可序列化為JSON的對(duì)象喊废。
如果連class的實(shí)例對(duì)象都無法序列化為JSON祝高,這肯定不合理!
別急污筷,我們仔細(xì)看看dumps()方法的參數(shù)列表工闺,可以發(fā)現(xiàn),除了第一個(gè)必須的obj參數(shù)外瓣蛀,dumps()方法還提供了一大堆的可選參數(shù):

json.dumps(obj, *, skipkeys=False, ensure_ascii=True, 
check_circular=True, allow_nan=True, 
cls=None, indent=None, separators=None, 
default=None, sort_keys=False, **kw))

這些可選參數(shù)就是讓我們來定制JSON序列化陆蟆。前面的代碼之所以無法把Student類實(shí)例序列化為JSON,是因?yàn)槟J(rèn)情況下惋增,dumps()方法不知道如何將Student實(shí)例變?yōu)橐粋€(gè)JSON的{}對(duì)象叠殷。
可選參數(shù)default就是把任意一個(gè)對(duì)象變成一個(gè)可序列為JSON的對(duì)象,我們只需要為Student專門寫一個(gè)轉(zhuǎn)換函數(shù)诈皿,再把函數(shù)傳進(jìn)去即可:

def student2dict(std):
    return {
        'name': std.name,
        'age': std.age,
        'score': std.score
    }

這樣林束,Student實(shí)例首先被student2dict()函數(shù)轉(zhuǎn)換成dict,然后再被順利序列化為JSON:

>>> print(json.dumps(s, default=student2dict))
{"age": 20, "name": "Bob", "score": 88}

不過纫塌,下次如果遇到一個(gè)Teacher類的實(shí)例,照樣無法序列化為JSON讲弄。我們可以偷個(gè)懶措左,把任意class的實(shí)例變?yōu)?code>dict:
print(json.dumps(s, default=lambda obj: obj.__dict__))
同樣的道理,如果我們要把JSON反序列化為一個(gè)Student對(duì)象實(shí)例避除,loads()方法首先轉(zhuǎn)換出一個(gè)dict對(duì)象怎披,然后,我們傳入的object_hook函數(shù)負(fù)責(zé)把dict轉(zhuǎn)換為Student實(shí)例:

def dict2student(d):
    return Student(d['name'],d['age'],d['score'])
>>> json_str = '{"age": 20, "score": 88, "name": "Bob"}'
>>> print(json.loads(json_str, object_hook=dict2student))
<__main__.Student object at 0x10cd3c190>

打印出的是反序列化的Student實(shí)例對(duì)象瓶摆。

在Python中,json.dumps函數(shù)接受參數(shù)default用于指定一個(gè)函數(shù)凉逛,該函數(shù)能夠把自定義類型的對(duì)象轉(zhuǎn)換成可序列化的基本類型。json.loads函數(shù)接受參數(shù)objec_thook用于指定函數(shù)群井,該函數(shù)負(fù)責(zé)把反序列化后的基本類型對(duì)象轉(zhuǎn)換成自定義類型的對(duì)象状飞。

最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請(qǐng)聯(lián)系作者
  • 序言:七十年代末,一起剝皮案震驚了整個(gè)濱河市书斜,隨后出現(xiàn)的幾起案子诬辈,更是在濱河造成了極大的恐慌,老刑警劉巖荐吉,帶你破解...
    沈念sama閱讀 217,277評(píng)論 6 503
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件焙糟,死亡現(xiàn)場(chǎng)離奇詭異,居然都是意外死亡样屠,警方通過查閱死者的電腦和手機(jī)穿撮,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 92,689評(píng)論 3 393
  • 文/潘曉璐 我一進(jìn)店門缺脉,熙熙樓的掌柜王于貴愁眉苦臉地迎上來,“玉大人悦穿,你說我怎么就攤上這事攻礼。” “怎么了咧党?”我有些...
    開封第一講書人閱讀 163,624評(píng)論 0 353
  • 文/不壞的土叔 我叫張陵秘蛔,是天一觀的道長(zhǎng)。 經(jīng)常有香客問我傍衡,道長(zhǎng)深员,這世上最難降的妖魔是什么? 我笑而不...
    開封第一講書人閱讀 58,356評(píng)論 1 293
  • 正文 為了忘掉前任蛙埂,我火速辦了婚禮倦畅,結(jié)果婚禮上,老公的妹妹穿的比我還像新娘绣的。我一直安慰自己叠赐,他們只是感情好,可當(dāng)我...
    茶點(diǎn)故事閱讀 67,402評(píng)論 6 392
  • 文/花漫 我一把揭開白布屡江。 她就那樣靜靜地躺著芭概,像睡著了一般。 火紅的嫁衣襯著肌膚如雪惩嘉。 梳的紋絲不亂的頭發(fā)上罢洲,一...
    開封第一講書人閱讀 51,292評(píng)論 1 301
  • 那天,我揣著相機(jī)與錄音文黎,去河邊找鬼惹苗。 笑死,一個(gè)胖子當(dāng)著我的面吹牛耸峭,可吹牛的內(nèi)容都是我干的桩蓉。 我是一名探鬼主播,決...
    沈念sama閱讀 40,135評(píng)論 3 418
  • 文/蒼蘭香墨 我猛地睜開眼劳闹,長(zhǎng)吁一口氣:“原來是場(chǎng)噩夢(mèng)啊……” “哼院究!你這毒婦竟也來了?” 一聲冷哼從身側(cè)響起本涕,我...
    開封第一講書人閱讀 38,992評(píng)論 0 275
  • 序言:老撾萬榮一對(duì)情侶失蹤儡首,失蹤者是張志新(化名)和其女友劉穎,沒想到半個(gè)月后偏友,有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體蔬胯,經(jīng)...
    沈念sama閱讀 45,429評(píng)論 1 314
  • 正文 獨(dú)居荒郊野嶺守林人離奇死亡,尸身上長(zhǎng)有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點(diǎn)故事閱讀 37,636評(píng)論 3 334
  • 正文 我和宋清朗相戀三年位他,在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了氛濒。 大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片产场。...
    茶點(diǎn)故事閱讀 39,785評(píng)論 1 348
  • 序言:一個(gè)原本活蹦亂跳的男人離奇死亡,死狀恐怖舞竿,靈堂內(nèi)的尸體忽然破棺而出京景,到底是詐尸還是另有隱情,我是刑警寧澤骗奖,帶...
    沈念sama閱讀 35,492評(píng)論 5 345
  • 正文 年R本政府宣布确徙,位于F島的核電站,受9級(jí)特大地震影響执桌,放射性物質(zhì)發(fā)生泄漏鄙皇。R本人自食惡果不足惜,卻給世界環(huán)境...
    茶點(diǎn)故事閱讀 41,092評(píng)論 3 328
  • 文/蒙蒙 一仰挣、第九天 我趴在偏房一處隱蔽的房頂上張望伴逸。 院中可真熱鬧,春花似錦膘壶、人聲如沸错蝴。這莊子的主人今日做“春日...
    開封第一講書人閱讀 31,723評(píng)論 0 22
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽顷锰。三九已至,卻和暖如春亡问,著一層夾襖步出監(jiān)牢的瞬間官紫,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 32,858評(píng)論 1 269
  • 我被黑心中介騙來泰國(guó)打工玛界, 沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留万矾,地道東北人悼吱。 一個(gè)月前我還...
    沈念sama閱讀 47,891評(píng)論 2 370
  • 正文 我出身青樓慎框,卻偏偏與公主長(zhǎng)得像,于是被迫代替她去往敵國(guó)和親后添。 傳聞我的和親對(duì)象是個(gè)殘疾皇子笨枯,可洞房花燭夜當(dāng)晚...
    茶點(diǎn)故事閱讀 44,713評(píng)論 2 354

推薦閱讀更多精彩內(nèi)容

  • IO編程概念 IO在計(jì)算機(jī)中指Input/Output,也就是輸入和輸出遇西。由于程序和運(yùn)行時(shí)數(shù)據(jù)是在內(nèi)存中駐留馅精,由C...
    時(shí)間之友閱讀 726評(píng)論 0 0
  • pyton review 學(xué)習(xí)指南 https://www.zhihu.com/question/29138020...
    孫小二wuk閱讀 1,046評(píng)論 0 2
  • 今天是第三次在沙龍群聽王師答疑,與前兩次一樣粱檀,聽到的方法很受用洲敢! 針對(duì)怎么讓田開學(xué)第一天能心甘...
    田米米閱讀 200評(píng)論 0 0
  • 《開山》 為了寫一手好詩 我決定去少林寺 練鐵砂掌 一口氣劈十塊磚頭 為了寫一手好詩 我決定上武當(dāng)山 上到一半 就...
    詩人祁連山閱讀 247評(píng)論 0 0
  • 念叨了幾天終于得空把電影票買了,雖說是第三排的位置茄蚯,但總比沒有強(qiáng)吧压彭。 一下班就奔向地下車庫(kù)睦优,一路狂奔到...
    蝦米2號(hào)閱讀 269評(píng)論 0 1