文件讀寫
寫文件就是請(qǐng)求操作系統(tǒng)打開一個(gè)文件對(duì)象(通常稱為文件描述符),然后谤饭,通過(guò)操作系統(tǒng)提供的接口從這個(gè)文件對(duì)象中讀取數(shù)據(jù)(讀文件)添坊,或者把數(shù)據(jù)寫入這個(gè)文件對(duì)象(寫文件)魄健。
讀文件
# 要以讀文件的模式打開一個(gè)文件對(duì)象叉抡,使用Python內(nèi)置的open()函數(shù)殖演,傳入文件名和標(biāo)示符:
>>> f = open('/Users/michael/test.txt', 'r')
# 如果文件不存在讼稚,open()函數(shù)就會(huì)拋出一個(gè)IOError的錯(cuò)誤闯传,并且給出錯(cuò)誤碼和詳細(xì)的信息告訴你文件不存在:
>>> f=open('/Users/michael/notfound.txt', 'r')
Traceback (most recent call last):
File "<stdin>", line 1, in <module>
FileNotFoundError: [Errno 2] No such file or directory: '/Users/michael/notfound.txt'
# 如果文件打開成功经宏,接下來(lái)桥状,調(diào)用read()方法可以一次讀取文件的全部?jī)?nèi)容茂缚,Python把內(nèi)容讀到內(nèi)存戏罢,用一個(gè)str對(duì)象表示
>>> f.read()
'Hello, world!'
# 最后一步是調(diào)用close()方法關(guān)閉文件屋谭。文件使用完畢后必須關(guān)閉,因?yàn)槲募?duì)象會(huì)占用操作系統(tǒng)的資源龟糕,并且操作系統(tǒng)同一時(shí)間能打開的文件數(shù)量也是有限的
>>> f.close()
# 由于文件讀寫時(shí)都有可能產(chǎn)生IOError桐磁,一旦出錯(cuò),后面的f.close()就不會(huì)調(diào)用讲岁。所以我擂,為了保證無(wú)論是否出錯(cuò)都能正確地關(guān)閉文件,我們可以使用try ... finally來(lái)實(shí)現(xiàn)
try:
f = open('/path/to/file', 'r')
print(f.read())
finally:
if f:
f.close()
# 但是每次都這么寫實(shí)在太繁瑣催首,所以扶踊,Python引入了with語(yǔ)句來(lái)自動(dòng)幫我們調(diào)用close()方法
with open('/path/to/file', 'r') as f:
print(f.read())
# 這和前面的try ... finally是一樣的,但是代碼更佳簡(jiǎn)潔郎任,并且不必調(diào)用f.close()方法秧耗。
# 可以反復(fù)調(diào)用read(size)方法,每次最多讀取size個(gè)字節(jié)的內(nèi)容舶治。另外分井,調(diào)用readline()可以每次讀取一行內(nèi)容,調(diào)用readlines()一次讀取所有內(nèi)容并按行返回list
# 如果文件很小霉猛,read()一次性讀取最方便尺锚;如果不能確定文件大小,反復(fù)調(diào)用read(size)比較保險(xiǎn)惜浅;如果是配置文件瘫辩,調(diào)用readlines()最方便:
for line in f.readlines():
print(line.strip()) # 把末尾的'\n'刪掉
file-like Object
像open()函數(shù)返回的這種有個(gè)read()方法的對(duì)象,在Python中統(tǒng)稱為file-like Object坛悉。除了file外伐厌,還可以是內(nèi)存的字節(jié)流,網(wǎng)絡(luò)流裸影,自定義流等等挣轨。file-like Object不要求從特定類繼承,只要寫個(gè)read()方法就行轩猩。
二進(jìn)制文件
前面講的默認(rèn)都是讀取文本文件卷扮,并且是UTF-8編碼的文本文件。要讀取二進(jìn)制文件均践,比如圖片晤锹、視頻等等,用'rb'模式打開文件即可:
>>> f = open('/Users/michael/test.jpg', 'rb')
>>> f.read()
b'\xff\xd8\xff\xe1\x00\x18Exif\x00\x00...' # 十六進(jìn)制表示的字節(jié)
字符編碼
# 要讀取非UTF-8編碼的文本文件彤委,需要給open()函數(shù)傳入encoding參數(shù)鞭铆,例如,讀取GBK編碼的文件:
>>> f = open('/Users/michael/gbk.txt', 'r', encoding='gbk')
>>> f.read()
'測(cè)試'
# 遇到有些編碼不規(guī)范的文件葫慎,你可能會(huì)遇到UnicodeDecodeError衔彻,因?yàn)樵谖谋疚募锌赡軍A雜了一些非法編碼的字符。遇到這種情況偷办,open()函數(shù)還接收一個(gè)errors參數(shù)艰额,表示如果遇到編碼錯(cuò)誤后如何處理。最簡(jiǎn)單的方式是直接忽略:
>>> f = open('/Users/michael/gbk.txt', 'r', encoding='gbk', errors='ignore')
寫文件
寫文件和讀文件是一樣的椒涯,唯一區(qū)別是調(diào)用open()函數(shù)時(shí)柄沮,傳入標(biāo)識(shí)符'w'或者'wb'表示寫文本文件或?qū)懚M(jìn)制文件
>>> f = open('/Users/michael/test.txt', 'w')
>>> f.write('Hello, world!')
>>> f.close()
# 可以反復(fù)調(diào)用write()來(lái)寫入文件,但是務(wù)必要調(diào)用f.close()來(lái)關(guān)閉文件废岂。當(dāng)我們寫文件時(shí)祖搓,操作系統(tǒng)往往不會(huì)立刻把數(shù)據(jù)寫入磁盤,而是放到內(nèi)存緩存起來(lái)湖苞,空閑的時(shí)候再慢慢寫入拯欧。只有調(diào)用close()方法時(shí),操作系統(tǒng)才保證把沒(méi)有寫入的數(shù)據(jù)全部寫入磁盤财骨。忘記調(diào)用close()的后果是數(shù)據(jù)可能只寫了一部分到磁盤镐作,剩下的丟失了。所以隆箩,還是用with語(yǔ)句來(lái)得保險(xiǎn):
with open('/Users/michael/test.txt', 'w') as f:
f.write('Hello, world!')
# 要寫入特定編碼的文本文件该贾,請(qǐng)給open()函數(shù)傳入encoding參數(shù),將字符串自動(dòng)轉(zhuǎn)換成指定編碼捌臊。
在Python中杨蛋,文件讀寫是通過(guò)open()函數(shù)打開的文件對(duì)象完成的。使用with語(yǔ)句操作文件IO是個(gè)好習(xí)慣理澎。
StringIO和BytesIO
StringIO
數(shù)據(jù)讀寫不一定是文件逞力,也可以在內(nèi)存中讀寫。
StringIO顧名思義就是在內(nèi)存中讀寫str矾端。
要把str寫入StringIO掏击,我們需要先創(chuàng)建一個(gè)StringIO,然后秩铆,像文件一樣寫入即可
>>> from io import StringIO
>>> f = StringIO()
>>> f.write('hello')
5
>>> f.write(' ')
1
>>> f.write('world!')
6
>>> print(f.getvalue()) # getvalue()方法用于獲得寫入后的str
hello world!
# 要讀取StringIO砚亭,可以用一個(gè)str初始化StringIO,然后像讀文件一樣讀扰孤辍:
>>> from io import StringIO
>>> f = StringIO('Hello!\nHi!\nGoodbye!')
>>> while True:
... s = f.readline()
... if s == '':
... break
... print(s.strip())
...
Hello!
Hi!
Goodbye!
BytesIO
StringIO操作的只能是str捅膘,如果要操作二進(jìn)制數(shù)據(jù),就需要使用BytesIO
# BytesIO實(shí)現(xiàn)了在內(nèi)存中讀寫bytes滚粟,我們創(chuàng)建一個(gè)BytesIO寻仗,然后寫入一些bytes:
>>> from io import BytesIO
>>> f = BytesIO()
>>> f.write('中文'.encode('utf-8'))
6
>>> print(f.getvalue())
b'\xe4\xb8\xad\xe6\x96\x87'
# 請(qǐng)注意,寫入的不是str凡壤,而是經(jīng)過(guò)UTF-8編碼的bytes署尤。
# 和StringIO類似耙替,可以用一個(gè)bytes初始化BytesIO,然后曹体,像讀文件一樣讀人咨取:
>>> from io import BytesIO
>>> f = BytesIO(b'\xe4\xb8\xad\xe6\x96\x87')
>>> f.read()
b'\xe4\xb8\xad\xe6\x96\x87'
操作文件和目錄
>>> import os
# 操作系統(tǒng)類型
>>> os.name
'posix'
# 要獲取詳細(xì)的系統(tǒng)信息,可以調(diào)用uname()函數(shù)
>>> os.uname()
posix.uname_result(sysname='Darwin', nodename='MichaelMacPro.local', release='14.3.0', version='Darwin Kernel Version 14.3.0: Mon Mar 23 11:59:05 PDT 2015; root:xnu-2782.20.48~5/RELEASE_X86_64', machine='x86_64')
# 注意uname()函數(shù)在Windows上不提供箕别,也就是說(shuō)铜幽,os模塊的某些函數(shù)是跟操作系統(tǒng)相關(guān)的
# 在操作系統(tǒng)中定義的環(huán)境變量,全部保存在os.environ這個(gè)變量中串稀,可以直接查看
>>> os.environ
environ({'VERSIONER_PYTHON_PREFER_32_BIT': 'no', 'TERM_PROGRAM_VERSION': '326', 'LOGNAME': 'michael', 'USER': 'michael', 'PATH': '/usr/bin:/bin:/usr/sbin:/sbin:/usr/local/bin:/opt/X11/bin:/usr/local/mysql/bin', ...})
# 要獲取某個(gè)環(huán)境變量的值除抛,可以調(diào)用os.environ.get('key'):
>>> os.environ.get('PATH')
'/usr/bin:/bin:/usr/sbin:/sbin:/usr/local/bin:/opt/X11/bin:/usr/local/mysql/bin'
>>> os.environ.get('x', 'default')
'default'
# 操作文件和目錄的函數(shù)一部分放在os模塊中,一部分放在os.path模塊中
# 查看當(dāng)前目錄的絕對(duì)路徑:
>>> os.path.abspath('.')
'/Users/michael'
# 在某個(gè)目錄下創(chuàng)建一個(gè)新目錄母截,首先把新目錄的完整路徑表示出來(lái):
>>> os.path.join('/Users/michael', 'testdir')
'/Users/michael/testdir'
# 然后創(chuàng)建一個(gè)目錄:
>>> os.mkdir('/Users/michael/testdir')
# 刪掉一個(gè)目錄:
>>> os.rmdir('/Users/michael/testdir')
# 把兩個(gè)路徑合成一個(gè)時(shí)到忽,不要直接拼字符串,而要通過(guò)os.path.join()函數(shù)清寇,這樣可以正確處理不同操作系統(tǒng)的路徑分隔符绘趋。在Linux/Unix/Mac下,os.path.join()返回這樣的字符串:
part-1/part-2
# 而Windows下會(huì)返回這樣的字符串:
part-1\part-2
# 同樣的道理颗管,要拆分路徑時(shí)陷遮,也不要直接去拆字符串,而要通過(guò)os.path.split()函數(shù)垦江,這樣可以把一個(gè)路徑拆分為兩部分帽馋,后一部分總是最后級(jí)別的目錄或文件名:
>>> os.path.split('/Users/michael/testdir/file.txt')
('/Users/michael/testdir', 'file.txt')
# os.path.splitext()可以直接讓你得到文件擴(kuò)展名,很多時(shí)候非常方便:
>>> os.path.splitext('/path/to/file.txt')
('/path/to/file', '.txt')
# 這些合并比吭、拆分路徑的函數(shù)并不要求目錄和文件要真實(shí)存在绽族,它們只對(duì)字符串進(jìn)行操作。
# 文件操作使用下面的函數(shù)衩藤。假定當(dāng)前目錄下有一個(gè)test.txt文件:
# 對(duì)文件重命名:
>>> os.rename('test.txt', 'test.py')
# 刪掉文件:
>>> os.remove('test.py')
# shutil模塊提供了copyfile()的函數(shù)吧慢,你還可以在shutil模塊中找到很多實(shí)用函數(shù),它們可以看做是os模塊的補(bǔ)充赏表。
# 要列出當(dāng)前目錄下的所有目錄检诗,只需要一行代碼
>>> [x for x in os.listdir('.') if os.path.isdir(x)]
['.lein', '.local', '.m2', '.npm', '.ssh', '.Trash', '.vim', 'Applications', 'Desktop', ...]
列出所有的.py文件
>>> [x for x in os.listdir('.') if os.path.isfile(x) and os.path.splitext(x)[1]=='.py']
['apis.py', 'config.py', 'models.py', 'pymonitor.py', 'test_db.py', 'urls.py', 'wsgiapp.py']
Python的os模塊封裝了操作系統(tǒng)的目錄和文件操作,要注意這些函數(shù)有的在os模塊中瓢剿,有的在os.path模塊中逢慌。
序列化
把變量從內(nèi)存中變成可存儲(chǔ)或傳輸?shù)倪^(guò)程稱之為序列化(pickling)
序列化之后,就可以把序列化后的內(nèi)容寫入磁盤间狂,或者通過(guò)網(wǎng)絡(luò)傳輸?shù)絼e的機(jī)器上攻泼。
反過(guò)來(lái),把變量?jī)?nèi)容從序列化的對(duì)象重新讀到內(nèi)存里稱之為反序列化,即unpickling忙菠。
Python提供了pickle模塊來(lái)實(shí)現(xiàn)序列化
# 把一個(gè)對(duì)象序列化并寫入文件:
>>> import pickle
>>> d = dict(name='Bob', age=20, score=88)
>>> pickle.dumps(d)
b'\x80\x03}q\x00(X\x03\x00\x00\x00ageq\x01K\x14X\x05\x00\x00\x00scoreq\x02KXX\x04\x00\x00\x00nameq\x03X\x03\x00\x00\x00Bobq\x04u.'
# pickle.dumps()方法把任意對(duì)象序列化成一個(gè)bytes何鸡,然后,就可以把這個(gè)bytes寫入文件牛欢∫舯龋或者用另一個(gè)方法pickle.dump()直接把對(duì)象序列化后寫入一個(gè)file-like Object:
>>> f = open('dump.txt', 'wb')
>>> pickle.dump(d, f)
>>> f.close()
# 看看寫入的dump.txt文件,一堆亂七八糟的內(nèi)容氢惋,這些都是Python保存的對(duì)象內(nèi)部信息。
# 當(dāng)我們要把對(duì)象從磁盤讀到內(nèi)存時(shí)稽犁,可以先把內(nèi)容讀到一個(gè)bytes焰望,然后用pickle.loads()方法反序列化出對(duì)象,也可以直接用pickle.load()方法從一個(gè)file-like Object中直接反序列化出對(duì)象已亥。
>>> f = open('dump.txt', 'rb')
>>> d = pickle.load(f)
>>> f.close()
>>> d
{'age': 20, 'score': 88, 'name': 'Bob'}
# Pickle的問(wèn)題和所有其他編程語(yǔ)言特有的序列化問(wèn)題一樣熊赖,就是它只能用于Python,并且可能不同版本的Python彼此都不兼容虑椎,因此震鹉,只能用Pickle保存那些不重要的數(shù)據(jù),不能成功地反序列化也沒(méi)關(guān)系捆姜。
JSON
如果我們要在不同的編程語(yǔ)言之間傳遞對(duì)象传趾,就必須把對(duì)象序列化為標(biāo)準(zhǔn)格式,比如XML泥技,但更好的方法是序列化為JSON浆兰,因?yàn)镴SON表示出來(lái)就是一個(gè)字符串,可以被所有語(yǔ)言讀取珊豹,也可以方便地存儲(chǔ)到磁盤或者通過(guò)網(wǎng)絡(luò)傳輸簸呈。JSON不僅是標(biāo)準(zhǔn)格式,并且比XML更快店茶,而且可以直接在Web頁(yè)面中讀取蜕便,非常方便。
JSON表示的對(duì)象就是標(biāo)準(zhǔn)的JavaScript語(yǔ)言的對(duì)象贩幻,JSON和Python內(nèi)置的數(shù)據(jù)類型對(duì)應(yīng)如下:
Tables | Are |
---|---|
{} | dict |
[] | list |
"string" | str |
1234.56 | int或float |
true/false | True/False |
null | None |
Python內(nèi)置的json模塊提供了非常完善的Python對(duì)象到JSON格式的轉(zhuǎn)換
# 把Python對(duì)象變成一個(gè)JSON
>>> import json
>>> d = dict(name='Bob', age=20, score=88)
>>> json.dumps(d)
'{"age": 20, "score": 88, "name": "Bob"}'
# dumps()方法返回一個(gè)str轿腺,內(nèi)容就是標(biāo)準(zhǔn)的JSON。類似的丛楚,dump()方法可以直接把JSON寫入一個(gè)file-like Object吃溅。
# 要把JSON反序列化為Python對(duì)象,用loads()或者對(duì)應(yīng)的load()方法鸯檬,前者把JSON的字符串反序列化决侈,后者從file-like Object中讀取字符串并反序列化
>>> json_str = '{"age": 20, "score": 88, "name": "Bob"}'
>>> json.loads(json_str)
{'age': 20, 'score': 88, 'name': 'Bob'}
# Python的dict對(duì)象可以直接序列化為JSON的{},不過(guò),很多時(shí)候赖歌,我們更喜歡用class表示對(duì)象枉圃,比如定義Student類,然后序列化
# 默認(rèn)情況下庐冯,dumps()方法不知道如何將Student實(shí)例變?yōu)橐粋€(gè)JSON的{}對(duì)象
# 可選參數(shù)default就是把任意一個(gè)對(duì)象變成一個(gè)可序列為JSON的對(duì)象孽亲,我們只需要為Student專門寫一個(gè)轉(zhuǎn)換函數(shù),再把函數(shù)傳進(jìn)去即可
def student2dict(std):
return {
'name': std.name,
'age': std.age,
'score': std.score
}
# 這樣展父,Student實(shí)例首先被student2dict()函數(shù)轉(zhuǎn)換成dict返劲,然后再被順利序列化為JSON
>>> print(json.dumps(s, default=student2dict))
{"age": 20, "name": "Bob", "score": 88}
# 下次如果遇到一個(gè)Teacher類的實(shí)例,照樣無(wú)法序列化為JSON栖茉。我們可以偷個(gè)懶篮绿,把任意class的實(shí)例變?yōu)閐ict:
print(json.dumps(s, default=lambda obj: obj.__dict__))
# 因?yàn)橥ǔlass的實(shí)例都有一個(gè)__dict__屬性,它就是一個(gè)dict吕漂,用來(lái)存儲(chǔ)實(shí)例變量亲配。也有少數(shù)例外,比如定義了__slots__的class惶凝。
# 同樣的道理吼虎,如果我們要把JSON反序列化為一個(gè)Student對(duì)象實(shí)例,loads()方法首先轉(zhuǎn)換出一個(gè)dict對(duì)象苍鲜,然后思灰,我們傳入的object_hook函數(shù)負(fù)責(zé)把dict轉(zhuǎn)換為Student實(shí)例:
def dict2student(d):
return Student(d['name'], d['age'], d['score'])
# 運(yùn)行結(jié)果如下:
>>> json_str = '{"age": 20, "score": 88, "name": "Bob"}'
>>> print(json.loads(json_str, object_hook=dict2student))
<__main__.Student object at 0x10cd3c190>