如果我們要操作文件蔽午、目錄樟遣,可以在命令行下面輸入操作系統(tǒng)提供的各種命令來完成雕憔。比如dir
姿骏、cp
等命令。
如果要在Python程序中執(zhí)行這些目錄和文件的操作怎么辦斤彼?其實(shí)操作系統(tǒng)提供的命令只是簡(jiǎn)單地調(diào)用了操作系統(tǒng)提供的接口函數(shù)分瘦,Python內(nèi)置的os
模塊也可以直接調(diào)用操作系統(tǒng)提供的接口函數(shù)。
打開Python交互式命令行琉苇,我們來看看如何使用os
模塊的基本功能:
>>> import os
>>> os.name # 操作系統(tǒng)類型
'posix'
如果是posix
嘲玫,說明系統(tǒng)是Linux
、Unix
或Mac OS X
翁潘,如果是nt
趁冈,就是Windows
系統(tǒng)。
要獲取詳細(xì)的系統(tǒng)信息拜马,可以調(diào)用uname()
函數(shù):
>>> os.uname()
posix.uname_result(sysname='Darwin', nodename='MichaelMacPro.local', release='14.3.0', version='Darwin Kernel Version 14.3.0: Mon Mar 23 11:59:05 PDT 2015; root:xnu-2782.20.48~5/RELEASE_X86_64', machine='x86_64')
注意uname()
函數(shù)在Windows上不提供渗勘,也就是說,os
模塊的某些函數(shù)是跟操作系統(tǒng)相關(guān)的俩莽。
環(huán)境變量
在操作系統(tǒng)中定義的環(huán)境變量旺坠,全部保存在os.environ
這個(gè)變量中,可以直接查看:
>>> os.environ
environ({'VERSIONER_PYTHON_PREFER_32_BIT': 'no', 'TERM_PROGRAM_VERSION': '326', 'LOGNAME': 'michael', 'USER': 'michael', 'PATH': '/usr/bin:/bin:/usr/sbin:/sbin:/usr/local/bin:/opt/X11/bin:/usr/local/mysql/bin', ...})
要獲取某個(gè)環(huán)境變量的值扮超,可以調(diào)用os.environ.get('key')
:
>>> os.environ.get('PATH')
'/usr/bin:/bin:/usr/sbin:/sbin:/usr/local/bin:/opt/X11/bin:/usr/local/mysql/bin'
>>> os.environ.get('x', 'default')
'default'
操作文件和目錄
操作文件和目錄的函數(shù)一部分放在os
模塊中取刃,一部分放在os.path
模塊中,這一點(diǎn)要注意一下出刷。查看璧疗、創(chuàng)建和刪除目錄可以這么調(diào)用:
# 查看當(dāng)前目錄的絕對(duì)路徑:
>>> os.path.abspath('.')
'/Users/michael'
# 在某個(gè)目錄下創(chuàng)建一個(gè)新目錄,首先把新目錄的完整路徑表示出來:
>>> os.path.join('/Users/michael', 'testdir')
'/Users/michael/testdir'
# 然后創(chuàng)建一個(gè)目錄:
>>> os.mkdir('/Users/michael/testdir')
# 刪掉一個(gè)目錄:
>>> os.rmdir('/Users/michael/testdir')
把兩個(gè)路徑合成一個(gè)時(shí)馁龟,不要直接拼字符串崩侠,而要通過os.path.join()
函數(shù),這樣可以正確處理不同操作系統(tǒng)的路徑分隔符坷檩。在Linux/Unix/Mac下却音,os.path.join()
返回這樣的字符串:
part-1/part-2
而Windows下會(huì)返回這樣的字符串:
part-1\part-2
同樣的道理改抡,要拆分路徑時(shí),也不要直接去拆字符串系瓢,而要通過os.path.split()
函數(shù)阿纤,這樣可以把一個(gè)路徑拆分為兩部分贯莺,后一部分總是最后級(jí)別的目錄或文件名:
>>> os.path.split('/Users/michael/testdir/file.txt')
('/Users/michael/testdir', 'file.txt')
os.path.splitext()
可以直接讓你得到文件擴(kuò)展名喉恋,很多時(shí)候非常方便:
>>> os.path.splitext('/path/to/file.txt')
('/path/to/file', '.txt')
這些合并、拆分路徑的函數(shù)并不要求目錄和文件要真實(shí)存在鹤啡,它們只對(duì)字符串進(jìn)行操作肌稻。
文件操作使用下面的函數(shù)清蚀。假定當(dāng)前目錄下有一個(gè)test.txt
文件:
# 對(duì)文件重命名:
>>> os.rename('test.txt', 'test.py')
# 刪掉文件:
>>> os.remove('test.py')
但是復(fù)制文件的函數(shù)居然在os
模塊中不存在!原因是復(fù)制文件并非由操作系統(tǒng)提供的系統(tǒng)調(diào)用爹谭。理論上講枷邪,我們通過上一節(jié)的讀寫文件可以完成文件復(fù)制,只不過要多寫很多代碼诺凡。
幸運(yùn)的是shutil
模塊提供了copyfile()
的函數(shù)东揣,你還可以在shutil
模塊中找到很多實(shí)用函數(shù),它們可以看做是os
模塊的補(bǔ)充腹泌。
最后看看如何利用Python的特性來過濾文件嘶卧。比如我們要列出當(dāng)前目錄下的所有目錄,只需要一行代碼:
>>> [x for x in os.listdir('.') if os.path.isdir(x)]
['.lein', '.local', '.m2', '.npm', '.ssh', '.Trash', '.vim', 'Applications', 'Desktop', ...]
要列出所有的.py
文件凉袱,也只需一行代碼:
>>> [x for x in os.listdir('.') if os.path.isfile(x) and os.path.splitext(x)[1]=='.py']
['apis.py', 'config.py', 'models.py', 'pymonitor.py', 'test_db.py', 'urls.py', 'wsgiapp.py']
序列化
在程序運(yùn)行的過程中芥吟,所有的變量都是在內(nèi)存中,比如专甩,定義一個(gè)dict:
d = dict(name='Bob', age=20, score=88)
可以隨時(shí)修改變量钟鸵,比如把name
改成'Bill'
,但是一旦程序結(jié)束涤躲,變量所占用的內(nèi)存就被操作系統(tǒng)全部回收棺耍。如果沒有把修改后的'Bill'
存儲(chǔ)到磁盤上,下次重新運(yùn)行程序种樱,變量又被初始化為'Bob'
蒙袍。
我們把變量從內(nèi)存中變成可存儲(chǔ)或傳輸?shù)倪^程稱之為序列化,在Python中叫pickling嫩挤,在其他語言中也被稱之為serialization害幅,marshalling,flattening等等岂昭,都是一個(gè)意思矫限。
序列化之后,就可以把序列化后的內(nèi)容寫入磁盤,或者通過網(wǎng)絡(luò)傳輸?shù)絼e的機(jī)器上叼风。
反過來,把變量?jī)?nèi)容從序列化的對(duì)象重新讀到內(nèi)存里稱之為反序列化棍苹,即unpickling无宿。
Python提供了pickle
模塊來實(shí)現(xiàn)序列化。
首先枢里,我們嘗試把一個(gè)對(duì)象序列化并寫入文件:
>>> import pickle
>>> d = dict(name='Bob', age=20, score=88)
>>> pickle.dumps(d)
b'\x80\x03}q\x00(X\x03\x00\x00\x00ageq\x01K\x14X\x05\x00\x00\x00scoreq\x02KXX\x04\x00\x00\x00nameq\x03X\x03\x00\x00\x00Bobq\x04u.'
pickle.dumps()
方法把任意對(duì)象序列化成一個(gè)bytes
孽鸡,然后,就可以把這個(gè)bytes
寫入文件栏豺”蚣睿或者用另一個(gè)方法pickle.dump()
直接把對(duì)象序列化后寫入一個(gè)file-like Object:
>>> f = open('dump.txt', 'wb')
>>> pickle.dump(d, f)
>>> f.close()
看看寫入的dump.txt
文件,一堆亂七八糟的內(nèi)容奥洼,這些都是Python保存的對(duì)象內(nèi)部信息巷疼。
當(dāng)我們要把對(duì)象從磁盤讀到內(nèi)存時(shí),可以先把內(nèi)容讀到一個(gè)bytes
灵奖,然后用pickle.loads()
方法反序列化出對(duì)象嚼沿,也可以直接用pickle.load()
方法從一個(gè)file-like Object
中直接反序列化出對(duì)象。我們打開另一個(gè)Python命令行來反序列化剛才保存的對(duì)象:
>>> f = open('dump.txt', 'rb')
>>> d = pickle.load(f)
>>> f.close()
>>> d
{'age': 20, 'score': 88, 'name': 'Bob'}
變量的內(nèi)容又回來了瓷患!
當(dāng)然骡尽,這個(gè)變量和原來的變量是完全不相干的對(duì)象,它們只是內(nèi)容相同而已擅编。
Pickle的問題和所有其他編程語言特有的序列化問題一樣攀细,就是它只能用于Python,并且可能不同版本的Python彼此都不兼容爱态,因此谭贪,只能用Pickle保存那些不重要的數(shù)據(jù),不能成功地反序列化也沒關(guān)系肢藐。
JSON
如果我們要在不同的編程語言之間傳遞對(duì)象故河,就必須把對(duì)象序列化為標(biāo)準(zhǔn)格式,比如XML吆豹,但更好的方法是序列化為JSON鱼的,因?yàn)镴SON表示出來就是一個(gè)字符串,可以被所有語言讀取痘煤,也可以方便地存儲(chǔ)到磁盤或者通過網(wǎng)絡(luò)傳輸凑阶。JSON不僅是標(biāo)準(zhǔn)格式,并且比XML更快衷快,而且可以直接在Web頁面中讀取宙橱,非常方便。
JSON表示的對(duì)象就是標(biāo)準(zhǔn)的JavaScript語言的對(duì)象,JSON和Python內(nèi)置的數(shù)據(jù)類型對(duì)應(yīng)如下:
JSON類型 | Python類型 |
---|---|
{} | dict |
[] | list |
"string" | str |
1234.56 | int或float |
true/false | True/False |
null | None |
Python內(nèi)置的json
模塊提供了非常完善的Python對(duì)象到JSON格式的轉(zhuǎn)換师郑。我們先看看如何把Python對(duì)象變成一個(gè)JSON:
>>> import json
>>> d = dict(name='Bob', age=20, score=88)
>>> json.dumps(d)
'{"age": 20, "score": 88, "name": "Bob"}'
dumps()
方法返回一個(gè)str
环葵,內(nèi)容就是標(biāo)準(zhǔn)的JSON。類似的宝冕,dump()
方法可以直接把JSON寫入一個(gè)file-like Object
张遭。
要把JSON反序列化為Python對(duì)象,用loads()
或者對(duì)應(yīng)的load()
方法地梨,前者把JSON的字符串反序列化菊卷,后者從file-like Object
中讀取字符串并反序列化:
>>> json_str = '{"age": 20, "score": 88, "name": "Bob"}'
>>> json.loads(json_str)
{'age': 20, 'score': 88, 'name': 'Bob'}
由于JSON標(biāo)準(zhǔn)規(guī)定JSON編碼是UTF-8,所以我們總是能正確地在Python的str
與JSON的字符串之間轉(zhuǎn)換宝剖。
JSON進(jìn)階
Python的dict
對(duì)象可以直接序列化為JSON的{}
洁闰,不過,很多時(shí)候万细,我們更喜歡用class
表示對(duì)象扑眉,比如定義Student
類,然后序列化:
import json
class Student(object):
def __init__(self, name, age, score):
self.name = name
self.age = age
self.score = score
s = Student('Bob', 20, 88)
print(json.dumps(s))
運(yùn)行代碼雅镊,毫不留情地得到一個(gè)TypeError
:
Traceback (most recent call last):
...
TypeError: <__main__.Student object at 0x10603cc50> is not JSON serializable
錯(cuò)誤的原因是Student
對(duì)象不是一個(gè)可序列化為JSON的對(duì)象襟雷。
如果連class
的實(shí)例對(duì)象都無法序列化為JSON,這肯定不合理仁烹!
別急耸弄,我們仔細(xì)看看dumps()
方法的參數(shù)列表,可以發(fā)現(xiàn)卓缰,除了第一個(gè)必須的obj
參數(shù)外计呈,dumps()
方法還提供了一大堆的可選參數(shù):
https://docs.python.org/3/library/json.html#json.dumps
這些可選參數(shù)就是讓我們來定制JSON序列化。前面的代碼之所以無法把Student
類實(shí)例序列化為JSON征唬,是因?yàn)槟J(rèn)情況下捌显,dumps()
方法不知道如何將Student
實(shí)例變?yōu)橐粋€(gè)JSON的{}
對(duì)象。
可選參數(shù)default
就是把任意一個(gè)對(duì)象變成一個(gè)可序列為JSON的對(duì)象总寒,我們只需要為Student
專門寫一個(gè)轉(zhuǎn)換函數(shù)扶歪,再把函數(shù)傳進(jìn)去即可:
def student2dict(std):
return {
'name': std.name,
'age': std.age,
'score': std.score
}
這樣,Student
實(shí)例首先被student2dict()
函數(shù)轉(zhuǎn)換成dict
摄闸,然后再被順利序列化為JSON:
>>> print(json.dumps(s, default=student2dict))
{"age": 20, "name": "Bob", "score": 88}
不過善镰,下次如果遇到一個(gè)Teacher
類的實(shí)例,照樣無法序列化為JSON年枕。我們可以偷個(gè)懶炫欺,把任意class
的實(shí)例變?yōu)?code>dict:
print(json.dumps(s, default=lambda obj: obj.__dict__))
因?yàn)橥ǔ?code>class的實(shí)例都有一個(gè)__dict__
屬性,它就是一個(gè)dict
熏兄,用來存儲(chǔ)實(shí)例變量品洛。也有少數(shù)例外树姨,比如定義了__slots__
的class。
同樣的道理桥状,如果我們要把JSON反序列化為一個(gè)Student
對(duì)象實(shí)例帽揪,loads()
方法首先轉(zhuǎn)換出一個(gè)dict
對(duì)象,然后辅斟,我們傳入的object_hook
函數(shù)負(fù)責(zé)把dict
轉(zhuǎn)換為Student
實(shí)例:
def dict2student(d):
return Student(d['name'], d['age'], d['score'])
運(yùn)行結(jié)果如下:
>>> json_str = '{"age": 20, "score": 88, "name": "Bob"}'
>>> print(json.loads(json_str, object_hook=dict2student))
<__main__.Student object at 0x10cd3c190>
打印出的是反序列化的Student
實(shí)例對(duì)象台丛。
聲明:原文來自廖雪峰官方網(wǎng)站.