操作文件目錄及序列化

如果我們要操作文件蔽午、目錄樟遣，可以在命令行下面輸入操作系統(tǒng)提供的各種命令來完成雕憔。比如dir姿骏、cp等命令。

如果要在Python程序中執(zhí)行這些目錄和文件的操作怎么辦斤彼？其實(shí)操作系統(tǒng)提供的命令只是簡(jiǎn)單地調(diào)用了操作系統(tǒng)提供的接口函數(shù)分瘦，Python內(nèi)置的os模塊也可以直接調(diào)用操作系統(tǒng)提供的接口函數(shù)。

打開Python交互式命令行琉苇，我們來看看如何使用os模塊的基本功能：

>>> import os
>>> os.name # 操作系統(tǒng)類型
'posix'

如果是posix嘲玫，說明系統(tǒng)是Linux、Unix或Mac OS X翁潘，如果是nt趁冈，就是Windows系統(tǒng)。

要獲取詳細(xì)的系統(tǒng)信息拜马，可以調(diào)用uname()函數(shù)：

>>> os.uname()
posix.uname_result(sysname='Darwin', nodename='MichaelMacPro.local', release='14.3.0', version='Darwin Kernel Version 14.3.0: Mon Mar 23 11:59:05 PDT 2015; root:xnu-2782.20.48~5/RELEASE_X86_64', machine='x86_64')

注意uname()函數(shù)在Windows上不提供渗勘，也就是說，os模塊的某些函數(shù)是跟操作系統(tǒng)相關(guān)的俩莽。

環(huán)境變量

在操作系統(tǒng)中定義的環(huán)境變量旺坠，全部保存在os.environ這個(gè)變量中，可以直接查看：

>>> os.environ
environ({'VERSIONER_PYTHON_PREFER_32_BIT': 'no', 'TERM_PROGRAM_VERSION': '326', 'LOGNAME': 'michael', 'USER': 'michael', 'PATH': '/usr/bin:/bin:/usr/sbin:/sbin:/usr/local/bin:/opt/X11/bin:/usr/local/mysql/bin', ...})

要獲取某個(gè)環(huán)境變量的值扮超，可以調(diào)用os.environ.get('key')：

>>> os.environ.get('PATH')
'/usr/bin:/bin:/usr/sbin:/sbin:/usr/local/bin:/opt/X11/bin:/usr/local/mysql/bin'
>>> os.environ.get('x', 'default')
'default'

操作文件和目錄

操作文件和目錄的函數(shù)一部分放在os模塊中取刃，一部分放在os.path模塊中，這一點(diǎn)要注意一下出刷。查看璧疗、創(chuàng)建和刪除目錄可以這么調(diào)用：

# 查看當(dāng)前目錄的絕對(duì)路徑:
>>> os.path.abspath('.')
'/Users/michael'
# 在某個(gè)目錄下創(chuàng)建一個(gè)新目錄，首先把新目錄的完整路徑表示出來:
>>> os.path.join('/Users/michael', 'testdir')
'/Users/michael/testdir'
# 然后創(chuàng)建一個(gè)目錄:
>>> os.mkdir('/Users/michael/testdir')
# 刪掉一個(gè)目錄:
>>> os.rmdir('/Users/michael/testdir')

把兩個(gè)路徑合成一個(gè)時(shí)馁龟，不要直接拼字符串崩侠，而要通過os.path.join()函數(shù)，這樣可以正確處理不同操作系統(tǒng)的路徑分隔符坷檩。在Linux/Unix/Mac下却音，os.path.join()返回這樣的字符串：

part-1/part-2

而Windows下會(huì)返回這樣的字符串：

part-1\part-2

同樣的道理改抡，要拆分路徑時(shí)，也不要直接去拆字符串系瓢，而要通過os.path.split()函數(shù)阿纤，這樣可以把一個(gè)路徑拆分為兩部分贯莺，后一部分總是最后級(jí)別的目錄或文件名：

>>> os.path.split('/Users/michael/testdir/file.txt')
('/Users/michael/testdir', 'file.txt')

os.path.splitext()可以直接讓你得到文件擴(kuò)展名喉恋，很多時(shí)候非常方便：

>>> os.path.splitext('/path/to/file.txt')
('/path/to/file', '.txt')

這些合并、拆分路徑的函數(shù)并不要求目錄和文件要真實(shí)存在鹤啡，它們只對(duì)字符串進(jìn)行操作肌稻。

文件操作使用下面的函數(shù)清蚀。假定當(dāng)前目錄下有一個(gè)test.txt文件：

# 對(duì)文件重命名:
>>> os.rename('test.txt', 'test.py')
# 刪掉文件:
>>> os.remove('test.py')

但是復(fù)制文件的函數(shù)居然在os模塊中不存在！原因是復(fù)制文件并非由操作系統(tǒng)提供的系統(tǒng)調(diào)用爹谭。理論上講枷邪，我們通過上一節(jié)的讀寫文件可以完成文件復(fù)制，只不過要多寫很多代碼诺凡。

幸運(yùn)的是shutil模塊提供了copyfile()的函數(shù)东揣，你還可以在shutil模塊中找到很多實(shí)用函數(shù)，它們可以看做是os模塊的補(bǔ)充腹泌。

最后看看如何利用Python的特性來過濾文件嘶卧。比如我們要列出當(dāng)前目錄下的所有目錄，只需要一行代碼：

>>> [x for x in os.listdir('.') if os.path.isdir(x)]
['.lein', '.local', '.m2', '.npm', '.ssh', '.Trash', '.vim', 'Applications', 'Desktop', ...]

要列出所有的.py文件凉袱，也只需一行代碼：

>>> [x for x in os.listdir('.') if os.path.isfile(x) and os.path.splitext(x)[1]=='.py']
['apis.py', 'config.py', 'models.py', 'pymonitor.py', 'test_db.py', 'urls.py', 'wsgiapp.py']

序列化

在程序運(yùn)行的過程中芥吟，所有的變量都是在內(nèi)存中，比如专甩，定義一個(gè)dict：

d = dict(name='Bob', age=20, score=88)

可以隨時(shí)修改變量钟鸵，比如把name改成'Bill'，但是一旦程序結(jié)束涤躲，變量所占用的內(nèi)存就被操作系統(tǒng)全部回收棺耍。如果沒有把修改后的'Bill'存儲(chǔ)到磁盤上，下次重新運(yùn)行程序种樱，變量又被初始化為'Bob'蒙袍。

我們把變量從內(nèi)存中變成可存儲(chǔ)或傳輸?shù)倪^程稱之為序列化，在Python中叫pickling嫩挤，在其他語言中也被稱之為serialization害幅，marshalling，flattening等等岂昭，都是一個(gè)意思矫限。

序列化之后，就可以把序列化后的內(nèi)容寫入磁盤，或者通過網(wǎng)絡(luò)傳輸?shù)絼e的機(jī)器上叼风。

反過來，把變量?jī)?nèi)容從序列化的對(duì)象重新讀到內(nèi)存里稱之為反序列化棍苹，即unpickling无宿。

Python提供了pickle模塊來實(shí)現(xiàn)序列化。

首先枢里，我們嘗試把一個(gè)對(duì)象序列化并寫入文件：

>>> import pickle
>>> d = dict(name='Bob', age=20, score=88)
>>> pickle.dumps(d)
b'\x80\x03}q\x00(X\x03\x00\x00\x00ageq\x01K\x14X\x05\x00\x00\x00scoreq\x02KXX\x04\x00\x00\x00nameq\x03X\x03\x00\x00\x00Bobq\x04u.'

pickle.dumps()方法把任意對(duì)象序列化成一個(gè)bytes孽鸡，然后，就可以把這個(gè)bytes寫入文件栏豺”蚣睿或者用另一個(gè)方法pickle.dump()直接把對(duì)象序列化后寫入一個(gè)file-like Object：

>>> f = open('dump.txt', 'wb')
>>> pickle.dump(d, f)
>>> f.close()

看看寫入的dump.txt文件，一堆亂七八糟的內(nèi)容奥洼，這些都是Python保存的對(duì)象內(nèi)部信息巷疼。

當(dāng)我們要把對(duì)象從磁盤讀到內(nèi)存時(shí)，可以先把內(nèi)容讀到一個(gè)bytes灵奖，然后用pickle.loads()方法反序列化出對(duì)象嚼沿，也可以直接用pickle.load()方法從一個(gè)file-like Object中直接反序列化出對(duì)象。我們打開另一個(gè)Python命令行來反序列化剛才保存的對(duì)象：

>>> f = open('dump.txt', 'rb')
>>> d = pickle.load(f)
>>> f.close()
>>> d
{'age': 20, 'score': 88, 'name': 'Bob'}

變量的內(nèi)容又回來了瓷患！

當(dāng)然骡尽，這個(gè)變量和原來的變量是完全不相干的對(duì)象，它們只是內(nèi)容相同而已擅编。

Pickle的問題和所有其他編程語言特有的序列化問題一樣攀细，就是它只能用于Python，并且可能不同版本的Python彼此都不兼容爱态，因此谭贪，只能用Pickle保存那些不重要的數(shù)據(jù)，不能成功地反序列化也沒關(guān)系肢藐。

JSON

如果我們要在不同的編程語言之間傳遞對(duì)象故河，就必須把對(duì)象序列化為標(biāo)準(zhǔn)格式，比如XML吆豹，但更好的方法是序列化為JSON鱼的，因?yàn)镴SON表示出來就是一個(gè)字符串，可以被所有語言讀取痘煤，也可以方便地存儲(chǔ)到磁盤或者通過網(wǎng)絡(luò)傳輸凑阶。JSON不僅是標(biāo)準(zhǔn)格式，并且比XML更快衷快，而且可以直接在Web頁面中讀取宙橱，非常方便。

JSON表示的對(duì)象就是標(biāo)準(zhǔn)的JavaScript語言的對(duì)象，JSON和Python內(nèi)置的數(shù)據(jù)類型對(duì)應(yīng)如下：

JSON類型	Python類型
{}	dict
[]	list
"string"	str
1234.56	int或float
true/false	True/False
null	None

Python內(nèi)置的json模塊提供了非常完善的Python對(duì)象到JSON格式的轉(zhuǎn)換师郑。我們先看看如何把Python對(duì)象變成一個(gè)JSON：

>>> import json
>>> d = dict(name='Bob', age=20, score=88)
>>> json.dumps(d)
'{"age": 20, "score": 88, "name": "Bob"}'

dumps()方法返回一個(gè)str环葵，內(nèi)容就是標(biāo)準(zhǔn)的JSON。類似的宝冕，dump()方法可以直接把JSON寫入一個(gè)file-like Object张遭。

要把JSON反序列化為Python對(duì)象，用loads()或者對(duì)應(yīng)的load()方法地梨，前者把JSON的字符串反序列化菊卷，后者從file-like Object中讀取字符串并反序列化：

>>> json_str = '{"age": 20, "score": 88, "name": "Bob"}'
>>> json.loads(json_str)
{'age': 20, 'score': 88, 'name': 'Bob'}

由于JSON標(biāo)準(zhǔn)規(guī)定JSON編碼是UTF-8，所以我們總是能正確地在Python的str與JSON的字符串之間轉(zhuǎn)換宝剖。

JSON進(jìn)階

Python的dict對(duì)象可以直接序列化為JSON的{}洁闰，不過，很多時(shí)候万细，我們更喜歡用class表示對(duì)象扑眉，比如定義Student類，然后序列化：

import json

class Student(object):
    def __init__(self, name, age, score):
        self.name = name
        self.age = age
        self.score = score

s = Student('Bob', 20, 88)
print(json.dumps(s))

運(yùn)行代碼雅镊，毫不留情地得到一個(gè)TypeError：

Traceback (most recent call last):
  ...
TypeError: <__main__.Student object at 0x10603cc50> is not JSON serializable

錯(cuò)誤的原因是Student對(duì)象不是一個(gè)可序列化為JSON的對(duì)象襟雷。

如果連class的實(shí)例對(duì)象都無法序列化為JSON，這肯定不合理仁烹！

別急耸弄，我們仔細(xì)看看dumps()方法的參數(shù)列表，可以發(fā)現(xiàn)卓缰，除了第一個(gè)必須的obj參數(shù)外计呈，dumps()方法還提供了一大堆的可選參數(shù)：

https://docs.python.org/3/library/json.html#json.dumps

這些可選參數(shù)就是讓我們來定制JSON序列化。前面的代碼之所以無法把Student類實(shí)例序列化為JSON征唬，是因?yàn)槟J(rèn)情況下捌显，dumps()方法不知道如何將Student實(shí)例變?yōu)橐粋€(gè)JSON的{}對(duì)象。

可選參數(shù)default就是把任意一個(gè)對(duì)象變成一個(gè)可序列為JSON的對(duì)象总寒，我們只需要為Student專門寫一個(gè)轉(zhuǎn)換函數(shù)扶歪，再把函數(shù)傳進(jìn)去即可：

def student2dict(std):
    return {
        'name': std.name,
        'age': std.age,
        'score': std.score
    }

這樣，Student實(shí)例首先被student2dict()函數(shù)轉(zhuǎn)換成dict摄闸，然后再被順利序列化為JSON：

>>> print(json.dumps(s, default=student2dict))
{"age": 20, "name": "Bob", "score": 88}

不過善镰，下次如果遇到一個(gè)Teacher類的實(shí)例，照樣無法序列化為JSON年枕。我們可以偷個(gè)懶炫欺，把任意class的實(shí)例變?yōu)?code>dict：

print(json.dumps(s, default=lambda obj: obj.__dict__))

因?yàn)橥ǔ?code>class的實(shí)例都有一個(gè)__dict__屬性，它就是一個(gè)dict熏兄，用來存儲(chǔ)實(shí)例變量品洛。也有少數(shù)例外树姨，比如定義了__slots__的class。

同樣的道理桥状，如果我們要把JSON反序列化為一個(gè)Student對(duì)象實(shí)例帽揪，loads()方法首先轉(zhuǎn)換出一個(gè)dict對(duì)象，然后辅斟，我們傳入的object_hook函數(shù)負(fù)責(zé)把dict轉(zhuǎn)換為Student實(shí)例：

def dict2student(d):
    return Student(d['name'], d['age'], d['score'])

運(yùn)行結(jié)果如下：

>>> json_str = '{"age": 20, "score": 88, "name": "Bob"}'
>>> print(json.loads(json_str, object_hook=dict2student))
<__main__.Student object at 0x10cd3c190>

打印出的是反序列化的Student實(shí)例對(duì)象台丛。

聲明:原文來自廖雪峰官方網(wǎng)站.

?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請(qǐng)聯(lián)系作者

人面猴
序言：七十年代末，一起剝皮案震驚了整個(gè)濱河市砾肺，隨后出現(xiàn)的幾起案子，更是在濱河造成了極大的恐慌防嗡，老刑警劉巖变汪，帶你破解...
沈念sama閱讀 218,858評(píng)論 6贊 508
死咒
序言：濱河連續(xù)發(fā)生了三起死亡事件，死亡現(xiàn)場(chǎng)離奇詭異蚁趁，居然都是意外死亡裙盾，警方通過查閱死者的電腦和手機(jī)，發(fā)現(xiàn)死者居然都...
沈念sama閱讀 93,372評(píng)論 3贊 395
救了他兩次的神仙讓他今天三更去死
文/潘曉璐我一進(jìn)店門他嫡，熙熙樓的掌柜王于貴愁眉苦臉地迎上來番官，“玉大人，你說我怎么就攤上這事钢属∨侨郏” “怎么了？”我有些...
開封第一講書人閱讀 165,282評(píng)論 0贊 356
道士緝兇錄：失蹤的賣姜人
文/不壞的土叔我叫張陵淆党，是天一觀的道長(zhǎng)酷师。經(jīng)常有香客問我，道長(zhǎng)染乌，這世上最難降的妖魔是什么山孔？我笑而不...
開封第一講書人閱讀 58,842評(píng)論 1贊 295
?港島之戀（遺憾婚禮）
正文為了忘掉前任，我火速辦了婚禮荷憋，結(jié)果婚禮上台颠，老公的妹妹穿的比我還像新娘。我一直安慰自己勒庄，他們只是感情好串前，可當(dāng)我...
茶點(diǎn)故事閱讀 67,857評(píng)論 6贊 392
惡毒庶女頂嫁案：這布局不是一般人想出來的
文/花漫我一把揭開白布。她就那樣靜靜地躺著锅铅，像睡著了一般酪呻。火紅的嫁衣襯著肌膚如雪。梳的紋絲不亂的頭發(fā)上盐须，一...
開封第一講書人閱讀 51,679評(píng)論 1贊 305
城市分裂傳說
那天玩荠，我揣著相機(jī)與錄音，去河邊找鬼。笑死阶冈，一個(gè)胖子當(dāng)著我的面吹牛闷尿，可吹牛的內(nèi)容都是我干的。我是一名探鬼主播女坑，決...
沈念sama閱讀 40,406評(píng)論 3贊 418
雙鴛鴦連環(huán)套：你想象不到人心有多黑
文/蒼蘭香墨我猛地睜開眼填具，長(zhǎng)吁一口氣：“原來是場(chǎng)噩夢(mèng)啊……” “哼！你這毒婦竟也來了匆骗？” 一聲冷哼從身側(cè)響起劳景，我...
開封第一講書人閱讀 39,311評(píng)論 0贊 276
萬榮殺人案實(shí)錄
序言：老撾萬榮一對(duì)情侶失蹤，失蹤者是張志新（化名）和其女友劉穎碉就，沒想到半個(gè)月后盟广，有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體，經(jīng)...
沈念sama閱讀 45,767評(píng)論 1贊 315
?護(hù)林員之死
正文獨(dú)居荒郊野嶺守林人離奇死亡瓮钥，尸身上長(zhǎng)有42處帶血的膿包…… 初始之章·張勛以下內(nèi)容為張勛視角年9月15日...
茶點(diǎn)故事閱讀 37,945評(píng)論 3贊 336
?白月光啟示錄
正文我和宋清朗相戀三年筋量，在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了。大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片碉熄。...
茶點(diǎn)故事閱讀 40,090評(píng)論 1贊 350
活死人
序言：一個(gè)原本活蹦亂跳的男人離奇死亡桨武，死狀恐怖，靈堂內(nèi)的尸體忽然破棺而出锈津，到底是詐尸還是另有隱情呀酸，我是刑警寧澤，帶...
沈念sama閱讀 35,785評(píng)論 5贊 346
?日本核電站爆炸內(nèi)幕
正文年R本政府宣布一姿，位于F島的核電站七咧，受9級(jí)特大地震影響，放射性物質(zhì)發(fā)生泄漏叮叹。R本人自食惡果不足惜艾栋，卻給世界環(huán)境...
茶點(diǎn)故事閱讀 41,420評(píng)論 3贊 331
男人毒藥：我在死后第九天來索命
文/蒙蒙一、第九天我趴在偏房一處隱蔽的房頂上張望蛉顽。院中可真熱鬧蝗砾，春花似錦、人聲如沸携冤。這莊子的主人今日做“春日...
開封第一講書人閱讀 31,988評(píng)論 0贊 22
一樁弒父案，背后竟有這般陰謀
文/蒼蘭香墨我抬頭看了看天上的太陽曾棕。三九已至扣猫，卻和暖如春，著一層夾襖步出監(jiān)牢的瞬間翘地，已是汗流浹背申尤。一陣腳步聲響...
開封第一講書人閱讀 33,101評(píng)論 1贊 271
情欲美人皮
我被黑心中介騙來泰國(guó)打工癌幕，沒想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留，地道東北人昧穿。一個(gè)月前我還...
沈念sama閱讀 48,298評(píng)論 3贊 372
代替公主和親
正文我出身青樓勺远，卻偏偏與公主長(zhǎng)得像，于是被迫代替她去往敵國(guó)和親时鸵。傳聞我的和親對(duì)象是個(gè)殘疾皇子胶逢，可洞房花燭夜當(dāng)晚...
茶點(diǎn)故事閱讀 45,033評(píng)論 2贊 355

操作文件目錄及序列化

環(huán)境變量

操作文件和目錄

序列化

JSON

JSON進(jìn)階

推薦閱讀更多精彩內(nèi)容