記錄一次Python批量處理doc文件

起因

團委要求寫團員登記表晋控,大家填完匯聚后的幾天因為有些人不合格所以決定全班各自打印自己的表格檩帐,所以把全班的登記表都上傳到群里患久,感覺很可怕,決定分析一下數(shù)據(jù)

方案

  1. 將doc轉(zhuǎn)換txt
  2. 逐行讀取txt文件
  3. 通過比對關(guān)鍵詞示启,發(fā)現(xiàn)關(guān)鍵詞就把當(dāng)前行寫入?yún)R總的文件

準(zhǔn)備

win32com

網(wǎng)上找資料時發(fā)現(xiàn)如果你處理的doc文件是docx的話兢哭,你可以直接用python-docx但是我發(fā)現(xiàn)都是doc,所以沒啥用
看到v2ex有人說用unoconv弄了半天夫嗓,發(fā)現(xiàn)是在*nix的系統(tǒng)下的東西迟螺,我用的是win10所以也沒啥用
最后找到win32com這個詭異的名字,然后弄了半天舍咖,硬是不知道怎么下矩父,后來發(fā)現(xiàn)是Python for Windows Extensions簡寫pywin32下完包就可以importwin32com
基本轉(zhuǎn)換方式

from win32com import client
word = wc.Dispatch('Word.Application')
doc = word.Documents.Open('e:\test\38.doc')
doc.SaveAs('e:\test\38.txt', 2)
doc.Close()
word.Quit()

可以轉(zhuǎn)換成多種格式保存

wdFormatDocument =  0
wdFormatDocument97 =  0
wdFormatDocumentDefault = 16
wdFormatDOSText =  4
wdFormatDOSTextLineBreaks =  5
wdFormatEncodedText =  7
wdFormatFilteredHTML = 10
wdFormatFlatXML = 19
wdFormatFlatXMLMacroEnabled = 20
wdFormatFlatXMLTemplate = 21
wdFormatFlatXMLTemplateMacroEnabled = 22
wdFormatHTML =  8
wdFormatPDF = 17
wdFormatRTF =  6
wdFormatTemplate =  1
wdFormatTemplate97 =  1
wdFormatText =  2
wdFormatTextLineBreaks =  3
wdFormatUnicodeText =  7
wdFormatWebArchive  =  9
wdFormatXML = 11
wdFormatXMLDocument  = 12
wdFormatXMLDocumentMacroEnabled = 13
wdFormatXMLTemplate  = 14
wdFormatXMLTemplateMacroEnabled = 15
wdFormatXPS = 18

相關(guān)的文件處理

文件操作

開始寫的時候,發(fā)現(xiàn)對關(guān)于文件的操作都忘了差不多了排霉,又要重新去Google了下窍株,需要對獲取當(dāng)前目前了所有文件,和獲取當(dāng)前路徑郑诺,找到發(fā)現(xiàn)都是在os包里
os包
os.sep 可以取代操作系統(tǒng)特定的路徑分割符夹姥。
os.name 字符串指示你正在使用的平臺杉武。比如對于 Windows辙诞,它是'nt',而對于 Linux/Unix 用戶轻抱,它是'posix'飞涂。
os.getcwd() 函數(shù)得到當(dāng)前工作目錄,即當(dāng)前 Python 腳本工作的目錄路徑祈搜。
os.getenv() 和 os.putenv() 函數(shù)分別用來讀取和設(shè)置環(huán)境變量较店。
os.remove() 函數(shù)用來刪除一個文件。
os.system() 函數(shù)用來運行 shell 命令容燕。
os.linesep 字符串給出當(dāng)前平臺使用的行終止符梁呈。例如,Windows 使用'\r\n'蘸秘,Linux 使用'\n'而 Mac 使用'\r'官卡。
os.path.split() 函數(shù)返回一個路徑的目錄名和文件名。
os.path.isfile() 和 os.path.isdir() 函數(shù)分別檢驗給出的路徑是一個文件還是目錄醋虏。
os.listdir(dirname):列出 dirname 下的目錄和文件
os.curdir: 返回但前目錄('.')
os.chdir(dirname): 改變工作目錄到 dirname
os.path.isdir(name): 判斷 name 是不是一個目錄寻咒,name 不是目錄就返回 false
os.path.isfile(name): 判斷 name 是不是一個文件,不存在 name 也返回 false
os.path.exists(name): 判斷是否存在文件或目錄 name
os.path.getsize(name): 獲得文件大小颈嚼,如果 name 是目錄返回 0L
os.path.abspath(name): 獲得絕對路徑
os.path.normpath(path): 規(guī)范 path 字符串形式
os.path.split(name): 分割文件名與目錄(事實上毛秘,如果你完全使用目錄,它也會將最后一個目錄作為文件名而分離,同時它不會判斷文件或目錄是否存在)
os.path.splitext(): 分離文件名與擴展名
os.path.join(path,name): 連接目錄與文件名或目錄
os.path.basename(path): 返回文件名
os.path.dirname(path): 返回文件路徑

字符串操作

我還需要的操作是如果關(guān)鍵詞出現(xiàn)的就把它寫入新的文件叫挟,再StackOverflow里找到了一個方法any()

any() 函數(shù)用于判斷給定的可迭代參數(shù) iterable 是否全部為空對象艰匙,如果都為空、0抹恳、false旬薯,則返回 False,如果不都為空适秩、0绊序、false,則返回 True秽荞。

StackOverflow里的方法是

if any(x in str for x in a):

如果有一個是true就返回true
一切就緒就開始處理了

開始處理

整個代碼

from win32com import client
import os
word = client.Dispatch("Word.Application")
files = os.listdir(".");
key_word=["姓  名" , "籍  貫","居民","現(xiàn)居","省","市","父親","母親","姐姐","弟弟","群眾","黨員","就讀","小學(xué)","中學(xué)","學(xué)院"]
wf = open("all.txt","a")


for file_name in os.listdir("."):
    print("open",os.getcwd() +"\\" + file_name)
    if not (file_name.endswith("doc")):
        print("pass")
        continue
    doc = word.Documents.Open(os.getcwd()+"\\" + file_name)
    file_path = os.getcwd()+ file_name[0:file_name.index("附件3")]+".txt"
    doc.SaveAs(file_path,2)
    with open(file_path,"r") as f:
        for line in f.readlines():
            if any(x for x in key_word if x in line):
                wf.write(line)
        wf.write("------------------------------------------------\n")
doc.Close()
word.Quit()

最后的成果


口怕

引用

http://blog.csdn.net/pipisorry/article/details/50368044
http://www.cnblogs.com/rollenholt/archive/2012/04/23/2466179.html
https://stackoverflow.com/questions/3389574/check-if-multiple-strings-exist-in-another-string
http://www.runoob.com/python/python-func-any.html

最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者
  • 序言:七十年代末骤公,一起剝皮案震驚了整個濱河市码党,隨后出現(xiàn)的幾起案子仁堪,更是在濱河造成了極大的恐慌,老刑警劉巖释簿,帶你破解...
    沈念sama閱讀 217,657評論 6 505
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件钦听,死亡現(xiàn)場離奇詭異洒试,居然都是意外死亡,警方通過查閱死者的電腦和手機朴上,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 92,889評論 3 394
  • 文/潘曉璐 我一進店門垒棋,熙熙樓的掌柜王于貴愁眉苦臉地迎上來,“玉大人痪宰,你說我怎么就攤上這事叼架。” “怎么了衣撬?”我有些...
    開封第一講書人閱讀 164,057評論 0 354
  • 文/不壞的土叔 我叫張陵乖订,是天一觀的道長。 經(jīng)常有香客問我具练,道長乍构,這世上最難降的妖魔是什么? 我笑而不...
    開封第一講書人閱讀 58,509評論 1 293
  • 正文 為了忘掉前任扛点,我火速辦了婚禮哥遮,結(jié)果婚禮上,老公的妹妹穿的比我還像新娘占键。我一直安慰自己昔善,他們只是感情好,可當(dāng)我...
    茶點故事閱讀 67,562評論 6 392
  • 文/花漫 我一把揭開白布畔乙。 她就那樣靜靜地躺著君仆,像睡著了一般。 火紅的嫁衣襯著肌膚如雪。 梳的紋絲不亂的頭發(fā)上返咱,一...
    開封第一講書人閱讀 51,443評論 1 302
  • 那天钥庇,我揣著相機與錄音,去河邊找鬼咖摹。 笑死评姨,一個胖子當(dāng)著我的面吹牛,可吹牛的內(nèi)容都是我干的萤晴。 我是一名探鬼主播吐句,決...
    沈念sama閱讀 40,251評論 3 418
  • 文/蒼蘭香墨 我猛地睜開眼,長吁一口氣:“原來是場噩夢啊……” “哼店读!你這毒婦竟也來了嗦枢?” 一聲冷哼從身側(cè)響起,我...
    開封第一講書人閱讀 39,129評論 0 276
  • 序言:老撾萬榮一對情侶失蹤屯断,失蹤者是張志新(化名)和其女友劉穎文虏,沒想到半個月后,有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體殖演,經(jīng)...
    沈念sama閱讀 45,561評論 1 314
  • 正文 獨居荒郊野嶺守林人離奇死亡氧秘,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點故事閱讀 37,779評論 3 335
  • 正文 我和宋清朗相戀三年,在試婚紗的時候發(fā)現(xiàn)自己被綠了趴久。 大學(xué)時的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片丸相。...
    茶點故事閱讀 39,902評論 1 348
  • 序言:一個原本活蹦亂跳的男人離奇死亡,死狀恐怖朋鞍,靈堂內(nèi)的尸體忽然破棺而出已添,到底是詐尸還是另有隱情,我是刑警寧澤滥酥,帶...
    沈念sama閱讀 35,621評論 5 345
  • 正文 年R本政府宣布,位于F島的核電站畦幢,受9級特大地震影響坎吻,放射性物質(zhì)發(fā)生泄漏。R本人自食惡果不足惜宇葱,卻給世界環(huán)境...
    茶點故事閱讀 41,220評論 3 328
  • 文/蒙蒙 一瘦真、第九天 我趴在偏房一處隱蔽的房頂上張望。 院中可真熱鬧黍瞧,春花似錦诸尽、人聲如沸。這莊子的主人今日做“春日...
    開封第一講書人閱讀 31,838評論 0 22
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽。三九已至,卻和暖如春际看,著一層夾襖步出監(jiān)牢的瞬間咸产,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 32,971評論 1 269
  • 我被黑心中介騙來泰國打工仲闽, 沒想到剛下飛機就差點兒被人妖公主榨干…… 1. 我叫王不留脑溢,地道東北人。 一個月前我還...
    沈念sama閱讀 48,025評論 2 370
  • 正文 我出身青樓赖欣,卻偏偏與公主長得像屑彻,于是被迫代替她去往敵國和親。 傳聞我的和親對象是個殘疾皇子顶吮,可洞房花燭夜當(dāng)晚...
    茶點故事閱讀 44,843評論 2 354

推薦閱讀更多精彩內(nèi)容