大師兄的Python機器學習筆記:數(shù)據(jù)預處理

大師兄的Python機器學習筆記:Numpy庫耿战、Scipy庫和Matplotlib庫 (三)
大師兄的Python機器學習筆記:數(shù)據(jù)重抽樣

一禽作、獲得數(shù)據(jù)

  • 機器學習需要大量的真實數(shù)據(jù)碉熄,可以通過互聯(lián)網(wǎng)獲得直焙。
1. 關于Kaggle
  • Kaggle(https://www.kaggle.com/)成立于2010年祠斧,是一個進行數(shù)據(jù)發(fā)掘和預測競賽的在線平臺盹兢。
  • 通過Kaggle邻梆,我們可以獲得一些真實數(shù)據(jù)。
2. 下載數(shù)據(jù)
  • 例如绎秒,我們可以在 此處下載美國各縣的新冠肺炎數(shù)據(jù)浦妄。
3. 讀取數(shù)據(jù)
  • 由于數(shù)據(jù)基本都是.csv或者.json格式的,可以用python直接讀取。
import os
from pprint import pprint

def read_csv(file):
    # 讀取數(shù)據(jù)并轉(zhuǎn)換為list
    with open(file,'r') as f:
        return list(f.readlines())

if __name__ == '__main__':
    file_path = os.path.join('D:\\','dataset','us-counties.csv')
    data = read_csv(file_path)
    pprint(data) # 為了讓數(shù)據(jù)看起來更直觀剂娄,使用pprint
['date,county,state,fips,cases,deaths\n',
 '2020-01-21,Snohomish,Washington,53061,1,0\n',
 '2020-01-22,Snohomish,Washington,53061,1,0\n',
 '2020-01-23,Snohomish,Washington,53061,1,0\n',
 '2020-01-24,Cook,Illinois,17031,1,0\n',
 '2020-01-24,Snohomish,Washington,53061,1,0\n',
 '2020-01-25,Orange,California,06059,1,0\n',
 '2020-01-25,Cook,Illinois,17031,1,0\n',
 '2020-01-25,Snohomish,Washington,53061,1,0\n',
... ... (省略)
'2020-04-13,Teton,Wyoming,56039,56,0\n',
 '2020-04-13,Uinta,Wyoming,56041,4,0\n',
 '2020-04-13,Washakie,Wyoming,56043,4,0']

二蠢涝、判斷數(shù)據(jù)缺失

  • 為了保證結(jié)果的準確性,需要對缺失數(shù)據(jù)進行處理阅懦。
1. 篩選完整數(shù)據(jù)
  • 通過判斷跳過不完整的數(shù)據(jù)和二。
>>>import os
>>>from csv import reader
>>>from pprint import pprint

>>>def read_csv(file):
>>>    # 讀取數(shù)據(jù),跳過缺失的行或數(shù)據(jù)不完整的行 
>>>    dataset = []
    
>>>    with open(file,'r') as f:
>>>        lines = list(reader(f))
>>>        data_len = len(list(lines)[0]) # 獲取標題列的長度

>>>        for line in lines:
>>>            if line and len(line) == data_len: # 如果行為空或者數(shù)據(jù)不完整則跳過
>>>                dataset.append(line)
>>>        return dataset

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    pprint(data)
2. 判斷元素是否缺失**
  • 檢查每個元素是否有缺失的
>>>import os
>>>import pandas as pd
>>>from pprint import pprint

>>>def read_csv(file):
>>>    return pd.read_csv(file)

>>>def find_null(data):
>>>    return data.isnull()

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    pprint(find_null(data))
        date  county  state   fips  cases  deaths
0      False   False  False  False  False   False
1      False   False  False  False  False   False
2      False   False  False  False  False   False
3      False   False  False  False  False   False
4      False   False  False  False  False   False
...      ...     ...    ...    ...    ...     ...
56536  False   False  False  False  False   False
56537  False   False  False  False  False   False
56538  False   False  False  False  False   False
56539  False   False  False  False  False   False
56540  False   False  False  False  False   False

[56541 rows x 6 columns]
3. 判斷缺失列
  • 檢查每列是否包含缺失的元素耳胎。
>>>import os
>>>import pandas as pd
>>>from pprint import pprint

>>>def read_csv(file):
>>>    return pd.read_csv(file)

>>>def find_null_column(data):
>>>    return data.isnull().any()

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    pprint(find_null_column(data))
date      False
county    False
state     False
fips       True
cases     False
deaths    False
dtype: bool
4. 統(tǒng)計缺失元素
  • 統(tǒng)計每列缺失元素的數(shù)目惯吕。
>>>import os
>>>import pandas as pd
>>>from pprint import pprint

>>>def read_csv(file):
>>>    return pd.read_csv(file)

>>>def find_null_column(data):
>>>    return data.isnull().any()

>>>def count_null(data,null_column):
>>>    missing = data.columns[null_column].tolist()
>>>    return data[missing].isnull().sum()

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    null_column = find_null_column(data)
>>>    print(count_null(data,null_column))
fips    746
dtype: int64
5. 替換缺失值
  • 將缺失值替換為一個默認值。
>>>import os
>>>import pandas as pd
>>>from pprint import pprint

>>>def read_csv(file):
>>>    # 獲得文件中的數(shù)據(jù)
>>>    return pd.read_csv(file)

>>>def find_null_column(data):
>>>    # 返回所有包含空的列
>>>    return data.isnull().any()

>>>def get_null_column_name(null_column):
>>>    # 返回包含空列的列名
>>>    return data.columns[null_column].tolist()

>>>def replace_null(data,columns,value):
>>>    # 替換空值
>>>    for column in columns:
>>>        data.loc[data[column].isnull(),column] = value
>>>    return data

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    null_column_list = get_null_column_name(find_null_column(data)) # 獲得空列名
>>>    new_data = replace_null(data,null_column_list,0) # 將空數(shù)據(jù)替換為0
>>>    pprint(find_null_column(new_data))
date      False
county    False
state     False
fips      False
cases     False
deaths    False
dtype: bool
6. 缺失值比對
  • 判斷兩列的缺失值是否同時為空怕午,并獲得對比數(shù)據(jù)废登。
>>>import os
>>>import pandas as pd
>>>from pprint import pprint

>>>def read_csv(file):
>>>    # 獲得文件中的數(shù)據(jù)
>>>    return pd.read_csv(file)

>>>def compare_columns(col1,col2):
>>>    # 對比兩列的缺失值
>>>    res = data[[col1,col2]][data[col2].isnull()==True]
>>>    # 獲得對比數(shù)據(jù)
>>>    return res.describe()

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    pprint(compare_columns('state','fips'))
       fips
count   0.0
mean    NaN
std     NaN
min     NaN
25%     NaN
50%     NaN
75%     NaN
max     NaN

三. 數(shù)據(jù)類型轉(zhuǎn)換

  • 為了保障結(jié)果的統(tǒng)一性,需要盡量將數(shù)據(jù)類型轉(zhuǎn)換為浮點數(shù)(float)郁惜。
>>>import os
>>>import pandas as pd
>>>from pprint import pprint

>>>def read_csv(file):
>>>    # 獲得文件中的數(shù)據(jù)
>>>    return pd.read_csv(file)

>>>def to_float(data):
>>>    for column in data:
>>>        if column =='date':continue # 跳過日期
>>>        if str(data[column][1]).isdigit(): # 如果是數(shù)字
>>>            data[column] = data[column].astype('float') # 將列轉(zhuǎn)為浮點數(shù)
>>>    return data

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    print(to_float(data))
             date      county       state     fips  cases  deaths
0      2020-01-21   Snohomish  Washington  53061.0    1.0     0.0
1      2020-01-22   Snohomish  Washington  53061.0    1.0     0.0
2      2020-01-23   Snohomish  Washington  53061.0    1.0     0.0
3      2020-01-24        Cook    Illinois  17031.0    1.0     0.0
4      2020-01-24   Snohomish  Washington  53061.0    1.0     0.0
...           ...         ...         ...      ...    ...     ...
56536  2020-04-13    Sublette     Wyoming  56035.0    1.0     0.0
56537  2020-04-13  Sweetwater     Wyoming  56037.0    9.0     0.0
56538  2020-04-13       Teton     Wyoming  56039.0   56.0     0.0
56539  2020-04-13       Uinta     Wyoming  56041.0    4.0     0.0
56540  2020-04-13    Washakie     Wyoming  56043.0    4.0     0.0

[56541 rows x 6 columns]

四. 數(shù)據(jù)特征縮放

  • 為了保證數(shù)據(jù)的特征具有相近的尺度堡距,有時需要對數(shù)據(jù)進行特征縮放。
1. 歸一化(Rescaling)
  • 將所有特征縮放到0~1之間兆蕉,使梯度下降法能更快的收斂羽戒。
  • 公式x' = \frac{x-min}{max-min}
>>>import os
>>>import pandas as pd
>>>import numpy as np
>>>from pprint import pprint

>>>def read_csv(file):
>>>    # 獲得文件中的數(shù)據(jù)
>>>    return pd.read_csv(file)

>>>def to_float(data):
>>>    # 將數(shù)據(jù)改為浮點數(shù)
>>>    for column in data:
>>>        if column =='date':continue # 跳過日期
>>>        if str(data[column][1]).isdigit(): # 如果是數(shù)字
>>>            data[column] = data[column].astype('float') # 將列轉(zhuǎn)為浮點數(shù)
>>>    return data

>>>def min_max_normalization(data):
>>>    # 歸一化特征縮放
>>>    for column in data:
>>>        if column == 'date': continue  # 跳過日期
>>>        if isinstance(data[column][1],float):  # 如果是浮點數(shù)
>>>            x = data[column]
>>>            x = (x - np.min(x))/(np.max(x)-np.min(x))
>>>            data[column] = x
>>>    return data

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    pprint(min_max_normalization(to_float(data)))
             date      county       state      fips     cases  deaths
0      2020-01-21   Snohomish  Washington  0.945823  0.000008     0.0
1      2020-01-22   Snohomish  Washington  0.945823  0.000008     0.0
2      2020-01-23   Snohomish  Washington  0.945823  0.000008     0.0
3      2020-01-24        Cook    Illinois  0.291232  0.000008     0.0
4      2020-01-24   Snohomish  Washington  0.945823  0.000008     0.0
...           ...         ...         ...       ...       ...     ...
61966  2020-04-15    Sublette     Wyoming  0.999855  0.000008     0.0
61967  2020-04-15  Sweetwater     Wyoming  0.999891  0.000085     0.0
61968  2020-04-15       Teton     Wyoming  0.999927  0.000499     0.0
61969  2020-04-15       Uinta     Wyoming  0.999964  0.000034     0.0
61970  2020-04-15    Washakie     Wyoming  1.000000  0.000034     0.0

[61971 rows x 6 columns]
2. 均值歸一化(Mean Normalization)
  • 歸一化的另一種方法,數(shù)據(jù)離平均值的距離虎韵。
  • 公式x' = \frac{x-average(x)}{max-min}
>>>import os
>>>import pandas as pd
>>>import numpy as np
>>>from pprint import pprint

>>>def read_csv(file):
>>>    # 獲得文件中的數(shù)據(jù)
>>>    return pd.read_csv(file)

>>>def to_float(data):
>>>    # 將數(shù)據(jù)改為浮點數(shù)
>>>    for column in data:
>>>        if column =='date':continue # 跳過日期
>>>        if str(data[column][1]).isdigit(): # 如果是數(shù)字
>>>            data[column] = data[column].astype('float') # 將列轉(zhuǎn)為浮點數(shù)
>>>    return data

>>>def mean_normalization(data):
>>>    # 均值歸一化特征縮放
>>>    for column in data:
>>>        if column == 'date': continue  # 跳過日期
>>>        if isinstance(data[column][1],float):  # 如果是浮點數(shù)
>>>            x = data[column]
>>>            x = (x - np.mean(x))/(np.max(x)-np.min(x))
>>>            data[column] = x
>>>    return data

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    pprint(mean_normalization(to_float(data)))
             date      county       state      fips     cases   deaths
0      2020-01-21   Snohomish  Washington  0.426211 -0.001020 -0.00049
1      2020-01-22   Snohomish  Washington  0.426211 -0.001020 -0.00049
2      2020-01-23   Snohomish  Washington  0.426211 -0.001020 -0.00049
3      2020-01-24        Cook    Illinois -0.228380 -0.001020 -0.00049
4      2020-01-24   Snohomish  Washington  0.426211 -0.001020 -0.00049
...           ...         ...         ...       ...       ...      ...
61966  2020-04-15    Sublette     Wyoming  0.480243 -0.001020 -0.00049
61967  2020-04-15  Sweetwater     Wyoming  0.480279 -0.000944 -0.00049
61968  2020-04-15       Teton     Wyoming  0.480315 -0.000530 -0.00049
61969  2020-04-15       Uinta     Wyoming  0.480352 -0.000995 -0.00049
61970  2020-04-15    Washakie     Wyoming  0.480388 -0.000995 -0.00049

[61971 rows x 6 columns]
3. 標準化(Standardlization)
  • 特征標準化使得數(shù)據(jù)中每個特征的值具有零均值和單位方差易稠。
  • 公式x' = \frac{x-\bar{x}}{\sigma}
>>>import os
>>>import pandas as pd
>>>import numpy as np
>>>from pprint import pprint

>>>def read_csv(file):
>>>    # 獲得文件中的數(shù)據(jù)
>>>    return pd.read_csv(file)

>>>def to_float(data):
>>>    # 將數(shù)據(jù)改為浮點數(shù)
>>>    for column in data:
>>>        if column =='date':continue # 跳過日期
>>>        if str(data[column][1]).isdigit(): # 如果是數(shù)字
>>>            data[column] = data[column].astype('float') # 將列轉(zhuǎn)為浮點數(shù)
>>>    return data

>>>def standardlization(data):
>>>    # 標準化
>>>    for column in data:
>>>        if column == 'date': continue  # 跳過日期
>>>        if isinstance(data[column][1],float):  # 如果是浮點數(shù)
>>>            x = data[column]
>>>            x = (x - np.mean(x))/(np.var(x))
>>>            data[column] = x
>>>    return data

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    pprint(standardlization(to_float(data)))
             date      county       state      fips     cases    deaths
0      2020-01-21   Snohomish  Washington  0.000097 -0.000052 -0.000585
1      2020-01-22   Snohomish  Washington  0.000097 -0.000052 -0.000585
2      2020-01-23   Snohomish  Washington  0.000097 -0.000052 -0.000585
3      2020-01-24        Cook    Illinois -0.000052 -0.000052 -0.000585
4      2020-01-24   Snohomish  Washington  0.000097 -0.000052 -0.000585
...           ...         ...         ...       ...       ...       ...
61966  2020-04-15    Sublette     Wyoming  0.000110 -0.000052 -0.000585
61967  2020-04-15  Sweetwater     Wyoming  0.000110 -0.000048 -0.000585
61968  2020-04-15       Teton     Wyoming  0.000110 -0.000027 -0.000585
61969  2020-04-15       Uinta     Wyoming  0.000110 -0.000051 -0.000585
61970  2020-04-15    Washakie     Wyoming  0.000110 -0.000051 -0.000585

[61971 rows x 6 columns]

4. 縮放至單位長度(Scaling to Unit Length)
  • 該方法也在機器學習中常用∪笆酰縮放特征向量的分量缩多,將每個分量除以向量的歐幾里得距離呆奕,使整個向量的長度為1养晋。
  • 公式:x' = \frac{x}{||x||}
>>>import os
>>>import pandas as pd
>>>import numpy as np
>>>from pprint import pprint

>>>def read_csv(file):
>>>    # 獲得文件中的數(shù)據(jù)
>>>    return pd.read_csv(file)

>>>def to_float(data):
>>>    # 將數(shù)據(jù)改為浮點數(shù)
>>>    for column in data:
>>>        if column =='date':continue # 跳過日期
>>>        if str(data[column][1]).isdigit(): # 如果是數(shù)字
>>>            data[column] = data[column].astype('float') # 將列轉(zhuǎn)為浮點數(shù)
>>>    return data

>>>def scaling_to_Unit_Length(data):
>>>    #  縮放至單位長度
>>>    for column in data:
>>>        if column == 'date': continue  # 跳過日期
>>>        if isinstance(data[column][1],float):  # 如果是浮點數(shù)
>>>            x = data[column]
>>>            x = x/np.linalg.norm(x)
>>>            data[column] = x
>>>    return data

>>>if __name__ == '__main__':
>>>    file_path = os.path.join('D:\\','dataset','us-counties.csv')
>>>    data = read_csv(file_path)
>>>    pprint(standardlization(to_float(data)))
             date      county       state      fips     cases    deaths
0      2020-01-21   Snohomish  Washington  0.000097 -0.000052 -0.000585
1      2020-01-22   Snohomish  Washington  0.000097 -0.000052 -0.000585
2      2020-01-23   Snohomish  Washington  0.000097 -0.000052 -0.000585
3      2020-01-24        Cook    Illinois -0.000052 -0.000052 -0.000585
4      2020-01-24   Snohomish  Washington  0.000097 -0.000052 -0.000585
...           ...         ...         ...       ...       ...       ...
61966  2020-04-15    Sublette     Wyoming  0.000110 -0.000052 -0.000585
61967  2020-04-15  Sweetwater     Wyoming  0.000110 -0.000048 -0.000585
61968  2020-04-15       Teton     Wyoming  0.000110 -0.000027 -0.000585
61969  2020-04-15       Uinta     Wyoming  0.000110 -0.000051 -0.000585
61970  2020-04-15    Washakie     Wyoming  0.000110 -0.000051 -0.000585

[61971 rows x 6 columns]

參考資料


最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者
  • 序言:七十年代末,一起剝皮案震驚了整個濱河市梁钾,隨后出現(xiàn)的幾起案子绳泉,更是在濱河造成了極大的恐慌,老刑警劉巖姆泻,帶你破解...
    沈念sama閱讀 211,348評論 6 491
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件零酪,死亡現(xiàn)場離奇詭異,居然都是意外死亡拇勃,警方通過查閱死者的電腦和手機四苇,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 90,122評論 2 385
  • 文/潘曉璐 我一進店門,熙熙樓的掌柜王于貴愁眉苦臉地迎上來方咆,“玉大人月腋,你說我怎么就攤上這事。” “怎么了榆骚?”我有些...
    開封第一講書人閱讀 156,936評論 0 347
  • 文/不壞的土叔 我叫張陵片拍,是天一觀的道長。 經(jīng)常有香客問我妓肢,道長捌省,這世上最難降的妖魔是什么? 我笑而不...
    開封第一講書人閱讀 56,427評論 1 283
  • 正文 為了忘掉前任碉钠,我火速辦了婚禮纲缓,結(jié)果婚禮上,老公的妹妹穿的比我還像新娘喊废。我一直安慰自己色徘,他們只是感情好,可當我...
    茶點故事閱讀 65,467評論 6 385
  • 文/花漫 我一把揭開白布操禀。 她就那樣靜靜地躺著褂策,像睡著了一般。 火紅的嫁衣襯著肌膚如雪颓屑。 梳的紋絲不亂的頭發(fā)上斤寂,一...
    開封第一講書人閱讀 49,785評論 1 290
  • 那天,我揣著相機與錄音揪惦,去河邊找鬼遍搞。 笑死,一個胖子當著我的面吹牛器腋,可吹牛的內(nèi)容都是我干的溪猿。 我是一名探鬼主播,決...
    沈念sama閱讀 38,931評論 3 406
  • 文/蒼蘭香墨 我猛地睜開眼纫塌,長吁一口氣:“原來是場噩夢啊……” “哼诊县!你這毒婦竟也來了?” 一聲冷哼從身側(cè)響起措左,我...
    開封第一講書人閱讀 37,696評論 0 266
  • 序言:老撾萬榮一對情侶失蹤依痊,失蹤者是張志新(化名)和其女友劉穎,沒想到半個月后怎披,有當?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體胸嘁,經(jīng)...
    沈念sama閱讀 44,141評論 1 303
  • 正文 獨居荒郊野嶺守林人離奇死亡,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點故事閱讀 36,483評論 2 327
  • 正文 我和宋清朗相戀三年凉逛,在試婚紗的時候發(fā)現(xiàn)自己被綠了性宏。 大學時的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片。...
    茶點故事閱讀 38,625評論 1 340
  • 序言:一個原本活蹦亂跳的男人離奇死亡状飞,死狀恐怖毫胜,靈堂內(nèi)的尸體忽然破棺而出蝌借,到底是詐尸還是另有隱情,我是刑警寧澤指蚁,帶...
    沈念sama閱讀 34,291評論 4 329
  • 正文 年R本政府宣布菩佑,位于F島的核電站,受9級特大地震影響凝化,放射性物質(zhì)發(fā)生泄漏稍坯。R本人自食惡果不足惜,卻給世界環(huán)境...
    茶點故事閱讀 39,892評論 3 312
  • 文/蒙蒙 一搓劫、第九天 我趴在偏房一處隱蔽的房頂上張望瞧哟。 院中可真熱鬧,春花似錦枪向、人聲如沸勤揩。這莊子的主人今日做“春日...
    開封第一講書人閱讀 30,741評論 0 21
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽陨亡。三九已至,卻和暖如春深员,著一層夾襖步出監(jiān)牢的瞬間负蠕,已是汗流浹背。 一陣腳步聲響...
    開封第一講書人閱讀 31,977評論 1 265
  • 我被黑心中介騙來泰國打工倦畅, 沒想到剛下飛機就差點兒被人妖公主榨干…… 1. 我叫王不留遮糖,地道東北人。 一個月前我還...
    沈念sama閱讀 46,324評論 2 360
  • 正文 我出身青樓叠赐,卻偏偏與公主長得像欲账,于是被迫代替她去往敵國和親。 傳聞我的和親對象是個殘疾皇子芭概,可洞房花燭夜當晚...
    茶點故事閱讀 43,492評論 2 348

推薦閱讀更多精彩內(nèi)容