Scikit-learn是基于numpy和scipy的一個機器學(xué)習(xí)算法庫台谊,包含很多監(jiān)督學(xué)習(xí)冤寿,非監(jiān)督學(xué)習(xí)一級半監(jiān)督學(xué)習(xí)的算法。同時也包括數(shù)據(jù)特征提取青伤,數(shù)據(jù)清洗等的一些功能。從功能來分殴瘦,有以下幾個:分類Classification, 回歸Regression, 聚類Clustering, 維度降低Dimensionality Reduction, 模型選擇Model Selection 和 預(yù)處理Preprocessing.
高斯混合模型GMM和KMeans都是聚類算法狠角,其中GMM利用高斯概率密度函數(shù)來量化事物,將事物分解為若干高斯分布的模型蚪腋。將觀測點數(shù)據(jù)及的分布丰歌,看做多個單一的高斯分布模型進行混合,每一個component就是一個聚類的中心屉凯。
WechatIMG18.jpeg
KMeans就是將輸入的數(shù)據(jù)分為k類立帖。首先隨機確定k個中心點,根據(jù)所有觀測點與中心點之間的距離悠砚,將觀測點分為不同的類晓勇。再根據(jù)新的Cluster計算新的中心點,并且重新歸類灌旧。循環(huán)直到中心點的位置不再有變化绑咱。
WechatIMG17.jpeg
以下是所有程序的代碼:
首先導(dǎo)入Excel文件的數(shù)據(jù):
# Open excel file
workbook = xlrd.open_workbook('DATA.xlsx')
# Choose sheets 1
sheet1 = workbook.sheet_by_name('Sheet1')
# Get Data Sets
numRow = sheet1.nrows
numCol = sheet1.ncols
x = np.zeros((numRow, numCol))
for i in range(sheet1.nrows):
if i == 0:
continue
else:
x[i][0] = (sheet1.row_values(i)[0])
x[i][1] = (sheet1.row_values(i)[1])
利用KMeans進行擬合:
kmeans = KMeans(n_clusters=5, max_iter=300, n_init=10, init='k-means++', random_state=0)
y_kmeans = kmeans.fit_predict(x)
for i in range(1,len(y_kmeans)):
if y_kmeans[i] == 0:
plt.scatter(x[i, 0], x[i, 1], s=15, c='red')
elif y_kmeans[i] == 1:
plt.scatter(x[i, 0], x[i, 1], s=15, c='blue')
elif y_kmeans[i] == 2:
plt.scatter(x[i, 0], x[i, 1], s=15, c='green')
elif y_kmeans[i] == 3:
plt.scatter(x[i, 0], x[i, 1], s=15, c='cyan')
elif y_kmeans[i] == 4:
plt.scatter(x[i, 0], x[i, 1], s=15, c='magenta')
print(kmeans.cluster_centers_)
plt.scatter(kmeans.cluster_centers_[:,0], kmeans.cluster_centers_[:,1], s = 30, c = 'yellow', label = 'Centroids')
plt.title('K-Means Clusters K = 5')
plt.xlabel('x')
plt.ylabel('y')
plt.legend()
plt.show()
利用GMM進行擬合:
gmmModel = GaussianMixture(n_components=5, covariance_type='diag', random_state=0)
gmmModel.fit(x)
labels = gmmModel.predict(x)
print(labels)
for i in range(1,len(labels)):
if labels[i] == 0:
plt.scatter(x[i, 0], x[i, 1], s=15, c='red')
elif labels[i] == 1:
plt.scatter(x[i, 0], x[i, 1], s=15, c='blue')
elif labels[i] == 2:
plt.scatter(x[i, 0], x[i, 1], s=15, c='green')
elif labels[i] == 3:
plt.scatter(x[i, 0], x[i, 1], s=15, c='cyan')
elif labels[i] == 4:
plt.scatter(x[i, 0], x[i, 1], s=15, c='magenta')
plt.title('Gaussian Mixture Model')
plt.xlabel('x')
plt.ylabel('y')
plt.show()
print(gmmModel.means_)
print(gmmModel.covariances_)