機器學(xué)習(xí)中的稀疏矩陣

什么是稀疏矩陣?

????大多數(shù)元素都是0的矩陣稱為稀疏矩陣究孕,否則稱為稠密矩陣啥酱。規(guī)模巨大的稀疏矩陣在應(yīng)用機器學(xué)習(xí)中很常見,尤其在自然語言處理領(lǐng)域中厨诸,例如獨熱編碼镶殷。稀疏矩陣的表示、計算會增加空間和時間復(fù)雜度微酬,因此描述稀疏矩陣的稀疏性需要進行特殊的表示绘趋,以提高存儲和計算性能。

????本文由淺入深地結(jié)合Python實例來剖析稀疏矩陣的很多存儲和計算方式颗管,比如SciPy庫在稀疏矩陣的計算上支持很好陷遮。文章內(nèi)容主要包含以下幾個部分。

稀疏矩陣的稀疏性

????矩陣的稀疏性可以用分數(shù)來量化垦江,等于矩陣中零值的個數(shù)除以矩陣中的元素總數(shù):

????sparsity = count zero elements / total elements

????下面是一個3 x 6稀疏矩陣的例子拷呆。

? ? ? 1, 0, 0, 1, 0, 0

A = 0, 0, 2, 0, 0, 1?

? ? ? 0, 0, 0, 2, 0, 0

? ? 該矩陣有13個零值元素,元素總數(shù)為18,因此該矩陣的稀疏性為:13/18=0.722.

機器學(xué)習(xí)中的稀疏矩陣

? ? ? 對于機器學(xué)習(xí)來說茬斧,稀疏矩陣很常見腰懂,比如用戶是否看過電影庫中的所有電影,用戶是否購買了產(chǎn)品目錄中的產(chǎn)品项秉,歌曲目錄中每首歌曲的收聽次數(shù)等绣溜。

? ? 稀疏矩陣的表示方法如下:

? ? 1)Coordinate Format (COO):是一種坐標(biāo)形式的稀疏矩陣。采用三個數(shù)組row娄蔼、col和data保存非零元素的信息怖喻,這三個數(shù)組的長度相同,row保存元素的行岁诉,col保存元素的列锚沸,data保存元素的值。存儲的主要優(yōu)點是靈活涕癣、簡單哗蜈,僅存儲非零元素以及每個非零元素的坐標(biāo)。但是COO不支持元素的存取和增刪坠韩,一旦創(chuàng)建之后距潘,除了將之轉(zhuǎn)換成其它格式的矩陣,幾乎無法對其做任何操作和矩陣運算只搁。

坐標(biāo)表示實例
coo例子

2)Diagonal Storage Format (DIA,對角線存儲格式):對角線矩陣音比,它由兩個數(shù)組進行存儲:values是一個二維數(shù)組,distance是一個一維數(shù)組氢惋,distance[i]表示對角線相對主對角線的偏移量洞翩。values[i][j]表示第i行,相對主對角線偏離distance[j]的那條對角線上的數(shù)值焰望。

DIA表示實例
DIA例子

3)Compressed Sparse Row Format (CSR):壓縮稀疏行矩陣骚亿,它由values、columns柿估、rows三個數(shù)組組成循未。values是一個一維數(shù)組陷猫,columns是一個和values等長的一維數(shù)組秫舌,表示values中每個元素所在的列。rows是一個一維數(shù)組绣檬,rows[i]表示第i行元素在columns和values中的起始位置足陨。rows數(shù)組的長度等于行數(shù)+1。

稀疏矩陣的表示


用Python進行稀疏矩陣計算

最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者
  • 序言:七十年代末娇未,一起剝皮案震驚了整個濱河市墨缘,隨后出現(xiàn)的幾起案子,更是在濱河造成了極大的恐慌,老刑警劉巖镊讼,帶你破解...
    沈念sama閱讀 217,542評論 6 504
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件宽涌,死亡現(xiàn)場離奇詭異,居然都是意外死亡蝶棋,警方通過查閱死者的電腦和手機卸亮,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 92,822評論 3 394
  • 文/潘曉璐 我一進店門,熙熙樓的掌柜王于貴愁眉苦臉地迎上來玩裙,“玉大人兼贸,你說我怎么就攤上這事〕越Γ” “怎么了溶诞?”我有些...
    開封第一講書人閱讀 163,912評論 0 354
  • 文/不壞的土叔 我叫張陵,是天一觀的道長决侈。 經(jīng)常有香客問我螺垢,道長,這世上最難降的妖魔是什么颜及? 我笑而不...
    開封第一講書人閱讀 58,449評論 1 293
  • 正文 為了忘掉前任甩苛,我火速辦了婚禮,結(jié)果婚禮上俏站,老公的妹妹穿的比我還像新娘讯蒲。我一直安慰自己,他們只是感情好肄扎,可當(dāng)我...
    茶點故事閱讀 67,500評論 6 392
  • 文/花漫 我一把揭開白布墨林。 她就那樣靜靜地躺著,像睡著了一般犯祠。 火紅的嫁衣襯著肌膚如雪旭等。 梳的紋絲不亂的頭發(fā)上,一...
    開封第一講書人閱讀 51,370評論 1 302
  • 那天衡载,我揣著相機與錄音搔耕,去河邊找鬼。 笑死痰娱,一個胖子當(dāng)著我的面吹牛弃榨,可吹牛的內(nèi)容都是我干的。 我是一名探鬼主播梨睁,決...
    沈念sama閱讀 40,193評論 3 418
  • 文/蒼蘭香墨 我猛地睜開眼鲸睛,長吁一口氣:“原來是場噩夢啊……” “哼!你這毒婦竟也來了坡贺?” 一聲冷哼從身側(cè)響起官辈,我...
    開封第一講書人閱讀 39,074評論 0 276
  • 序言:老撾萬榮一對情侶失蹤箱舞,失蹤者是張志新(化名)和其女友劉穎,沒想到半個月后拳亿,有當(dāng)?shù)厝嗽跇淞掷锇l(fā)現(xiàn)了一具尸體晴股,經(jīng)...
    沈念sama閱讀 45,505評論 1 314
  • 正文 獨居荒郊野嶺守林人離奇死亡,尸身上長有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點故事閱讀 37,722評論 3 335
  • 正文 我和宋清朗相戀三年肺魁,在試婚紗的時候發(fā)現(xiàn)自己被綠了队魏。 大學(xué)時的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片。...
    茶點故事閱讀 39,841評論 1 348
  • 序言:一個原本活蹦亂跳的男人離奇死亡万搔,死狀恐怖胡桨,靈堂內(nèi)的尸體忽然破棺而出,到底是詐尸還是另有隱情瞬雹,我是刑警寧澤昧谊,帶...
    沈念sama閱讀 35,569評論 5 345
  • 正文 年R本政府宣布,位于F島的核電站酗捌,受9級特大地震影響呢诬,放射性物質(zhì)發(fā)生泄漏。R本人自食惡果不足惜胖缤,卻給世界環(huán)境...
    茶點故事閱讀 41,168評論 3 328
  • 文/蒙蒙 一尚镰、第九天 我趴在偏房一處隱蔽的房頂上張望。 院中可真熱鬧哪廓,春花似錦狗唉、人聲如沸。這莊子的主人今日做“春日...
    開封第一講書人閱讀 31,783評論 0 22
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽。三九已至哆料,卻和暖如春缸剪,著一層夾襖步出監(jiān)牢的瞬間,已是汗流浹背东亦。 一陣腳步聲響...
    開封第一講書人閱讀 32,918評論 1 269
  • 我被黑心中介騙來泰國打工杏节, 沒想到剛下飛機就差點兒被人妖公主榨干…… 1. 我叫王不留,地道東北人典阵。 一個月前我還...
    沈念sama閱讀 47,962評論 2 370
  • 正文 我出身青樓奋渔,卻偏偏與公主長得像,于是被迫代替她去往敵國和親萄喳。 傳聞我的和親對象是個殘疾皇子卒稳,可洞房花燭夜當(dāng)晚...
    茶點故事閱讀 44,781評論 2 354