做好數(shù)據(jù)挖掘模型的9條經(jīng)驗(yàn)總結(jié)

? ? ?數(shù)據(jù)挖掘是利用業(yè)務(wù)知識(shí)從數(shù)據(jù)中發(fā)現(xiàn)和解釋知識(shí)(或稱(chēng)為模式)的過(guò)程荸哟,這種知識(shí)是以自然或者人工形式創(chuàng)造的新知識(shí)嘱能。

當(dāng)前的數(shù)據(jù)挖掘形式擎浴,是在20世紀(jì)90年代實(shí)踐領(lǐng)域誕生的,是在集成數(shù)據(jù)挖掘算法平臺(tái)發(fā)展的支撐下適合商業(yè)分析的一種形式根暑。也許是因?yàn)閿?shù)據(jù)挖掘源于實(shí)踐而非理論力试,在其過(guò)程的理解上不太引人注意。20世紀(jì)90年代晚期發(fā)展的CRISP-DM排嫌,逐漸成為數(shù)據(jù)挖掘過(guò)程的一種標(biāo)準(zhǔn)化過(guò)程畸裳,被越來(lái)越多的數(shù)據(jù)挖掘?qū)嵺`者成功運(yùn)用和遵循。

雖然CRISP-DM能夠指導(dǎo)如何實(shí)施數(shù)據(jù)挖掘淳地,但是它不能解釋數(shù)據(jù)挖掘是什么或者為什么適合這樣做怖糊。在本文中我將闡述我提出數(shù)據(jù)挖掘的九種準(zhǔn)則或“定律”(其中大多數(shù)為實(shí)踐者所熟知)以及另外其它一些熟知的解釋。開(kāi)始從理論上(不僅僅是描述上)來(lái)解釋數(shù)據(jù)挖掘過(guò)程颇象。

我的目的不是評(píng)論CRISP-DM伍伤,但CRISP-DM的許多概念對(duì)于理解數(shù)據(jù)挖掘是至關(guān)重要的,本文也將依賴(lài)于CRISP-DM的常見(jiàn)術(shù)語(yǔ)遣钳。CRISP-DM僅僅是論述這個(gè)過(guò)程的開(kāi)始嚷缭。

第一,目標(biāo)律:業(yè)務(wù)目標(biāo)是所有數(shù)據(jù)解決方案的源頭

它定義了數(shù)據(jù)挖掘的主題:數(shù)據(jù)挖掘關(guān)注解決業(yè)務(wù)業(yè)問(wèn)題和實(shí)現(xiàn)業(yè)務(wù)目標(biāo)耍贾。數(shù)據(jù)挖掘主要不是一種技術(shù),而是一個(gè)過(guò)程路幸,業(yè)務(wù)目標(biāo)是它的的核心荐开。沒(méi)有業(yè)務(wù)目標(biāo),沒(méi)有數(shù)據(jù)挖掘(不管這種表述是否清楚)简肴。因此這個(gè)準(zhǔn)則也可以說(shuō)成:數(shù)據(jù)挖掘是業(yè)務(wù)過(guò)程晃听。

第二,知識(shí)律:業(yè)務(wù)知識(shí)是數(shù)據(jù)挖掘過(guò)程每一步的核心

這里定義了數(shù)據(jù)挖掘過(guò)程的一個(gè)關(guān)鍵特征。CRISP-DM的一種樸素的解讀是業(yè)務(wù)知識(shí)僅僅作用于數(shù)據(jù)挖掘過(guò)程開(kāi)始的目標(biāo)的定義與最后的結(jié)果的實(shí)施能扒,這將錯(cuò)過(guò)數(shù)據(jù)挖掘過(guò)程的一個(gè)關(guān)鍵屬性佣渴,即業(yè)務(wù)知識(shí)是每一步的核心。

為了方便理解初斑,我使用CRISP-DM階段來(lái)說(shuō)明:

1.商業(yè)理解必須基于業(yè)務(wù)知識(shí)辛润,所以數(shù)據(jù)挖掘目標(biāo)必須是業(yè)務(wù)目標(biāo)的映射(這種映射也基于數(shù)據(jù)知識(shí)和數(shù)據(jù)挖掘知識(shí));

2.數(shù)據(jù)理解使用業(yè)務(wù)知識(shí)理解與業(yè)務(wù)問(wèn)題相關(guān)的數(shù)據(jù),以及它們是如何相關(guān)的;

3.數(shù)據(jù)預(yù)處理就是利用業(yè)務(wù)知識(shí)來(lái)塑造數(shù)據(jù)见秤,使得業(yè)務(wù)問(wèn)題可以被提出和解答(更詳盡的第三條-準(zhǔn)備律);

4.建模是使用數(shù)據(jù)挖掘算法創(chuàng)建預(yù)測(cè)模型砂竖,同時(shí)解釋模型和業(yè)務(wù)目標(biāo)的特點(diǎn),也就是說(shuō)理解它們之間的業(yè)務(wù)相關(guān)性;

5.評(píng)估是模型對(duì)理解業(yè)務(wù)的影響;

6.實(shí)施是將數(shù)據(jù)挖掘結(jié)果作用于業(yè)務(wù)過(guò)程

總之鹃答,沒(méi)有業(yè)務(wù)知識(shí)乎澄,數(shù)據(jù)挖掘過(guò)程的每一步都是無(wú)效的,也沒(méi)有“純粹的技術(shù)”步驟测摔。業(yè)務(wù)知識(shí)指導(dǎo)過(guò)程產(chǎn)生有益的結(jié)果置济,并使得那些有益的結(jié)果得到認(rèn)可。數(shù)據(jù)挖掘是一個(gè)反復(fù)的過(guò)程锋八,業(yè)務(wù)知識(shí)是它的核心浙于,驅(qū)動(dòng)著結(jié)果的持續(xù)改善。

這背后的原因可以用“鴻溝的表現(xiàn)”(chasm of representation)來(lái)解釋(Alan Montgomery在20世紀(jì)90年代對(duì)數(shù)據(jù)挖掘提出的一個(gè)觀點(diǎn))查库。Montgomery指出數(shù)據(jù)挖掘目標(biāo)涉及到現(xiàn)實(shí)的業(yè)務(wù)路媚,然而數(shù)據(jù)僅能表示現(xiàn)實(shí)的一部分;數(shù)據(jù)和現(xiàn)實(shí)世界是有差距(或“鴻溝”)的。在數(shù)據(jù)挖掘過(guò)程中樊销,業(yè)務(wù)知識(shí)來(lái)彌補(bǔ)這一差距整慎,在數(shù)據(jù)中無(wú)論發(fā)現(xiàn)什么,只有使用業(yè)務(wù)知識(shí)解釋才能顯示其重要性围苫,數(shù)據(jù)中的任何遺漏必須通過(guò)業(yè)務(wù)知識(shí)彌補(bǔ)裤园。只有業(yè)務(wù)知識(shí)才能彌補(bǔ)這種缺失,這是業(yè)務(wù)知識(shí)為什么是數(shù)據(jù)挖掘過(guò)程每一步驟的核心的原因剂府。

第三拧揽,準(zhǔn)備律:數(shù)據(jù)預(yù)處理比數(shù)據(jù)挖掘其他任何一個(gè)過(guò)程都重要

這是數(shù)據(jù)挖掘著名的格言,數(shù)據(jù)挖掘項(xiàng)目中最費(fèi)力的事是數(shù)據(jù)獲取和預(yù)處理腺占。非正式估計(jì)淤袜,其占用項(xiàng)目的時(shí)間為50%-80%。最簡(jiǎn)單的解釋可以概括為“數(shù)據(jù)是困難的”衰伯,經(jīng)常采用自動(dòng)化減輕這個(gè)“問(wèn)題”的數(shù)據(jù)獲取铡羡、數(shù)據(jù)清理、數(shù)據(jù)轉(zhuǎn)換等數(shù)據(jù)預(yù)處理各部分的工作量意鲸。雖然自動(dòng)化技術(shù)是有益的烦周,支持者相信這項(xiàng)技術(shù)可以減 少數(shù)據(jù)預(yù)處理過(guò)程中的大量的工作量尽爆,但這也是誤解數(shù)據(jù)預(yù)處理在數(shù)據(jù)挖掘過(guò)程中是必須的原因。

數(shù)據(jù)預(yù)處理的目的是把數(shù)據(jù)挖掘問(wèn)題轉(zhuǎn)化為格式化的數(shù)據(jù)读慎,使得分析技術(shù)(如數(shù)據(jù)挖掘算法)更容易利用它漱贱。數(shù)據(jù)任何形式的變化(包括清理、最大最小值轉(zhuǎn)換夭委、增長(zhǎng)等)意味著問(wèn)題空間的變化幅狮,因此這種分析必須是探索性的。 這是數(shù)據(jù)預(yù)處理重要的原因闰靴,并且在數(shù)據(jù)挖掘過(guò)程中占有如此大的工作量彪笼,這樣數(shù)據(jù)挖掘者可以從容地操縱問(wèn)題空間,使得容易找到適合分析他們的方法蚂且。

有兩種方法“塑造”這個(gè)問(wèn)題空間配猫。第一種方法是將數(shù)據(jù)轉(zhuǎn)化為可以分析的完全格式化的數(shù)據(jù),比如杏死,大多數(shù)數(shù)據(jù)挖掘算法需要單一表格形式的數(shù)據(jù)泵肄,一個(gè)記錄就是一個(gè)樣例。數(shù)據(jù)挖掘者都知道什么樣的算法需要什么樣的數(shù)據(jù)形式淑翼,因此可以將數(shù)據(jù)轉(zhuǎn)化為一個(gè)合適的格式腐巢。第二種方法是使得數(shù)據(jù)能夠含有業(yè)務(wù)問(wèn)題的更多的信息,例如玄括,某些領(lǐng)域的一些數(shù)據(jù)挖掘問(wèn)題冯丙,數(shù)據(jù)挖掘者可以通過(guò)業(yè)務(wù)知識(shí)和數(shù)據(jù)知識(shí)知道這些。通過(guò)這些領(lǐng)域的知識(shí)遭京,數(shù)據(jù)挖掘者通過(guò)操縱問(wèn)題空間可能更容易找到一個(gè)合適的技術(shù)解決方案胃惜。

因此,通過(guò)業(yè)務(wù)知識(shí)哪雕、數(shù)據(jù)知識(shí)船殉、數(shù)據(jù)挖掘知識(shí)從根本上使得數(shù)據(jù)預(yù)處理更加得心應(yīng)手。數(shù)據(jù)預(yù)處理的這些方面并不能通過(guò)簡(jiǎn)單的自動(dòng)化實(shí)現(xiàn)斯嚎。

這個(gè)定律也解釋了一個(gè)有疑義的現(xiàn)象利虫,也就是雖然經(jīng)過(guò)數(shù)據(jù)獲取、清理堡僻、融合等方式創(chuàng)建一個(gè)數(shù)據(jù)倉(cāng)庫(kù)糠惫,但是數(shù)據(jù)預(yù)處理仍然是必不可少的,仍然占有數(shù)據(jù)挖掘過(guò)程一半以上的工作量钉疫。此外硼讽,就像CRISP-DM展示的那樣,即使經(jīng)過(guò)了主要的數(shù)據(jù)預(yù)處理階段陌选,在創(chuàng)建一個(gè)有用的模型的反復(fù)過(guò)程中理郑,進(jìn)一步的數(shù)據(jù)預(yù)處理的必要的。

第四咨油,試驗(yàn)律(NFL律:No Free Lunch):對(duì)于數(shù)據(jù)挖掘者來(lái)說(shuō)您炉,天下沒(méi)有免費(fèi)的午餐,一個(gè)正確的模型只有通過(guò)試驗(yàn)(experiment)才能被發(fā)現(xiàn)

機(jī)器學(xué)習(xí)有一個(gè)原則:如果我們充分了解一個(gè)問(wèn)題空間(problem space)役电,我們可以選擇或設(shè)計(jì)一個(gè)找到最優(yōu)方案的最有效的算法赚爵。一個(gè)卓越算法的參數(shù)依賴(lài)于數(shù)據(jù)挖掘問(wèn)題空間一組特定的屬性集,這些屬性可以通過(guò)分析發(fā)現(xiàn)或者算法創(chuàng)建法瑟。但是冀膝,這種觀點(diǎn)來(lái)自于一個(gè)錯(cuò)誤的思想,在數(shù)據(jù)挖掘過(guò)程中數(shù)據(jù)挖掘者將問(wèn)題公式化霎挟,然后利用算法找到解決方法窝剖。事實(shí)上,數(shù)據(jù)挖掘者將問(wèn)題公式化和尋找解決方法是同時(shí)進(jìn)行的--算法僅僅是幫助數(shù)據(jù)挖掘者的一個(gè)工具酥夭。

有五種因素說(shuō)明試驗(yàn)對(duì)于尋找數(shù)據(jù)挖掘解決方案是必要的:

1.數(shù)據(jù)挖掘項(xiàng)目的業(yè)務(wù)目標(biāo)定義了興趣范圍(定義域)赐纱,數(shù)據(jù)挖掘目標(biāo)反映了這一點(diǎn);

2.與業(yè)務(wù)目標(biāo)相關(guān)的數(shù)據(jù)及其相應(yīng)的數(shù)據(jù)挖掘目標(biāo)是在這個(gè)定義域上的數(shù)據(jù)挖掘過(guò)程產(chǎn)生的;

3.這些過(guò)程受規(guī)則限制,而這些過(guò)程產(chǎn)生的數(shù)據(jù)反映了這些規(guī)則;

4.在這些過(guò)程中熬北,數(shù)據(jù)挖掘的目的是通過(guò)模式發(fā)現(xiàn)技術(shù)(數(shù)據(jù)挖掘算法)和可以解釋這個(gè)算法結(jié)果的業(yè)務(wù)知識(shí)相結(jié)合的方法來(lái)揭示這個(gè)定義域上的規(guī)則;

5.數(shù)據(jù)挖掘需要在這個(gè)域上生成相關(guān)數(shù)據(jù)疙描,這些數(shù)據(jù)含有的模式不可避免地受到這些規(guī)則的限。讶隐。

在這里強(qiáng)調(diào)一下最后一點(diǎn)起胰,在數(shù)據(jù)挖掘中改變業(yè)務(wù)目標(biāo),CRISP-DM有所暗示巫延,但經(jīng)常不易被覺(jué)察到效五。廣為所知的CRISP-DM過(guò)程不是下一個(gè)步驟僅接著上一個(gè)步驟的“瀑布”式的過(guò)程。事實(shí)上烈评,在項(xiàng)目中的任何地方都可以進(jìn)行任何CRISP-DM步驟火俄,同樣商業(yè)理解也可以存在于任何一個(gè)步驟。業(yè)務(wù)目標(biāo)不是簡(jiǎn) 單地在開(kāi)始就給定讲冠,它貫穿于整個(gè)過(guò)程瓜客。這也許可以解釋一些數(shù)據(jù)挖掘者在沒(méi)有清晰的業(yè)務(wù)目標(biāo)的情況下開(kāi)始項(xiàng)目,他們知道業(yè)務(wù)目標(biāo)也是數(shù)據(jù)挖掘的一個(gè)結(jié)果竿开,不是靜態(tài)地給定谱仪。

Wolpert的“沒(méi)有免費(fèi)的午餐”理論已經(jīng)應(yīng)用于機(jī)器學(xué)習(xí)領(lǐng)域,無(wú)偏的狀態(tài)好于(如一個(gè)具體的算法)任何其他可能的問(wèn)題(數(shù)據(jù)集)出現(xiàn)的平均狀態(tài)否彩。這是因?yàn)榉柙埽绻覀兛紤]所有可能的問(wèn)題,他們的解決方法是均勻分布的列荔,以至于一個(gè)算法(或偏倚)對(duì)一個(gè)子集是有利的敬尺,而對(duì)另一個(gè)子集是不利的枚尼。這與數(shù)據(jù)挖掘者所知的具有驚人的相似性,沒(méi)有一個(gè)算法適合每一個(gè)問(wèn)題砂吞。但是經(jīng)過(guò)數(shù)據(jù)挖掘處理的問(wèn)題或數(shù)據(jù)集絕不是隨機(jī)的署恍,也不是所有可能問(wèn)題的均勻分布,他們代表的是一個(gè)有偏差的樣本蜻直,那么為什么要應(yīng)用NFL的結(jié)論?答案涉及到上面提到的因素:問(wèn)題空間初始是未知的盯质,多重問(wèn)題空間可能和每一個(gè)數(shù)據(jù)挖掘目標(biāo)相關(guān),問(wèn)題空間可能被數(shù)據(jù)預(yù)處理所操縱概而,模型不能通過(guò)技術(shù)手段評(píng)估呼巷,業(yè)務(wù)問(wèn)題本身可能會(huì)變化。由于這些原因,數(shù)據(jù)挖掘問(wèn)題空間在數(shù)據(jù)挖掘過(guò)程中展開(kāi),并且在這個(gè)過(guò)程中是不斷變化的压固,以至于在有條件的約束下诚欠,用算法模擬一個(gè)隨機(jī)選擇的數(shù)據(jù)集是有效的。對(duì)于數(shù)據(jù)挖掘者來(lái)說(shuō):沒(méi)有免費(fèi)的午餐。

這大體上描述了數(shù)據(jù)挖掘過(guò)程。但是,在有條件限制某些情況下渠脉,比如業(yè)務(wù)目標(biāo)是穩(wěn)定的,數(shù)據(jù)和其預(yù)處理是穩(wěn)定的瓶佳,一個(gè)可接受的算法或算法組合可以解決這個(gè)問(wèn)題芋膘。在這些情況下, 一般的數(shù)據(jù)挖掘過(guò)程中的步驟將會(huì)減少霸饲。 但是为朋,如果這種情況穩(wěn)定是持續(xù)的,數(shù)據(jù)挖掘者的午餐是免費(fèi)的厚脉,或者至少相對(duì)便宜的习寸。像這樣的穩(wěn)定性是臨時(shí)的,因?yàn)?對(duì)數(shù)據(jù)的業(yè)務(wù)理解(第二律)和對(duì)問(wèn)題的理解(第九律)都會(huì)變化的傻工。

第五霞溪,模式律(大衛(wèi)律):數(shù)據(jù)中總含有模式

這條規(guī)律最早由David Watkins提出。我們可能預(yù)料到一些數(shù)據(jù)挖掘項(xiàng)目會(huì)失敗中捆,因?yàn)榻鉀Q業(yè)務(wù)問(wèn)題的模式并不存在于數(shù)據(jù)中鸯匹,但是這與數(shù)據(jù)挖掘者的實(shí)踐經(jīng)驗(yàn)并不相關(guān)。

前文的闡述已經(jīng)提到泄伪,這是因?yàn)椋涸谝粋€(gè)與業(yè)務(wù)相關(guān)的數(shù)據(jù)集中總會(huì)發(fā)現(xiàn)一些有趣的東西殴蓬,以至于即使一些期望的模式不能被發(fā)現(xiàn),但其他的一些有用的東西可能會(huì)被發(fā)現(xiàn)(這與數(shù)據(jù)挖掘者的實(shí)踐經(jīng)驗(yàn)是相關(guān)的);除非業(yè)務(wù)專(zhuān)家期望的模式存在蟋滴,否則數(shù)據(jù)挖掘項(xiàng)目不會(huì)進(jìn)行染厅,這不應(yīng)感到奇怪痘绎,因?yàn)闃I(yè)務(wù)專(zhuān)家通常是對(duì)的。

然而肖粮,Watkins提出一個(gè)更簡(jiǎn)單更直接的觀點(diǎn):“數(shù)據(jù)中總含有模式简逮。”這與數(shù)據(jù)挖掘者的經(jīng)驗(yàn)比前面的闡述更一致尿赚。這個(gè)觀點(diǎn)后來(lái)經(jīng)過(guò)Watkins修正,基于客戶(hù)關(guān)系的數(shù)據(jù)挖掘項(xiàng)目蕉堰,總是存在著這樣的模式即客戶(hù)未來(lái)的行為總是和先前的行為相關(guān)凌净,顯然這些模式是有利可圖的(Watkins的客戶(hù)關(guān)系管理定律)。但是屋讶,數(shù)據(jù)挖掘者的經(jīng)驗(yàn)不僅僅局限于客戶(hù)關(guān)系管理問(wèn)題冰寻,任何數(shù)據(jù)挖掘問(wèn)題都會(huì)存在模式(Watkins的通用律)。

Watkins的通用律解釋如下:

1.數(shù)據(jù)挖掘項(xiàng)目的業(yè)務(wù)目標(biāo)定義了興趣范圍(定義域)皿渗,數(shù)據(jù)挖掘目標(biāo)反映了這一點(diǎn);

2.與業(yè)務(wù)目標(biāo)相關(guān)的數(shù)據(jù)及其相應(yīng)的數(shù)據(jù)挖掘目標(biāo)是在這個(gè)定義域上的數(shù)據(jù)挖掘過(guò)程產(chǎn)生的;

3.這些過(guò)程受規(guī)則限制斩芭,而這些過(guò)程產(chǎn)生的數(shù)據(jù)反映了這些規(guī)則;

4.在這些過(guò)程中,數(shù)據(jù)挖掘的目的是通過(guò)模式發(fā)現(xiàn)技術(shù)(數(shù)據(jù)挖掘算法)和可以解釋這個(gè)算法結(jié)果的業(yè)務(wù)知識(shí)相結(jié)合的方法來(lái)揭示這個(gè)定義域上的規(guī)則;

5.數(shù)據(jù)挖掘需要在這個(gè)域上生成相關(guān)數(shù)據(jù)乐疆,這些數(shù)據(jù)含有的模式不可避免地受到這些規(guī)則的限制

總結(jié)這一觀點(diǎn):數(shù)據(jù)中總存在模式划乖,因?yàn)樵谶@過(guò)程中不可避免產(chǎn)生數(shù)據(jù)這樣的副產(chǎn)品。為了發(fā)掘模式挤土,過(guò)程從(你已經(jīng)知道它)——業(yè)務(wù)知識(shí)開(kāi)始琴庵。

利用業(yè)務(wù)知識(shí)發(fā)現(xiàn)模式也是一個(gè)反復(fù)的過(guò)程;這些模式也對(duì)業(yè)務(wù)知識(shí)有貢獻(xiàn),同時(shí)業(yè)務(wù)知識(shí)是解釋模式的主要因素仰美。在這種反復(fù)的過(guò)程中迷殿,數(shù)據(jù)挖掘算法簡(jiǎn)單地連接了業(yè)務(wù)知識(shí)和隱藏的模式。

如果這個(gè)解釋是正確的咖杂,那么大衛(wèi)律是完全通用的庆寺。除非沒(méi)有相關(guān)的數(shù)據(jù)的保證,否則在每個(gè)定義域的每一個(gè)數(shù)據(jù)挖掘問(wèn)題總是存在模式的诉字。

六懦尝,洞察律:數(shù)據(jù)挖掘增大對(duì)業(yè)務(wù)的認(rèn)知

數(shù)據(jù)挖掘是如何產(chǎn)生洞察力的?這個(gè)定律接近了數(shù)據(jù)挖掘的核心:為什么數(shù)據(jù)挖掘必須是一個(gè)業(yè)務(wù)過(guò)程而不是一個(gè)技術(shù)過(guò)程。業(yè)務(wù)問(wèn)題是由人而非算法解決的奏窑。數(shù)據(jù)挖掘者和業(yè)務(wù)專(zhuān)家從問(wèn)題中找到解決方案导披,即從問(wèn)題的定義域上達(dá)到業(yè)務(wù)目標(biāo)需要的模式。數(shù)據(jù)挖掘完全或部分有助于這個(gè)認(rèn)知過(guò)程埃唯。數(shù)據(jù)挖掘算法揭示的模式通常不是人類(lèi)以正常的方式所能認(rèn)識(shí)到的撩匕。綜合這些算法和人類(lèi)正常的感知的數(shù)據(jù)挖掘過(guò)程在本質(zhì)上是敏捷的。在數(shù)據(jù)挖掘過(guò)程中墨叛,問(wèn)題解決者解釋數(shù)據(jù)挖掘算法產(chǎn)生的結(jié)果止毕,并統(tǒng)一到業(yè)務(wù)理解上模蜡,因此這是一個(gè)業(yè)務(wù)過(guò)程。

這類(lèi)似于“智能放大器”的概念扁凛,在早期的人工智能的領(lǐng)域忍疾,AI的第一個(gè)實(shí)際成果不是智能機(jī)器,而是被稱(chēng)為“智能放大器”的工具谨朝,它能夠協(xié)助人類(lèi)使用者提高獲取有效信息的能力卤妒。數(shù)據(jù)挖掘提供一個(gè)類(lèi)似的“智能放大器”,幫助業(yè)務(wù)專(zhuān)家解決他們不能單獨(dú)完成的業(yè)務(wù)問(wèn)題字币。

總之则披,數(shù)據(jù)挖掘算法提供一種超越人類(lèi)以正常方式探索模式的能力,數(shù)據(jù)挖掘過(guò)程允許數(shù)據(jù)挖掘者和業(yè)務(wù)專(zhuān)家將這種能力融合在他們的各自的問(wèn)題的中和業(yè)務(wù)過(guò)程中洗出。

第七士复,預(yù)測(cè)律:預(yù)測(cè)提高了信息泛化能力

“預(yù)測(cè)”已經(jīng)成為數(shù)據(jù)挖掘模型可以做什么的可接受的描述,即我們常說(shuō)的“預(yù)測(cè)模型”和“預(yù)測(cè)分析”翩活。這是因?yàn)樵S多流行的數(shù)據(jù)挖掘模型經(jīng)常使用“預(yù)測(cè)最可能的結(jié)果”(或者解釋可能的結(jié)果如何有可能)阱洪。這種方法是分類(lèi)和回歸模型的典型應(yīng)用。

但是菠镇,其他類(lèi)型的數(shù)據(jù)挖掘模型冗荸,比如聚類(lèi)和關(guān)聯(lián)模型也有“預(yù)測(cè)”的特征。這是一個(gè)含義比較模糊的術(shù)語(yǔ)利耍。一個(gè)聚類(lèi)模型被描述為“預(yù)測(cè)”一個(gè)個(gè)體屬于哪個(gè)群體俏竞,一個(gè)關(guān)聯(lián)模型可能被描述為基于已知基本屬性“預(yù)測(cè)”一個(gè)或更多屬性。

同樣我們也可以分析“預(yù)測(cè)”這個(gè)術(shù)語(yǔ)在不同的主題中的應(yīng)用:一個(gè)分類(lèi)模型可能被說(shuō)成可以預(yù)測(cè)客戶(hù)行為--更加確切的說(shuō)它可以預(yù)測(cè)以某種確定行為的目標(biāo)客戶(hù)堂竟,即使不是所有的目標(biāo)個(gè)體的行為都符合“預(yù)測(cè)”的結(jié)果魂毁。一個(gè)詐騙檢測(cè)模型可能被說(shuō)成可以預(yù)測(cè)個(gè)別交易是否具有高風(fēng)險(xiǎn)性,即使不是所有的預(yù)測(cè)的交易都有欺詐行為出嘹。

“預(yù)測(cè)”這個(gè)術(shù)語(yǔ)廣泛的使用導(dǎo)致了所謂的“預(yù)測(cè)分析”被作為數(shù)據(jù)挖掘的總稱(chēng)席楚,并且在業(yè)務(wù)解決方案中得到了廣泛的應(yīng)用。但是我們應(yīng)該意識(shí)到這不是日常所說(shuō)的“預(yù)測(cè)”税稼,我們不能期望預(yù)測(cè)一個(gè)特殊個(gè)體的行為或者一個(gè)特別的欺詐調(diào)查結(jié)果烦秩。

那么,在這個(gè)意義下的“預(yù)測(cè)”是什么?分類(lèi)郎仆、回歸只祠、聚類(lèi)和關(guān)聯(lián)算法以及他們集成模型有什么共性呢?答案在于“評(píng)分”,這是預(yù)測(cè)模型應(yīng)用到一個(gè)新樣例的方式扰肌。模型產(chǎn)生一個(gè)預(yù)估值或評(píng)分抛寝,這是這個(gè)樣例的新信息的一部 分;在概括和歸納的基礎(chǔ)上,這個(gè)樣例的可利用信息得到了提高,模式被算法發(fā)現(xiàn)和模型具體化盗舰。值得注意的是這個(gè)新信息不是在“給定”意義上的“數(shù)據(jù)”晶府,它僅有統(tǒng)計(jì)學(xué)意義。

第八钻趋,價(jià)值律:數(shù)據(jù)挖掘的結(jié)果的價(jià)值不取決于模型的穩(wěn)定性或預(yù)測(cè)的準(zhǔn)確性

準(zhǔn)確性和穩(wěn)定性是預(yù)測(cè)模型常用的兩個(gè)度量川陆。準(zhǔn)確性是指正確的預(yù)測(cè)結(jié)果所占的比例;穩(wěn)定性是指當(dāng)創(chuàng)建模型的數(shù)據(jù)改變時(shí),用于同一口徑的預(yù)測(cè)數(shù)據(jù)蛮位,其預(yù)測(cè)結(jié)果變化有多大(或多小)较沪。鑒于數(shù)據(jù)挖掘中預(yù)測(cè)概念的核心角色,一個(gè)預(yù)測(cè)模型的準(zhǔn)確性和穩(wěn)定性常被認(rèn)為決定了其結(jié)果的價(jià)值的大小失仁,實(shí)際上并非如此购对。

體現(xiàn)預(yù)測(cè)模型價(jià)值的有兩種方式:一種是用模型的預(yù)測(cè)結(jié)果來(lái)改善或影響行為,另一種是模型能夠傳遞導(dǎo)致改變策略的見(jiàn)解(或新知識(shí))陶因。

對(duì)于后者,傳遞出的任何新知識(shí)的價(jià)值和準(zhǔn)確性的聯(lián)系并不那么緊密;一些模型的預(yù)測(cè)能力可能有必要使我們相信發(fā)現(xiàn)的模式是真實(shí)的垂蜗。然而楷扬,一個(gè)難以理解的復(fù)雜的 或者完全不透明的模型的預(yù)測(cè)結(jié)果具有高準(zhǔn)確性,但傳遞的知識(shí)也不是那么有見(jiàn)地;然而贴见,一個(gè)簡(jiǎn)單的低準(zhǔn)確度的模型可能傳遞出更有用的見(jiàn)解烘苹。

準(zhǔn)確性和價(jià)值之間的分離在改善行為的情況下并不明顯,然而一個(gè)突出問(wèn)題是“預(yù)測(cè)模型是為了正確的事片部,還是為了正確的原因?” 換句話說(shuō)镣衡,一個(gè)模型的價(jià)值和它的預(yù)測(cè)準(zhǔn)確度一樣,都源自它的業(yè)務(wù)問(wèn)題档悠。例如廊鸥,客戶(hù)流失模型可能需要高的預(yù)測(cè)準(zhǔn)確度,否則對(duì)于業(yè)務(wù)上的指導(dǎo)不會(huì)那么有效辖所。相 反的是一個(gè)準(zhǔn)確度高的客戶(hù)流失模型可能提供有效的指導(dǎo)惰说,保留住老客戶(hù),但也僅僅是最少利潤(rùn)客戶(hù)群體的一部分缘回。如果不適合業(yè)務(wù)問(wèn)題吆视,高準(zhǔn)確度并不能提高模型 的價(jià)值。

模型穩(wěn)定性同樣如此酥宴,雖然穩(wěn)定性是預(yù)測(cè)模型的有趣的度量啦吧,穩(wěn)定性不能代替模型提供業(yè)務(wù)理解的能力或解決業(yè)務(wù)問(wèn)題,其它技術(shù)手段也是如此拙寡。

總之授滓,預(yù)測(cè)模型的價(jià)值不是由技術(shù)指標(biāo)決定的。數(shù)據(jù)挖掘者應(yīng)該在模型不損害業(yè)務(wù)理解和適應(yīng)業(yè)務(wù)問(wèn)題的情況下關(guān)注預(yù)測(cè)準(zhǔn)確度、模型穩(wěn)定性以及其它的技術(shù)度量褒墨。

第九炫刷,變化律:所有的模式因業(yè)務(wù)變化而變化

數(shù)據(jù)挖掘發(fā)現(xiàn)的模式不是永遠(yuǎn)不變的。數(shù)據(jù)挖掘的許多應(yīng)用是眾所周知的郁妈,但是這個(gè)性質(zhì)的普遍性沒(méi)有得到廣泛的重視浑玛。

數(shù)據(jù)挖掘在市場(chǎng)營(yíng)銷(xiāo)和CRM方面的應(yīng)用很容易理解,客戶(hù)行為模式隨著時(shí)間的變化而變化噩咪。行為的變化顾彰、市場(chǎng)的變化、競(jìng)爭(zhēng)的變化以及整個(gè)經(jīng)濟(jì)形勢(shì)的變化胃碾,預(yù)測(cè)模型會(huì)因這些變化而過(guò)時(shí)涨享,當(dāng)他們不能準(zhǔn)確預(yù)測(cè)時(shí),應(yīng)當(dāng)定期更新仆百。

數(shù)據(jù)挖掘在欺詐模型和風(fēng)險(xiǎn)模型的應(yīng)用中同樣如此厕隧,隨著環(huán)境的變化欺詐行為也在變化,因?yàn)樽锓敢淖冃袨橐员3诸I(lǐng)先于反欺詐俄周。欺詐檢測(cè)的應(yīng)用必須設(shè)計(jì)為就像處理舊的吁讨、熟悉的欺詐行為一樣能夠處理新的、未知類(lèi)型的欺詐行為峦朗。

某些種類(lèi)的數(shù)據(jù)挖掘可能被認(rèn)為發(fā)現(xiàn)的模式不會(huì)隨時(shí)間而變化建丧,比如數(shù)據(jù)挖掘在科學(xué)上的應(yīng)用,我們有沒(méi)有發(fā)現(xiàn)不變的普遍的規(guī)律?也許令人驚奇的是波势,答案是即使是這些模式也期望得到改變翎朱。理由是這些模式并不是簡(jiǎn)單的存在于這個(gè)世界上的規(guī)則,而是數(shù)據(jù)的反應(yīng)--這些規(guī)則可能在某些領(lǐng)域確實(shí)是靜態(tài)的尺铣。

然而拴曲,數(shù)據(jù)挖掘發(fā)現(xiàn)的模式是認(rèn)知過(guò)程的一部分,是數(shù)據(jù)挖掘在數(shù)據(jù)描述的世界與觀測(cè)者或業(yè)務(wù)專(zhuān)家的認(rèn)知之間建立的一個(gè)動(dòng)態(tài)過(guò)程凛忿。因?yàn)槲覀兊恼J(rèn)知在持續(xù)發(fā)展和增 長(zhǎng)疗韵,所以我們也期望模式也會(huì)變化。明天的數(shù)據(jù)表面上看起來(lái)相似侄非,但是它可能已經(jīng)集合了不同的模式蕉汪、(可能巧妙地)不同的目的、不同的語(yǔ)義;分析過(guò)程因受業(yè) 務(wù)知識(shí)驅(qū)動(dòng)逞怨,所以會(huì)隨著業(yè)務(wù)知識(shí)的變化而變化者疤。基于這些原因叠赦,模式會(huì)有所不同驹马。

總之革砸,所有的模式都會(huì)變化,因?yàn)樗麄儾粌H反映了一個(gè)變化的世界糯累,也反映了我們變化的認(rèn)知算利。

后記:

這九條定律是關(guān)于數(shù)據(jù)挖掘的簡(jiǎn)單的真知。這九條定律的大部分已為數(shù)據(jù)挖掘者熟知泳姐,但仍有一些不熟悉(例如效拭,第五、第六胖秒、第七)缎患。大多數(shù)新觀點(diǎn)的解釋都和這九條定律有關(guān),它試圖解釋眾所周知的數(shù)據(jù)挖掘過(guò)程中的背后的原因阎肝。

我們?yōu)槭裁春伪卦谝鈹?shù)據(jù)挖掘過(guò)程所采用的形式呢?除了知識(shí)和理解這些簡(jiǎn)單的訴求挤渔,有實(shí)實(shí)在在的理由去探討這些問(wèn)題。

數(shù)據(jù)挖掘過(guò)程以現(xiàn)在的形式存在是因?yàn)榧夹g(shù)的發(fā)展——機(jī)器學(xué)習(xí)算法的普及以及綜合其它技術(shù)集成這些算法的平臺(tái)的發(fā)展风题,使得商業(yè)用戶(hù)易于接受判导。我們是否應(yīng)該期望因技術(shù)的改變而改變數(shù)據(jù)挖掘過(guò)程?最終它會(huì)改變,但是如果我們理解數(shù)據(jù)挖掘過(guò)程形成的原因沛硅,然后我們可以辨別技術(shù)可以改變的和不能改變的眼刃。

一些技術(shù)的發(fā)展在預(yù)測(cè)分析領(lǐng)域具有革命性的作用,例如數(shù)據(jù)預(yù)處理的自動(dòng)化稽鞭、模型的重建以及在部署的框架里通過(guò)預(yù)測(cè)模型集成業(yè)務(wù)規(guī)則。數(shù)據(jù)挖掘的九條定律及其 解釋說(shuō)明:技術(shù)的發(fā)展不會(huì)改變數(shù)據(jù)挖掘過(guò)程的本質(zhì)引镊。這九條定律以及這些思想的進(jìn)一步發(fā)展朦蕴,除了有對(duì)數(shù)據(jù)挖掘者的教育價(jià)值之外,應(yīng)該被用來(lái)判別未來(lái)任何數(shù)據(jù) 挖掘過(guò)程革命性變化的訴求弟头。

來(lái)源:SOTON數(shù)據(jù)分析

(完)

最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請(qǐng)聯(lián)系作者
  • 序言:七十年代末吩抓,一起剝皮案震驚了整個(gè)濱河市,隨后出現(xiàn)的幾起案子赴恨,更是在濱河造成了極大的恐慌疹娶,老刑警劉巖,帶你破解...
    沈念sama閱讀 206,126評(píng)論 6 481
  • 序言:濱河連續(xù)發(fā)生了三起死亡事件伦连,死亡現(xiàn)場(chǎng)離奇詭異雨饺,居然都是意外死亡,警方通過(guò)查閱死者的電腦和手機(jī)惑淳,發(fā)現(xiàn)死者居然都...
    沈念sama閱讀 88,254評(píng)論 2 382
  • 文/潘曉璐 我一進(jìn)店門(mén)额港,熙熙樓的掌柜王于貴愁眉苦臉地迎上來(lái),“玉大人歧焦,你說(shuō)我怎么就攤上這事移斩。” “怎么了?”我有些...
    開(kāi)封第一講書(shū)人閱讀 152,445評(píng)論 0 341
  • 文/不壞的土叔 我叫張陵向瓷,是天一觀的道長(zhǎng)肠套。 經(jīng)常有香客問(wèn)我,道長(zhǎng)猖任,這世上最難降的妖魔是什么你稚? 我笑而不...
    開(kāi)封第一講書(shū)人閱讀 55,185評(píng)論 1 278
  • 正文 為了忘掉前任,我火速辦了婚禮超升,結(jié)果婚禮上入宦,老公的妹妹穿的比我還像新娘。我一直安慰自己室琢,他們只是感情好乾闰,可當(dāng)我...
    茶點(diǎn)故事閱讀 64,178評(píng)論 5 371
  • 文/花漫 我一把揭開(kāi)白布。 她就那樣靜靜地躺著盈滴,像睡著了一般涯肩。 火紅的嫁衣襯著肌膚如雪。 梳的紋絲不亂的頭發(fā)上巢钓,一...
    開(kāi)封第一講書(shū)人閱讀 48,970評(píng)論 1 284
  • 那天病苗,我揣著相機(jī)與錄音,去河邊找鬼症汹。 笑死硫朦,一個(gè)胖子當(dāng)著我的面吹牛,可吹牛的內(nèi)容都是我干的背镇。 我是一名探鬼主播咬展,決...
    沈念sama閱讀 38,276評(píng)論 3 399
  • 文/蒼蘭香墨 我猛地睜開(kāi)眼,長(zhǎng)吁一口氣:“原來(lái)是場(chǎng)噩夢(mèng)啊……” “哼瞒斩!你這毒婦竟也來(lái)了破婆?” 一聲冷哼從身側(cè)響起,我...
    開(kāi)封第一講書(shū)人閱讀 36,927評(píng)論 0 259
  • 序言:老撾萬(wàn)榮一對(duì)情侶失蹤胸囱,失蹤者是張志新(化名)和其女友劉穎祷舀,沒(méi)想到半個(gè)月后,有當(dāng)?shù)厝嗽跇?shù)林里發(fā)現(xiàn)了一具尸體烹笔,經(jīng)...
    沈念sama閱讀 43,400評(píng)論 1 300
  • 正文 獨(dú)居荒郊野嶺守林人離奇死亡裳扯,尸身上長(zhǎng)有42處帶血的膿包…… 初始之章·張勛 以下內(nèi)容為張勛視角 年9月15日...
    茶點(diǎn)故事閱讀 35,883評(píng)論 2 323
  • 正文 我和宋清朗相戀三年,在試婚紗的時(shí)候發(fā)現(xiàn)自己被綠了谤职。 大學(xué)時(shí)的朋友給我發(fā)了我未婚夫和他白月光在一起吃飯的照片嚎朽。...
    茶點(diǎn)故事閱讀 37,997評(píng)論 1 333
  • 序言:一個(gè)原本活蹦亂跳的男人離奇死亡,死狀恐怖柬帕,靈堂內(nèi)的尸體忽然破棺而出哟忍,到底是詐尸還是另有隱情狡门,我是刑警寧澤,帶...
    沈念sama閱讀 33,646評(píng)論 4 322
  • 正文 年R本政府宣布锅很,位于F島的核電站其馏,受9級(jí)特大地震影響,放射性物質(zhì)發(fā)生泄漏爆安。R本人自食惡果不足惜叛复,卻給世界環(huán)境...
    茶點(diǎn)故事閱讀 39,213評(píng)論 3 307
  • 文/蒙蒙 一、第九天 我趴在偏房一處隱蔽的房頂上張望扔仓。 院中可真熱鬧褐奥,春花似錦、人聲如沸翘簇。這莊子的主人今日做“春日...
    開(kāi)封第一講書(shū)人閱讀 30,204評(píng)論 0 19
  • 文/蒼蘭香墨 我抬頭看了看天上的太陽(yáng)版保。三九已至呜笑,卻和暖如春,著一層夾襖步出監(jiān)牢的瞬間彻犁,已是汗流浹背叫胁。 一陣腳步聲響...
    開(kāi)封第一講書(shū)人閱讀 31,423評(píng)論 1 260
  • 我被黑心中介騙來(lái)泰國(guó)打工, 沒(méi)想到剛下飛機(jī)就差點(diǎn)兒被人妖公主榨干…… 1. 我叫王不留汞幢,地道東北人驼鹅。 一個(gè)月前我還...
    沈念sama閱讀 45,423評(píng)論 2 352
  • 正文 我出身青樓,卻偏偏與公主長(zhǎng)得像森篷,于是被迫代替她去往敵國(guó)和親输钩。 傳聞我的和親對(duì)象是個(gè)殘疾皇子,可洞房花燭夜當(dāng)晚...
    茶點(diǎn)故事閱讀 42,722評(píng)論 2 345

推薦閱讀更多精彩內(nèi)容