版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
數據挖掘(第二版)DATAMINING第1章緒論.pptx第2章數據特征分析與預處理.pptx第3章分類.pptx第4章回歸.pptx第5章聚類.pptx第6章關聯規則.pptx第7章集成學習.pptx第8章推薦系統.pptx第9章互聯網數據挖掘.pptx全套可編輯PPT課件第一章緒論of432
我們生活在一個信息時代,社會信息化水平的不斷提高和數據庫應用的日益普及,使人類積累的數據量正在以指數方式增長。信息化時代給我們帶來大量的數據電子商務:電子商務交易數據社交平臺數據:微博,QQ,微信等金融:銀行卡交易數據科學計算:天氣、地理環境等豐富的數據,貧乏的知識理解數據遠遠超過人的能力迫切希望對海量數據進行更深入地分析,發現隱藏在其中的有價值信息。數據挖掘出現的時代背景1.1數據挖掘基本概念第一章緒論1.2數據挖掘起源及發展歷史1.3數據挖掘常用工具3.1數據挖掘概述1.4數據挖掘應用場景of433
習題數據挖掘(DataMining,DM),是從大量的、有噪聲的、不完全的、模糊和隨機的數據中,提取出隱含在其中的、人們事先不知道的、具有潛在利用價值的信息和知識的過程。這個定義包含以下幾層含義:數據源必須是真實的、大量的、含噪聲的;發現的是用戶感興趣的知識;發現的知識要可接受、可理解、可運用;不要求發現放之四海皆準的知識,僅支持特定的發現問題1.1.1數據挖掘的概念of4341.1數據挖掘基本概念第一章緒論數據挖掘的定義DataInformationKnowledgeWisdom數據挖掘是從數據中發掘知識的過程,在這個過程中人工智能和數據庫技術可以作為挖掘工具,數據可以被看作是土壤,云平臺可以看作是承載數據和挖掘算法的基礎設施。在挖掘數據的過程中需要用到一些挖掘工具和方法,如機器學習的方法。當挖掘完畢后,數據挖掘還需要對知識進行可視化和展現。1.1.1數據挖掘的概念of4351.1數據挖掘基本概念第一章緒論數據挖掘、數據庫、人工智能數據挖掘是一個交叉學科,涉及數據庫技術、人工智能、數理統計、機器學習、模式識別、高性能計算、知識工程、神經網絡、信息檢索、信息的可視化等眾多領域。1.1.1數據挖掘的概念of4361.1數據挖掘基本概念數據挖掘是多學科的匯合第一章緒論關系型數據庫、事務型數據庫、面向對象的數據庫數據倉庫/多維數據庫空間數據(如地圖信息)工程數據(如建筑、集成電路信息)文本和多媒體數據(如文本、圖像、音頻、視頻數據)時間相關的數據(如歷史數據或股票交換數據)萬維網(如半結構化的HTML、結構化的XML以及其他網絡信息)1.1.1數據挖掘的概念of4371.1數據挖掘基本概念常見的數據挖掘對象第一章緒論大數據挖掘:從體量巨大、類型多樣、動態快速流轉及價值密度低的大數據中挖掘出有巨大潛在價值的信息和知識,并以服務的形式提供給用戶。大數據挖掘與傳統數據挖掘相比:技術背景差異處理對象差異挖掘程度差異1.1.2大數據環境下的數據挖掘of4381.1數據挖掘基本概念第一章緒論在大數據時代,數據的產生和收集是基礎,數據挖掘是關鍵,即數據挖掘是大數據中最關鍵、最有價值的工作。大數據挖掘的特性:應用性工程性集合性1.1.3大數據挖掘的特性of4391.1數據挖掘基本概念第一章緒論數據挖掘的任務主要分為描述性任務和預測性任務。描述性任務:刻畫目標數據中數據的一般性質,例如,通過客戶行為特征,將客戶進行不同類型的聚類劃分。預測性任務:在當前數據上進行歸納,以便做出預測。例如,通過一個消費者的消費情況判斷是否會成為自己的重要客戶。1.1.4數據挖掘的任務和功能of43101.1數據挖掘基本概念第一章緒論常見的數據挖掘功能:分類聚類關聯分析數據總結離群點分析預測1.1.4數據挖掘的任務和功能of43111.1數據挖掘基本概念第一章緒論數據挖掘的對象可以是任何類型的數據。數據可以分為結構化數據、半結構化數據和非結構化數據。結構化數據,包括:數據庫數據、數據倉庫數據和事務數據。非結構化數據,包括:序列數據、圖或網絡數據、空間數據、文本和多媒體數據、萬維網數據等。1.1.5數據挖掘的對象of43121.1數據挖掘基本概念第一章緒論1999年,歐盟創建了跨行業的數據挖掘標準流程CRISP-DM,提供了一個數據挖掘生命周期的全面評述,包括業務理解、數據理解及收集、數據準備、數據建模、模型評估與部署六個階段。1.1.6數據挖掘的過程of43131.1數據挖掘基本概念第一章緒論1.2數據挖掘起源及發展第一章緒論1.1數據挖掘基本概念1.3數據挖掘常用工具3.1數據挖掘概述習題1.4數據挖掘應用of4314
之后每年召開一次這樣的會議,經過十幾年的努力,數據挖掘技術的研究已經取得了豐碩的成果。美國麻省理工學院在2001年1月份的《科技評論》提出數據挖掘將是未來5年對人類產生重大影響的10大新興技術之一。1.數據挖掘的起源of43151.2數據挖掘起源及發展第一章緒論1989年8月于美國底特律市召開的第十一屆國際聯合人工智能學術會議上首次提到“知識發現”這一概念;1993年,美國電氣電子工程師學會(IEEE)的知識與數據工程(KnowledgeandDataEngineering)會刊出版了KDD技術專刊,發表的論文和摘要體現了當時KDD的最新研究成果和動態。1995年,在加拿大蒙特利爾召開的首屆“知識發現和數據挖掘”國際學術會議上,首次提出了“數據挖掘”這一學科的名稱,并把數據挖掘技術分為科研領域的知識發現與工程領域的數據挖掘。1)多媒體數據挖掘2)時序數據挖掘3)Web數據挖掘4)文本數據挖掘2.數據挖掘的研究熱點of43161.2數據挖掘起源及發展第一章緒論web數據挖掘分類示意圖隨著物聯網、云計算和大數據時代的來臨,在大數據背景下數據挖掘要面臨的挑戰,主要表現在以下幾個方面:數據挖掘分析模型的重構:在大數據的背景下要以低成本和可擴展的方式處理大數據,這就需要對整個IT架構進行重構,開發先進的軟件平臺和算法。清洗粒度大小不易把握:由于普適終端的所處地理位置的復雜性,使得產生的數據具有很多噪聲。數據開放與隱私的權衡:互聯網的交互性,使得人們在不同位置產生的數據足跡得到積累和關聯,從而增加了隱私暴露的概率,且這種隱性的數據暴露往往是無法控制和預知的。3.數據挖掘面臨的新挑戰of43171.2數據挖掘起源及發展第一章緒論數據挖掘語言的標準化描述:標準的數據挖掘語言將有助于數據挖掘的系統化開發。改進多個數據挖掘系統和功能間的互操作,促進其在企業和社會中的使用。數據挖掘過程的可視化方法:可視化要求已經成為數據挖掘系統中必不可少的技術。可以在發現知識的過程中進行很好的人機交互。與特定數據存儲類型的適應問題:根據不同的數據存儲類型的特點,進行針對性的研究是目前流行以及將來一段時間必須面對的問題。4數據挖掘未來的發展趨勢of43181.2數據挖掘起源及發展第一章緒論網絡與分布式環境下的數據挖掘問題:隨著Internet的不斷發展,網絡資源日漸豐富,這就需要分散的技術人員各自獨立地處理分離數據庫的工作方式應是可協作的。數據挖掘與數據庫系統和Web數據庫系統的集成:數據庫系統和以Web查詢接口方式訪問數據庫資源的Web數據庫已經成為信息處理系統的主流。4數據挖掘未來的發展趨勢of43191.2數據挖掘起源及發展第一章緒論1.3數據挖掘常用工具第一章緒論1.2數據挖掘起源及發展歷史1.1數據挖掘基本概念3.1數據挖掘概述1.4數據挖掘應用場景of4320
習題我們需要借助一些有效的工具進行數據挖掘工作,更輕松地從巨大的數據集中找出關系、集群、模式、分類信息等,借助這類工具可以幫助我們做出最準確的決策,為我們的業務獲取更多收益。數據挖掘工具分為:商用工具和開源工具。1.3數據挖掘工具of43211.3數據挖掘常用工具第一章緒論SASEnterpriseMinerSPSSClementineIntelligentMinerQUEST1.3.1商用工具of43221.3數據挖掘常用工具第一章緒論SASEnterpriseMinerEnterpriseMiner是一種通用的數據挖掘工具,按照“抽樣-探索-修改-建模-評價”的方法進行數據挖掘,它把統計分析系統和圖形用戶界面(GUI)集成起來,為用戶提供了用于建模的圖形化流程處理環境。1.3.1商用工具of43231.3數據挖掘常用工具第一章緒論SPSSClementineClementine是SPSS公司開發的數據挖掘工具,支持整個數據挖掘過程,即從數據獲取、轉化、建模、評估到最終部署的全部過程,還支持數據挖掘的行業標準CRISP-DM。1.3.1商用工具of43241.3數據挖掘常用工具第一章緒論RWekaMahoutRapidMinerPythonSparkMLlib1.3.2開源工具of43251.3數據挖掘常用工具第一章緒論RR是用于統計分析和圖形化的計算機語言及分析工具,提供了豐富的統計分析和數據挖掘功能,其核心模塊是用C、C++和Fortran編寫的。1.3.2開源工具of43261.3數據挖掘常用工具第一章緒論PythonPython是一種功能強大的、開源的、解釋性、面向對象計算機編程語言,內建有各種高級數據結構,支持模塊和包,支持多種平臺并可擴展。Python提供sklearn第三方程序庫,對一些常用的機器學習方法進行了封裝,只需要調用模塊中的函數就可實現大多數機器學習任務,包括分類、回歸、聚類、數據降維、數據預處理等。1.3.2開源工具of43271.3數據挖掘常用工具第一章緒論WEKAWEKA是一個基于JAVA環境下免費開源的數據挖掘工作平臺,集合了大量能承擔數據挖掘任務的機器學習算法,包括對數據進行預處理,分類,回歸、聚類、關聯規則以及在新的交互式界面上的可視化。1.3.2開源工具of43281.3數據挖掘常用工具第一章緒論MahoutMahout是ApacheSoftwareFoundation(ASF)旗下的一個開源項目,在機器學習領域提供了一些可擴展的經典算法的實現和數據挖掘的程序庫。它可以實現很多功能,包括聚類、分類、推薦過濾、頻繁子項挖掘等。1.3.2開源工具of43291.3數據挖掘常用工具第一章緒論SparkMLlibMLlib(machinelearninglib)是Spark中的一個可擴展的機器學習庫,由通用的學習算法和工具組成,包括分類、線性回歸、聚類、協同過濾、梯度下降以及底層優化原語。1.3.2開源工具of43301.3數據挖掘常用工具第一章緒論1.4數據挖掘應用場景第一章緒論1.2數據挖掘起源及發展歷史1.1數據挖掘基本概念1.3數據挖掘常用工具of4331
習題數據挖掘能做什么?發現最有價值的客戶1.4數據挖掘的應用of43321.4數據挖掘應用場景第一章緒論數據挖掘能做什么?發現最有價值的客戶使組合銷售更有效率1.4數據挖掘的應用of43331.4數據挖掘應用場景第一章緒論數據挖掘能做什么?發現最有價值的客戶使組合銷售更有效率留住那些最有價值的客戶1.4數據挖掘的應用of43341.4數據挖掘應用場景第一章緒論數據挖掘能做什么?發現最有價值的客戶使組合銷售更有效率留住那些最有價值的客戶用更小的成本發現欺詐現象1.4數據挖掘的應用of43351.4數據挖掘應用場景第一章緒論電信:客戶細分,客戶流失分析銀行:優化客戶服務,信貸風險評估,欺詐檢測百貨公司/超市:購物籃分析(關聯規則)電子商務:挖掘客戶潛在需求,交叉銷售稅務部門:偷漏稅行為探測警察機關:犯罪行為分析醫學:醫療保健1.4數據挖掘的應用of43361.4數據挖掘應用場景第一章緒論應用案例1:啤酒與尿不濕
沃爾瑪超市,關聯規則1.4數據挖掘的應用of43371.4數據挖掘應用場景第一章緒論應用案例2匯豐銀行需要對不斷增長的客戶群進行分類,對每種產品找出最有價值的客戶,營銷費用減少了30%。應用案例3美國國防財務部需要從每年上百萬比的軍火交易中發現可能存在的欺詐現象。發現可能存在欺詐的交易,進行深入調查,節約了大量的調查成本。1.4數據挖掘的應用of43381.4數據挖掘應用場景第一章緒論習題第一章緒論1.1數據挖掘基本概念1.3數據挖掘常用工具1.4數據挖掘應用場景of4339
1.2數據挖掘起源及發展歷史1.什么是數據挖掘?2.數據挖掘、統計學和機器學習之間的關系是什么?3.什么是物聯網、云計算?并說明它們和大數據的關系。4.查閱資料,說明在大數據背景下,數據挖掘面臨哪些挑戰,以及如何解決。5.什么是數據倉庫?數據倉庫與數據庫有何不同?6.數據挖掘有哪些常用的工具?of4340習題第一章緒論感謝聆聽第二章數據預處理與相似性of4342
數據是數據挖掘的目標對象和原始資源,對數據挖掘最終結果起著決定性的作用。現實世界中的數據是多種多樣的,具有不同的特征,這就要求數據的存儲采用合適的數據類型,并且數據挖掘算法的適用性會受到具體的數據類型限制。另外,原始數據通常存在著噪聲、不一致、部分數據缺失等問題,為了達到較好的挖掘結果,有必要對這些數據進行預處理加工從而提高數據的質量。2.1
數據類型第二章數據預處理與相似性2.2
數據特征分析2.3
數據預處理3.1數據挖掘概述2.4
數據的相似性of4343
習題屬性是數據對象的性質或特性,屬性又可稱為特征。每一個數據對象用一組屬性描述,數據集用結構化數據表表示,其中列是存放在表中的對象的屬性,行代表一個對象實例,表中單元格是實例對應屬性的屬性值。2.1數據類型2.1數據類型
可以通過以下4種基本操作來確定屬性的類型:(1)相異性:=和≠
(2)序:≤、≥、<和>(3)加法:+和-(4)乘法:*和/按照上面屬性測量值可使用的基本操作,可將屬性值大致可以分為:標稱、序數、區間、二元、比率5種類型。2.1.1屬性與度量2.1數據類型2.1數據類型2.1.1屬性與度量2.1數據類型
2.1.2數據集的類型記錄數據有序數據圖形數據記錄數據是最常見的數據集類型,數據集是一個二維表格,其中表中行代表記錄,列代表屬性。例如一張普通的Excel表格文件或一張關系數據庫中的表。有序數據對象之間存在時間或空間上的順序關系。例如股票價格波動信息,醫療儀器監視病人的心跳、血壓、呼吸數值,用戶上網購物會產生鼠標點擊網頁等操作指令序列,這些信息可以用來挖掘用戶的上網習慣。圖形數據對象之間存在顯式或隱式的聯系,相互之間有一定的復雜依賴關系,構成圖形或網狀結構,如互聯網中的超鏈接。第二章數據預處理與相似性of4348
2.3
數據預處理3.1數據挖掘概述2.4
數據的相似性2.1
數據類型2.2
數據特征分析習題2.2數據特征分析描述數據集中趨勢(centraltendency)的度量:Mean(均值),median(中位數),mode(眾數),midrange(中列數):最大和最小值的均值描述數據離散程度(dispersion)的度量:Quartiles(四分位數),interquartilerange(IQR):四分位數極差,andvariance(方差)2.2數據特征分析1.算術平均值(ArithmeticMean)算術平均值是最常用的數據集中趨勢指標,就是數據集合中所有數值的加和除以數值個數,定義如下:2.2.1描述數據集中趨勢的度量平均數的優點:它能夠利用所有數據的特征,而且比較好算。不足之處,平均數容易受極端數據的影響。2.2數據特征分析2.眾數(Mode)2.2.1描述數據集中趨勢的度量眾數(Mode):在一組數據中,出現次數最多的數據;用眾數代表一組數據,適合于數據量較多時使用,且眾數不受極端數據的影響;
當數值或被觀察者沒有明顯次序(常發生于非數值性資料)時特別有用,由于可能無法良好定義算術平均數和中位數。例子:{蘋果,蘋果,香蕉,橙,橙,橙,桃}的眾數是橙。2.2數據特征分析3.中位數(Median)2.2.1描述數據集中趨勢的度量按順序排列的一組數據中居于中間位置的數。例:3,13,7,5,21,23,39,23,40,23,14,12,56,23,29
排序后:3,5,7,12,13,14,21,23,23,23,23,29,39,40,56這15個數中,第8個數為中位數:23中位數是通過排序得到的,它不受最大、最小兩個極端數值的影響。2.2數據特征分析4.k百分位數(Percentile)在一組數據從小到大排序,并計算相應的累計百分比,處于k%位置的值成為第k百分位數。第k百分位數是這樣一個值,它使得至少有k%的數據項小于或等于這個值,且至少有(100-k)%的數據項大于或等于這個值。前面介紹的中位數就是50百分位數。2.2.1描述數據集中趨勢的度量2.2數據特征分析4.k百分位數(Percentile)求k百分位數的步驟:第1步:以遞增順序排列原始數據(即從小到大排列)。第2步:計算指數i=1+(n-1)*k%(n是數據個數)第3步:i是數據序列中k百分位數據的位置2.2.1描述數據集中趨勢的度量2.2數據特征分析4.k百分位數(Percentile)【例2-1】有一組數據:3,13,7,5,21,23,39,23,40,23,14,12,56,23,29,求這組數的50百分位數(也就是中位數)。排序后:3,5,7,12,13,14,21,23,23,23,23,29,39,40,56
計算50百分位數的位置:1+(15-1)*50%=8第8個數據(即23)是50百分位數的位置。2.2.1描述數據集中趨勢的度量2.2數據特征分析1.極差(Range)極差是指在在某個數值屬性上的最大值和最小值之差。比如,示例2-1中的數列的最大值和最小值差是56-3=53,53位這個屬性值上的極差。極差能體現一組數據波動的范圍。極差越大,離散程度越大;但是極差未能利用全部測量值的信息,不能細致地反映測量值彼此相符合的程度,易受極端值的影響。2.2.2描述數據離散程度的度量2.2數據特征分析2.四分位極差(IQR)前面學習過的50百分位數(即中位數)是指用中位數把數據分布分成了高低兩半。這里的四分位數指的是有三個分位點把數據分布分成了四個相等的部分。這三個分位點是:第一個分位點是25百分位數,記作Q1;第二個分位點是50百分位數,記作Q2;第三個分位點是75百分位數,記作Q3。四分位極差記作IQR,IQR=Q3-Q1。經驗公式:超過Q3+1.5×IQR或者低于Q1-1.5×IQR的數據,可能是離群點。2.2.2描述數據離散程度的度量2.2數據特征分析2.四分位極差(IQR)【例2-2】例2-1中的15個數:3,5,7,12,13,14,21,23,23,23,23,29,39,40,56。求出IQR。25百分位位置是4,25百分位數Q1=1275百分位位置是12,75百分位數Q3=29則IQR=29-12=17。根據經驗公式計算可得離群點是56。2.2.2描述數據離散程度的度量2.2數據特征分析3.五數概括與箱圖因為Q1、Q2(Median)和Q3并不包含數據序列的兩個端點信息,因此,為了數據分布形狀更完整的概括可以同時給出兩個端點信息,也就是最小值(Minimum)和最大值(Maximum),稱為五數概括。分布的五數概括包括:內限內最小值、Q1、中位數、Q3和內限內最大值。一般在五數箱圖中內限內最小值是不小于Q1-1.5×IQR的最小值,內限內最大值是不大于Q3+1.5×IRQ的最大值。在內限內最小值到內限內最大值范圍以外的數據稱為離群點數據。2.2.2描述數據離散程度的度量2.2數據特征分析3.五數概括與箱圖【例2-3】示例2-1中的15個數:3,5,7,12,13,14,21,23,23,23,23,29,39,40,56。使用箱圖來直觀展示五數概括,如下圖2-2所示:此例中內限內最大值是40,內限內最小值是3,離群點是56。2.2.2描述數據離散程度的度量2.2數據特征分析4.方差和標準差方差和標準差都是數據散布度量,它們指出數據分布的散布程度。方差σ2的計算機公式:2.2.2描述數據離散程度的度量2.2數據特征分析4.方差和標準差方差和標準差都是數據散布度量,它們指出數據分布的散布程度。方差σ2的計算機公式:2.2.2描述數據離散程度的度量標準差σ是σ2的開方。方差大表示觀測的數據兩極分化大,方差小表示觀測的數據比較靠近均值。例如,兩個班級中,A班級的成績方差大,B班級方差小,則A班級學生學習成績比較離散,適于分層教學;B班級成績比較集中,不適于分層教學。2.2數據特征分析5.離散系數離散系數又稱變異系數,是統計學當中的指標。離散系數是度量數據離散程度的相對統計量,主要是用于比較不同樣本數據的離散程度。當進行兩個或多個數據集合離散程度的比較時,均值相當的情況下,可以用標準差來判斷離散程度;但是均值相差很大的情況下,用離散系數判斷離散程度。離散系數用符號表示,計算公式如下:2.2.2描述數據離散程度的度量
σ是樣本標準差,是樣本的平均值。離散系數大,說明數據的離散程度也大;離散系數小,說明數據的離散程度也小。2.2數據特征分析5.離散系數【例2-4】甲乙兩個運動員都是中等水平,各連續打靶8次,請問那個運動員發揮穩定?甲運動員:[8,9,8,9,9,8,10,10]乙運動員:[10,6,8,10,8,9,9,10]通過計算,得到了甲、乙運動員的平均值、標準差和離散系數如下表2-2:表2-2標準差和離散系數表2.2.2描述數據離散程度的度量名稱甲乙平均值8.8758.75標準差0.781.30離散系數0.0880.1482.2數據特征分析1.標稱數據的卡方檢驗對于離散數據,我們可以使用卡方檢驗來做類似計算。假設兩個屬性分別為A和B,卡方檢驗用符號表示,計算公式如下:上述公式中,Oij表示A和B屬性的配對值(Ai,Bj)的實際觀測值;Eij表示A和B屬性的配對值(Ai,Bj)的理論推算值,卡方檢驗就是說明了理論值和實際觀測值的偏差程度:卡方值越大,偏差越大;卡方值越小,偏差越小;卡方值為0,則理論值和實際值完全符合。2.2.3數據相關性分析2.2數據特征分析1.標稱數據的卡方檢驗【例2-6】我們要觀察性別和網上購物有沒有關系。通過對987名顧客的調查,結果如下表2-4所示。那么,怎么判斷買不買生鮮跟性別有沒有關聯呢?2.2.3數據相關性分析
男女總計線上不買生鮮434102536線上買生鮮206245451總計6403479872.2數據特征分析1.標稱數據的卡方檢驗上表中數據是實際觀察值,通過這個值,我們發現的人不在線上買生鮮,的人會在線上買生鮮,按照這個比例,我們可以算出(男,線上不買生鮮)的理論值是,依次算出(男,線上買生鮮)、(女,線上不買生鮮)、(女,線上買生鮮)的理論值,我們還可以得到理論值如下表2-5所示。2.2.3數據相關性分析
男女總計線上不買生鮮348188536線上買生鮮292159451總計6403479872.2數據特征分析1.標稱數據的卡方檢驗判斷線上買不買生鮮跟性別相關性步驟如下:(1)求出卡方值根據前面得到的實際觀察值和理論值,可得:
=(434-348)2/348+(102-188)2/188+(206-292)2/292+(245-159)2/159=132.46(2)求自由度(行數-1)*(列數-1)=(2-1)*(2-1)=1(3)置信度此例確定為90%,查找卡方分布表獲得置信度為90%的卡方值是2.706因為132.46遠遠大于2.706,因此,性別和線上購買生鮮兩者之間是強關聯性。2.2.3數據相關性分析2.2數據特征分析2.數值數據的協方差公式中,X和Y為兩個不同的屬性集,Xi和Yi分別是X和Y屬性對應的屬性值,和分別是X和Y屬性值的平均值。假設協方差結果為C,C的取值范圍:–1≤C≤1。若>0,表明屬性X和屬性Y之間存在正線性相關關系,數據變化是同向的;若<0,表明屬性X和屬性Y之間存在負線性相關關系,數據變化是負向的;若=0,說明二者之間不存在線性相關關系,但并不排除存在非線性相關性。因此,協方差的正負代表了兩個屬性之間相關性的方向,而協方差的絕對值代表了它們相互關系的強弱。2.2.3數據相關性分析2.2數據特征分析2.數值數據的協方差【例2-7】下圖2-3是某種商品銷售受溫度影響的數據散點圖。圖2-3中左圖是正相關,(銷售量,溫度)協方差是大于0的,說明這兩個屬性是正相關的。但是圖2-3右圖得到的(銷售量,溫度)協方差是等于0的,按照協方差規律,這個兩屬性是不相關的。顯然根據數據分布情況,這兩個屬性是相關的,先是正相關,超過一定溫度的時候呈現負相關性,所以右圖顯示的兩個屬性之間是存在非線性相關性的,此時,用協方差結果來評判是不客觀的。所以,協方差只是針對線性相關有效,當協方差為0的時候有可能也存在非線性相關。2.2.3數據相關性分析2.2數據特征分析3.數值數據的相關系數協方差的大小與屬性的取值范圍以及量綱都有關系,造成不同的屬性對之間的協方差難以進行橫向比較。為了解決這個問題,把協方差歸一化,就得到樣本相關系數用r表示,計算如公式2.6所示:如果取值在-1與1之間,且如果>0,表示它們正相關,值越大相關性越大。相反,如果<0,表示負相關。2.2.3數據相關性分析2.2數據特征分析3.數值數據的相關系數【例2-8】冰激凌銷售和溫度的統計數據如表所示,右邊是數據分布散點圖,用python程序計算銷售和溫度兩個屬性的協方差和相關系數。2.2.3數據相關性分析第二章數據預處理與相似性2.2
數據特征分析3.1數據挖掘概述2.4
數據的相似性of4373
2.3數據預處理2.1
數據類型習題2.3數據預處理數據預處理的過程2.3數據預處理2.3.1數據清洗數據清洗(Datacleaning)缺失值填充:Fillinginmissingvalues平滑噪聲:Smoothingnoisydata識別和去除離群點:Identifyingorremovingoutliers,解決不一致性:Resolvinginconsistencies2.3數據預處理2.3.1數據清洗1.處理缺失值(1)忽略元組(2)數據補齊:人工填寫、特殊值填充、平均值填充、使用最有可能的值填充。(3)不處理:有很多數據挖掘方法在屬性值缺失方面具有良好的魯棒性,直接在包含空值的數據上進行數據挖掘。這類方法包括貝葉斯網絡和人工神經網絡等。2.3數據預處理2.3.1數據清洗2.平滑噪聲主要使用的技術有回歸、分箱、離群點分析。現在主要介紹分箱方法。分箱(binning):是將屬性的值域劃分成若干個連續子區間。分箱的方法:有4種:等深分箱法、等寬分箱法、最小熵法和用戶自定義區間法。等深分箱法:將數據集按記錄行數分箱,每箱具有相同的記錄數,每箱記錄數稱為箱子的深度。等寬分箱法:使數據集在整個屬性值的區間上平均分布,即每個箱的區間范圍是一個常量,稱為箱子寬度。最小熵法:在分箱時考慮因變量的取值,使得分享后箱內達到最小熵。用戶自定義區間,用戶可以根據需要自定義區間,當用戶明確希望觀察某些區間范圍內的數據分布時,使用這種方法可以方便地幫助用戶達到目的。2.3數據預處理2.3.1數據清洗2.平滑噪聲將數據分箱后,對每個分箱中的數據進行局部平滑,常用的方式有下面三種:
按平均值平滑對同一箱值中的數據求平均值,用平均值替代該箱子中的所有數據。
按邊界值平滑用距離較小的邊界值替代箱中每一數據。
按中值平滑取箱子的中值,用來替代箱子中的所有數據。2.3數據預處理2.3.2數據集成數據集成就是將若干個分散的數據源中的數據,邏輯地或物理地集成到一個統一的數據集合中。這些數據源包括關系數據庫、數據倉庫和一般文件。數據集成的核心任務是要將互相關聯的分布式異構數據源集成到一起,使用戶能夠以透明的方式訪問這些數據源。數據集成中經常會遇到以下問題:1.實體識別問題2.屬性冗余問題3.數據值沖突問題2.3數據預處理2.3.3數據規范化數據規范化主要包括數據同趨化處理和無量綱化處理兩個方面,可以使屬性值按比例落入到一個特定區間,如[-1,1]或[0,1]。數據規范化一方面可以簡化計算,提升模型的收斂速度;另一方面,在涉及到一些距離計算的算法時防止較大初始值域的屬性與具有較小初始值域的屬性相比權重過大,可以有效提高結果精度。介紹三種規范化方法。2.3數據預處理2.3.3數據規范化1.最小-最大規范化也稱離差標準化,是對原始數據的線性變換,假定min,max分別為屬性A的最小值和最大值。轉換函數如下:
將轉換到區間[new_min?〖,new_max〗]中,結果為。這種方法有一個缺陷就是當有新的數據加入時,可能導致max,min值的變化,需要重新定義。另外,如果要做0-1規范化,上述式子可以簡化為:2.3數據預處理2.3.3數據規范化1.最小-最大規范化
【例2-11】下表2-8中是某部分同學數學和語文成績的成績,數據是百分制,語文是150分制,兩組數據不在同一個量綱,對其進行最小-最大規范。2.3數據預處理2.3.3數據規范化1.最小-最大規范化
【例2-11】下表2-8中是某部分同學數學和語文成績的成績,數據是百分制,語文是150分制,兩組數據不在同一個量綱,對其進行最小-最大規范。結果分析:以姓名為胡建的學生為例,他的(數學,語文)成績是(80,80),由于分制不同,所以直接比較是不正確的,經過最小-最大規范后可以得出(數學,語文)成績是(0.57142857,0),這樣就可以比較出該同學的數學成績要比語文成績好。2.3數據預處理2.3.3數據規范化2.z-score規范化也叫標準差標準化,經過處理的數據符合標準正態分布,即均值為0,標準差為1。轉化函數為如如公式2.9所示,其中表示屬性的均值,為標準差。2.3數據預處理2.3.3數據規范化3.按小數定標規范化通過移動數據的小數點位置來進行標準化。小數點的移動位數取決于屬性的最大絕對值。規范后的值計算方法:其中j是使的最小整數。例如,,取j=3,-84規范化后值為-0.084,231規范化后為0.231。需要注意的是,z-score規范化和按小數定標規范化在計算過程中有參數值,需要保存起來,為后續的數據進行統一的標準化使用。2.3數據預處理2.3.3數據規范化3.按小數定標規范化【例2-13】對于樣本數據(0,-3,1)(3,1,2)(0,1,-1),通過按小數定標規范化實現標準化的程序如下:運行結果:[[0.-0.30.1][0.30.10.2][0.0.1-0.1]]2.3數據預處理2.3.3數據規范化4.獨熱編碼處理標稱屬性數據獨熱編碼(OneHotEncoding)將每個標稱屬性進行擴充,在上面的例子中,可以擴充為如下表2-9。左圖進行獨熱編碼后如右表所示。編號血型1123324153編號A型B型O型AB型1100020010301004100050010這樣做的好處是任何兩個血型之間的差異是相同的,比如編號1和編號3的人的血型差異是(歐式距離),可以看到任意兩個人之間的血型差異都是,這和數值本身的實際意義是相符合的。2.3數據預處理2.3.4數據規約數據規約(datareduction)技術是指在盡可能的保持原始數據集完整性的前堤下,最大限度地精簡數據量。數據歸約技術可以用來得到數據集的歸約表示,它雖然小,但仍大致保持原數據的完整性。這樣,在歸約后的數據集上挖掘將更有效,并產生相同(或幾乎相同)的分析結果。數據規約的策略主要包括維規約和數量規約。維規約減少所考慮的隨機變量或屬性的個數,主要方法有小波變換、主成分分析和屬性子集選擇,通過這些方法可以把原始數據變換或投影到較小的空間,其中不相關、弱相關或冗余的屬性或維被檢測或刪除。數量規約是用替代的、較小的數據表示形式換原始數據。這些技術可以是參數或者非參數的。對于參數方法而言,使用模型估計數據,使得一般只需要存放模型參數而不是實際數據(離群點需存放)。非參數方法包括:直方圖、聚類、抽樣和數據立方體聚類。2.3數據預處理2.3.4數據規約1.主成分分析主成分分析(principalcomponentanalysis,PCA)是一種廣泛用于不同領域的無監督線性數據轉換技術。PCA的目標是在高維數據中找到最大方差的方向,并將數據映射到一個維度小得多的新子空間上。借助于正交變換,將其分量相關的原隨機向量轉化成其分量不相關的新隨機向量。2.3數據預處理2.3.4數據規約1.主成分分析PCA的基本過程:(1)首先對所有屬性數據規范化,每個屬性都落入相同的區間,消去量綱對算法的影響。(2)計算樣本數據的協方差矩陣(3)求出協方差矩陣的的特征值及相應正交化單位特征向量。前m個較大的特征值就是前m個主成分對應的方差。主成分的方差貢獻優選法反映信息量的大小。(4)通過計算累計貢獻率來選擇主成分。主成分向量構成了一組正交基,輸入數據可以由它們線性組成表示。(5)對主成分按重要性排序。主成分是新空間下的坐標軸,提供了關于方差的重要信息。(6)選擇重要性最高的若干個主成分,同時將剩下的較弱主成分舍棄,這樣就完成了約簡數據的規模。2.3數據預處理2.3數據預處理2.3.4數據規約2.屬性子集選擇屬性子集選擇的基本啟發式方法包括以下技術:(1)逐步向前選擇:該過程由空屬性集作為歸約集開始,確定原屬性集中最好的屬性,并將它添加到歸約集中。在其后的每一次迭代,將剩下的原屬性集中的最好的屬性添加到該集合中。(2)逐步向后刪除:該過程由整個屬性集開始。在每一步中,刪除尚在屬性集中最差的屬性。(3)逐步向前選擇和逐步向后刪除的組合:可以將逐步向前選擇和逐步向后刪除方法結合在一起,每一步選擇一個最好的屬性,并在剩余屬性中刪除一個最差的屬性。(4)決策樹歸納:決策樹算法(在后面第三章介紹)最初是用于分類的。決策樹歸納構造一個類似于流程圖的結構,其中每個內部(非樹葉)結點表示一個屬性上的測試,每個分枝對應于測試的一個結果;每個外部(樹葉)結點表示一個類預測。在每個結點上,算法選擇“最好”的屬性,將數據劃分成類。2.3數據預處理2.3數據預處理2.3.4數據規約3.直方圖直方圖使用分箱近似數據分布,是一種流行的數據歸約形式。屬性A的直方圖將A的數據分布劃分為不相交的子集或桶。桶安放在水平軸上,而桶的高度(和面積)是該桶所代表的值的平均頻率。如果每個桶只代表單個屬性值/頻率對,則該桶稱為單值桶。通常,桶表示給定屬性的一個連續區間。2.3數據預處理2.3數據預處理2.3.4數據規約3.直方圖【例2-16】我們得到一個商店每日利潤數據:390、100、350、380、160、350、400、340、430、150、380、390、400、440、600、230、440首先,以50為區間統計利潤的直方圖如下圖2-12所示。2.3數據預處理2.3數據預處理2.3.4數據規約3.直方圖【例2-16】我們得到一個商店每日利潤數據:390、100、350、380、160、350、400、340、430、150、380、390、400、440、600、230、440其次,我們以100為區間統計利潤的直方圖如下所示。以50劃分區間得到的13個桶的數據,以100為區間得到的7個桶的數據。利用直方圖壓縮了數據,而得到結論仍然是商店每日利潤集中300-400這個區間。2.3數據預處理2.3數據預處理2.3.4數據規約4.聚類把數據元組看作對象。它將對象劃分為群或簇,使得一個簇中的對象相互“相似”,而與其他簇中的對象“相異”。通常,相似性基于距離函數,形心距離是另一種度量。聚類方法在后面第五章有詳細介紹。2.3數據預處理2.3數據預處理2.3.4數據規約5.抽樣很多應用領域的數據也不能完全存儲,或者分析的時候是以動態的流式數據形式存在,在很多情況下,數據抽樣是數量規約的一種常見方法。常見的抽樣有簡單抽樣(包含不放回簡單隨機抽樣和有放回簡單隨機抽樣)、簇抽樣、分層抽樣。采用抽樣進行數據歸約的優點是,得到樣本的花費正比例于樣本集的大小s,而不是數據集的大小N。因此,抽樣的復雜度可能亞線性(sublinear)于數據的大小。其它數據歸約技術至少需要完全掃描D。對于固定的樣本大小,抽樣的復雜度僅隨數據的維數n線性地增加;而其它技術,如使用直方圖,復雜度隨d呈指數增長。2.3數據預處理2.3數據預處理2.3.5數據離散化數據離散化是指將連續的數據進行分段,使其變為一段段離散化的區間。連續屬性離散化的問題本質是:決定選擇多少個分割點和確定分割點位置。任務可分為兩個步驟完成。首先將連續屬性排序并通過指定n-1個分割點把它們分成n個區間。然后,將一個區間中的所有值映射到相同的分類值。2.3數據預處理2.3數據預處理2.3.5數據離散化1.數據離散化的原因(1)算法需要像決策樹,NaiveBayes算法,都是基于離散型的數據展開的。如果要使用該類算法,必須將連續型數據處理成離散型的數據。(2)數據離散化更方便對連續型數據的理解例如,某個問題中的年齡屬性可以按照如下辦法離散化:[0-11]→兒童,[12-17]→青少年,[18-44]→青年,[45-69]→中年,[69-∞]→老年。這樣,可以更加方便對于年齡屬性的理解。(3)可以有效的克服數據中隱藏的缺陷,使模型結果更加穩定。比如如果對用戶年齡離散化,[18-44]作為一個區間,不會因為一個用戶年齡長了一歲就變成一個完全不同的人。2.3數據預處理2.3數據預處理2.3.5數據離散化2.數據離散化的方法數據離散化的方法有多種類型,通常可以分為無監督離散化和有監督離散化。在離散化過種中使用類信息的方法是監督的,而不使用類信息的方法是無監督的。無監督離散化方法中最簡單的方法是等寬分箱法和等深分箱法(分箱法見本章2.3.1節)。2.3數據預處理2.3數據預處理2.3.5數據離散化2.數據離散化的方法等寬分箱法將排好序的數據從最小值到最大值均勻劃分成n等份,每份的間距是相等的。假設A和B分別是屬性值的最小值和最大值,那么劃分間距為W=(B-A)/n,每個類別的劃分邊界將為A+W,A+2W,A+3W,…A+(n-1)W。這種方法的缺點對異常點比較敏感,傾向于不均勻地把實例分布到各個箱中。等深分箱法將數據總記錄數均勻分為n等分,每份包含的數據個數相同。如果n=10,那么每一份中將包含大約10%的數據對象。這兩種方法都需要人工確定劃分區間的個數。等頻法可能將具有不相同類標號的相同屬性值分入不同的箱中以滿足箱中數據的固定個數的條件。2.3數據預處理2.3數據預處理2.3.5數據離散化2.數據離散化的方法ChiMerge是一種監督的、基于χ2檢驗(卡方檢驗見2.3.3)的數據離散化方法。其基本思想:對于精確的離散化,相對類頻率在一個區間內應當完全一致。因此,如果兩個相鄰的區間具有非常類似的類分布,則這兩個區間可以合并;否則,它們應當保持分開。而低χ2值表明它們具有相似的類分布。ChiMerge算法離散化數據操作流程包含兩個部分:第一步:初始化根據連續變量的值的大小排序,進行初始的離散處理。2.3數據預處理2.3數據預處理2.3.5數據離散化2.數據離散化的方法ChiMerge算法離散化數據操作流程包含兩個部分:第二步:合并箱子合并過程分為兩個步驟,連續重復進行:(1)對每對相鄰的區間進行檢驗。(2)將最小值的相鄰區間合并成一個區間。(根據卡方檢驗原理可知卡方值越低,表明兩個類別越獨立,相互影響的程度越小;或者另一種理解是兩箱分布相似,可以進行合并。)重復執行檢驗并且至底向上合并區間直到達到設定的閾值。2.3數據預處理2.3數據預處理2.3.5數據離散化2.數據離散化的方法ChiMerge算法離散化數據操作流程包含兩個部分:合并停止條件:直到所有相鄰箱子的值大于等于設置的閾值。(根據自由度和顯著性水平選取合適的值閾值;自由度則是根據數據能夠確定的為(R-1)*(C-1),因為都是計算相鄰兩箱的,故R=2;C也可根據數據情況確定。顯著性水平推薦選擇0.1,0.05,0.01。)或者,箱子數量達到預先設置的數量。2.3數據預處理第二章數據預處理與相似性of43104
2.2
數據特征分析2.3
數據預處理2.1
數據類型2.4數據的相似性習題2.4數據的相似性數據挖掘任務需要計算數據對象之間的相似性或相異性,如聚類、最近鄰分類、異常檢測等。相似度指兩個對象相似程度的數據度量。相異度指兩個對象差異程度的數值度量,距離可以作為相異度的同義詞,兩個數據所在的空間距離越大表示數據越相異,。相似性和相異性計算方法是一致的,通常是用兩個對象之間的一個或多個屬性距離來表示。數據對象之間的鄰近度計算與數據對象屬性類型密切相關。掌握簡單屬性之間的鄰近度是計算復雜對象之間鄰近度的基礎。本節分別以標稱和數值類型屬性介紹鄰近性度量方法。2.4數據的相似性假設每個對象有m個屬性,可以把一個對象視為m維空間的一個點,n個對象就是m維空間中的n個點。從直觀上看,屬于同一類的對象在空間中應該互相靠近,而不同類的對象之間的距離要大得多,因此可用距離來衡量對象之間的相似程度。距離越小,對象間的相似性就越大。常用的距離形式有:曼哈頓距離、歐幾里得距離、切比雪夫距離、閔可夫斯基距離、杰卡德距離等。2.4.1數值屬性的相似性度量2.4數據的相似性1.曼哈頓距離(ManhattanDistance)曼哈頓距離之所以稱為“曼哈頓距離”,是因為這里在兩個點之間行進時必須要沿著網格線前進,就如同沿著城市(如曼哈頓)的街道行進一樣。對于一個具有正南正北、正東正西方向規則布局的城市街道,從一點到達另一點的距離正是在南北方向上旅行的距離加上在東西方向上旅行的距離,是將多個維度上的距離進行求和的結果。其距離公式:2.4.1數值屬性的相似性度量2.4數據的相似性2.歐幾里得距離(EuclideanDistance)歐幾里得距離,也稱歐氏距離是最為熟知的距離測度,也就是我們常說的“距離”。在m維歐氏空間中,每個點是一個m維實數向量,該空間中的傳統距離測度為L2范式定義如下:也就是說,首先計算每一維上的距離,然后求它們的平方和,最后求算術平方根。另一個有趣的距離測度是L范式,也就是當r趨向無窮大時Lr范式的極限值。當r增大時,只有那個具有最大距離的維度才真正其作用,因此,通常L范式定義為在所有維度下中的最大值。2.4.1數值屬性的相似性度量2.4數據的相似性3.切比雪夫距離(Chebyshev)以數學的觀點來看,切比雪夫距離是由一致范數(uniformnorm)(或稱為上確界范數)所衍生的度量,也是超凸度量(injectivemetricspace)的一種。它產生兩個數據對象的最大屬性值差。2.4.1數值屬性的相似性度量2.4數據的相似性4.閔可夫斯基距離(MinkowskiDistance)閔可夫斯基距離又稱閔氏距離,是歐幾里得距離、曼哈頓距離和切比雪夫距離的推廣。閔氏距離對應Lp范數,其中p是一個變參數,根據參數的不同閔氏距離可以表示一類的距離。當p=1時,就是曼哈頓距離;當p=2時,就是歐氏距離;當p→∞時,就是切比雪夫距離。2.4.1數值屬性的相似性度量2.4數據的相似性5.杰卡德距離杰卡德距離(JaccardDistance)用于衡量兩個集合的差異性,它是杰卡德相似度的補集,被定義為1減去Jaccard相似度。Jaccard相似度用來度量兩個集合之間的相似性,它被定義為兩個集合交集的元素個數除以并集的元素個數,即集合A和B的相似度為:2.4.1數值屬性的相似性度量2.4數據的相似性5.杰卡德距離多維二元數據,其某位數據為1表示元素集合中的某個元素出現,為0表示不出現。例如,超市的一張交易清單中的1或0來表示是否包含某件商品,一篇文章中用0或1來表示詞語是否出現。多維二元數據情況下,集合A、B的相似度可以進一步寫成:2.4.1數值屬性的相似性度量2.4數據的相似性數值數據是有大小順序的,距離公式非常適合計算不同維度的數值數據的鄰近度。但是,離散的標稱屬性數據間并不存在大小順序關系,不能直接距離來計算相似度或相異度。標稱屬性取值是代表事物狀態的若干值,只包含了相異性信息。標稱類型可以通過編碼方案轉換成二元數據類型,然后使用數值計算方法來計算鄰近度。如果一個標稱類型數據有M個不同的狀態值,那么將該標稱數據轉換成M個二元屬性值,每一個標稱狀態值對應一個二元屬性,這些二元屬性中有一個值為1,剩余的全為0。這樣標稱屬性相似度計算就可可通過編碼方式轉化為多個二元屬性的相似度計算。2.4.2標稱屬性的相似性度量2.4數據的相似性一般地,二元屬性相似度,可以通過對屬性匹配值求和來計算。即首先分別求解對應單個屬性間的相似度,然后對所有相似度數值進行直接累加:中,d代表對象的屬性總數。更為直接的理解,相似度可用“取值相同的同位屬性數/屬性總位數”標識對于包含多個二元屬性的數據對象相似度計算。設有={1,0,0,1,0,0,1,0,1,1},={0,0,0,1,0,1,1,1,1,1},兩個對象共有7個屬性取值相同,3個取值不同,那么相似度可以標識為3/10=0.3。2.4.2標稱屬性的相似性度量2.4數據的相似性1.距離度量的標準化和相關性當數據對象屬性具有不同的域值時,即屬性變量的大小變化范圍不同,量綱不同,測量單位不同。如果不對屬性值進行標準化處理,那么在使用歐幾里得距離計算相似度,將會受到屬性值大的屬性影響。例如第一個變量的數量級是1000,而第二個變量的數量級是10,如v1=(2000,20),v2=(5000,60),那么如果只有2維的點中,歐氏距離為2.4.3組合異種屬性的相似性度量2.4數據的相似性2.組合異種屬性的相似度異種對象X,Y的相似度計算算法:步驟1:將第k個屬性標準化到區間[0,1],計算相似度。步驟2:創建一個指示變量用來標示兩個對象在第k個屬性上是否同時取值為0,如果同時為0,=0,否則=1。步驟3:使用如下公式計算對象X,Y的相似度:2.4.3組合異種屬性的相似性度量2.4數據的相似性3.使用權值前面所述所有相似度計算,都是將對象的所有屬性同等對待,沒有區分不同屬性的重要程度。當現實問題中屬性的重要程度存在較大差異時,可以借助于領域專業知識,給它們賦予不同的權值,以期望獲得更好的性能。相似度計算公式增加權值項后形式如下:2.4.3組合異種屬性的相似性度量2.4數據的相似性文檔是由大量詞語構成,如果把特定詞語出現的頻率看作一個單獨屬性,那么文檔可以由數千個詞頻屬性構成的向量表示。詞頻向量通常很長,并且是稀疏的,因為它包括了大量的零值屬性。統計兩個文檔中共同沒有的詞,即公共零值屬性對計算它們間的相似度并沒有多大幫助。對于文檔這種特殊結構數據,使用基于距離計算鄰近度的方法,會受到大量零值的影響,評估效果并不好。文檔相似度需要關注兩個文檔同時出現的詞語,以及這些詞語出現的次數,忽略零匹配的數值數據度量。2.4.4文本相似性度量2.4數據的相似性1.余弦相似度又稱為余弦相似性,適合用來計算文檔間的相似度。其原理是把兩個文本文檔以詞頻向量表示,通過計算兩個向量的夾角余弦值來評估他們的相似度。如果余弦值越接近于1,夾角越小,代表向量之間的匹配越大。而如果兩個向量的余弦值為0,表示它們正交,沒有匹配。2.4.4文本相似性度量2.4數據的相似性1.余弦相似度2.4.4文本相似性度量
假設有兩個文檔,新聞a和新聞b,將它們的內容經過分詞、詞頻統計處理后得到如下兩個向量:文檔a:(1,1,2,1,1,1,0,0,0)文檔b:(1,1,1,0,1,3,1,6,1)。使用余弦相似度來計算兩個文檔的相似度過程如下:新聞a和新聞b對應的向量分別是
和(1)計算向量a、b的點積:(2)計算向量a、b的歐幾里得范數,即||a||、||b||:(3)計算相似度:2.4數據的相似性2.詞頻-逆文檔頻率(TermFrequency-InverseDocumentFrequency,TF-IDF)
一種用于資訊檢索與資訊探勘的常用加權技術。基于統計學方法來評估詞語對文檔的重要性。字詞的重要性隨著它在文檔中出現的次數成正比增加,但同時會隨著它在語料庫中出現的頻率成反比下降。其中,詞頻(termfrequency,TF)指的是某一個給定的詞語在該文檔中出現的次數。由于同一個詞語在長文檔里可能會比短文檔有更高的詞頻,為了防止它偏向較長的文檔,通常會采用詞頻除以文檔總詞數來歸一化。2.4.4文本相似性度量2.4數據的相似性2.詞頻-逆文檔頻率(TermFrequency-InverseDocumentFrequency,TF-IDF)
逆向文檔頻率(inversedocumentfrequency,IDF)的主要思想是:出現頻率較少的詞才能夠表達文檔的主題。如果包含詞語w的文檔越少,IDF值越大,則說明詞條具有很好的類別區分能力。為了避免分母為0值,分母做加1處理。2.4.4文本相似性度量2.4數據的相似性2.詞頻-逆文檔頻率(TermFrequency-InverseDocumentFrequency,TF-IDF)
最終TF-IDF的計算式為:TF-IDF算法用來對文本進行特征提取,選出可以表征文章特性的關鍵詞。假設文章X由d個關鍵詞的詞頻組成的向量表示,兩篇文章X,Y的相似度可表示為:2.4.4文本相似性度量2.4數據的相似性1.編輯距離編輯距離具有下面幾個性質: 兩個字符串的最小編輯距離是兩個符串的長度差; 兩個字符串的最大編輯距離是兩字符串中較長字符串的長度; 只有兩個相等的字符串的編輯距離才會為0; 編輯距離滿足三角不等式,即;2.4.5離散序列相似性度量2.4數據的相似性1.編輯距離編輯距離(EditDistance)是指將序列變換為序列所用的最少編輯操作次數。編輯操作類型包括字符的替換、插入和刪除,三種類型可以根據實際應用問題指定相同或不同的操作代價。一般來說,編輯距離越小,兩個字符串的相似度越大。2.4.5離散序列相似性度量2.4數據的相似性2.最長公共子序列最長公共子序列(LongestCommonSubsequence,LCS)的定義是,一個序列S,如果分別是兩個或多個已知序列的子序列,且是所有符合此條件序列中最長的,則S稱為已知序列的最長公共子序列。子序列要求左右兩元素在母序列中為相鄰元素,且前后順序一致。設序列和的最長公共子序列為,則有如下特性:1)若xm=yn,則zk=xm=yn,且zk-1是xm-1和yn-1的最長公共子序列。2)若xm≠yn且zk≠xm,則Z是xm-1和Y的最長公共子序列。3)若xm≠yn且zk≠yn,則Z是X和yn-1的最長公共子序列。2.4.5離散序列相似性度量2.4數據的相似性2.最長公共子序列當兩個序列X,Y中任意一個為空集時,它們的最長公共子序列為零。即有和,這兩個式子可以作為求解算法的邊界條件。2.4.5離散序列相似性度量第二章數據預處理與相似性of43128
2.3
數據預處理3.1數據挖掘概述2.4
數據的相似性2.1
數據類型習題2.2
數據圖特征分析
1.在數據挖掘之前為什么要對原始數據進行預處理?2.簡述數據清洗的基本內容。3.簡述數據預處理的方法和內容。4.簡述數據空缺值的處理方法。5.數據約簡的方法有哪些?6.什么是數據規范化?規范化的常用方法有哪些?寫出對應的變換公式。7.【示例2-10】種的數據[3、22、8、22、9、11、32、93、12],試用等寬分箱法完成數據平滑。8.下列數據是對鳶尾花進行頻率統計后的部分數據,在此基礎上,用ChiMerge方法完成數據離散化。of43129習題第二章數據預處理與相似性of43130習題第二章數據預處理與相似性9.計算數據對象X=(3,5,2,7)和Y=(6,8,2,3)之間的歐幾里得距離、曼哈頓距離以及閔可夫斯基距離,其中閔可夫斯距離中p值取為3。sepal_length0類1類2類和4.310014.430034.510014.640044.720024.850054.941165820105.181095.231045.31
015.451065.525075.605165.725185.813375.90213感謝聆聽第三章分類of56132
分類是一種很重要的數據挖掘技術,也是數據挖掘研究的重點和熱點之一。分類的目的是分析輸入數據,通過訓練集中的數據表現出來的特性,為每一個類找到一種準確描述或者模型,這種描述常常用謂詞來表示。由此生成的類描述用來對未來的測試數據進行分類。盡管這些未來測試數據的類標簽是未知的,仍可以由此預測這些新數據所屬的類。也可以由此對數據中每一個類有更好的理解。More應用市場:醫療診斷、人臉檢測、故障診斷和故障預警······3.1分類概述第三章分類3.2
決策樹3.3
貝葉斯分類3.5實戰:Python支持向量機分類習題3.4
支持向量機of56133
分類(Classification)是一種重要的數據分析形式,它提取刻畫重要數據類的模型。這種模型稱為分類器,預測分類的(離散的、無序的)類標號。這些類別可以用離散值表示,其中值之間的次序沒有意義。3.1.1分類的基本概念of561343.1分類概述第三章分類
分類可描述如下:從訓練數據中確定函數模型y=f(x1,x2,...,xd),其中xi,i=1,...d為特征變量,y為分類變量。當y為離散變量時,即dom(y)={y1,y2,...,ym},被稱為分類。
分類也可定義為:分類的任務就是通過學習得到一個目標函數(TargetFunction)?,把每個屬性集x映射到一個預先定義的類標號y。
數據分類過程有兩階段:
(1)學習階段(構建分類模型)。
(2)分類階段(使用學習階段構建的模型預測給定數據的類標號)。3.1.2分類的過程of561353.1分類概述第三章分類建立分類模型的一般方法3.1.2分類的過程of561363.1分類概述第三章分類建立分類模型的一般方法
訓練集:用于訓練模型,擬合參數,即模型擬合的數據樣本集合,如通過訓練擬合一些參數來建立一個分類器。
測試集:用來評估訓練好的最終模型的性能如何,評價模型好壞,測試集沒有參于訓練,主要是測試訓練好的模型的準確能力等,但不能作為調參、選擇特征等算法相關的選擇的依據。
訓練數據中的數據不能再出現在驗證數據以及測試數據中,驗證數據最好也不要出現在測試數據中,這點在訓練分類器的時候一定要特別注意。
3.1.3分類器性能的評估方法of561373.1分類概述第三章分類(1)評估分類器性能的度量度量公式準確率、識別率(TP+TN)/(P+N)錯誤率、誤分類率(FP+FN)/(P+N)敏感度、真正例率、召回率TP/P特效型、真負例率TN/N精度TP/(TP+FP)TP,TN,FP,FN,P,N分別表示真正例,真負例,假正例,假負例,正和負樣本數。
3.1.3分類器性能的評估方法of561383.1分類概述第三章分類(2)比較分類器的其他方面速度:這涉及產生和使用分類器的計算開銷。魯棒性:這是假的數據有噪聲或有缺失值時分類器做出正確預測的能力。通常,魯棒性用噪聲和缺失值漸增的一系列合成數據集評估。可伸縮性:這涉及給定大量數據,有效的構造分類器的能力。通常,可伸縮性用規模漸增的一系列數據集評估。可解釋性:這涉及分類器或預測其提供的理解和洞察水平。可解釋性是主觀的,因而很難評估。決策樹和分類規則可能容易解釋,但隨著它們變得更復雜,它們的可解釋性也隨著消失。
3.1.3分類器性能的評估方法of561393.1分類概述
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 審計專業技術資格(初級)易錯題集錦(含解析)
- 公路水運工程試驗檢測師橋梁隧道工程易錯題(帶答案)
- 統編版(2024)新教材小學二年級道德與法制下冊第三單元第12課《見賢要思齊》第1課時課件
- 《憤怒的河馬》美術教育繪畫課件創意教程教案
- 計算機技術與軟件專業技術資格(中級)真題實戰卷(完整版)
- 人工智能證券投資
- 人工智能驅動的精準營銷策略
- 2026 年十月鄉村秋季防災減災科普課件
- 2026 年山洪災害防御預案科普學習課堂
- 2026年材料質量控制考核試卷
- SJG 75-2020 裝飾工程消耗量定額
- 基于ESP32的智能家居安防系統
- 《中藥調劑技術》課件-中成藥的保管與養護、驗收
- GB/T 44713-2024節地生態安葬服務指南
- DL-T5796-2019水電工程邊坡安全監測技術規范
- ISO22000基礎知識培訓
- 煙葉及煙絲鑒別檢測方法
- 《浙江省城鎮既有住宅房屋結構安全排查技術導則(試行)》
- 富馬酸奧賽利定注射液-藥品臨床應用解讀
- 外科學課件:第37章 結直腸與肛門疾病
- GB/T 38634.2-2020系統與軟件工程軟件測試第2部分:測試過程
評論
0/150
提交評論