下載本文檔
版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
學問點一數據倉庫數據倉庫是一個從多個數據源收集的信息存儲庫,存放在全都的模式下,并且通常駐留在單個站點上。數據倉庫通過數據清理、數據變換、數據集成、數據裝入和定期數據刷來構造。數據倉庫圍繞主題組織數據倉庫基于歷史數據供給消息,是匯總的。數據倉庫用稱作數據立方體的多維數據構造建模,每一個維對應于模式中的一個或者一組屬性,每一個單元存放某種聚攏的度量值數據立方體供給數據的多維視圖,并允許估量算和快速訪問匯總數據供給供給多維數據視圖和匯總數據的估量算,數據倉庫格外適合聯(lián)機分析處理,允許在不同的抽象層供給數據,這種操作適合不同的用戶角度OLAP例子包括下鉆和上卷,允許用戶在不同的匯總級別上觀看數據多維數據挖掘又叫做探究式多維數據挖掘OLAP風格在多維空間進展數據挖掘,允許在各種粒度進展多維組合探查,因此更有可能代表學問的好玩模式。學問點二可以挖掘什么數據大量的數據挖掘功能,包括特征化和區(qū)分、頻繁模式、關聯(lián)和相關性分析挖掘、分類和回歸、聚類分析、離群點分析大量的數據挖掘功能,包括特征化和區(qū)分、頻繁模式、關聯(lián)和相關性分析挖掘、分類和回歸、聚類分析、離群點分析數據挖掘功能用于指定數據挖掘任務覺察的模式,分為描述性和推測性描述性挖掘任務刻畫目標數據中數據的一般性質推測性挖掘任務在當前數據上進展歸納,以便做出推測用匯總、簡潔、準確的表達描述類和概念,稱為類/概念描述用匯總、簡潔、準確的表達描述類和概念,稱為類/概念描述描述的方法有數據特征化〔針對目標類、數據區(qū)分〔針對比照類、數據特征化和區(qū)分數據特征化用來查詢用戶指定的數據,上卷操作用來執(zhí)行用戶掌握的、沿著指定維的數系或者規(guī)章〔也叫特征規(guī)章〕供給。用規(guī)章表示的區(qū)分描述叫做區(qū)分規(guī)章。數據頻繁消滅的模式叫做頻繁模式,類型包括頻繁項集、頻繁子項集〔又叫頻繁序列、頻繁子構造。頻繁項集一般指頻繁地在事務數據中一起消滅的商品的集合頻繁子序列就是一個頻繁序列模式子構造涉及不同的構造,可以與項集和子項集一起消滅挖掘頻繁模式導致覺察數據中好玩的關聯(lián)和相關性包含單個謂詞的關聯(lián)規(guī)章稱作單維關聯(lián)規(guī)章。多個謂詞的關聯(lián)規(guī)章叫做多維關聯(lián)規(guī)章。假設不能同時滿足最小支持度閾值和最小置信度閾值是無趣的關聯(lián)規(guī)章。頻繁模式挖掘的根底是頻繁項集挖掘分類找出描述和區(qū)分數據類或概念的模型或者函數來推測類標號未知對象的類標號。導出模型是基于訓練數據集的分析,推測類標號未知對象的類標號。形式有分類規(guī)章、決策樹、數學公式或者神經網絡決策樹類似流程圖的樹構造,每一個結點代表一個屬性上的測試,每一個分支代表測試的一個結果,樹葉代表類或者類分布。分類時,神經網絡類似于神經處理單元,單元之間加權連接。構造分類模型的方法還有樸實貝葉斯分類、支持向量機、K最近鄰分類。分類推測類別〔離散的、無序的〕標號,回歸建立連續(xù)值函數模型來推測缺失的、難以獲得的數據數據值術語推測指數值推測和類標號推測回歸也包含基于可用數據的分布趨勢識別相關分析在分類和回歸之前進展,試圖識別與分類和回歸過程顯著相關的屬性織成分層構造,把類似的大事組織在一起織成分層構造,把類似的大事組織在一起離群點指與數據的一般行為或模型不全都的數據對象,視為噪聲或者特別舍棄。離群點數據分析也叫離群點分析或特別挖掘,用統(tǒng)計監(jiān)測或者距離度量、基于密度方法識別好玩的模式指易于被人理解、在某種確信度上對于的或檢驗數據是有效的、潛在有用的、穎的模式。好玩的模式代表學問。模式興趣的度量包括客觀度量和反映特特定用戶需要和興趣的主觀度量。客觀度量基于〔也叫可行動的〕依據用戶供給的約束和興趣度度量對搜尋聚焦,對某些任務而言能夠保證算法的完全性模式興趣度量依據模式的興趣度對所覺察的模式進展排位,可以通過減去模式空間中不滿足預先設定的興趣度約束的子集來指導和約束覺察過程。學問點三數據對象與數據屬性數據集由數據對象組成,一個對象代表一個實體。數據對象用屬性描述,又叫樣本、實例、數據點或對象。存放在數據庫中的數據對象叫做數據元組。屬性是一個數據字段,表示數據對象的一個特征,也叫維、特征、變量。用來描述一個給定對象的一組屬性叫做屬性向量〔或者特征向量。涉及一個屬性的叫做單變量、兩個屬性的叫做雙變量一個屬性的類型由該屬性可能具有的值的集合打算,分為標稱的、二元的、序數的、數值的標稱屬性的值是一些符號或者事物的名稱,每一個值代表某種類別、編碼或者狀態(tài),被看做是分類或者枚舉的,不必具有有意義的序二元屬性是一種標稱屬性,又叫布爾屬性,只有兩個狀態(tài):0或者1,0代表不消滅,1代表消滅。假設兩種狀態(tài)具體同等價值并且攜帶一樣的權重,那二元屬性是對稱的。序數屬性可能的值之間具有有意義的序或秩評定,相繼之間的差是未知的,通常用于等級評定調查。數值屬性用整數或者實數值表示,可以是區(qū)間標度或者比率標度的。區(qū)間標度屬性用相同的單位尺度度量,有序,可以為負、零、正,允許比較和度量評估值之間的值。比率標度是具有固定零點的數值屬性,可以說一個數是另一個數的倍數機器學習領域開發(fā)的分類算法通常把屬性分為離散的、連續(xù)的。離散屬性具有有限或者位數字表示。學問點四數據的根本描述統(tǒng)計中心趨勢度量數據分布的中部或者中心位置,包括均值、中位數、眾數、中列數數據的分散度量包括極差、四分位數、四分位數極差、五數概括和和盒圖差圖形可視化打量數據,包括條圖、餅圖、線圖為了抵消少數極端值的影響,使用截尾均值來凹凸極端值后的均值。具有一個、兩個、三個眾數的數據集合叫做單峰、雙峰、三峰值分位數是取自數據分布的每隔肯定間隔上的點合。識別可疑的離群點選擇落在第三個四分位數之上或者第一個四分位數之下至少1.5*IQR〔四分數極差〕處的值。五數概括包括中位值、四分位數Q1、四分位數Q3、最小和最大觀測值組成盒圖。學問點五度量數據的相像性和相異性簇是數據對象的集合,使得每一個簇中的元素相互相像,與其他簇中的對象相異。〔存放數據對象〔存放數據對象對的相異性值〕鄰近性指相異性和相像性數據矩陣也叫二模矩陣,相異矩陣只包含一種實體,稱為單模矩陣歐幾里得距離和曼哈頓距離滿足:非負性、同一性、對稱性、三角不等式,滿足條件的測度叫做度量。上確界距離是兩個對象的最大值差學問點六數據預處理概述數據質量包括預備性、完整性、全都性、時效性、可信性、可解釋性。質量基于數據的應用目的。數據預處理的主要任務數據清理、數據集成、數據歸約、數據變換數據清理是為了填補缺失的值、光滑噪聲數據、識別和刪除離群點、訂正數據的不全都性。這是一個兩步的迭代的過程,分為偏差檢測和數據變換數據集成涉及集成多個文件、數據庫、數據立方體,整合成全都的數據存儲。語義異種性的解決、元數據、相關分析、元組重復檢測和數據沖突檢測都有助于數據的集成。數據歸約得到數據集的簡化表示,使信息內容的損失最小化。策略包括維歸約和數值歸分析、屬性子集選擇和屬性創(chuàng)立。數值歸約歸約中,使用參數模型和非參數模型屬性的原始值被區(qū)間或者叫高層的概念所取代可以承受離散化和概念分層產生的方法,使得數據在多個抽象層上進展。數據變換包括標準化、數據離散化、概念分層產生冗余數據的刪除既是數據清理也是數據歸約〔中位數或者均值、使用給定元組屬性的同一類的全部樣本的屬性均值或者中位數、使用最可能的值〔使用回歸或者貝葉斯推理得到〕噪聲是被測量的變量的隨機誤差或者方差識別噪聲的方法有根本統(tǒng)計描述技術和數據可視化方法數據光滑技術有分箱、回歸、離群點分析分箱通過考察數據的近鄰來光滑有序數據值,這些有序的值被安排到一些桶或箱中。分箱考察近鄰的值,它是局部光滑對于用箱均值光滑,全部值都被替換成均值;用箱中位數光滑,每一個數都替換成中位數;用箱邊界光滑,每一個數字都替換成最近的邊界值,寬度越大代表光滑效果越好數據變換指數據被變換或者統(tǒng)一成適合挖掘的形式,策略包括光滑、屬性構造、聚攏、離散化、由標稱數據產生概念分層。光滑指去掉數據中的噪聲,技術包括分箱、回歸、聚類;屬性構造通過屬性產生的屬性添加到屬性集中;聚類對數據的匯總和聚攏;概念分層將屬性泛化到較高的概念層離散化技術依據如何離散化加以分類,比方自頂向下的分類或者離散化。使用類信息叫做監(jiān)視的離散化。離散化和概念分層也是數據歸約的形式,原始數據被曲建或者標簽取代。用較小的單位表示屬性將導致該屬性有較大值域,因此傾向于使這樣的屬性具有較大的影響或者較高的權重標準化或標準化的目的是避開對度量單位選擇的依靠性,標準化數據試圖賜予全部屬性相等的權重。方法有最小-最大標準化、z分數標準化和按小數定標標準化最小v-〕-〔-zv均值方差按小數定標標準化:全部除以一個數字的離散化技術,對用戶指定的箱個數敏感,簡潔受離群點的影響直方圖是一種非監(jiān)視的離散化方法,將屬性A的值劃分為不相交的區(qū)間,叫做桶或者預先設定的概念層數,過程終止。對每一層使用最小區(qū)間長度來掌握遞歸。聚類將屬性A劃分為簇或組來離散化屬性A合并策略產生概念分層,其中每一個簇形成的概念分層的一個結點。決策樹承受自頂向下的方式,是監(jiān)視的離散化方法,使用了類標號。的相像性就可以合并他們。ChiMerge把數值屬性A的每一個不同看做是一個區(qū)間,對每一個相鄰區(qū)間進展檢驗,具有最小卡方檢驗值的說明有相像的類分布。合并過程遞歸地進展,直至滿足定義的條件為止。構造的一局部、說明屬性集但不說明它們的偏序、只說明局部屬性集。學問七數據倉庫與聯(lián)機分析處理信息處理供給支持。數據倉庫是一個面對主題的〔排解決策無用的數據、集成的〔來源于多個數據源、時變的〔隱式或顯式地包含時間元素、非易失的〔物理地分別存放數據〕數據集合,支持治理者的決策過程個數據訪問操作數據倉庫的構建過程需要數據集成、數據清理、數據統(tǒng)一從異構數據庫集成看,組織由多個異構的、自治的和分布的數據源維護大型數據庫。傳統(tǒng)的數據庫集成建立一個包裝程序和一個集成程序的站點返回不一樣的結果被集成為全局答復處理,并且與局部數據源上的處理競爭資源數據倉庫使用更驅動的方法,將多個數據源的信息預先集成存在數據倉庫中,供直接查詢和分析。聯(lián)機操作數據庫系統(tǒng)的主要任務是執(zhí)行聯(lián)機事務和查詢處理和系統(tǒng)的面對性、數據內容、數據庫設計、視圖、訪問模式。用戶和系統(tǒng)的面對性:聯(lián)機事務處理面對顧客,數據倉庫面對市場的數據內容:聯(lián)機事務處理治理當前數據,數據倉庫治理大量的歷史數據ER,后者是星形或者雪花模型和面對主題的本,處理不同單位的數據,數據量大,存放在多個介質上。訪問模式:前者由短的原子事務組成,需要并發(fā)、恢復機制來保證全都性和事務的魯棒性。后者只需要訪問操作。其他區(qū)分包括數據庫大小、操作頻繁程度、性能度量等織、存取方法和實現方法。其次是訪問模式的不同。第三是兩者的功能和數據不同。的應用程序。這一層包括元數據庫,存放關于數據倉庫和它的內容的信息。中間是OLAP效勞器。頂層是前端客戶層,包括查詢和報告的工具、分析工具/數據挖掘工具。從構造看,有三種數據倉庫模型:倉庫企業(yè)、數據集市、虛擬倉庫倉庫企業(yè):搜集了關于主題的全部信息,跨越整個企業(yè)個特定部門或者地區(qū)局部產生的數據。依靠數據集市直接來源于數據倉庫虛擬倉庫是操作數據上的視圖的集合,只有一些可能的匯總視圖被物化庫。數據倉庫系統(tǒng)使用的工具有數據提取、變換、裝入數據提取:由多個異構的外部數據源搜集數據數據清理:檢測數據中的錯誤,可能時訂正它們數據變換:將數據由遺產或宿主格式轉換成數據倉庫格式裝入:排序、匯總、合并、計算視圖、檢查完整性、建立索引和劃分刷:傳播由數據源到數據倉庫的更數據清理和數據變換的目的是提高數據質量述、用于匯總的算法、由操作環(huán)境到數據倉庫的映射、關于系統(tǒng)性能的數據、商務元數據。多維數據模型有星形模式、雪花模式、事實星座模式。星形模式:一個大的中心表〔包含大批數據不冗余,一組小的附屬表〔每維一個雪花模式:數據進一步分解到附加的表中事實星座模式:多個事實表共享維表-值對聚焦數據計算該點的度量值。度量分為三類:分布、代數avg、整體的。學問點八頻繁項集、閉項集和關聯(lián)規(guī)章強規(guī)章同時滿足最小置信度閾值和最小支持度閾值。項的集合稱為項集,包含K個項的項集叫做k項集。項集的消滅頻度是包含項集的事務數,稱為頻度、支持度計數或者計數。YYXD中具有一樣的支持度計數,該項集在數據集中是閉的,叫做閉頻繁項集。假設X是頻繁的,并且不存在超項集Y使得Y包含X并且YD中是頻繁的,那么X是極大頻繁項集。Apriori算法:通過限制候選碼產生頻繁項集。先驗性質:頻繁項集的全部非空子集也肯定劃分、抽樣、動態(tài)項集,即削減掃描事務數據庫的次數、削減候選項集的數量、候選項支持度計算的簡化。FP-tree算法:將代表頻繁項集的數據庫壓縮到一棵頻繁模式樹,保存項集的關聯(lián)信息。把每一個條件數據庫,顯著地壓縮被搜尋的數據集的大小。反單調性指一個結合不能通過測試,它的全部超集也不能通過一樣的測試強規(guī)章不肯定是好玩的。用相關性度量拓展支持度-lift(A,B)=P(A∪B)/P(A)P(B)1表示一個消滅另一個肯定消滅,等于1=∑〔觀測值-期望值〕的平方/1,實際值小于觀測值說明是負相關的。四種評估模式度量:全置信度、最大置信度、Kulczynski和余弦全置信度稱為最小置信度;Kulczynski是兩個置信度的平均值;余弦看做是調和提升度量。提升度和卡方值識別事務數據集中的模式關聯(lián)關系的力量差由于不是零不變度量一種度量大型數據庫中的關聯(lián)模式的重要性質。不平衡比評估規(guī)章蘊含式中兩個項集AB的不平衡程度。學問點九分類分類構造一個模型或者分類器來推測類標號序值。推測回歸的兩種主要類型是分類和回歸。數據分類包含學習階段〔構造分類模型〕和分類階段〔使用模型推測給定數據的類標號。第一階段建立描述預先定義的數據類或概念集的分類器,其中分類算法通過分析或從了數據的壓縮表示,它是監(jiān)視學習。訓練集由數據庫元組和與他們相關聯(lián)的類標號組成類標號屬性是離散和無序的,是分類的〔標稱,由于每一個值充當一個類別或者類例、數據點或者對象訓練元組,指不使用它們構建分類器。分類器在給定檢驗集上的準確率是分類器正確分類的檢驗元組所占的百分比驗元組的類標號與學習模型對該元組的類推測進展比較。學問點十決策樹歸納決策樹歸納指從有類標號的訓練元組中學習決策樹類標號,最頂層是根結點。給定一個類標號未知的元組X,在決策樹上測試該元組的屬性值。跟蹤一條從根到葉結點的路徑,該葉結點就存放著該元組的推測,決策樹簡潔轉換為分類規(guī)章。據在決策樹構建的時候,使用屬性選擇度量來選擇將元組最好地劃分為不同的類的屬性開頭構建決策樹。隨著構建,訓練集漸漸被劃分為較小的子集決策樹算法的策略:用三個參數D,attribute_list和attribution_selection_method調用該算法。該過程使用一種屬性選擇度量,比方信息增量、基尼指數,它打算了樹是否為嚴格的二叉樹Ps:D代表數據分區(qū),是訓練元組和它們相應類標號的完全集Attribute_list描述元組屬性的列表attribution_selection_method指定選擇屬性的啟發(fā)式過程,用來選擇可以按類最好地區(qū)分給定元組的屬性。樹從單個結點N開頭,ND中的訓練元組假設D中的元組都為同一類,結點 N變成樹葉,并用類標記它。否則,調用attribution_selection_method確定分類準則。分類準則確定把D中的元組劃分為個體類的最好方法在結點N上對哪一個屬性進展測試對于選擇的測試從結點N生長出哪些分支。分類準則指定分裂屬性,指出分裂點或者分裂子集,使得每個分支的屬性盡量純。結點N用分裂準則作為結點的測試。終止原則:分區(qū)D中的全部元組都是一個類型的;沒有剩余的屬性可以連續(xù)劃分;給定的分支沒有元組O(n*|D|*log(|D|)),|D|D中的訓練元組屬性選擇度量是一種選擇分裂準則,把給定類標號的元組的數據分區(qū)D最好地劃分為子集必需作為分裂準則的一局部返回。為分區(qū)D構建的樹結點用分類準則標記,從準則的每一個輸誕生長出分支,并且相應地劃分元組。主要有信息增量、基尼指數、增益率方法。選擇具有最高信息增益的屬性作為結點N的分裂屬性,使結果分區(qū)中對元組分類所需望測試數目最小,并確保找到一顆簡潔的樹。基尼指數度量數據分區(qū)或者訓練元組集D的不純度導致相等大小的分區(qū)和純度。基于最小描述長度〔MDL〕二進制的
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業(yè)或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 物流合作合同違約處理預通知函6篇范文
- 2026年新能源車銷售市場拓展項目進度函7篇范文
- 2026重慶醫(yī)科大學附屬大足醫(yī)院編外人員招聘5人筆試參考題庫及答案詳解
- 上海電院自動控制工程有限公司招聘駕駛員1人筆試模擬試題及答案詳解
- 2026年信陽潢川縣醫(yī)療保險中心全日制公益性崗位招聘2名考試參考題庫及答案詳解
- 2026天津交易集團有限公司社會化公開招聘一般員工1人筆試參考題庫及答案詳解
- 2026年庫存盤查商定函(4篇)范文
- 家庭財務預算管理月度控制表理財手冊
- 北京市東城區(qū)第一人民醫(yī)院招聘中藥學1人(一)考試備考試題及答案詳解
- 2026年陜西師范大學外國語學院管理助理、教學助理招聘筆試模擬試題及答案詳解
- 電梯安全管理員責任制度
- 2026年甘肅省武威市高職單招職業(yè)技能考試題庫與答案詳解
- (正式版)DB51∕T 1235-2011 《香樟用材林栽培技術規(guī)程》
- 中國抗病毒洗衣液臨床效果驗證與醫(yī)療渠道拓展戰(zhàn)略報告
- 銀行員工消保培訓課件
- 區(qū)域供冷供熱行業(yè)分析報告
- 室外廣場硬地鋪裝監(jiān)理實施細則
- 2025年投融資崗位筆試題及答案
- 《廢棄物綠色再利用碳減排量核算技術規(guī)范》征求意見稿
- 黨建知識考試題庫及答案
- 專利技術應用效益綜合證明范例
評論
0/150
提交評論