版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
章節名稱第1章概述裝訂線授課安排裝訂線授課時數2授課時間1-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的了解機器學習領域的術語教學重點機器學習中的分類與回歸教學難點有監督學習與無監督學習;模型的泛化、過擬合與欠擬合☆教學過程與內容:構造情境,引出機器學習概念(1)教師根據課件,講述機器學習的誕生與發展。在計算機系統中,經驗通常以數據的形式存在。為了能夠自動地從經驗中提取出學習算法,需要獲得過去大量的郵件實例作為數據。從實例數據中學習出垃圾郵件的模型,以此作為判斷的依據。(2)教師根據課件,介紹機器學習概述。機器學習(MachineLearning)是計算機程序隨著經驗積累自動提高性能或系統自我改進的過程,即通過經驗提高性能的某類程序。機器學習通常需要一定的算法,依據特定的指令序列,將輸入變換得到輸出,然而,對于現實中的很多任務,我們并沒有確定的算法,我們希望計算機自動地為學習任務提取相應的算法。(3)教師根據課件,介紹機器學習所研究的主要內容。機器學習所研究的主要內容,是如何在計算機上從數據中產生模型的算法,即學習算法。機器學習是研究學習算法的學問,機器學習的過程是從大量數據中自動地尋找有用模型的過程。本課程內容比較抽象,理解上有一定難度,鼓勵學生要敢于面對困難,要有戰勝困難的勇氣與智慧。(4)明確學習目標。要求學生了解機器學習中的分類與回歸要求學生理解有監督學習與無監督學習要求學生理解模型的泛化、過擬合與欠擬合進行重點知識的講解教師根據課件,講解機器學習的基本術語。機器學習的方法試圖從數據中尋找特定的模型,這種從數據中學得模型的過程稱為學習(Learning)或訓練(Training)。如果希望預測的結果是離散值,此類學習任務稱為分類(Classification);如果希望預測的結果是連續值,此類學習任務稱為回歸(Regression)。教師根據課件,講解有監督學習與無監督學習。依據訓練數據是否擁有標記信息,機器學習任務可大致劃分為監督學習(SupervisedLearning)和無監督學習(UnsupervisedLearning)兩大類。教師根據課件,講解模型的泛化、過擬合與欠擬合。學習得到的模型適用于新樣本的能力稱為泛化(Generalization)能力。過擬合:對于一個假設,當存在其他的假設對訓練樣例的擬合比它差,但事實上在包含訓練集合以外的實例的整個分布上表現得卻更好時,說這個假設過度擬合訓練樣例;在模型在訓練集上表現的非常優秀,可以有效的區分每一個樣本。但是在測試集上則表現的十分糟糕。欠擬合,是指學習器對訓練樣本的一般性質尚未學好;所訓練的模型在訓練集中表現的就很差,既準確度很低。三、歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。提問講解的知識點,對存在問題進行講解。帶領學生回顧機器學習的應用場景;有監督學習與無監督學習、分類、回歸、泛化、過擬合與欠擬合的。(2)布置隨堂練習,檢查學生掌握情況。給學生布置隨堂練習,檢測學生的掌握程度,并對學生出現的問題進行解決。(3)課后記:學生一開始對大量的概念比較模糊,后期逐個接觸后慢慢理解。
章節名稱第2章基于Python語言的環境配置裝訂線授課安排裝訂線授課時數2授課時間1-2授課方法講授+課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握Python程序的運行方式了解程序開發流程及編寫方法教學重點掌握基本庫的安裝和使用教學難點配置開發環境☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了機器學習的相關概念,本節課介紹Python環境配置、集成開發環境、程序開發與編寫。本次課的內容需要同學們積極動手,遇到問題多進行交流和討論,促進學生進一步思考。(3)明確學習目標。Python的下載和安裝JupyterNotebook的安裝與使用方法一些必需庫的安裝及功能簡介scikit-learn——Python機器學習庫進行重點知識的講解教師根據課件,演示安裝Python解釋器。教師根據教材內容,以Windows系統為例演示安裝python解釋器。教師根據課件,講解Python程序的運行方式。Python程序的運行方式有兩種分別為交互式和文件式。交互式指Python解釋器逐行接收Python代碼并批量即時響應;文件式也稱批量式,指先將Python代碼保存在文件中,再啟動Python解釋器批量解釋代碼。教師根據課件,演示如何運行Python程序。教師根據教材內容1.3.3中的示例代碼,演示Python代碼的運行。教師根據課件,介紹JupyterNotebook的安裝與使用方法。教師根據教材內容,以Windows系統為例演示如何下載安裝和使用JupyterNotebook。教師根據課件,介紹一些必需庫的安裝及功能簡介。教師根據課件介紹NumPy庫、SciPy庫、Pandas庫、Matplotlib庫的使用。教師根據課件,介紹scikit-learn——Python機器學習庫。scikit-learn是一個由第三方志愿者維護的、不斷改進的機器學習庫;scikit-learn是一個建立在NumPy、SciPy和Matplotlib模塊之上的,主要用Python語言開發的開源機器學習模塊。歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)布置隨堂練習,檢測學生掌握情況。(3)課后記:只要遵循教師演示的步驟,學生都能完成開發環境的搭建。(上機練習)上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機一:請按照以下要求開始上機課:要求如下:掌握JupyterNotebook的安裝與使用掌握程序開發流程掌握程序編寫的基本方法
章節名稱第3章K最近鄰算法裝訂線授課安排裝訂線授課時數2授課時間2-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的K最近鄰算法的原理與用法教學重點K最近鄰算法處理多元分類任務、用于回歸分析教學難點使用K最近鄰算法進行建模;使用模型對新樣本的分類進行預測☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了Python環境配置、集成開發環境、程序開發與編寫,本節課介紹K最近鄰算法。(3)明確學習目標。K最近鄰算法的原理K最近鄰算法的用法K最近鄰算法項目實戰進行重點知識的講解教師根據課件,介紹最近鄰算法的原理。KNN(K-NearestNeighbor)法即K最鄰近法,最初由Cover和Hart于1968年提出,是一個理論上比較成熟的方法,也是最簡單的機器學習算法之一。該方法的思路非常簡單直觀:如果一個樣本在特征空間中的K個最相似(即特征空間中最鄰近)的樣本中的大多數屬于某一個類別,則該樣本也屬于這個類別。該方法在定類決策上只依據最鄰近的一個或者幾個樣本的類別來決定待分樣本所屬的類別。K最近鄰算法是分類算法比較基礎的算法,它易于理解。核心思想就是距離的比較,離誰越近,就被歸類于誰。該原理如“近朱者赤,近墨者黑”,晉朝文學家和哲學家傅玄在《太子少傅箴》中指出:“近朱者赤,近墨者黑;聲和則響清,形正則影直。”告訴人們一個人生活在好的環境里受到好的影響,生活在壞的環境里也會受到壞的影響,強調環境對人的影響。教師根據課件,講解K最近鄰算法的用法。K最近鄰的核心數學知識,就是距離的計算和權重的計算。我們把需要預測的點作為中心點,然后和它周圍的一定半徑內的已知點計算距離,挑選前k個點,進行投票。再k個點中,哪個類別的點多,該預測點就被判定屬于哪一類。這就是k最近鄰分類中k的意思。k值的確定可以通過設置不同的k值,然后比較不同k值對應的最后的分類的正確率來確定。K最近鄰算法在分類任務中的應用K最近鄰算法處理多元分類任務K最近鄰算法用于回歸分析教師根據課件,演示如K最近鄰算法項目實戰——酒的分類。對數據集進行分析生成訓練數據集和測試數據集使用K最近鄰算法進行建模使用模型對新樣本的分類進行預測歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)布置隨堂練習,檢測學生掌握情況。(3)布置課后習題(4)課后記:學生對機器學習第一個算法模型KNN理解還比較能接受。
章節名稱第3章K最近鄰算法裝訂線授課安排裝訂線授課時數2授課時間2授課方法課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的K最近鄰算法的原理與用法教學重點K最近鄰算法處理多元分類任務、用于回歸分析教學難點使用K最近鄰算法進行建模;使用模型對新樣本的分類進行預測☆教學過程與內容:教師演示教師根據課件,演示如K最近鄰算法項目實戰——酒的分類。對數據集進行分析生成訓練數據集和測試數據集使用K最近鄰算法進行建模使用模型對新樣本的分類進行預測KNN的分類思想生動形象的說明了客觀環境對人的影響是很大的,特別是對青少年,所以不僅注重環境選擇,更注意一定環境中人的交往。上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機:使用K最近鄰算法進行酒的分類請按照以下要求開始上機課:從sklearn的datasets模塊載入酒的數據集打印酒的數據集中的簡短描述紅酒數據集中的鍵:dict_keys(['data','target','target_names','DESCR','feature_names'])將數據集拆分為訓練數據集和測試數據集X_trainshape:(133,13)X_testshape:(45,13)y_trainshape:(133,)y_testshape:(45,)導入KNN分類模型fromsklearn.neighborsimportKNeighborsClassifier指定模型的n_neighbors參數值為1knn=KNeighborsClassifier(n_neighbors=1)用模型對數據進行擬合knn.fit(X_train,y_train)打印模型的得分測試數據集得分:0.76輸入新的數據點;使用.predict進行預測預測新紅酒的分類為:['class_2']歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)檢測學生隨堂練習掌握情況。(3)布置課后習題(4)課后記:機器學習算法的設計模式與之前的程序設計模式有些不一樣,學生一開始需要慢慢適應。
章節名稱第4章廣義線性模型裝訂線授課安排裝訂線授課時數2授課時間3-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握線性模型的基本原理與用法教學重點掌握線性模型的基本概念教學難點使用線性模型進行建模;使用模型對新樣本的分類進行預測☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了K最近鄰算法的原理與用法,本節課介紹線性模型。對線性方程組的研究,中國比歐洲至少早1500年,記載在公元初《九章算術》方程章中。激發學生的愛國之情與自豪感,勉勵他們樹立為國家、為人民努力奮斗的遠大理想。(3)明確學習目標。線性模型的基本概念最基本的線性模型——線性回歸進行重點知識的講解教師根據課件,介紹線性模型的基本概念。4.1.1線性模型的一般公式4.1.2線性模型的圖形表示4.1.3線性模型的特點教師根據課件,講解最基本的線性模型——線性回歸。線性回歸的基本原理回歸的目的就是進行連續值的預測:回歸之所以能預測是因為他通過歷史數據,摸透了“套路”,然后通過這個套路來預測未來的結果。在二維空間中繪制兩個變量之間的關系——圖象是直線,這樣的兩個變量之間的關系就是“線性關系”,如果圖象不是直線,就是“非線性關系”。回歸算法是一種有監督學習算法,用來建立自變量X和觀測變量Y之間的映射關系,如果觀測變量是離散的,則稱其為分類Classification;如果觀測變量是連續的,則稱其為回歸Regression。線性回歸模型試圖學得一個線性模型以盡可能準確地預測實值X的輸出標記Y。在這個模型中,因變量Y是連續的,自變量X可以是連續或離散的。LinearRegression線性回歸的基本思想:尋找直線/平面/超平面,使得輸入數據的殘差最小線性回歸算法:最終的線性回歸的結果為:歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)布置隨堂練習,檢測學生掌握情況。(3)課后記:學生對數學公式之類的接受比較困難,但是通過具體實例可以讓學生理解算法原理,比較容易學習算法模型。章節名稱第4章廣義線性模型裝訂線授課安排裝訂線授課時數2授課時間3-2授課方法課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握線性模型的基本原理與用法教學重點掌握線性模型的基本概念教學難點使用線性模型進行建模;使用模型對新樣本的分類進行預測☆教學過程與內容:實例學習:連鎖店消暑飲料的送貨量預測我們通過“連鎖店消暑飲料的送貨量預測”的實例來學習在連續值預測方面應用最廣泛的線性回歸算法,以及一些用途廣泛的擴展算法。場景描述:連鎖便利店的店面面積都不大,沒有大量儲存貨品的能力,針對連鎖店來說,如果能精確計算出每天的補貨量,特別是對一些季節性強的貨品進行統一配送,將有利于節約能源和提高店面使用率。分析:想要對夏季冷飲類貨品進行精確配送,這就要較好地預測第二天每個連鎖店的銷售量,這個預測要依據以往的銷售情況,冷飲類貨品的銷售量與氣溫,當地常住人口,店面交通便捷程度等因素都有較大關系。獲取數據:考慮氣溫,當地常住人口,店面交通情況因素,通過以往銷售數據的記錄,整理得到表中的數據。繪制圖像:數據有規律性趨勢,隨著氣溫升高銷售量逐步增大,在電子表格中對“趨勢線”添加方程??=〖??_????〗_??+〖??_????〗_??+〖??_????〗_??+??(Y表示銷售量,??_??、??_??、??_??代表公交站點數,氣溫和常駐人口)模型分析:模型只要用以往銷售記錄中的y和[??_??,??_??,??_??]數據計算出??和??,之后就可以通過給定新的[??_??,??_??,??_??]計算銷售量。由于方程建立在著名的線性方程??=????+??的基礎上,這個方法被稱為“線性回歸”,同線性方程一樣,線性回歸中??也被稱權重矩陣,??被稱為偏置值。線性回歸就是說通過學習到的線性模型來與猜測新的樣本的輸出值,站位科學角度和事實角度,對事實進行分析論證。教師根據課件,演示線性回歸。對數據集進行分析生成訓練數據集和測試數據集使用線性回歸進行建模算出線性回歸方程上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機:使用線性回歸算法求解方程線性回歸模型的預測線歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)布置隨堂練習,檢測學生掌握情況。(3)課后記:通過列舉生活實例加深學生對線性模型的理解,結合程序代碼的實現幫助學生學習模型算法。
章節名稱第4章廣義線性模型裝訂線授課安排裝訂線授課時數2授課時間4-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握嶺回歸、套索回歸的基本原理與用法教學重點L1、L2正則化的線性模型教學難點嶺回歸、套索回歸的參數調節☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了線性回歸算法的原理與用法,本節課介紹嶺回歸、套索回歸模型。機器學習算法針對特定數據所訓練出來的模型并非是十全十美的,再加上數據本身的復雜性,誤差不可避免。說到誤差,就必須考慮其來源:模型誤差=偏差(Bias)+方差(Variance)+數據本身的誤差。學習中出現錯誤問題是不可避免的,鼓勵學生自主發現問題、分析問題和解決問題。(3)明確學習目標。使用L2正則化的線性模型——嶺回歸使用L1正則化的線性模型——套索回歸進行重點知識的講解教師根據課件,介紹使用L2正則化的線性模型——嶺回歸模型的基本原理。-嶺回歸是一種用于共線性數據分析的有偏估計回歸方法,是一種改良的最小二乘估計法;-通過放棄最小二乘法的無偏性,以損失部分信息、降低精度為代價從而獲得更符合實際、更可靠的回歸系數,對病態數據(這樣的數據中某個元素的微小變動會導致計算結果誤差很大)的擬合效果比最小二乘法好。-嶺回歸通過在代價函數后面加上一個對參數的約束項(回歸系數向量的l2范數與一個常數α的乘積,稱作L2正則化)來防止過擬合。教師根據課件,講解使用L1正則化的線性模型——套索回歸。-Lasso(Leastabsoluteshrinkageandselectionoperator)方法是以縮小變量集(降階)為思想的壓縮估計方法。它通過構造一個懲罰函數,可以將變量的系數進行壓縮并使某些回歸系數變為0,進而達到變量選擇的目的。-在數學表達上,Lasso類似于嶺回歸,也是在代價函數基礎上增加了一個懲罰項的線性模型,區別在于Lasso的正則項為系數向量的l1范數與一個常數α的乘積(稱作L1正則化)-Lasso是可以估計稀疏系數的線性模型,尤其適用于減少給定解決方案依賴的特征數量的場合。如果數據的特征過多,而其中只有一小部分是真正重要的,此時選擇Lasso比較合適。教師根據課件,演示套索回歸和嶺回歸的對比。歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)布置隨堂練習,檢測學生掌握情況。(3)課后記:通過不同類型的線性模型的對比加深學生對模型的理解,結合圖示幫助學生理解模型參數對模型擬合效果的區別。
章節名稱第4章廣義線性模型裝訂線授課安排裝訂線授課時數2授課時間4-2授課方法課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握嶺回歸、套索回歸的基本原理與用法教學重點L1、L2正則化的線性模型教學難點嶺回歸、套索回歸的參數調節☆教學過程與內容:上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。選擇學生感興趣的實際問題,吸引學生積極參與,引導學生的正確價值取向。形式:單獨完成上機:使用線性回歸算法進行房價預測要求如下:1.導入boston數據集fromsklearn.datasetsimportload_bostonboston=load_boston()X=boston['data']#數據樣本y=boston['target']#目標變量2.將數據集劃分為訓練集和測試集fromsklearn.model_selectionimporttrain_test_splitX_train,X_test,y_train,y_test=train_test_split(X,y,random_state=8)3.使用線性回歸算法進行建模并訓練模型fromsklearn.linear_modelimportLinearRegressionreg=LinearRegression()#建立線性回歸模型對象reg.fit(X_train,y_train)#訓練模型4.測試模型進行數據預測和評分#預測測試集結果y_pred=reg.predict(X_test)print("測試集得分:{:.2f}".format(reg.score(X_test,y_test)))測試集得分:0.725.繪制折線圖對比預測值和真實值歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)檢測學生隨堂練習掌握情況,布置課后練習(3)課后記:在學習過兩個典型的機器學習模型后,學生已經了解模型的編程模式,并嘗試應用到實際應用中。
章節名稱第5章樸素貝葉斯裝訂線授課安排裝訂線授課時數2授課時間5-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握貝努利、高斯、多項式樸素貝葉斯的基本原理與用法教學重點樸素貝葉斯算法的三種不同方法教學難點使用高斯樸素貝葉斯進行建模☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了嶺回歸、套索回歸的基本原理與用法,本節課介紹貝努利、高斯、多項式樸素貝葉斯模型。樸素貝葉斯分類器(NaiveBayesClassifier或NBC)發源于古典數學理論,有著堅實的數學基礎,以及穩定的分類效率。樸素貝葉斯算法假設了數據集屬性之間是相互獨立的,因此算法的邏輯性十分簡單,并且算法較為穩定,當數據呈現不同的特點時,樸素貝葉斯的分類性能不會有太大的差異。相對于其他精心設計的更復雜的分類算法,樸素貝葉斯分類算法是學習效率和分類效果較好的分類器之一。樸素貝葉斯算法在文字識別,圖像識別方向有著較為重要的作用。可以將未知的一種文字或圖像,根據其已有的分類規則來進行分類,最終達到分類的目的。考慮學生的認知規律和接受特點,將算法模型與現實生活中的樸素貝葉斯算法進行應用,如文本分類,垃圾郵件的分類,信用評估,釣魚網站檢測等等。引導學生將這些思路與方法用來分析和解決現實社會中的問題,觸發對人生的思考。(3)明確學習目標。樸素貝葉斯算法的三種不同方法使用高斯樸素貝葉斯進行建模進行重點知識的講解教師根據課件,介紹樸素貝葉斯基本概念。教師根據課件,講解樸素貝葉斯算法的不同方法。貝努利樸素貝葉斯在伯努利模型中,每個特征的取值是布爾型的,即true和false,或者1和0。如果樣本特征是二元離散值或者很稀疏的多元離散值,使用BernoulliNB高斯樸素貝葉斯高斯分布就是正態分布,GaussianNB就是先驗為高斯分布的樸素貝葉斯如果樣本特征的分布大部分是連續值,使用GaussianNB會比較好多項式樸素貝葉斯如果如果樣本特征的分大部分是多元離散值,使用MultinomialNB比較合適教師根據課件,演示樸素貝葉斯實戰。對數據集進行分析使用高斯樸素貝葉斯進行建模高斯樸素貝葉斯的學習曲線歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)布置隨堂練習,檢測學生掌握情況。(3)課后記:給學生講解原理的時候盡量簡化數學公式,通過舉例和圖示化的方式幫助學生理解各種模型的特點和區別。
章節名稱第5章樸素貝葉斯裝訂線授課安排裝訂線授課時數2授課時間5-2授課方法課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握貝努利、高斯、多項式樸素貝葉斯的基本原理與用法教學重點樸素貝葉斯算法的三種不同方法教學難點使用高斯樸素貝葉斯進行建模☆教學過程與內容:教師根據課件,演示樸素貝葉斯實戰:對數據集進行分析使用高斯樸素貝葉斯進行建模高斯樸素貝葉斯的學習曲線通過腫瘤良惡性判斷,引導學生管理好自身健康,注重自身調節要素,使學習過程更為緊湊和流暢,以便將來投身國家建設。上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機:使用樸素貝葉斯判斷腫瘤是良性還是惡性要求如下:1.導入威斯康辛乳腺腫瘤數據集#導入威斯康辛乳腺腫瘤數據集fromsklearn.datasetsimportload_breast_cancercancer=load_breast_cancer()#打印數據集鍵值print(cancer.keys())2.將數據集劃分為訓練集和測試集fromsklearn.model_selectionimporttrain_test_split#將數據集的數值和分類目標賦值給X和yX,y=cancer.data,cancer.target#使用數據集拆分工具拆分為訓練集和測試集X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=8)#打印訓練集和測試集的數據形態print('訓練集數據形態:',X_train.shape)print('測試集數據形態:',X_test.shape)3.使用高斯樸素貝葉斯進行建模fromsklearn.naive_bayesimportGaussianNBgnb=GaussianNB()gnb.fit(X_train,y_train)#打印模型評分print('訓練集得分:{:.3f}'.format(gnb.score(X_train,y_train)))print('測試集得分:{:.3f}'.format(gnb.score(X_test,y_test)))訓練集得分:0.948測試集得分:0.9374.測試模型進行數據預測和評分#打印模型預測的分類和真實的分類print('模型預測的分類是:{}'.format(gnb.predict([X[312]])))print('樣本的正確分類是:',y[312])模型預測的分類是:[1]樣本的正確分類是:15.繪制高斯樸素貝葉斯的學習曲線歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)檢測學生隨堂練習掌握情況。(3)課后記:學生在熟悉了機器學習算法模型建模的模式后,可以在老師的演示講解后,課下自行完成模型算法和測試。
章節名稱第6章決策樹與隨機森林裝訂線授課安排裝訂線授課時數2授課時間6-1授課方法講授+課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握決策樹與隨機森林的原理和使用教學重點決策樹與隨機森林的原理和構造教學難點決策樹與隨機森林的優勢和不足☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了貝努利、高斯、多項式樸素貝葉斯模型的基本原理與用法,本節課介紹決策樹與隨機森林的原理和構造。決策樹易于理解和實現,人們在在學習過程中不需要使用者了解很多的背景知識,這同時是它的能夠直接體現數據的特點,只要通過解釋后都有能力去理解決策樹所表達的意義。通過具體實例的演示,學生既可以掌握相關技能,也能培育職業精神與職業素養。(3)明確學習目標。決策樹與隨機森林的原理和構造決策樹與隨機森林的優勢和不足進行重點知識的講解教師根據課件,介紹決策樹的基本原理。分類決策樹是一種描述對象分類的樹形結構。樹中的節點為了兩類:內部節點和葉節點,內部節點表示了一個特征,葉節點表示了最后輸出的類標志。有趣的是,與其他分類模型算法不同的是,決策樹既不是尋找超平面對其進行逼近,也不是使用先驗后驗概率對其進行預測,決策樹在分類的過程中所使用的是最大化樣本子集特征純度的策略進行分類,這樣就不需要任何領域知識/參數設定。當然決策樹模型也會有欠擬合或過擬合的擔憂,那么我們其實在決策樹模型中就將關注點放在了以下幾點:策略:最優化目標函數/目標值是什么?策略:如何避免過擬合?算法:我們依據最優化目標采取的算法是什么?算法:我們如何生成一個決策樹,并防止其過擬合?1.決策樹生成過程是一個遞歸的過程2.在遞歸過程中會導致遞歸返回的情形有三種:-2.1當前節點包含的樣本子集都是同一類,無需劃分,直接以當前類作為葉節點的決策結果。-2.2當前節點屬性級為空集,或所有樣本在所有屬性上都取值相同,無法劃分,直接按照少數服從多數來作為當前葉節點的決策結果,這是利用當前節點的后驗分布。-2.3當前節點的樣本子集為空集,無法劃分,只能以其父節點中的樣本子集中的樣本最多類來表示。把父節點的樣本分布當作當前節點的先驗分布。教師根據課件,講解隨機森林的構造方法。隨機森林是集成學習的一個子類,它依靠于決策樹的投票選擇來決定最后的分類結果。隨機森林中有許多的分類樹。我們要將一個輸入樣本進行分類,我們需要將輸入樣本輸入到每棵樹中進行分類。打個形象的比喻:森林中召開會議,討論某個動物到底是老鼠還是松鼠,每棵樹都要獨立地發表自己對這個問題的看法,也就是每棵樹都要投票。該動物到底是老鼠還是松鼠,要依據投票情況來確定,獲得票數最多的類別就是森林的分類結果。隨機森林是一個可做能夠回歸和分類。它具備處理大數據的特性,而且它有助于估計或變量是非常重要的基礎數據建模。參數說明:最主要的兩個參數是n_estimators和max_features。n_estimators:表示森林里樹的個數。理論上是越大越好。但是伴隨著就是計算時間的增長。但是并不是取得越大就會越好,預測效果最好的將會出現在合理的樹個數。max_features:隨機選擇特征集合的子集合,并用來分割節點。子集合的個數越少,方差就會減少的越快,但同時偏差就會增加的越快。根據較好的實踐經驗。如果是回歸問題則:max_features=n_features,如果是分類問題則max_features=sqrt(n_features)。如果想獲取較好的結果,必須將max_depth=None,同時min_sample_split=1。同時還要記得進行cross_validated(交叉驗證),除此之外記得在randomforest中,bootstrap=True。但在extra-trees中,bootstrap=False。(3)教師根據課件,演示信用卡審批系統的決策樹。歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)課后記:決策樹模型可以進行可視化,使得學生對該模型的算法比較容易理解。
章節名稱第6章決策樹與隨機森林裝訂線授課安排裝訂線授課時數2授課時間6-2授課方法課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的掌握決策樹與隨機森林的原理和使用教學重點決策樹與隨機森林的原理和構造教學難點決策樹與隨機森林的優勢和不足☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。本節課介紹決策樹與隨機森林的應用。引導學生在學習過程中接受積極向上、愛國敬業的精神,樹立正確的價值觀與人生觀。(3)明確學習目標。決策樹與隨機森林的優勢和不足進行重點知識的講解教師根據課件,介紹決策樹與隨機森林的優勢和不足。隨機森林的本質屬于機器學習的一大分支——集成學習(EnsembleLearning)方法。它有如下幾個特點:在當前所有算法中,具有極好的準確率能夠有效地運行在大數據集上能夠處理具有高維特征的輸入樣本,而且不需要降維能夠評估各個特征在分類問題上的重要性在生成過程中,能夠獲取到內部生成誤差的一種無偏估計對于缺失值問題也能夠獲得很好得結果上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機:使用酒的數據集演示決策樹的構建(選取數據集樣本的前兩個特征)#導入tree模型和數據集加載工具fromsklearnimporttree,datasets#導入數據集拆分工具fromsklearn.model_selectionimporttrain_test_splitwine=datasets.load_wine()#只選取數據集的前兩個特征X=wine.data[:,:2]y=wine.target#將數據集拆分成訓練集和測試集X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=8)設定決策樹分類器最大深度加大深度試試看結果會有什么變化#設定決策樹最大深度為3clf2=tree.DecisionTreeClassifier(max_depth=3)#重新擬合數據clf2.fit(X_train,y_train)繪制圖形看看分類器的表現歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)檢測學生隨堂練習掌握情況。(3)課后記:通過一個可視化的樹形圖演示決策樹的工作過程,使學生可以直觀的看到決策樹的原理,加深理解。
章節名稱第6章決策樹與隨機森林裝訂線授課安排裝訂線授課時數2授課時間7-1授課方法講授+課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的隨機森林實例教學重點決策樹算法教學難點建模☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了決策樹與隨機森林的原理和構造,本節課介紹隨機森林實例。設計學生積極參與的教學情境,引導學生自主思考和主動實踐,從而獲得知識與技能,培養良好的職業素質,樹立正確的理想信念。(3)明確學習目標。決策樹算法進行重點知識的講解教師根據課件,演示數據集的準備。將美國人口普查數據導入,查看'年齡','單位性質','學歷','性別','周工作時長','職業','收入'這幾項特征值,根據特征判斷年收入階層。教師根據課件,演示用get_dummies處理數據。使用get_dummies將文本數據轉化為數值對比樣本原始特征和虛擬變量特征把各列分配給特征向量X和分類標簽y教師根據課件,演示用決策樹建模并做出預測。將數據集拆分為訓練集和測試集用最大深度為5的隨機森林擬合數據把Mr.Z的數據輸入,并用模型對他的收入進行預測上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機:使用隨機森林判斷年收入階層要求如下:1.導入成年人口統計數據集'adult.csv'importpandasaspddata=pd.read_csv('adult.csv',header=None,index_col=False,names=['年齡','單位性質','權重','學歷','受教育時長','婚姻狀況','職業','家庭情況','種族','性別','資產所得','資產損失','周工作時長','原籍','收入'])#為了方便展示,我們選取其中一部分數據data_lite=data[['年齡','單位性質','學歷','性別','周工作時長','職業','收入']]2.用get_dummies處理數據,將文本數據轉化為數值#使用get_dummies將文本數據轉化為數值data_dummies=pd.get_dummies(data_lite)#對比樣本原始特征和虛擬變量特征print('樣本原始特征:\n',list(data_lite.columns),'\n')print('虛擬變量特征:\n',list(data_dummies.columns))3.將數據集劃分為訓練集和測試集4.用決策樹建模并做出預測fromsklearn.model_selectionimporttrain_test_splitfromsklearnimporttree#將數據集拆分為訓練集和測試集X_train,X_test,y_train,y_test=train_test_split(X,y,random_state=0)#用最大深度為5的隨機森林擬合數據go_dating_tree=tree.DecisionTreeClassifier(max_depth=5)go_dating_tree.fit(X_train,y_train)print('模型得分:{:.2f}'.format(go_dating_tree.score(X_test,y_test)))模型得分:0.80#將Mr.Z的數據輸入給模型Mr_Z=[[37,40,0,0,0,0,0,0,1,0,0,0,0,0,0,0,0,0,0,0,0,0,0,1,0,0,0,0,1,0,1,0,0,0,0,0,0,0,0,0,0,0,0,0]]#使用模型做出預測dating_dec=go_dating_tree.predict(Mr_Z)ifdating_dec==1:print("大膽去追求真愛吧,這哥們月薪過5萬了!")else:print("不用去了,不滿足你的要求")5.用隨機森林建模并做出預測fromsklearn.ensembleimportRandomForestClassifiergo_dating_forest=RandomForestClassifier(n_estimators=20,max_depth=7,random_state=0)go_dating_forest.fit(X_train,y_train)go_dating_forest.score(X_test,y_test)go_dating_forest.predict(Mr_Z)array([0],dtype=uint8)歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)檢測學生隨堂練習掌握情況,布置課后作業。(3)課后記:學生對決策樹和隨機森林的理解情況不錯,部分同學對常規代碼還有待加強,有些關鍵字記不住。
章節名稱第7章支持向量機SVM裝訂線授課安排裝訂線授課時數2授課時間7-2授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的支持向量機SVM基本概念教學重點支持向量機SVM基本原理教學難點支持向量機SVM的核函數☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了隨機森林實例,本節課介紹支持向量機SVM基本概念。要堅持價值性和知識性相統一,即在幫助學生掌握知識的同時,實現價值觀引導;(3)明確學習目標。支持向量機SVM的原理支持向量機SVM的核函數進行重點知識的講解教師根據課件,介紹支持向量機SVM的原理。支持向量機(supportvectormachines,SVM)是一種二分類模型,它的基本模型是定義在特征空間上的間隔最大的線性分類器,間隔最大使它有別于感知機;SVM還包括核技巧,這使它成為實質上的非線性分類器。SVM的的學習策略就是間隔最大化,可形式化為一個求解凸二次規劃的問題,也等價于正則化的合頁損失函數的最小化問題。SVM的的學習算法就是求解凸二次規劃的最優化算法。SVM學習的基本想法是求解能夠正確劃分訓練數據集并且幾何間隔最大的分離超平面。對于線性可分的數據集來說,這樣的超平面有無窮多個(即感知機),但是幾何間隔最大的分離超平面卻是唯一的。教師根據課件,介紹支持向量機SVM的核函數。對于輸入空間中的非線性分類問題,可以通過非線性變換將它轉化為某個維特征空間中的線性分類問題,在高維特征空間中學習線性支持向量機。由于在線性支持向量機學習的對偶問題里,目標函數和分類決策函數都只涉及實例和實例之間的內積,所以不需要顯式地指定非線性變換,而是用核函數替換當中的內積。核函數表示,通過一個非線性轉換后的兩個實例間的內積。SVC(C=1000,cache_size=200,class_weight=None,coef0=0.0,decision_function_shape='ovr',degree=3,gamma='auto_deprecated',kernel='linear',max_iter=-1,probability=False,random_state=None,shrinking=True,tol=0.001,verbose=False)參數C:SVC的懲罰參數。C越大,即對分錯樣本的懲罰程度越大,因此在訓練樣本中準確率越高,但是泛化能力降低,也就是對測試數據的分類準確率降低。相反,減小C的話,容許訓練樣本中有一些誤分類錯誤樣本,泛化能力強。對于訓練樣本帶有噪聲的情況,一般采用后者,把訓練樣本集中錯誤分類的樣本作為噪聲。kernel:核函數,默認是rbf,可以是‘linear’線性,‘poly’多項式,‘rbf’高斯,‘sigmoid’,‘precomputed’核矩陣。degree:多項式poly函數的維度,默認是3,選擇其他核函數時會被忽略。gamma:‘rbf’,‘poly’和‘sigmoid’的核函數參數。默認是’auto’,代表其值為樣本特征數的倒數,即1/n_features。coef0:核函數的常數項。對于‘poly’和‘sigmoid’有用。cache_size:核函數cache緩存大小,默認為200。class_weight:類別的權重,字典形式傳遞,給每個類別分別設置不同的懲罰參數C為weight*C。decision_function_shape:‘ovo’(OneVsOne),‘ovr’(OneVsRest)orNone,多分類時需要進行選擇的兩種不同策略。max_iter:最大迭代次數。-1為無限制。probability:是否采用概率估計,默認為False。shrinking:是否采用shrinkingheuristic收縮啟發式方法,默認為truetol:停止訓練的誤差值大小,默認為1e-3verbose:是否允許冗余輸出教師分別演示線性內核和高斯內核的分類圖歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)布置隨堂練習,檢測學生掌握情況。(3)課后記:支持向量機的算法公式比較復雜,結合圖形演示幫助學生理解向量機的分類原理,將原本抽象的概念可視化。
章節名稱第7章支持向量機SVM裝訂線授課安排裝訂線授課時數2授課時間8-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的SVM的核函數與參數選擇教學重點SVM的核函數與參數選擇教學難點支持向量機的gamma、C參數調節☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了支持向量機SVM基本概念,本節課介紹SVM的核函數與參數選擇。引導學生將這些思路與方法用來分析和解決現實社會中的問題,觸發對人生的思考。(3)明確學習目標。SVM的核函數與參數選擇支持向量機的gamma、C參數調節進行重點知識的講解教師根據課件,介紹不同核函數的SVM對比。常見的核函數有:線性核函數、多項式核函數、高斯核函數教師根據課件,介紹支持SVM的核函數選擇。選擇核函數的一般原則是依據數據量:當數據量很大的時候,可以選擇復雜一點的模型,因為大數據量可以減低復雜模型引起的過擬合風險。如果數據量較小,則應該首先考慮選擇簡單的線性的核函數,若發現欠擬合,再逐步增加多項式核函數,糾正欠擬合。更進一步來說,也可以根據樣本量和特征量的比例,嘗試使用不同的核函數,其規律如圖所示:教師分別演示不同核函數的SVM對比分類圖教師根據課件分別演示支持向量機的gamma、C參數調節其中有兩個重要的參數,即C(懲罰系數)和gamma,gamma越大,支持向量越少,gamma越小,支持向量越多。而支持向量的個數影響訓練和預測的速度。C越高,容易過擬合。C越小,容易欠擬合。歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)布置隨堂練習,檢測學生掌握情況。(3)課后記:支持向量機的內核和參數選擇結合圖形演示幫助學生理解不同內核的分類原理,將原本抽象的概念可視化。
章節名稱第7章支持向量機SVM裝訂線授課安排裝訂線授課時數2授課時間8-2授課方法課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的SVM的核函數與參數選擇教學重點SVM的核函數與參數選擇教學難點支持向量機的gamma、C參數調節☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了SVM的核函數與參數選擇,本節課介紹SVM實例。設計與學生既有知識結構、生活經驗以及社會現實之間的關聯的案例,激發學生的學習興趣。(3)明確學習目標。SVM算法——波士頓房價回歸分析進行重點知識的講解教師根據課件,演示數據集的準備。將波士頓房價數據集導入,查看特征值,根據特征預測波士頓房價。教師根據課件,演示用SVR進行建模。導入支持向量機回歸模型分別測試linear核函數和rbf核函數教師根據課件,演示對數據集進行預處理。查看數據集中各個特征的數量級用StandardScaler類可用于特征的標準差標準化處理教師根據課件,演示用經過預處理后的數據重新訓練模型。用經過預處理后的數據重新訓練模型進一步調整RBF內核的SVR模型參數上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機:使用SVM回歸分析波士頓房價要求如下:1.導入波士頓房價數據集2.使用SVR進行建模值3.對數據集進行預處理4.用經過預處理后的數據重新訓練模型5.進一步調整RBF內核的SVR模型參數歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)檢測學生隨堂練習掌握情況,布置課后作業。(3)課后記:支持向量機SVM在分類和回歸上的應用都給予了具體實例引導學生分析模型特征,學生對應用場景有了一定的理解。
章節名稱第8章神經網絡裝訂線授課安排裝訂線授課時數2授課時間9-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的了解神經網絡的原理及使用教學重點掌握MLP神經網絡的參數設置教學難點利用神經網絡辨認手寫數字☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了SVM的基本原理與用法,本節課介紹神經網絡的原理及使用。GeoffreyHinton,被稱為“神經網絡之父”、“深度學習鼻祖”,他曾獲得愛丁堡大學人工智能的博士學位,并且為多倫多大學的特聘教授。在2012年,Hinton還獲得了加拿大基廉獎(KillamPrizes,有“加拿大諾貝爾獎”之稱的國家最高科學獎)。2013年,Hinton加入谷歌并帶領一個AI團隊,他將神經網絡帶入到研究與應用的熱潮,將“深度學習”從邊緣課題變成了谷歌等互聯網巨頭仰賴的核心技術,并將HintonBackPropagation(反向傳播)算法應用到神經網絡與深度學習。(3)明確學習目標。神經網絡的原理及使用神經網絡的參數設置進行重點知識的講解教師根據課件,介紹神經網絡的原理。神經網絡是由一個個的被稱為“神經元”的基本單元構成,一個簡單的神經網絡的結構如下圖所示:其中一個神經元的輸出是另一個神經元的輸入,+1項表示的是偏置項。上圖是含有一個隱含層的神經網絡模型,L1層稱為輸入層,L2層稱為隱含層,L3層稱為輸出層。教師根據課件,講解神經網絡中的激活函數。在神經網絡中,激活函數的作用是能夠給神經網絡加入一些非線性因素,使得神經網絡可以更好地解決較為復雜的問題。激活函數有:sigmoid函數,tanh函數,Relu函數,softmax函數。(3)教師根據課件,演示神經網絡的參數設置。主要參數說明:hidden_layer_sizes:例如hidden_layer_sizes=(50,50),表示有兩層隱藏層,第一層隱藏層有50個神經元,第二層也有50個神經元。activation:激活函數,{‘identity’,‘logistic’,‘tanh’,‘relu’},默認relusolver:{‘lbfgs’,‘sgd’,‘adam’},默認adam,權重優化的求解器alpha:float,可選的,默認0.0001,L2懲罰(正則化項)參數歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)課后記:神經網絡是深度學習的入門概念,目前只需要學生有個基本了解,能使用MLP模型簡單調參。
章節名稱第8章神經網絡裝訂線授課安排裝訂線授課時數2授課時間9-2授課方法講授+課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的了解神經網絡的原理及使用教學重點掌握MLP神經網絡的參數設置教學難點利用神經網絡辨認手寫數字☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了神經網絡的原理及使用,本節課介紹用于手寫數字識別的數據集,掌握神經網絡辨認手寫數字的原理,最后搭建神經網絡模型。。Hinton教授是機器學習的開創者,使得計算機可以獨立想出程序、自己解決問題。特別重要的是,他還從中開辟了機器學習的一個子領域,即所謂的“深度學習”,也就是讓那些機器像一個蹣跚學步的孩子一樣,模仿大腦的神經網絡形式。他笑著表示:“我對我自己的數據有一種里根式的篤信。”而正是GeoffreyHinton對自己的工作成果不可動搖的信念,促使他從學術生涯多年的不得志走到了當前最熱門的AI前沿。(3)明確學習目標。利用神經網絡辨認手寫數字進行重點知識的講解教師根據課件,演示手寫數字識別的數據集的準備。手寫數字識別屬于圖像識別的一種。計算機識別手寫體圖片最大的難度是手寫體與印刷字體不同,不同人的手寫體風格迥異,大小不一。但是數字手寫體識別最大的特點是它的類別只有10個種類,這也使得手寫數字識別成為了相對簡單的圖像識別任務。Mnist數據集是一個包含數字0~9的手寫體圖片數據集,圖片已歸一化為以手寫數字為中心的28*28規格的圖片。MNIST由訓練集與測試集兩個部分組成,訓練集中有60000個手寫體圖片和對應的標簽,而測試集中有1萬個手寫體圖片及對應標簽。教師根據課件,介紹神經網絡辨認手寫數字的原理。在人工智能領域,單純用數字表達分類存在一個容易混淆的問題,容易將“分類”誤解成為“程度”,而很多情況下,不同的分類之間根本沒有數量的關系,所以應當讓分類在不同的“維度”中,以確保它們不相關,因此需要利用“獨熱碼”(onehot)來指示不同的分類。獨熱碼是只有一個元素是1,其余元素都為0的向量,用獨熱碼表達分類時,向量中元素的個數與需要表達的分類數應該一致。我們知道這個手寫數字圖片是由28*28個像素點構成的矩陣,也就是說他是28*28的矩陣,一共784個元素,出于辨認筆記的問題對神經網絡復雜程度的要求并不高,為了進一步減少計算量,可以將二維矩陣拉伸變為一維的向量,那么可將其拉伸成一個784*1的矩陣,為了方便計算把該矩陣轉置,變為1*784的矩陣,下面的問題就來了我們的輸出要是1*10的獨熱碼形式,怎么變化可以得到?如9這個手寫數字的數據是1*784的矩陣,通過了兩次變換得到了最后的1*10的獨熱碼。我們看看他是怎么變化的,首先成了一個784*32的矩陣,變為1*32,然后再乘以32*10的矩陣,就會得到1*10的矩陣了。教師根據課件,演示神經網絡實例——手寫識別。上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機:使用神經網絡訓練手寫數字識別模型要求如下:1.加載MNIST手寫數字數據集2.訓練MLP神經網絡3.使用模型進行數字識別三、歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)檢測學生隨堂練習掌握情況,布置課后作業。(3)課后記:通過一個圖像識別的簡單例子來理解神經網絡的原理和使用,使學生易于接受比較抽象的概念。
章節名稱第9章數據預處理、降維、特征提取及聚類裝訂線授課安排裝訂線授課時數2授課時間10-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的了解數據預處理、降維的原理及使用教學重點掌握幾種常見的數據預處理工具教學難點PCA主成分分析用于數據降維☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了神經網絡的基本原理與用法,本節課介紹預處理、降維的原理及使用。
在許多領域的研究與應用中,往往需要對反映事物的多個變量進行大量的觀測,收集大量數據以便進行分析尋找規律。如果分別對每個指標進行分析,分析往往是孤立的,而不是綜合的。盲目減少指標會損失很多信息,容易產生錯誤的結論。因此需要找到一個合理的方法,在減少需要分析的指標同時,盡量減少原指標包含信息的損失,以達到對所收集數據進行全面分析的目的。引導學生將這些思路與方法用來分析和解決現實社會中的問題,自主思考和主動實踐。(3)明確學習目標。數據預處理工具的原理及使用PCA主成分分析用于數據降維進行重點知識的講解教師根據課件,介紹數據預處理的原理。9.1.1使用StandardScaler進行數據預處理StandardScaler類是一個用來將數據進行歸一化和標準化的類。將數據按其屬性(按列進行)減去平均值和縮放到單位方差來標準化特征。得到的結果是,對于每個屬性/每列來說所有數據都聚集在0附近,標準差為1,使得新的X數據集方差為1,均值為0適用于:如果數據的分布本身就服從正態分布,就可以用這個方法。9.1.2使用MinMaxScaler進行數據預處理將每個元素(特征,feature)轉換成給定范圍的值。MinMaxScaler有一個重要參數"feature_range",控制數據壓縮到的范圍,默認是[0,1]。適用于數據在一個范圍內分布的情況,在不涉及距離度量、協方差計算、數據不符合正太分布的時候,可以使用MinMaxScaler。9.1.3使用RobustScaler進行數據預處理若數據中存在很大的異常值,可能會影響特征的平均值和方差,影響標準化結果。在此種情況下,使用中位數和四分位數間距進行縮放會更有效。9.1.4使用Normalizer進行數據預處理normalize提供了一個快速有簡單的方式在一個單向量上來實現這正則化的功能。正則化有l1,l2等。正則化是將樣本在向量空間模型上的一個轉換,經常被使用在分類與聚類中。教師根據課件,講解PCA主成分分析原理。PCA是一種無監督降維算法,它是最常用的降維算法之一,可以很好地解決因變量太多而復雜性、計算量增大的弊端。PCA主要通過把數據從高維映射到低維來降低特征維度。PCA將n維輸入數據縮減為r維,其中r<n。簡單地說,PCA實質上是一個基變換,使得變換后的數據有最大的方差,也就是通過對坐標軸的旋轉和坐標原點的平移使得其中一個軸(主軸)與數據點之間的方差最小,坐標轉換后去掉高方差的正交軸,得到降維數據集。(3)教師根據課件,演示對數據降維以便于進行可視化。使用主成分繪制熱度圖分析原始特征與PCA主成分之間的關系歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)課后記:主成分分析作為基礎的數學分析方法,其實際應用十分廣泛,比如人口統計學、數量地理學、分子動力學模擬、數學建模、數理分析等學科中均有應用,通過原理分析讓學生理解應用場景。
章節名稱第9章數據預處理、降維、特征提取及聚類裝訂線授課安排裝訂線授課時數2授課時間10-2授課方法課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的了解數據預處理、降維的原理及使用教學重點通過數據預處理提高模型準確率教學難點對數據降維以便于進行可視化☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了預處理、降維的原理及使用,本節課介紹通過數據預處理提高模型準確率,對數據降維以便于進行可視化。
1846年,Bracais提出的旋轉多元正態橢球到“主坐標”上,使得新變量之間相互獨立。[2]皮爾遜(Pearson)(1901)、霍特林(Hotelling)(1933)都對主成分的發展做出了貢獻,霍特林的推導模式被視為主成分模型的成熟標志。主成分分析被廣泛應用于區域經濟發展評價,服裝標準制定,滿意度測評,模式識別,圖像壓縮等許多領域。引導學生立足專業和相關研究進展,樹立奉獻社會的人生理想。(3)明確學習目標。數據預處理工具的原理及使用PCA主成分分析用于數據降維上機練習上機練習主要針對本章中需要重點掌握的知識點,以及在程序中容易出錯的內容進行練習,通過上機練習可以考察同學對知識點的掌握情況,對本章知識掌握程度。形式:單獨完成上機1:通過數據預處理提高模型準確率要求如下:1.導入紅酒數據集2.導入MLP神經網絡,設定MLP設計網絡的參數3.使用MLP擬合數據,打印模型得分4.使用MinMaxScaler進行數據預處理5.重新訓練模型,打印模型分數上機2:對數據降維以便于進行可視化要求如下:1.導入紅酒數據集2.對紅酒數據集進行預處理3.導入PCA,設置主成分數量為2以便我們進行可視化4.打印主成分提取后的數據形態5.將經過PCA降維的數據可視化6.使用主成分繪制熱度圖歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)課后記:通過實例操作使學生體會數據預處理對模型準確率的作用,學生也能使用PCA降維使多維數據進行可視化。
章節名稱第9章數據預處理、降維、特征提取及聚類裝訂線授課安排裝訂線授課時數2授課時間11-1授課方法講授授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的了解特征提取、聚類算法的原理及使用教學重點掌握幾種常用的聚類算法教學難點NMF非負矩陣分解用于特征提取☆教學過程與內容:回顧上節課內容,繼續講解本課時的知識(1)教師對學生們的疑問進行統一答疑。(2)回顧總結上節課內容,繼續介紹本課時的內容。上機課介紹了預處理、降維的原理及使用,本節課介紹特征提取、聚類算法的原理及使用。
聚類分析起源于分類學,在古老的分類學中,人們主要依靠經驗和專業知識來實現分類,很少利用數學工具進行定量的分類。隨著人類科學技術的發展,對分類的要求越來越高,以致有時僅憑經驗和專業知識難以確切地進行分類,于是人們逐漸地把數學工具引用到了分類學中,形成了數值分類學,之后又將多元分析的技術引入到數值分類學形成了聚類分析。本次課的內容涉及圖像處理,難度較大,鼓勵學生要敢于面對困難,要有破解專業難、戰勝困難的勇氣與智慧。(3)明確學習目標。特征提取的原理及使用K均值聚類算法進行重點知識的講解教師根據課件,介紹特征提取的原理。在機器學習、模式識別和圖像處理中,特征提取從初始的一組測量數據開始,并建立旨在提供信息和非冗余的派生值(特征),從而促進后續的學習和泛化步驟,并且在某些情況下帶來更好的可解釋性。特征提取與降維有關。特征的好壞對泛化能力有至關重要的影響。PCA是非常常用的數據降維方法。它的基本思想是從一組特征中計算出一組按照重要性的大小從大到小依次排列的新特征,它們是原有特征的線性組合,并且新特征之間不相關,我們計算出原有特征在新特征上的映射值即為新的降維后的樣本。也就是說PCA的目標是用一組正交向量來對原特征進行變換得到新特征,新特征是原有特征的線性組合。非負矩陣分解用于特征提取基本思想:給定一個非負矩陣V,NMF能夠找到一個非負矩陣W和一個非負矩陣H,使得矩陣W和H的乘積近似等于矩陣V中的值。NMF能夠廣泛應用于圖像分析、文本挖掘和語音處理等領域。教師根據課件,講解聚類算法原理。k均值聚類算法(k-meansclusteringalgorithm)是一種迭代求解的聚類分析算法,其步驟是,預將數據分為K組,則隨機選取K個對象作為初始的聚類中心,然后計算每個對象與各個種子聚類中心之間的距離,把每個對象分配給距離它最近的聚類中心。凝聚聚類(agglomerativeclustering)指的是許多基于相同原則構建的聚類算法,這一原則是:算法首先聲明每個點是自己的簇,然后合并兩個最相似的簇,直到滿足某種停止準則為止。scikit-learn中實現的停止準則是簇的個數,因此相似的簇被合并,直到僅剩下指定個數的簇。DBSCAN是一種基于密度的聚類算法,這類密度聚類算法一般假定類別可以通過樣本分布的緊密程度決定。同一類別的樣本,他們之間的緊密相連的,也就是說,在該類別任意樣本周圍不遠處一定有同類別的樣本存在。通過將緊密相連的樣本劃為一類,這樣就得到了一個聚類類別。通過將所有各組緊密相連的樣本劃為各個不同的類別,則我們就得到了最終的所有聚類類別結果。(3)教師根據課件,演示特征提取、聚類算法的原理。PCA主成分分析法用于特征提取使用K均值來對數據進行聚類歸納總結,布置課后作業(1)回顧上課前的學習目標,對本節課知識點進行總結。(2)課后記:聚類的用途是很廣泛的。在商業上,聚類可以幫助市場分析人員從消費者數據庫中區分出不同的消費群體來,并且概括出每一類消費者的消費模式或者說習慣,通過引入一些實用場景幫忙學生理解聚類。
章節名稱第9章數據預處理、降維、特征提取及聚類裝訂線授課安排裝訂線授課時數2授課時間11-2授課方法課內實訓授課教具Python3.7及后續版本、PyCharm、Jupyter教學目的了解特征提取、聚類算法的原理及使用教學重點掌握特征提取的原理及使用教學難點K均值聚類算法☆教學過程與內容:回顧上
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 論文:人工智能賦能初中生涯教育課程設計與實施
- 譯林版(三起)三年級英語上冊課件Unit 4 This is my friend第4課時(Wrap-up time Assessment time)
- 精算師考試精算師考試客觀題訓練(含評分標準)
- 導游證考試全真模擬試卷及答題技巧
- 公路水運工程試驗檢測專業技術人員職業資格水運材料真題匯編(含解析)
- 老年臟器康復中心建設標準共識2026
- 潔凈服清洗效果及存放效期確認方案
- 交易數據挖掘與分析
- 幼兒認識日月星辰簡易天文科普
- 夏季冷飲危害養生科普
- LNG加氣站安全生產投入制度
- 2026年烏魯木齊一中分班測試題及答案
- 貸款防欺詐安全知識培訓課件
- 2024年貴州能源集團有限公司綜合管理崗招聘考試真題
- 勞工道德風險評估
- 房地產銷售激勵及績效考核方案
- DB50∕T 1509-2023 互聯網+上門護理服務規范
- 水利工程堤壩澆筑腳手架施工方案
- 醫療護理員國家職業標準(2024版)
- 《中華人民共和國農產品質量安全法》培訓與解讀課件
- 2025年供銷社財務人員招聘面試題詳解與解析
評論
0/150
提交評論