版權(quán)說明:本文檔由用戶提供并上傳,收益歸屬內(nèi)容提供方,若內(nèi)容存在侵權(quán),請(qǐng)進(jìn)行舉報(bào)或認(rèn)領(lǐng)
文檔簡(jiǎn)介
第二章電子商務(wù)數(shù)據(jù)分析的統(tǒng)計(jì)基礎(chǔ)2.1電子商務(wù)數(shù)據(jù)的描述性統(tǒng)計(jì)分析教學(xué)目的與要求:
了解統(tǒng)計(jì)數(shù)據(jù)的類型熟悉描述性統(tǒng)計(jì)各測(cè)度值的計(jì)算方法掌握各種類型數(shù)據(jù)的展示方法2.1描述性統(tǒng)計(jì)分析描述性統(tǒng)計(jì)分析主要從三個(gè)方面進(jìn)行分析:1.分析數(shù)據(jù)分布的集中趨勢(shì),即反映各數(shù)據(jù)向其中心值靠攏或聚集的程度,可以用平均指標(biāo)描述;2.分析數(shù)據(jù)分布的離中趨勢(shì),即反映各數(shù)據(jù)遠(yuǎn)離其中心值的程度,可以用變異指標(biāo)描述;3.分析數(shù)據(jù)分布的偏斜程度和陡峭程度,即反映數(shù)據(jù)分布的形態(tài),可以用偏度和峰度描述。描述統(tǒng)計(jì)分析是利用圖表和統(tǒng)計(jì)量描述數(shù)據(jù)基本分布特征的方法。2.1.1統(tǒng)計(jì)數(shù)據(jù)的類型
在進(jìn)行統(tǒng)計(jì)分析時(shí),不同類型的數(shù)據(jù)采用的統(tǒng)計(jì)方法也不同,因此需要先區(qū)分?jǐn)?shù)據(jù)類型。
統(tǒng)計(jì)數(shù)據(jù)根據(jù)所采用的計(jì)量尺度不同,可以分為分類數(shù)據(jù)、順序數(shù)據(jù)和數(shù)值型數(shù)據(jù)。
分類數(shù)據(jù)和順序數(shù)據(jù)只能用文字或者數(shù)字代碼來表現(xiàn)的品質(zhì)特征或者屬性特征,因此稱為定性數(shù)據(jù),也稱品質(zhì)數(shù)據(jù);數(shù)值型數(shù)據(jù)是用數(shù)值來表現(xiàn)事物的數(shù)量特征,因此稱為定量數(shù)據(jù),也稱數(shù)量數(shù)據(jù)。2.1.1統(tǒng)計(jì)數(shù)據(jù)的類型1.分類數(shù)據(jù):對(duì)事物進(jìn)行分類的結(jié)果,數(shù)據(jù)表現(xiàn)為類別,是用文字來表達(dá)的。例如,淘寶網(wǎng)中的熱賣寶貝交易類目也是分類數(shù)據(jù),可以分為手機(jī)、衛(wèi)浴用品、床類等。
用分類數(shù)據(jù)對(duì)現(xiàn)象進(jìn)行分析時(shí),由于不同類別間的地位平等,沒有高低、大小之分,因此各類之間的順序是可以改變的。
分類數(shù)據(jù)是最粗略、計(jì)量層次最低的數(shù)據(jù)。2.1.1統(tǒng)計(jì)數(shù)據(jù)的類型2.順序數(shù)據(jù):只能歸于某一有序類別的非數(shù)字型數(shù)據(jù),數(shù)據(jù)表現(xiàn)為有順序的類別。例如,高校教師的職稱有助教、講師、副教授和教授;業(yè)主對(duì)住房的滿意度有很滿意、滿意、一般、不滿意、很不滿意;但這些數(shù)字代碼只能體現(xiàn)一種順序或者程度,不能體現(xiàn)事物之間的具體數(shù)量差別。
由于客觀現(xiàn)象的不同類別間存在順序性差異,因此用順序數(shù)據(jù)對(duì)現(xiàn)象進(jìn)行分析時(shí)其順序是不能隨意排列的。2.1.1統(tǒng)計(jì)數(shù)據(jù)的類型3.?dāng)?shù)值型數(shù)據(jù):是按數(shù)字尺度測(cè)量的觀察值。有的數(shù)據(jù)可以通過對(duì)比計(jì)算來體現(xiàn)數(shù)據(jù)的相對(duì)程度,其結(jié)果表現(xiàn)為具體的數(shù)值。
數(shù)值型數(shù)據(jù)是比順序數(shù)據(jù)高一層次的數(shù)據(jù),它不僅能將現(xiàn)象區(qū)分為不同類型并進(jìn)行排序,而且可以準(zhǔn)確地指出類別之間的差距。
數(shù)值型數(shù)據(jù)是最常見的統(tǒng)計(jì)數(shù)據(jù),現(xiàn)實(shí)中處理的數(shù)據(jù)大多數(shù)是數(shù)值型數(shù)據(jù)。例如,網(wǎng)店的訂單數(shù)據(jù)、客服數(shù)據(jù)、評(píng)級(jí)數(shù)據(jù)、行業(yè)數(shù)據(jù)、寶貝數(shù)據(jù)、轉(zhuǎn)化率數(shù)據(jù)等都是數(shù)值型數(shù)據(jù)。2.1.2數(shù)據(jù)的集中趨勢(shì)
集中趨勢(shì)是指數(shù)據(jù)分布以某一數(shù)值為中心的傾向。作為中心的數(shù)值就稱為中心值,它反映數(shù)據(jù)分布中心點(diǎn)的位置所在。對(duì)于絕大多數(shù)的數(shù)據(jù),總是接近中心值的較多,數(shù)據(jù)呈現(xiàn)出向中心值靠攏的態(tài)勢(shì),這種態(tài)勢(shì)就是數(shù)據(jù)分布的集中趨勢(shì)。
平均數(shù)是描述定量數(shù)據(jù)的集中趨勢(shì)最常用的一種測(cè)度值。平均數(shù)有不同的計(jì)算形式和計(jì)算公式,主要包括數(shù)值平均數(shù)和位置平均數(shù)兩大類。2.1.2數(shù)據(jù)的集中趨勢(shì)1.算術(shù)平均數(shù)算術(shù)平均數(shù)就是總體中各觀察值(即各變量值)的總和除以觀察值個(gè)數(shù)得到的商。(1)簡(jiǎn)單算術(shù)平均數(shù)。若總體資料未進(jìn)行分組,則先計(jì)算各觀察值的總和,再用總體單位數(shù)去除,計(jì)算的結(jié)果為簡(jiǎn)單算術(shù)平均數(shù)。其計(jì)算公式為:(2)加權(quán)算術(shù)平均數(shù)。若總體資料已經(jīng)分組,這時(shí)將各組觀察值乘以其出現(xiàn)的次數(shù),然后加總求和,再除以總體單位數(shù),所得結(jié)果為加權(quán)算術(shù)平均數(shù)。其計(jì)算公式為:2.1.2數(shù)據(jù)的集中趨勢(shì)2.調(diào)和平均數(shù):是總體各觀察值倒數(shù)的算術(shù)平均數(shù)的倒數(shù),也稱倒數(shù)平均數(shù)。
調(diào)和平均數(shù)按其計(jì)算方法不同,可分為簡(jiǎn)單調(diào)和平均數(shù)和加權(quán)調(diào)和平均數(shù)。
(1)簡(jiǎn)單調(diào)和平均數(shù)是先計(jì)算各觀察值倒數(shù)的簡(jiǎn)單算術(shù)平均數(shù),然后求其倒數(shù)。計(jì)算公式為:
(2)加權(quán)調(diào)和平均數(shù)是先計(jì)算總體各觀察值倒數(shù)的加權(quán)算術(shù)平均數(shù),再求其倒數(shù)。計(jì)算公式為:
其中,m表示調(diào)和平均數(shù)的權(quán)數(shù)2.1.2數(shù)據(jù)的集中趨勢(shì)2.調(diào)和平均數(shù)
在統(tǒng)計(jì)分析中,計(jì)算平均利潤(rùn)率、平均合格率等需要用到調(diào)和平均數(shù)。加權(quán)調(diào)和平均數(shù)大多數(shù)情況下是作為加權(quán)算術(shù)平均數(shù)的一種變形來使用的。
設(shè)總體各觀察值為x,它由分子m與分母
f相除得到,那么,如果知道該觀察值的分子資料,則用加權(quán)調(diào)和平均數(shù)公式計(jì)算該觀察值的平均數(shù);如果知道該觀察值的分母資料,則用加權(quán)算術(shù)平均數(shù)公式計(jì)算該觀察值的平均數(shù)
公式如下:2.1.2數(shù)據(jù)的集中趨勢(shì)3.幾何平均數(shù)把若干個(gè)變量連乘,得其乘積再開n次方根。在社會(huì)經(jīng)濟(jì)統(tǒng)計(jì)中,幾何平均數(shù)適用于計(jì)算平均比率和平均速度。幾何平均數(shù)按計(jì)算方法不同分為簡(jiǎn)單幾何平均數(shù)和加權(quán)幾何平均數(shù)。簡(jiǎn)單幾何平均數(shù)的計(jì)算公式:加權(quán)幾何平均數(shù)的計(jì)算公式:2.1.2數(shù)據(jù)的集中趨勢(shì)4.眾數(shù)
是總體中出現(xiàn)次數(shù)最多的觀察值,一般用字母表示,反映一種最普遍、最常見的現(xiàn)象。在一定條件下,眾數(shù)常常用來代替算術(shù)平均數(shù),反映總體的一般水平。
眾數(shù)是位置平均數(shù),不受極端數(shù)值的影響,主要用于對(duì)定類數(shù)據(jù)的集中趨勢(shì)測(cè)定,也適用于對(duì)定序數(shù)據(jù)與數(shù)值型數(shù)據(jù)的集中趨勢(shì)測(cè)定,例如,我國(guó)大多數(shù)家庭中的人口數(shù)等,都是眾數(shù)。
眾數(shù)只有在總體單位數(shù)多且具有明顯的集中趨勢(shì)時(shí),才有合理的代表性和現(xiàn)實(shí)意義;當(dāng)總體單位數(shù)少或者總體單位數(shù)雖多,但無明顯集中趨勢(shì)時(shí),眾數(shù)就不存在實(shí)際意義。2.1.2數(shù)據(jù)的集中趨勢(shì)5.中位數(shù)
將總體各個(gè)觀察值按大小順序排列,處于數(shù)列中點(diǎn)位置的數(shù)值,一般用字母表示。中位數(shù)將數(shù)列分為相等的兩部分,一部分的數(shù)值小于中位數(shù),另一部分的數(shù)值大于中位數(shù)。在有些情況下,不易計(jì)算平均值,可用中位數(shù)代表總體的一般水平。
中位數(shù)主要用于對(duì)定序數(shù)據(jù)的集中趨勢(shì)測(cè)定,也適用于對(duì)數(shù)值型數(shù)據(jù)的集中趨勢(shì)測(cè)定,但不能用于定類數(shù)據(jù)。例如,人口年齡中位數(shù),可表示人口總體年齡的一般水平;集貿(mào)市場(chǎng)上某種商品的價(jià)格中位數(shù),可代表該種商品價(jià)格的一般水平。2.1.2數(shù)據(jù)的集中趨勢(shì)5.中位數(shù)
中位數(shù)與眾數(shù)一樣,不受極端數(shù)值的影響。中位數(shù)的大小僅取決于它在數(shù)列中的位置,因此,在總體數(shù)據(jù)差異很大的情況下,中位數(shù)具有較強(qiáng)的代表性。
當(dāng)總體單位數(shù)n是奇數(shù)時(shí),中位數(shù)即處于中間位置的數(shù)值;如果n是偶數(shù)時(shí),中位數(shù)則是中間的兩個(gè)數(shù)值的算術(shù)平均數(shù)。2.1.2數(shù)據(jù)的集中趨勢(shì)6.位置平均數(shù)與算術(shù)平均數(shù)之間的相互關(guān)系
不同的平均數(shù)適用于不同數(shù)據(jù)類型的集中趨勢(shì)測(cè)定,它們各自具有自己的含義、特點(diǎn)和應(yīng)用場(chǎng)合。當(dāng)總體分布為正態(tài)分布時(shí),如果對(duì)同一資料同時(shí)計(jì)算眾數(shù)、中位數(shù)和算術(shù)平均數(shù),則它們?nèi)咧g存在一定的數(shù)量關(guān)系。(1)在對(duì)稱正態(tài)分布時(shí)有:(2)在非對(duì)稱正態(tài)分布時(shí),三者之間有差異。當(dāng)變量的次數(shù)分布左偏時(shí),有
;當(dāng)變量的次數(shù)分布右偏時(shí),有2.1.3數(shù)據(jù)的離中趨勢(shì)
離中趨勢(shì)是指數(shù)據(jù)分布中各觀察值背離中心值的傾向。如果說集中趨勢(shì)是數(shù)據(jù)分布同質(zhì)性的體現(xiàn),那么離中趨勢(shì)就是數(shù)據(jù)分布變異性的體現(xiàn)。
對(duì)離中趨勢(shì)的描述,就是要反映數(shù)據(jù)分布中各觀察值遠(yuǎn)離中心值的程度,主要用變異指標(biāo)來反映。變異指標(biāo)不僅可以綜合地顯示觀察值的離中趨勢(shì),還可以用來判別平均數(shù)的代表性。
常用的變異指標(biāo)有四分位差、全距、平均差、標(biāo)準(zhǔn)差和離散系數(shù)。據(jù)統(tǒng)計(jì)學(xué)中經(jīng)典的3σ準(zhǔn)則,異常值通常為3個(gè)標(biāo)準(zhǔn)差之外的變量。2.1.3數(shù)據(jù)的離中趨勢(shì)1.四分位差(分位距)把觀察值從小到大排序,并把它們分為四等分,形成三個(gè)分割點(diǎn),這三個(gè)分割點(diǎn)的數(shù)值就稱為四分位數(shù),記為(第一四分位數(shù),也稱下四分位數(shù))、(第二四分位數(shù),也稱中位數(shù))、(第三四分位數(shù),也稱上四分位數(shù))。和的計(jì)算如下:2.1.3數(shù)據(jù)的離中趨勢(shì)2.全距全距也稱極差,它是總體中某觀察值的最大值與最小值之差,用R表示。即全距可以說明總體中數(shù)據(jù)變動(dòng)的范圍。全距越大,說明總體中數(shù)據(jù)變動(dòng)的范圍越大,從而說明總體中數(shù)據(jù)的差異大;全距越小,說明總體中數(shù)據(jù)變動(dòng)的范圍越小,從而說明總體中數(shù)據(jù)的差異也小。2.1.3數(shù)據(jù)的離中趨勢(shì)3.標(biāo)準(zhǔn)差標(biāo)準(zhǔn)差是各觀察值與其算術(shù)平均數(shù)的離差平方的算術(shù)平均數(shù),最后開方根,用表示,表示各觀察值與算術(shù)平均數(shù)的平均距離。標(biāo)準(zhǔn)差越大,說明數(shù)據(jù)差異程度越大,平均數(shù)的代表性越差;標(biāo)準(zhǔn)差越小,說明數(shù)據(jù)差異程度越小,平均數(shù)的代表性越好。根據(jù)掌握的資料不同,標(biāo)準(zhǔn)差也有兩種計(jì)算方法:簡(jiǎn)單平均法和加權(quán)平均法。
2.1.3數(shù)據(jù)的離中趨勢(shì)3.標(biāo)準(zhǔn)差(1)簡(jiǎn)單平均法根據(jù)未分組的資料計(jì)算標(biāo)準(zhǔn)差,將每個(gè)觀察值與算術(shù)平均數(shù)的離差平方和除以總體單位數(shù)后再開平方求得。其計(jì)算公式為:(2)加權(quán)平均法是在分組情況下計(jì)算標(biāo)準(zhǔn)差,將各組組中值與算術(shù)平均數(shù)的離差平方乘以各組次數(shù)(權(quán)數(shù)),然后除以總次數(shù),再開平方。其計(jì)算公式為:
2.1.3數(shù)據(jù)的離中趨勢(shì)4.離散系數(shù)全距、平均差、標(biāo)準(zhǔn)差適用于對(duì)數(shù)值型數(shù)據(jù)的集中趨勢(shì)進(jìn)行測(cè)定,都是用絕對(duì)數(shù)表示的,它們的計(jì)量單位與平均數(shù)的計(jì)量單位相同。當(dāng)兩個(gè)不同計(jì)量單位的數(shù)列進(jìn)行比較時(shí),很難對(duì)兩者直接進(jìn)行對(duì)比。因此,在比較兩個(gè)數(shù)列的平均數(shù)代表性大小時(shí),如果它們的平均水平不同或計(jì)量單位不同,就不能用前述的變異指標(biāo)直接比較它們的差異程度,而應(yīng)該用變異指標(biāo)的相對(duì)指標(biāo)即離散系數(shù)進(jìn)行比較。常用的離散系數(shù)是標(biāo)準(zhǔn)差系數(shù),其計(jì)算公式為:2.1.4數(shù)據(jù)的分布形態(tài)數(shù)據(jù)的分布形態(tài)是指數(shù)據(jù)分布是否對(duì)稱,偏斜程度如何,分布陡峭程度等。1.偏度的測(cè)定偏度是描述數(shù)據(jù)分布形態(tài)是否對(duì)稱的指標(biāo)。資料沒有分組時(shí),偏度的計(jì)算公式為:資料分組時(shí),偏度的計(jì)算公式為:偏度值大于0表示正偏差值大,可以判斷為正偏或者右偏;偏度值小于0表示負(fù)偏差值大,可以判斷為負(fù)偏或者左偏。偏度絕對(duì)值越大,表示數(shù)據(jù)分布形態(tài)的偏斜程度越大。2.1.4數(shù)據(jù)的分布形態(tài)2.峰度的測(cè)定峰度是描述數(shù)據(jù)取值分布形態(tài)陡峭程度的指標(biāo)。資料沒有分組時(shí),峰度的計(jì)算公式為:資料分組時(shí),峰度的計(jì)算公式為:上式表明,當(dāng)峰度值等于0時(shí),數(shù)據(jù)分布與標(biāo)準(zhǔn)正態(tài)分布的陡峭程度相同,為正態(tài)分布;峰度值大于0時(shí),數(shù)據(jù)分布比標(biāo)準(zhǔn)正態(tài)分布更陡峭,為尖峰分布;峰度值小于0時(shí),數(shù)據(jù)分布比標(biāo)準(zhǔn)正態(tài)分布平緩,為平峰分布。2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示統(tǒng)計(jì)圖的種類有很多,在對(duì)數(shù)據(jù)進(jìn)行整理時(shí),不同類型的數(shù)據(jù),所采取的處理方式和所適用的處理方法是不同的。品質(zhì)數(shù)據(jù)主要做分類整理,一般采用條形圖、餅形圖、環(huán)形圖展示;數(shù)值型數(shù)據(jù)主要是做分組處理,通常采用莖葉圖、箱線圖、直方圖、曲線圖、散點(diǎn)圖展示。條形圖餅形圖環(huán)形圖未分組數(shù)據(jù)多變量數(shù)據(jù)時(shí)間序列數(shù)據(jù)分組數(shù)據(jù)莖葉圖直方圖曲線圖散點(diǎn)圖箱線圖品質(zhì)數(shù)據(jù)分類數(shù)據(jù)數(shù)值型數(shù)據(jù)數(shù)據(jù)類型2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示1.品質(zhì)數(shù)據(jù)的展示:條形圖條形圖是以寬度相等的條形的長(zhǎng)度或高度來反映統(tǒng)計(jì)資料。條形圖可以橫置也可以縱置。當(dāng)各類別放在縱軸時(shí),稱為條形圖;當(dāng)各類別放在橫軸時(shí),稱為柱形圖。條形圖適用于分類數(shù)據(jù)和順序數(shù)據(jù)的頻率分布。2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示2.品質(zhì)數(shù)據(jù)的展示:餅形圖餅形圖也稱圓形圖,是用圓形面積的大小代表總體數(shù)值,或用圓形中的扇形面積反映總體內(nèi)部各構(gòu)成指標(biāo)的數(shù)值,后者也稱圓形結(jié)構(gòu)圖。圓形結(jié)構(gòu)圖是使用最普遍使用的一種統(tǒng)計(jì)圖,常用于在總體分組的情況下,反映總體的結(jié)構(gòu)、各組所占比重(百分比)資料。2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示3.品質(zhì)數(shù)據(jù)的展示:環(huán)形圖當(dāng)有多個(gè)總體時(shí),可以用環(huán)形圖進(jìn)行結(jié)構(gòu)比較分析。環(huán)形圖其實(shí)是餅圖的擴(kuò)展形式,看上去就像是把多個(gè)餅圖去掉中間部分疊放在了一起。簡(jiǎn)單餅圖只能描述單個(gè)總體的結(jié)構(gòu),不能對(duì)多個(gè)總體的結(jié)構(gòu)進(jìn)行比較;而環(huán)形圖則可以對(duì)多個(gè)總體的結(jié)構(gòu)進(jìn)行比較。例圖表示甲乙兩個(gè)地區(qū)的消費(fèi)者對(duì)網(wǎng)購(gòu)產(chǎn)品滿意程度,圖中外圈代表乙地區(qū),內(nèi)圈代表甲地區(qū)。2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示4.分組數(shù)據(jù)的展示:直方圖直方圖也稱柱狀圖,是用矩形的寬度和高度來表示次數(shù)分布的圖形。在平面直角坐標(biāo)中,橫軸表示數(shù)據(jù)分組,即各組組限,縱軸表示次數(shù)。一般縱軸的左側(cè)標(biāo)明頻數(shù),右側(cè)標(biāo)明頻率,如果沒有頻率,直方圖只在左側(cè)標(biāo)明頻數(shù)。用各組組距的寬度與相應(yīng)次數(shù)的高度繪制成一個(gè)個(gè)矩形,形成直方圖。直方圖與條形圖的區(qū)別是各矩形之間不留間隔,且各矩形的寬度是各組組距,而條形圖寬度只表示類別。2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示5.未分組數(shù)據(jù)的展示:莖葉圖莖葉圖是反映原始數(shù)據(jù)分布的圖形,又稱“枝葉圖”,它由莖和葉兩部分構(gòu)成,其圖形是由數(shù)字組成的。通過莖葉圖,可以看出數(shù)據(jù)的分布形態(tài),及數(shù)據(jù)的離散狀況,比如,分布是否對(duì)稱,數(shù)據(jù)是否集中,是否有異常值等。2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示6.未分組數(shù)據(jù)的展示:箱線圖箱線圖是由一組數(shù)據(jù)的最大值、最小值、中位數(shù)、兩個(gè)四分位數(shù)這五個(gè)數(shù)據(jù)繪制而成的,它主要反映原始數(shù)據(jù)分布的特征,還可以進(jìn)行多組數(shù)據(jù)分布特征的比較,可以找到一組數(shù)據(jù)中的異常值。箱線圖的形式一般從上到下依次由最大值、上四分位數(shù)、中位數(shù)、下四分位數(shù)、最小值組成。如圖所示大于中位數(shù)(799臺(tái))的箱體稍微大點(diǎn),屬于右偏分布,但是偏斜程度不大。2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示7.未分組數(shù)據(jù)的展示:曲線圖曲線圖亦稱線形圖,是用折線(多角曲線)或曲線在直角坐標(biāo)中反映統(tǒng)計(jì)指標(biāo)數(shù)值,是統(tǒng)計(jì)圖中應(yīng)用最多的一種圖形。如圖是2009-2018年天貓“雙十一”活動(dòng)單日銷售額(億元)的曲線圖,它反映天貓“雙十一”單日銷售額在這段時(shí)間內(nèi)的增長(zhǎng)趨勢(shì)呈曲線增長(zhǎng)趨勢(shì)。2.1.5數(shù)據(jù)的統(tǒng)計(jì)圖展示8.多變量數(shù)據(jù)的展示:散點(diǎn)圖散點(diǎn)圖是數(shù)據(jù)點(diǎn)在直角坐標(biāo)系平面上的分布圖,用來展示數(shù)據(jù)之間關(guān)系的一種圖形。用兩組數(shù)據(jù)構(gòu)成多個(gè)坐標(biāo)點(diǎn),以考察坐標(biāo)點(diǎn)的分布,進(jìn)而判斷兩組數(shù)據(jù)之間是否存在某種關(guān)聯(lián)。2.2數(shù)理統(tǒng)計(jì)基礎(chǔ)教學(xué)目的與要求:
掌握抽樣估計(jì)的基礎(chǔ)知識(shí)掌握正態(tài)分布以及三大分布的定義和性質(zhì);掌握中心極限定理。2.2.1抽樣估計(jì)基礎(chǔ)1.隨機(jī)事件及其概率:隨機(jī)現(xiàn)象是指在相同情況下不會(huì)總出現(xiàn)相同結(jié)果的現(xiàn)象,例如買彩票中獎(jiǎng)、拋硬幣正面朝上等,這類事件可能發(fā)生也可能不發(fā)生,其結(jié)果具有偶然性。對(duì)隨機(jī)現(xiàn)象進(jìn)行一次觀察或測(cè)量的過程稱為一次隨機(jī)試驗(yàn),隨機(jī)事件就是隨機(jī)現(xiàn)象進(jìn)行多次重復(fù)試驗(yàn)得到的一類基本結(jié)果的集合。2.2.1抽樣估計(jì)基礎(chǔ)1.隨機(jī)事件及其概率:研究隨機(jī)事件在一次試驗(yàn)中發(fā)生的可能性是通過多次重復(fù)試驗(yàn)的規(guī)律來判斷的,這種規(guī)律性和可能性被稱為隨機(jī)事件的概率。隨機(jī)事件的概率取值在0和1之間,取值越大表明隨機(jī)事件發(fā)生的可能性越大。有兩種特殊情況,當(dāng)概率值為0時(shí)稱該隨機(jī)事件為不可能事件,當(dāng)概率值為1時(shí)該隨機(jī)事件被稱為必然事件。隨機(jī)事件的概率主要分為:古典概率、統(tǒng)計(jì)概率以及主觀概率2.2.1抽樣估計(jì)基礎(chǔ)1.隨機(jī)事件及其概率:(1)古典概率:如果某一隨機(jī)試驗(yàn)的結(jié)果有限并且是等可能發(fā)生的,則某一事件發(fā)生的概率為事件包含的事件數(shù)與隨機(jī)試驗(yàn)包含的所有基本事件數(shù)之比,這就是古典概率,記作:;(2)統(tǒng)計(jì)概率:隨著試驗(yàn)次數(shù)的不斷增加,頻率將會(huì)穩(wěn)定在某一常數(shù)附近,這個(gè)穩(wěn)定的常數(shù)稱為該事件的概率,這種利用頻率來確定的概率就是統(tǒng)計(jì)概率,記作:;(3)主觀概率:對(duì)一些無法通過隨機(jī)試驗(yàn)重復(fù)次來確定發(fā)生概率的事件,人們會(huì)根據(jù)以往的經(jīng)驗(yàn),人為地給出自己的概率,這種概率就是主觀概率。2.2.1抽樣估計(jì)基礎(chǔ)1.隨機(jī)事件及其概率:在概率分析中還有兩個(gè)重要的概念,條件概率和獨(dú)立事件。條件概率:在事件發(fā)生的條件下事件發(fā)生的概率,規(guī)定:
獨(dú)立事件:當(dāng)事件發(fā)生的條件下事件發(fā)生的條件概率等于事件發(fā)生的概率,即時(shí),則稱事件和是相互獨(dú)立的。進(jìn)一步可推導(dǎo)出,
這一結(jié)論是分析概率問題時(shí)一個(gè)重要條件,是很多定理的基礎(chǔ)。2.2.1抽樣估計(jì)基礎(chǔ)2.隨機(jī)變量的分布函數(shù):設(shè)X是隨機(jī)變量,是任意實(shí)數(shù),則稱為隨機(jī)變量X的分布函數(shù),記作,即:有了分布函數(shù),對(duì)于任意的實(shí)數(shù)(),隨機(jī)變量X落在區(qū)間(]里的概率可以用分布函數(shù)來計(jì)算:=2.2.1抽樣估計(jì)基礎(chǔ)3.隨機(jī)變量及其概率分布:隨機(jī)變量是指可以用來表示隨機(jī)現(xiàn)象結(jié)果的變量,也就是用數(shù)值來表示隨機(jī)試驗(yàn)的結(jié)果,隨機(jī)變量常用大寫字母X,Y,Z……表示。隨機(jī)變量根據(jù)是否可列分為兩大類,一是離散型隨機(jī)變量,該種隨機(jī)變量可以在數(shù)軸上用有限的點(diǎn)表示出來;二是連續(xù)型隨機(jī)變量,這種變量的取值在數(shù)軸上只能用區(qū)間表示。隨機(jī)變量取值的統(tǒng)計(jì)規(guī)律被稱為概率分布,兩種類型的隨機(jī)變量(即離散型隨機(jī)變量和連續(xù)型隨機(jī)變量)對(duì)應(yīng)的概率分布是有差別的。2.2.1抽樣估計(jì)基礎(chǔ)3.隨機(jī)變量及其概率分布:(1)離散型隨機(jī)變量的分布:因?yàn)殡x散型隨機(jī)變量的取值是可以列出的,并且對(duì)應(yīng)的概率是可以確定的,所以其概率分布可以用一種含有隨機(jī)變量X的所有可能取值以及概率的表格表示出來,這就是離散型隨機(jī)變量的概率分布,簡(jiǎn)稱分布列。下為離散型隨機(jī)變量的概率分布(分布列)2.2.1抽樣估計(jì)基礎(chǔ)3.隨機(jī)變量及其概率分布:(2)連續(xù)型隨機(jī)變量的分布:用來描述連續(xù)型隨機(jī)變量取值規(guī)律的分布被稱為概率密度函數(shù),記作。概率密度函數(shù)有兩個(gè)性質(zhì):①概率密度曲線定位于x軸上方,即;②分布曲線和x軸之間的面積是1,即在連續(xù)分布的情況下可以用函數(shù)曲線下的面積表示概率,例如,隨機(jī)變量X在a和b之間的概率可以寫成:如果隨機(jī)變量X的取值在它的概率即對(duì)應(yīng)的分布函數(shù)可以表示為:2.2.1抽樣估計(jì)基礎(chǔ)4.隨機(jī)變量的數(shù)字特征:常見的數(shù)字特征有:數(shù)學(xué)期望(簡(jiǎn)稱期望)和方差,分別用和表示。方差越大,說明隨機(jī)變量的取值越分散;方差越小,說明隨機(jī)變量的取值越集中。離散型隨機(jī)變量的期望和方差可以表示為:連續(xù)型隨機(jī)變量的期望和方差可以表示為:期望反映隨機(jī)變量取值的集中情況,方差反映隨機(jī)變量取值的分散(離中)程度。2.2.2正態(tài)分布服從正態(tài)分布的隨機(jī)變量有這樣的特征:該隨機(jī)變量的取值在一定范圍內(nèi)波動(dòng),其中接近均值的數(shù)比較多,遠(yuǎn)離均值的數(shù)比較少。正態(tài)分布的概率密度函數(shù)可以表示為:此時(shí)隨機(jī)變量服從均值為、方差為的正態(tài)分布,記作,它的概率密度函數(shù)曲線如下所示。2.2.2正態(tài)分布特別地,的正態(tài)分布,稱為標(biāo)準(zhǔn)正態(tài)分布,記作。對(duì)于標(biāo)準(zhǔn)正態(tài)分布人們習(xí)慣上把它的分布函數(shù)表示為:標(biāo)準(zhǔn)正態(tài)分布的性質(zhì):2.2.2正態(tài)分布對(duì)于任何非標(biāo)準(zhǔn)正態(tài)分布,都可以通過“標(biāo)準(zhǔn)化”化為標(biāo)準(zhǔn)正態(tài)分布,變換公式為這樣非標(biāo)準(zhǔn)正態(tài)分布事件的概率就可以轉(zhuǎn)化為標(biāo)準(zhǔn)正態(tài)分布來計(jì)算,例如非標(biāo)準(zhǔn)正態(tài)分布在區(qū)間之間的概率可以這樣計(jì)算:2.2.3基于正態(tài)分布的三大分布1.分布:設(shè)隨機(jī)變量,,,是相互獨(dú)立的,且服從標(biāo)準(zhǔn)正態(tài)分布,則它們的平方和服從自由度為的分布,記作:其分布密度函數(shù)可以表示為:當(dāng)自由度趨于無限大時(shí),分布趨近于正態(tài)分布。分布的分位數(shù)可以從分布表查到。2.2.3基于正態(tài)分布的三大分布1.分布的主要性質(zhì):(1)卡方值都是正值,卡方分布曲線下的面積都是1。(2)卡方分布在第一象限內(nèi),呈正偏態(tài),隨著參數(shù)的增大,分布趨近于正態(tài)分布。(3)可加性。若有個(gè)服從分布且相互獨(dú)立的隨機(jī)變量,則它們之和仍是分布,新的分布的自由度為原來個(gè)分布自由度之和。即若,,且相互獨(dú)立,則有。(4)期望和方差。若,則,,。不同的自由度決定不同的卡方分布,自由度越小,分布越偏斜。(5)正態(tài)分布與卡方分布的轉(zhuǎn)換關(guān)系。對(duì)于正態(tài)總體,樣本方差滿足2.2.3基于正態(tài)分布的三大分布2.分布:設(shè)隨機(jī)變量,,且X與Y相互獨(dú)立,則隨機(jī)變量服從自由度為的t分布,記作。其概率密度函數(shù)為:如圖可見,t分布的密度函數(shù)曲線關(guān)于縱軸對(duì)稱,與標(biāo)準(zhǔn)正態(tài)分布曲線非常相似,都是單峰偶函數(shù),只是t分布的側(cè)尾部略寬與標(biāo)準(zhǔn)正態(tài)分布曲線是不能完全重合的。隨著自由度的增加,t分布的密度函數(shù)曲線會(huì)越來越接近標(biāo)準(zhǔn)正態(tài)分布曲線。一般認(rèn)為,當(dāng)時(shí),t分布可近似等于標(biāo)準(zhǔn)正態(tài)分布。在信息不足的情況下,一般使用t分布。例如在不知道總體方差的情況下,可對(duì)總體均值的檢驗(yàn)用t統(tǒng)計(jì)量。2.2.3基于正態(tài)分布的三大分布2.分布的性質(zhì):(1)自由度n=1的t分布就是柯西分布,均值不存在;當(dāng)自由度n>1時(shí),分布的數(shù)學(xué)期望等于0;當(dāng)自由度n>2時(shí),分布的方差存在且等于n/(n-2)。(2)t分布與正態(tài)分布之間的關(guān)系。設(shè)X與Y是兩個(gè)獨(dú)立同方差的總體,,,來自于X的n個(gè)樣本,來自于Y的m個(gè)樣本,則有:其中,,,
,2.2.3基于正態(tài)分布的三大分布3.F分布:若隨機(jī)變量與Z相互獨(dú)立,且Y和Z分別服從自由度為m和n的分布,則隨機(jī)變量服從第一自由度為m,第二自由度為n的F分布,記為。F分布的概率密度函數(shù)為:F分布的性質(zhì):(1)F分布是右偏態(tài)分布,且沒有小于0的部分。(2)當(dāng)?shù)诙杂啥萵>2時(shí),;當(dāng)?shù)诙杂啥萵>4時(shí),。(3)分位數(shù)滿足。2.2.3基于正態(tài)分布的三大分布這三個(gè)分布在區(qū)間估計(jì)、假設(shè)檢驗(yàn)、回歸分析中都有重要應(yīng)用,是統(tǒng)計(jì)推斷的基礎(chǔ)。結(jié)合正態(tài)分布的性質(zhì),將它們的特征歸納在表中。2.2.4中心極限定理從均值為,方差為的總體中隨機(jī)抽取樣本容量為n的簡(jiǎn)單隨機(jī)樣本,當(dāng)樣本容量n充分大時(shí),樣本均值的抽樣分布近似服從均值為,方差為的正態(tài)分布。中心極限定理提供了一個(gè)非常有用的樣本均值的近似抽樣分布,而不管總體服從何種分布,只要能夠得到足夠多的樣本(一般要求),就可以用正態(tài)分布的性質(zhì)進(jìn)行統(tǒng)計(jì)推斷。最早的中心極限定理是由德莫佛提出的,認(rèn)為二項(xiàng)分布的極限分布是正態(tài)分布。現(xiàn)在人們熟知的中心極限定理是林德伯格和勒維證明的樣本均值近似服從正態(tài)分布。2.2.4中心極限定理【例2-17】燈具制造廠生產(chǎn)一批燈泡,它們總體的壽命近似服從,一家零售商決定購(gòu)買100只,請(qǐng)問這100只燈泡的壽命均值小于等于48的概率是多少?解:,2.3相關(guān)分析與回歸分析相關(guān)分折是一種研究隨機(jī)變量之間相關(guān)關(guān)系的統(tǒng)計(jì)分析方法,主要研究現(xiàn)象之間是否存在某種依存關(guān)系,并對(duì)具有依存關(guān)系的現(xiàn)象探討其相關(guān)方向及相關(guān)程度?;貧w分析按照涉及自變量的多少,可分為一元回歸分析和多元回歸分析。根據(jù)自變量和因變量之間的關(guān)系類型,可分為線性回歸和非線性回歸。2.3.1相關(guān)分析在相互聯(lián)系的現(xiàn)象之間存在著一定的因果關(guān)系,把其中起著影響作用的現(xiàn)象具體化,通過一定的變量反映出來,這樣的變量稱作自變量。由于受到自變量變動(dòng)的影響而發(fā)生變動(dòng)的變量稱作因變量。典型的相關(guān)性分析步驟包括三步:一是繪制兩個(gè)變量的散點(diǎn)圖;二是計(jì)算變量之間的相關(guān)系數(shù);三是相關(guān)系數(shù)的顯著性檢驗(yàn)。進(jìn)一步的,相關(guān)分析可以在影響某個(gè)變量的諸多變量中判斷哪些是顯著的,哪些是不顯著的。2.3.1相關(guān)分析1.散點(diǎn)圖的繪制為了研究?jī)蓚€(gè)變量之間存在什么關(guān)系,可以在平面直角坐標(biāo)系中畫一張圖,將隨機(jī)變量X與Y的觀察值(xi,yj)(i=1,2,……,n)看成直角坐標(biāo)系中的個(gè)點(diǎn),在圖中標(biāo)出n個(gè)點(diǎn),則稱這樣的圖為散點(diǎn)圖。散點(diǎn)圖可以幫助人們了解變量之間是否相關(guān)及相關(guān)程度。繪制散點(diǎn)圖是相關(guān)分析的第一步,用Excel2013的“散點(diǎn)圖繪制”功能可以完成這一過程。2.3.1相關(guān)分析2.相關(guān)系數(shù)的計(jì)算若相關(guān)系數(shù)是根據(jù)總體全部數(shù)據(jù)計(jì)算的,則稱為總體相關(guān)系數(shù),記為ρ,它是兩個(gè)變量之間的協(xié)方差和標(biāo)準(zhǔn)差的商,它按照積差方法計(jì)算,以兩個(gè)變量與各自平均值的離差為基礎(chǔ),通過兩個(gè)離差相乘來反映兩個(gè)變量之間的相關(guān)程度。其公式如下:若是根據(jù)樣本數(shù)據(jù)計(jì)算的,則稱為樣本相關(guān)系數(shù),記為r。常用的相關(guān)系數(shù)有3種,即皮爾遜相相關(guān)系數(shù)、斯皮爾曼相關(guān)系數(shù)和肯德爾相關(guān)系數(shù)。2.3.1相關(guān)分析2.相關(guān)系數(shù)的計(jì)算(1)皮爾遜相相關(guān)系數(shù),記為Pearson線性相關(guān)系數(shù):皮爾遜相關(guān)系數(shù)是著名統(tǒng)計(jì)學(xué)家卡爾·皮爾遜設(shè)計(jì)的統(tǒng)計(jì)量,如果散點(diǎn)圖的n個(gè)點(diǎn)基本在一條直線附近,但又不完全在一條直線上,此時(shí)就可以使用該統(tǒng)計(jì)量來表示變量關(guān)系的密切程度。它的計(jì)算公式:,r被稱為隨機(jī)變量X與Y的Pearson線性相關(guān)系數(shù)。當(dāng)兩個(gè)變量的標(biāo)準(zhǔn)差都不為零時(shí),相關(guān)系數(shù)才有定義,皮爾遜相關(guān)系數(shù)適用于:兩個(gè)變量之間是線性關(guān)系,都是連續(xù)數(shù)據(jù),可以使用散點(diǎn)圖查看;兩個(gè)變量的總體是正態(tài)分布,或接近正態(tài)的單鋒分布;兩個(gè)變量的觀測(cè)值是成對(duì)的,每對(duì)觀測(cè)值之間相互獨(dú)立。2.3.1相關(guān)分析2.相關(guān)系數(shù)的計(jì)算(1)皮爾遜相相關(guān)系數(shù):根據(jù)觀測(cè)到的樣本數(shù)據(jù)就可以計(jì)算相關(guān)系數(shù)統(tǒng)計(jì)量r,根據(jù)r值的大小,就能夠反映變量X與Y之間線性關(guān)系的密切程度。r值不同,兩個(gè)變量的相關(guān)密切程度也不同,這就是相關(guān)系數(shù)的性質(zhì),具體內(nèi)容如下:①當(dāng)r=1時(shí),各個(gè)點(diǎn)完全在一條直線上,這時(shí)稱兩個(gè)變量完全線性相關(guān)。②當(dāng)r=0時(shí),兩個(gè)變量不相關(guān),這時(shí)散點(diǎn)圖上的n個(gè)點(diǎn)可能毫無規(guī)律,不過兩個(gè)變量之間也可能存在某種曲線的趨勢(shì)。③當(dāng)r>0時(shí),兩個(gè)變量正相關(guān),這時(shí)當(dāng)x的值增加時(shí),y的值也有增加的趨勢(shì)。④當(dāng)r<0時(shí),兩個(gè)變量負(fù)相關(guān),這時(shí)當(dāng)x的值增加時(shí),y的值有減少的趨勢(shì)。2.3.1相關(guān)分析2.相關(guān)系數(shù)的計(jì)算(1)皮爾遜相相關(guān)系數(shù)皮爾遜相關(guān)系數(shù)的經(jīng)驗(yàn)解釋如下:①當(dāng)≥0.8時(shí),可視為兩個(gè)變量之間高度相關(guān)。②當(dāng)0.5≤<0.8時(shí),可視為兩個(gè)變量之間中度相關(guān)。③當(dāng)0.3≤<0.5時(shí),可視為兩個(gè)變量之間低度相關(guān)。④當(dāng)<03時(shí),說明兩個(gè)變量之間的相關(guān)程度極弱,可視為不相關(guān)。2.3.1相關(guān)分析2.相關(guān)系數(shù)的計(jì)算(2)斯皮爾曼相關(guān)系數(shù),記為spearman等級(jí)相關(guān)系數(shù):斯皮爾曼相關(guān)系教是根據(jù)等級(jí)資料研究?jī)蓚€(gè)變量之間相關(guān)關(guān)系的方法,它是依據(jù)兩列成對(duì)等級(jí)的各對(duì)等級(jí)數(shù)之差來進(jìn)行計(jì)解的,所以又被稱為“等級(jí)差數(shù)法”。其計(jì)算公式為:等級(jí)相關(guān)系數(shù)與線性相關(guān)系數(shù)一樣,取值為-1~+1,ρ為正表示正相關(guān),為負(fù)表示負(fù)相關(guān),等于零則表示零相關(guān),區(qū)別是等級(jí)相關(guān)系數(shù)是建立在等級(jí)的基礎(chǔ)上計(jì)算的,比較適用于反映序列變量的相關(guān)。等級(jí)相關(guān)系數(shù)和通常的相關(guān)系數(shù)一樣,它與樣本的容量有關(guān),尤其是在樣本容量比較小的情況下,其變異程度較大,等級(jí)相關(guān)系數(shù)的顯著性檢驗(yàn)與普通的相關(guān)系數(shù)的顯著性檢驗(yàn)相同。2.3.1相關(guān)分析2.相關(guān)系數(shù)的計(jì)算(3)肯德爾相關(guān)系數(shù),記為Kendall等級(jí)相關(guān)系數(shù):肯德爾相關(guān)系數(shù)是以MauriceKendall命名的,并經(jīng)常用希臘字母τ(taw)表示其值??系聽栂嚓P(guān)系數(shù)是一個(gè)用來測(cè)量?jī)蓚€(gè)隨機(jī)變量相關(guān)性的統(tǒng)計(jì)值??系聽枡z驗(yàn)是無參數(shù)假設(shè)檢驗(yàn),它使用計(jì)算而得的相關(guān)系數(shù)去檢驗(yàn)兩個(gè)隨機(jī)變量的統(tǒng)計(jì)依賴性。肯德爾相關(guān)系數(shù)的計(jì)算公式有3種,這里僅介紹其中一個(gè)計(jì)算公式:其中C表示X與Y中擁有一致性的元素對(duì)數(shù)(兩個(gè)元素為一對(duì));D表示X與Y中擁有不致性的元素對(duì)數(shù)。2.3.2一元線性回歸分析回歸分析(RegressionAnalysis)是因果關(guān)系法的一個(gè)主要類別,是數(shù)理統(tǒng)計(jì)學(xué)中最基本的方法之一,主要用于探討數(shù)據(jù)之間的某種特定關(guān)系。當(dāng)兩個(gè)變量之間存在線性相關(guān)關(guān)系時(shí),人們常常希望在兩者之間建立定量關(guān)系,兩個(gè)相關(guān)變量之間的定量關(guān)系的表達(dá)即是一元線性回歸方程。將兩個(gè)變量的值繪制到散點(diǎn)圖,從散點(diǎn)圖上看,n個(gè)點(diǎn)在一條直線附近波動(dòng),一元線性回歸方程便是對(duì)這條直線的一種估計(jì)。當(dāng)估計(jì)出這條直線后,就可以利用這個(gè)直線方程根據(jù)給定的自變量來預(yù)測(cè)因變量,這就是一元線性回歸分折要解決的問題。2.3.2一元線性回歸分析1.一元回歸模型及相關(guān)假設(shè)設(shè)有自變量x是一般變量,因變量y是隨機(jī)變量,對(duì)于固定的X值,Y值有可能是不同的。假定Y的均值是X的線性函數(shù),其波動(dòng)是一致的,并且總假定n組數(shù)據(jù)的收集是獨(dú)立進(jìn)行的,在以下的檢驗(yàn)及計(jì)算概率時(shí)還進(jìn)一步假定Y服從正態(tài)分布。在這些假定的基礎(chǔ)上,建立如下一元線性回歸模型:其中x為自變量,y為因變量。β0和β1稱為模型的參數(shù),β0為截距,β1為回歸系數(shù),表明自變量對(duì)因變量的影響程度。誤差項(xiàng)ε是隨機(jī)變量,反映了除x和y之間的線性關(guān)系外的隨機(jī)因素對(duì)y的影響,是不能由x和y之間的線性關(guān)系所解釋的變異性。2.3.2一元線性回歸分析從專業(yè)角度講,以上建立的一元回歸分析模型只有在以下假設(shè)成立時(shí)才有意義。(1)正態(tài)性假設(shè):要求總體誤差項(xiàng)服從正態(tài)分布。如果違反這一假設(shè),則最小二乘估計(jì)不再是無偏估計(jì),不能進(jìn)行區(qū)間估計(jì)。如果不涉及假設(shè)檢驗(yàn)和區(qū)間估計(jì),則此假設(shè)可以忽略。(2)零均值性假設(shè):即在自變量取一定值的條件下,其總體各誤差項(xiàng)的條件平均值為零。如果違反這一假設(shè),則由最小二乘估計(jì)得到的不再是無偏估計(jì)。(3)等方差性假設(shè):即在自變量取一定值的條件下,其總體各誤差項(xiàng)的條件方差為一個(gè)常數(shù)。違反這一假設(shè),則最小二乘估計(jì)不再是有效估計(jì),不能進(jìn)行區(qū)間估計(jì)。(4)獨(dú)立性假設(shè):誤差項(xiàng)之間相互獨(dú)立(不相關(guān)),誤差項(xiàng)與自變量之間應(yīng)相互獨(dú)立。如果違反這一假設(shè),則誤差項(xiàng)之間可能出現(xiàn)序列相關(guān),最小二乘估計(jì)不再是有效估計(jì)。2.3.2一元線性回歸分析2.一元線性回歸方程根據(jù)一元線性回歸模型和對(duì)誤差項(xiàng)的假設(shè),可以建立如下線性回歸方程,其表達(dá)式為,該表達(dá)式描述了y的平均值或期望值如何依賴于自變量x?,F(xiàn)在給出了n對(duì)樣本數(shù)據(jù),i=1,2,…,n,下面要根據(jù)這些樣本數(shù)據(jù)去估計(jì)和,估計(jì)值記為和。如果和已經(jīng)估計(jì)出來,那么在給定的值上,回歸直線上對(duì)應(yīng)的點(diǎn)的縱坐標(biāo)為,稱為回歸值,實(shí)際的觀測(cè)值與之間存在偏差,我們希望求得的直線(即確定和)使這種偏差的平方和達(dá)到最小,即要求達(dá)到最小。2.3.2一元線性回歸分析2.一元線性回歸方程根據(jù)微分學(xué)的原理,可以證明上式中的和可以用下式求出:這一組解稱為最小二乘估計(jì),其中是回歸直線的斜率,稱為回歸系數(shù);是回歸直線的截距,一般稱為常數(shù)項(xiàng)。這樣就可以根據(jù)樣本數(shù)據(jù)求得和,也就能找到回歸方程,完成回歸分析的主要任務(wù)。
2.3.2一元線性回歸分析3.回歸模型的檢驗(yàn)由于回歸分析也是從樣本數(shù)據(jù)估計(jì)總體的參數(shù)的分析方法,因此得出回歸方程以后,需要對(duì)得出的估計(jì)與之前的假設(shè)進(jìn)行檢驗(yàn),從而確認(rèn)所做的分析是有效的。回歸模型的檢驗(yàn)包括三個(gè)方面的內(nèi)容。(1)回歸方程的顯著性檢驗(yàn)(F檢驗(yàn))對(duì)于一元線性回歸方程的顯著性檢驗(yàn)的方法,可以利用上述一元線性回歸方程所求兩個(gè)變量之間的相關(guān)系數(shù),對(duì)于給定的顯著水平α,當(dāng)相關(guān)系數(shù)r的絕對(duì)值大于臨界值時(shí),便認(rèn)為兩個(gè)變量之間存在線性相關(guān)關(guān)系,所求得的回歸方程是顯著的,即回歸方程是有意義的。若要便于推廣到多元線性回歸場(chǎng)合,則可用方差分析法進(jìn)行檢驗(yàn)。
2.3.2一元線性回歸分析3.回歸模型的檢驗(yàn)
(2)回歸系數(shù)的顯著性檢驗(yàn)(t檢驗(yàn)):回歸方程進(jìn)行顯著性檢驗(yàn)以后,方程中的每個(gè)系數(shù)對(duì)因變量的貢獻(xiàn)還需要進(jìn)一步檢驗(yàn)(尤其是在多元線性回歸中)??傮w回歸效果顯著并不說明方程中每個(gè)自變量,,…,對(duì)因變量y都是重要的,即可能有某個(gè)自變量對(duì)y并不起作用,或者能被其他的的作用所代替,因此,對(duì)于這種自變量,一般需要從回歸方程中剔除,這樣可以建立更簡(jiǎn)單的回歸方程。顯然某個(gè)自變量如果對(duì)y不顯著,則它的系數(shù)就應(yīng)取值為0,因此檢驗(yàn)每個(gè)自變量是否顯著,就要進(jìn)行假設(shè)檢驗(yàn),在一元線性回歸的系數(shù)檢驗(yàn)中,因?yàn)橛袃蓚€(gè)參數(shù),因此需要進(jìn)行兩個(gè)假設(shè)檢驗(yàn)。對(duì)于數(shù)據(jù)分析師而言,一定要知道每個(gè)假設(shè)檢驗(yàn)?zāi)P偷?個(gè)要素:原假設(shè)、檢驗(yàn)統(tǒng)計(jì)置和統(tǒng)計(jì)量的分布。2.3.2一元線性回歸分析3.回歸模型的檢驗(yàn)
(2)回歸系數(shù)的顯著性檢驗(yàn)(t檢驗(yàn)):①對(duì)常數(shù)項(xiàng)的檢驗(yàn)原假設(shè)是,即假設(shè)常數(shù)項(xiàng)為零。在假設(shè)下,可應(yīng)用t檢驗(yàn)統(tǒng)計(jì)量:其中,當(dāng)原假設(shè)成立時(shí),該統(tǒng)計(jì)量服從自由度為n-2內(nèi)t分布。這樣根據(jù)得到的樣本數(shù)據(jù),就可以計(jì)算出給定樣本統(tǒng)計(jì)量的t值。有了這個(gè)t值后,就可使用α和p值檢驗(yàn)的方法,檢驗(yàn)原假設(shè)是否成立。在α檢驗(yàn)時(shí),對(duì)給定的檢驗(yàn)水平α,從t分布表中查出與α對(duì)應(yīng)的臨界值,如果有,則拒絕假設(shè),即認(rèn)為常數(shù)項(xiàng)不等于零。在p值檢時(shí),根據(jù)樣本統(tǒng)計(jì)量的分布和其t值,就可以計(jì)算出p值,當(dāng)P值小于檢驗(yàn)水平α?xí)r,拒絕原假設(shè)。2.3.2一元線性回歸分析3.回歸模型的檢驗(yàn)
(2)回歸系數(shù)的顯著性檢驗(yàn)(t檢驗(yàn)):②對(duì)系數(shù)的檢驗(yàn)原假設(shè)是,即假設(shè)系數(shù)為零。在假設(shè)下,可應(yīng)用t檢驗(yàn)統(tǒng)計(jì)量:
其中,在多元線性回歸分析中,如果某一系數(shù)被檢驗(yàn)出無顯著差異,則說明系數(shù)對(duì)應(yīng)的自變量對(duì)因變量沒有重要作用,需要從模型中剔除;在一元線性回歸分析中,如果檢驗(yàn)出無顯著差異,則需要對(duì)模型進(jìn)行重新考慮。2.3.2一元線性回歸分析3.回歸模型的檢驗(yàn)
(3)殘差分析:指由回歸方程計(jì)算得到的預(yù)測(cè)值與實(shí)際樣本值之間的差距,其定義為。對(duì)于線性回歸分析,如果方程能夠比較好地反映被解釋變量的特征和規(guī)律性,那么殘差序列中應(yīng)不包含明顯的規(guī)律性。殘差分析包括以下內(nèi)容:殘差服從正態(tài)分布,其平均值等于零;殘差取值與X的取值無關(guān);殘差的自相關(guān)性;殘差方差相等。2.3.2一元線性回歸分析3.回歸模型的檢驗(yàn)
(3)殘差分析:①殘差均值和方差齊次性檢驗(yàn)。可以利用殘差圖進(jìn)行分析,如果殘差均值為零,則殘差圖的點(diǎn)應(yīng)該在縱坐標(biāo)為零的中心帶狀區(qū)域中隨機(jī)散落。如果殘差的方差隨著解釋變量值(或被解釋量值)的增加呈有規(guī)律的變化趨勢(shì),則出現(xiàn)了異方差現(xiàn)象。②D-W檢驗(yàn)。D-W檢驗(yàn)用來檢驗(yàn)殘差的自相關(guān)。檢驗(yàn)統(tǒng)計(jì)量為DW值為2表示無自相關(guān),為0~2說明存在正自相關(guān),為2~4說明存在負(fù)自相關(guān)。一般情況DW值為1.5~2.5即可說明無自相關(guān)現(xiàn)象。2.3.2一元線性回歸分析4.回歸直線的擬合優(yōu)度回歸直線的擬合優(yōu)度是指回歸直線對(duì)觀測(cè)值的擬合程度。顯然,若觀測(cè)點(diǎn)離回歸直線近,則擬合程度好;反之則擬合程度差。度量擬合優(yōu)度的統(tǒng)計(jì)量是可決系數(shù)(亦稱判定系數(shù))R2。可決系數(shù)是回歸平方和(SSR)占總誤差平方和(SST)的比例,計(jì)算公式為R2的取值范圍是[0,1]。R2的值越接近1,說明回歸直線對(duì)觀測(cè)值的擬合程度越好;反之,R2的值越接近0,說明回歸直線對(duì)觀測(cè)值的擬合程度越差。2.4應(yīng)用實(shí)例:使用Excel實(shí)現(xiàn)一元回歸分析回歸分析是根據(jù)所擬合的回歸方程來研究自變量與因變量相關(guān)關(guān)系的方法,實(shí)踐中主要用于估測(cè)和預(yù)測(cè)。本節(jié)主要討論如何使用Excel實(shí)現(xiàn)一元線性回歸分析。Excel中可以使用多種方法進(jìn)行回歸分析問題的求解,常用方法主要有:①采用圖表分析;②使用回歸函數(shù);③使用規(guī)劃求解工具;④使用回歸分析工具。其中,回歸分析工具僅適用于線性回歸分析;規(guī)劃求解工具是最有效和最方便的求解工具。2.4.1
求解問題及要求
以一段時(shí)間內(nèi)某系列商品銷售的利潤(rùn)和成交金額數(shù)據(jù)為依據(jù)(見表2-16),用Excel實(shí)現(xiàn)商品銷售利潤(rùn)和銷售金額的一元線性回歸分析。表2-16某系列商品銷售的利潤(rùn)和成交金額數(shù)據(jù)類別成交金額(萬元)利潤(rùn)(萬元)陶器&玻璃88
4458
460郵票10211照片9
584779消費(fèi)者電子商品-視頻23215古董12
0985
897照片16
377718健康&美麗17
9261
560健康&美麗198
5099
358計(jì)算機(jī)54
7895
205珠寶、手表113
56910
789家居35
9333
414陶器&玻璃133
4343
176照片234
9153
317書61
4525
838服裝&飾品77
8067
392汽車零件82
9967
885收藏品10
572942體育用品6
502682體育用品11
952197服裝&飾品112
0671
095陶器&玻璃288
4458
460郵票110211照片39
584779消費(fèi)者電子商品-視頻123215古董112
0985
897照片46
377718健康&美麗217
9261
560具體要求:(1)建立x與y散點(diǎn)圖,在圖上添加線性趨勢(shì)線、線性回歸方程及判定系數(shù)R2的值。(2)使用規(guī)劃求解法計(jì)算一元線性回歸模型的參數(shù),求判定系數(shù)R2的值。(3)使用回歸分析工具建立一元線性回歸模型,求解模型參數(shù)和判定系數(shù)R2的值,并通過R2判斷回歸方程的線性關(guān)系是否顯著。(4)比較上述3種方法的結(jié)果,并預(yù)測(cè)成交金額投入為200
000萬元時(shí)的利潤(rùn)。(5)將規(guī)劃求解法預(yù)測(cè)得到的利潤(rùn)預(yù)測(cè)值添加到散點(diǎn)圖上。2.4.2不同方法實(shí)現(xiàn)回歸分析的基本步驟1.采用圖表分析——添加趨勢(shì)線第一步:在Excel中打開“商品類目銷售利潤(rùn)表.xls”工作表,選取B1:C201區(qū)域的單元格,在【插入】選項(xiàng)中選擇【圖表】組,單擊【散點(diǎn)圖】按鈕,創(chuàng)建如圖所示
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請(qǐng)下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請(qǐng)聯(lián)系上傳者。文件的所有權(quán)益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內(nèi)容里面會(huì)有圖紙預(yù)覽,若沒有圖紙預(yù)覽就沒有圖紙。
- 4. 未經(jīng)權(quán)益所有人同意不得將文件中的內(nèi)容挪作商業(yè)或盈利用途。
- 5. 人人文庫網(wǎng)僅提供信息存儲(chǔ)空間,僅對(duì)用戶上傳內(nèi)容的表現(xiàn)方式做保護(hù)處理,對(duì)用戶上傳分享的文檔內(nèi)容本身不做任何修改或編輯,并不能對(duì)任何下載內(nèi)容負(fù)責(zé)。
- 6. 下載文件中如有侵權(quán)或不適當(dāng)內(nèi)容,請(qǐng)與我們聯(lián)系,我們立即糾正。
- 7. 本站不保證下載資源的準(zhǔn)確性、安全性和完整性, 同時(shí)也不承擔(dān)用戶因使用這些下載資源對(duì)自己和他人造成任何形式的傷害或損失。
最新文檔
- 2026年汽車組裝代工智能制造實(shí)施方案設(shè)計(jì)
- 辦公物業(yè)租賃服務(wù)協(xié)議
- 江西工業(yè)工程考試題及答案
- 教練轎車考試題及答案解析
- 2026年中職兒童發(fā)展(成長(zhǎng)指導(dǎo))試題及答案
- 檢驗(yàn)師考試題及答案大全
- 內(nèi)河船員考試題及答案
- 廚房人員考試題及答案
- 2026年中職(計(jì)算機(jī)應(yīng)用)計(jì)算機(jī)操作階段測(cè)試題及答案
- 班干部測(cè)試考試題及答案
- 四川成都市成華區(qū)2025-2026學(xué)年八年級(jí)下期期末學(xué)業(yè)水平監(jiān)測(cè)英語試卷
- 公立醫(yī)院行政管理崗招聘考試核心考點(diǎn)筆記:公共衛(wèi)生應(yīng)急管理
- 2026年中國(guó)建設(shè)銀行福建省分行消防安全崗社會(huì)招聘筆試備考試題及答案解析
- 醉酒后的急救處理與預(yù)防方法
- 2026農(nóng)業(yè)4.0智慧農(nóng)業(yè)領(lǐng)航之路行業(yè)趨勢(shì)白皮書
- 2026年三級(jí)老年人能力評(píng)估師復(fù)習(xí)復(fù)習(xí)試題及答案詳解(有一套)
- 湖南長(zhǎng)沙水業(yè)集團(tuán)有限公司招聘考試真題2025
- 保婦康栓臨床應(yīng)用專家共識(shí)(2025年版)
- 吊橋施工方案
- 路基施工培訓(xùn)教學(xué)課件
- 生產(chǎn)凈化車間管理制度
評(píng)論
0/150
提交評(píng)論