《機器學習》期末考試復習題庫(附答案)_第1頁
《機器學習》期末考試復習題庫(附答案)_第2頁
《機器學習》期末考試復習題庫(附答案)_第3頁
《機器學習》期末考試復習題庫(附答案)_第4頁
《機器學習》期末考試復習題庫(附答案)_第5頁
已閱讀5頁,還剩60頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

《機器學習》期末考試復習題庫(附答案)

單選題

1.做一個二分類預測問題,先設定閾值為0.5,概率大于等于0.5

的樣本歸入正例類(即1),小于0.5的樣本歸入反例類(即0)。

然后,用閾值n(n>0.5)重新劃分樣本到正例類和反例類,v面

哪一種說法正確是()1.增加閾值不會提高召回率2.增加閾值會

提高召回率3.增加閾值不會降低查準率4.增加閾值會降低查準率

A、1

B、2

C、1、3

D、2、4

參考答案:C

2.在一個線性回歸問題中,我們使用R平方(R-Squared)來判斷

擬合度。此時,如果增加一個特征,模型不變,則下面說法正確

的是?

A、如果R-Squared增加,則這個特征有意義

B、如果R-Squared減小,則這個特征沒有意義

C^僅看R-Squarcd單一變量,無法確定這個特征是否有意義。

D、以上說法都不對

參考答案:C

1st

3.在機器學習中,學得的模型適用于新樣本的能力稱為()

A、分析能力

B、泛化能力

C、訓練能力

D、驗證能力

參考答案:B

4.在回歸模型中,下列哪一^頁在權衡欠擬合(under-fitting)和過

擬合(over-fitting)中影響最大?

A、多項式階數

B、更新權重w時,使用的是矩陣求逆還是梯度下降

C、使用常數項

參考答案:A

5.在構造決策樹時,以下哪種不是選擇屬性的度量的方法

A、信息值

B、信息增益

C、信息增益率

D、基尼指數

參考答案:A

6.在大數據集上訓練決策樹,為了使用較少時間,我們可以()

A、增加樹的深度

B、增加學習率

C、減少樹的深度

2nd

D、減少樹的數量

參考答案:C

7.在變量選擇過程中,下列哪些方法可用于檢查模型的性能?a.

多重變量用于同一個模型b.模型的可解釋性c.特征的信息d.交叉

驗證

A、d

B、abc

C、acd

D、全部

參考答案:C

8.在SVM中,margin的含義是()

A、差額

B、損失誤差

C、幅度

D、間隔

參考答案:D

9.以下有關隨機森林算法的說法錯誤的是:

A、隨機森林算法的分類精度不會隨著決策樹數量的增加而提高

B、隨機森林算法對異常值和缺失值不敏感

C、隨機森林算法不需要考慮過擬合問題

D、決策樹之間相關系數越低、每棵決策樹分類精度越高的隨機

森林模型分類效果越好

3rd

參考答案:C

io.以下哪些是無序屬性()

A、{1,2,3}

B、{飛機,火車、輪船)

C、閔可夫斯基距離

D、{小,中,大}

參考答案:B

11.以下哪項是非線性降維方法

A、PCA(主成分分析)

B、LDA(線性判別)

C、ICA(獨立成分分析)

D、KPCA(核化線性降維)

參考答案:D

12.以下哪個是PCA算法的主要應用?

A、聚類

B、分類

C、距離度量

D、數據壓縮

參考答案:D

13.以下哪個不是原型聚類算法。

A、K均值算法

B、學習向量量化LVQ

4th

C、高斯混合聚類

D、PCA算法

參考答案:D

14.以下哪個不是常見的決策樹算法

A、ID3

B、C4.5

C、ART

D、BSCAN

參考答案:D

15.以下關于訓練集、驗證集和測試集說法不正確的是()。

A、驗證集用于調整模型參數

B、測試集是純粹是用于測試模型泛化能力

C、以上說法都不對

D、訓練集是用來訓練以及評估模型性能

參考答案:D

16.以下關于學習率說法錯誤的是()。

A、學習率太大會導致無法收斂

B、學習率必須是固定不變的

C、學習率的選擇不能太大也不能太小

D、學習率太小會使得算法陷入局部極小點

參考答案:B

17.以下關于神經網絡的說法中,正確的是()?

5th

A、增加網絡層數,一定能減小訓練集錯誤率

B、減小網絡層數,一定能減小測試集錯誤率

C、增加網絡層數,可能增加測試集錯誤率

D、增加網絡層數,一定增加測試集錯誤率

參考答案:C

18.以下關于降維說法不正確的是?

A、降維是將訓練樣本從高維空間轉換到低維空間

B、降維有助于數據可視化

C、通過降維可以更有效地發掘有意義的數據結構

D、降維不會對數據產生損傷

參考答案:D

19.以下關于機器學習描述錯誤的是?

A、是一門涉及統計學、系統辨識、逼近理論、神經網絡、優化

理論、計算機科學、腦科學等諸多領域的交叉學科

B、研究計算機怎樣模擬或實現人類的學習行為,以獲取新的知

識或技能

C、器學習強調三個關鍵詞:算法、模型、訓練

D、基于數據的機器學習是現代智能技術中的重要方法之一

參考答案:C

20.以下關于感知器說法錯誤的是:()

A、感知器中的偏置只改變決策邊界的位置

B、可為感知器的輸出值設置閾值使其用于處理分類問題

6th

C、單層感知器可以用于處理非線性學習問題

D、感知器是最簡單的前饋式人工神經網絡

參考答案:C

21.以下關于Sigmoid的特點說法錯誤的是()o

A、Sigmoid函數計算量小

B、趨向無窮的地方,函數變化很小,容易出現梯度消失的現象

C、可以將函數值的范圍壓縮到

D、函數處處連續

參考答案:A

22.一個包含n類的多分類問題,若采用一對剩余的方法,需要拆

分成多少次?

A、n

B、1

C、n-1

D、n+1

參考答案:C

23.一對一法分類器,k個類別需要多少個SVM:

A、k(k-1)/2

B、k(k-1)

C、k

D、k!

參考答案:A

7th

24.一般來說,下列哪種方法常用來預測連續獨立變量?

A、線性回歸

B、邏輯回顧

C、線性回歸和邏輯回歸都行

D、以上說法都不對

參考答案:A

25.線性回歸能完成的任務是

A、預測離散值

B、預測連續值

C、分類

D、聚類

參考答案:B

26.下面關于貝葉斯分類器描述錯誤的是

A、以貝葉斯定理為基礎

B、是基于后驗概率

C、可以解決有監督學習的問題

D、可以用極大似然估計法解貝葉斯分類器

參考答案:B

27.下面關于SVM算法敘述不正確的是()

A、SVM在解決小樣本、非線性及高維模式識別問題中具有優勢

B、SVM是一種基于經驗風險最小化準則的算法

C、SVM求得的解為全局唯一最優解

8th

D、SVM最終分類結果只與少數支持向量有關

參考答案:B

28.下面符合特征選擇標準的是()

A、越少越好

B、越多越好

C、選擇能夠反映不同事物差異的特征

D、以上均不對

參考答案:C

29.下面不屬于過擬合原因的是

A、特征維度過多

B、模型假設過于復雜

C、訓練數據過多

D、噪聲過多

參考答案:C

30.下列中為判別模型的是()

A、高斯混合模型

B、隱含馬爾科夫模型

C、GAN模型

D、邏輯回歸模型

參考答案:D

31.下列有關支持向量機說法不正確的是:

A、得到的是局部最優解

9th

B、具有很好的推廣能力

C、采用結構風險最小化原理

D、是凸二次優化問題

參考答案:A

32.下列有關核函數不正確的是:

A、可以采用cross-validalion方法選擇最佳核函數

B、滿足Mercer條件的函數不一定能作為支持向量機的核函數

C、極大地提高了學習機器的非線性處理能力

D、函數與非線性映射并不是一一對應的關系

參考答案:B

33.下列有關SVM和LR說法不正確的是()

A、SVM是分類模型,LR是回歸模型

B、SVM和LR都是分類模型

C、SVM是判別式模型

D、LR判別式模型

參考答案:A

34.下列誤差和錯誤中,哪一項是由于訓練樣本的錯誤而導致?

A、泛化誤差

B、偏差

C、方差

D、噪聲

參考答案:D

10th

35.下列是機器學習中降維任務的準確描述的為

A、依據某個準則對項目進行排序

B、將其映射到低維空間來簡化輸入

C、預測每個項目的實際值

D、對數據對象進行分組

參考答案:B

36.下列哪種歸納學習采用符號表示方式?

A、經驗歸納學習

B、遺傳算法

C、聯接學習

D、強化學習

參考答案:A

37.下列哪種方法可以用來緩解過擬合的產生:()。

A、正則化

B、增加更多的特征

C、以上都是

D、增加模型的復雜度

參考答案:A

38.下列哪一種偏移,是我們在最小二家直線擬合的情況下使用

的?圖中橫坐標是輸入X,縱坐標是輸出Y。

A、垂直偏移

B、垂向偏移

11th

C、兩種偏移都可以

D、以上說法都不對

參考答案:A

39.下列兩個變量之間的關系中,那一個是線性關系

A、學生的性別與他(她)的數學成績

B、人的工作環境與他的身體健康狀況

C、兒子的身高與父親的身高

D、正方形的邊長與周長

參考答案:D

40.下列激活函數中,能夠實現將特征限制到區間[-1,1]的是哪一個

A、Tanh

BALogistic

C、RcLU

D、Sigmoid

參考答案:A

41.下列關于主成分分析的表述錯誤的是

A、主成分分析方法一種數據降維的方法

B、通過主成分分析,可以將多個變量縮減為少數幾個新的變量,

而信息并沒有損失,或者說信息損失很少

C、通過主成分分析,可以用較少的新的指標來代替原來較多的

指標反映的信息,并且新的指標之間是相互獨立的

D、主成分分析是數據增維的方法

12th

參考答案:D

42.下列關于線性回歸分析中的殘差(Residuals)說法正確的是?

A、殘差均值總是為零

B、殘差均值總是小于零

C、殘差均值總是大于零

D、以上說法都不對

參考答案:A

43.下列關于過擬合的說法錯誤的是

A、過擬合是指模型在訓練集上表現很好,但是在交叉驗證集和

測試集上表現一般

B、解決過擬合可以采用Dropout方法

C、解決過擬合可以采用參數正則化方法

D、數據集擴增不能用來解決過擬合問題

參考答案:D

44.下列關于Boosting和Bagging的描述正確的是:

A、Boosting主要關注降低方差

B、costing的代表算法有隨機森林

C、Bagging基于自助采樣法

D、Bagging主要關注降低偏差

參考答案:C

45.下列方法中,屬于無監督學習的為()

A、線性回歸

13th

B、K均值

C、神經網絡

D、決策樹

參考答案:B

46.下列不屬于集成學習方法是

A、bagging

B、connecting

C、boosting

D、stacking

參考答案:B

47.下列不是SVM核函數的是:

A、多項式核函數

logistic核函數

C、徑向基核函數

D、Sigmoid核函數

參考答案:B

48.下列表述中,在k-fold交叉驗證中關于選擇K說法正確的是

A、較大的K并不總是好的,選擇較大的1<可能需要較長的時間

來評估你的結果

B、相對于期望誤差來說,選擇較大的K會導致低偏差(因為訓

練folds會變得與整個數據集相似)

C、在交叉驗證中通過最小化方差法來選擇K值

14th

D、以上都正確

參考答案:D

49.下列貝葉斯網結構中不屬于三種典型的依賴關系

A、同父結構

B、選擇結構

C、順序結構

D、V型結構

參考答案:B

5().同質集成中的個體學習器亦稱()

A、基學習器

B、同質學習器

C、組件學習器

D、異質學習器

參考答案:A

51.四個點坐標為(1,1),(1,0),(-1,-1),(-1,0),用SVM分類的

決策邊界是

A^尸x

B、x=O

C、y--x

DvJ=0

參考答案:B

52.神經網絡算法有時會出現過擬合的情況,那么采取以下哪些方

15th

法解決過擬合更為可行()。

A、為參數選取多組初始值,分別訓練,再選取一組作為最優值

B、增大學習的步長

C、減少訓練數據集中數據的數量

D、設置一個正則項減小模型的復雜度

參考答案:D

53.若某學習器預測的是離散值,則此類學習任務稱為()

A、分類

B、聚類

C、回歸

D、強化學習

參考答案:A

54.若svm出現欠擬合,以下合適的做法是

A、使用更powful的kernel

B、增加訓練樣本

C、使用L2正規化

D、做數據增強

參考答案:A

55.如果一個SVM模型出現欠擬合,那么下列哪種方法能解決這

一問題?

A、增大懲罰參數C的值

B、減小懲罰參數C的值

16th

C、減小核系數(gamma參數)

D、都不正確

參考答案:A

56.如果我們說“線性回歸”模型完美地擬合了訓練樣本(訓練樣

本誤差為零),則下面哪個說法是正確的?

A、測試樣本誤差始終為零

B、測試樣本誤差不可能為零

C、以上答案都不對

參考答案:C

57.樸素貝葉斯是一種典型的基于概率的機器學習方法,它利月了

A、先驗概率

B、后驗概率

C、以上都是

D、以上都不是

參考答案:C

58.樸素貝葉斯分類器的特征不包括

A、孤立的噪聲對該分類器的影響不大

B、數據的缺失值影響不大

C、要求數據的屬性是相互獨立的

D、條件獨立的假設可能不成立

參考答案:C

59.樸素貝葉斯分類器的三種實現不包括

17th

A、基于伯努利模型實現

B、基于多項式模型實現

C、屬性條件獨立性假設實現

D、基于高斯模型實現

參考答案:C

60.哪一個是機器學習的合理定義?

A、機器學習是計算機編程的科學

B、機器學習從標記的數據中學習

C、機器學習是允許機器人智能行動的領域

D、機器學習能使計算機能夠在沒有明確編程的情況下學習

參考答案:D

61.哪些機器學習模型經過訓練,能夠根據其行為獲得的獎勵和反

饋做出一系列決策?

A、無監督學習

B、監督學習

C、強化學習

D、以上全部

參考答案:C

62.模型評估的常用方法有哪些

A、留出法

B、交叉驗證法

C、自助法

18th

D、以上都是

參考答案:D

63.決策樹中不包含以下哪種結點

A、根節點

B、內部結點

C、葉節點

D、外部結點

參考答案:D

64.決策樹學習的關鍵是

A、初始結點選擇

B、剪枝

C、選擇最優劃分屬性

D、分枝

參考答案:C

65.決策樹模型中應如何妥善處理連續型屬性

A、直接忽略

B、利用固定閾值進行離散化

C、根據信息增益選擇閾值進行離散化

D、隨機選擇數據標簽發生變化的位置進行離散化

參考答案:C

66.將數據集D進行適當處理,產生出訓練集S和測試集T,有

哪些常見的做法:

19th

A、留出法

B、交叉驗證法

C、自助法

D、以上都是

參考答案:D

67.假設現在只有兩個類,這種情況下SVM需要訓練幾次?

A、1

B、2

C、3

D、4

參考答案:A

68.假設我們使用原始的非線性可分版本的Soft-SVM優化目標函

數。我們需要做什么來保證得到的模型是線性可分離的?

A、C=0

B、C=1

C、正無窮大

D、C負無窮大

參考答案:C

69.假設你有以下數據:(0,2)(2,2)(3,1)輸入和輸出都只有一個

變量。使用線性回歸模型(y=wx+b)來擬合數據。那么使用留

一法(Lcavc-OncOut)交叉驗證得到的均方誤差是多少?

A、10/32

20th

B、39/27

C、49/27

D、55/27

參考答案:C

704艮如我們使用Lasso回歸來擬合數據集,該數據集輸入特征有

100個(XI,X2,…,X100)o現在,我們把其中一個特征值擴

大10倍(例如是特征XI),然后用相同的正則化參數對Lasso

回歸進行修正。那么,下列說法正確的是?

A、特征XI很可能被排除在模型之外

B、特征XI很可能還包含在模型之中

C、無法確定特征XI是否被舍棄

D、以上說法都不對

參考答案:B

71.極大似然估計中參數是()

A、確定且已知的量

B、確定且未知的量

C、已知的隨機變量

D、未知的隨機變量

參考答案:B

72.極大似然估計是()

A、與總體分布無關的統計量

B、通過總體分布才能求出來的統計量

21st

C、似然方程的解

D、對數似然方程的解

參考答案:B

73.基于層次的聚類算法包括()。

A、合并的層次聚類

B、基于密度的聚類算法

C、基于劃分的算法

D、基于網絡的聚類算法

參考答案:A

74.機器學習這個術語是由()定義的?

A、rthurSamuel

B、GuidovanRossum

C、JamesGosling

D、以上都不是

參考答案:A

75.混淆矩陣中的TP=16,FP=12,FN=8,TN=4,準確率是

A、四分之一

B、二分之一

C、七分之四

D、三分之二

參考答案:B

76.混淆矩陣的真負率公式是為

22nd

A、TP/(TP+FN)

B、FP/(FP+TN)

C、FN/(TP+FN)

D、TN/(TN+FP)

參考答案:D

77.關于維數災難說法錯誤的是?

A、高維度數據可使得算法泛華能力變得越來越弱

B、降低高維度數據會對數據有所損傷

C、高維度數據增加了運算難度

D、高維度數據難以可視化

參考答案:A

78.關于隨機森林,說法錯誤的是:

A、相對于Boosting系列的Adaboost和GBDT,RF實現比較簡

單。

B、在訓練后,可以給出各個特征對于輸出的重要性

C、訓練高度串行化

D、隨機采樣,訓練出的模型的方差小,泛化能力強

參考答案:C

79.關于數據規范化,下列說法中錯誤的是()。

A、標準化實際上是將數據在樣本的標準差上做了等比例的縮放

操作

B、歸一化利用了樣本中的最大值和最小值

23rd

C、包含標準化和歸一/匕

D、標準化在任何場景下受異常值的影響都很小

參考答案:D

80.關于決策樹結點劃分指標描述正確的是

A、類別非純度越大越好

B、信息增益越大越好

C、信息增益率越小越好

D、基尼指數越大越好

參考答案:B

81.關于決策樹,以下哪種說法是正確的

A、可讀性強

B、只用于分類問題

C、只用于回歸問題

D、是無監督學習

參考答案:A

82.關于SVM泛化誤差描述正確的是

A、超平面與支持向量之間距離

B、超平面與支持向量之間距離

C、SVM的誤差閾值

參考答案:B

83.關于logistic回歸和SVM不正確的是()

A、Logistic回歸目標函數是最小化后驗概率

24th

B、Logistic回歸可以用于預測事件發生概率的大小

C、SVM目標是結構風險最小化

D、SVM可以有效避免模型過擬合

參考答案:A

84.關于K.均值算法,以下說法不正確的是

A、K-均值算法是一種劃分方法。

B、K-均值算法能發現任意形狀的簇。

C、K-均值算法不一定收斂于全局最優解。

D、比起DBSCAN算法來,K更好

參考答案:B

85.關于EM算法正確的是

A、EM算法包括兩步:E算法和M算法

B、EM算法一定能收斂到全局最大值點

C^英文全稱是Expectation-Minimization

D、以上都不正確

參考答案:A

86.關于BP算法優缺點的說法錯誤的是()o

A、BP算法不能用于處理非線性分類問題

B、P算法容易陷入局部敢小值

C、BP算法訓練時間較長

D、BP算法訓練時候可能由于權值調整過大使得激活函數達到

飽和

25th

參考答案:A

87.關于BP算法信號前向傳播的說法正確的是()。

A、BP算法在計算正向傳播輸出值時需要考慮激活函數

B、P算法信號前向傳播的計算量跟輸入層神經元數目無關

C、BP算法只有在隱層才有激活函數

D、BP算法信號傳播的順序是輸出層、隱層、輸入層。

參考答案:A

88.關于BP算法特點描述錯誤的是()

A、輸入信號順著輸入層、隱層、輸出層依次傳播

B、計算之前不需要對訓練數據進行歸一化

C、預測誤差需逆向傳播,順序是輸出層、隱層、輸入層

D、各個神經元根據預測誤差對權值進行調整

參考答案:B

89.關于算法反向傳播的說法正確的是()。

A.BP算法反向傳播進行更新時一般用到微積分的鏈式傳播法則

B、P算法更新量與步長關系不大

C、BP算法反向傳播的預測誤差值一般由真實標簽值和預測標簽

值的差計算得來

D、BP算法反向傳播的目的是只對權值進行更新

參考答案:A

90.谷歌新聞每天收集非常多的新聞,并運用。方法再將這些新

聞分組,組成若干類有關聯的新聞。于是,搜索時同一組新聞事

26th

件往往隸屬同一主題的,所以顯示到一起。

A、關聯規則

B、聚類

C、回歸

D、分類

參考答案:B

91.構建一個最簡單的線性回歸模型需要幾個系數(只有一個特

征)?

A、1個

B、2個

C、3個

D、4個

參考答案:B

92.對主成分分析PCA方法描述正確的是:

A、投影矩陣是正交矩陣

B、進行非正交投影

C、PCA不需要進行樣本去均值

D、投影到特征值最小的方向

參考答案:A

93.對于在原空間中線性不可分問題,支持向量機()。

A、無法處理

B、將數據映射到核空間中

27th

C、在原空間中尋找非線性函數的劃分數據

D、在原空間中尋找線性函數劃分數據

參考答案:B

94.對于非概率模型而言,可按照判別函數線性與否分成線性模型

與非線性模型。下面哪個模型不屬于線性模型?

A、感知機

B、AdaBoost

C、K-means

D、k近鄰

參考答案:B

95.對決策樹進行剪枝處理的主要目的是什么

A、避免欠擬合

B、提高對訓練集的學習能力

C、避免過擬合,降低泛化能力

D、避免過擬合,提升泛化能力

參考答案:D

96.對函數dist(.,.)若它是一個距離度量則需要滿足的基本特

性中以下哪個不是正確答案

A、非負性

B、同一性

C、遞增性

D、對稱性

28th

參考答案:C

97.對Boosting模型的描述錯誤的是

A、采用串行訓練模式

B、增加被錯誤分類樣本的權值

C、通過改變訓練集進行有針對性的學習

D、基礎分類器采用少數服從多數原則進行集成

參考答案:D

98.點擊率的預測是一個數據比例不平衡問題(比如訓練集中樣本

呈陰性的比例為99%,陽性的比例是1%),如果我們用這種數據

建立模型并使得訓練集的準確率高達99%o我們可以得出結論

是:

A、模型的準確率非常高,我們不需要進一步探索

B、模型不好,我們應建一個更好的模型

C、無法評價模型

D、以上都不正確

參考答案:B

99.當訓練集很多時,一種更為強大的結合策略是使用(),即通

過另一個學習器來進行結合。

A、學習法

B、平均法

C、投票法

D、加權投票法

29th

參考答案:A

100.當數據分布不平衡時,我們可采取的措施不包括()。

A、對數據分布較多的類別賦予更大的權重

B、對數據分布較多的類別欠采樣

C、對數據分布較少的類別過采樣

D、對數據分布較少的類別賦予更大的權重

參考答案:A

101.不屬于KNN算法要素的是:

A、k值的選擇

B、距離度量

C、分類決策的規則

D、訓練樣本的個數

參考答案:D

102.按照求解方法進行分類算法的劃分,下列中為生成模型的是

()

A、決策樹

B、K近鄰

C、貝葉斯分類器

D、支持向量機SVM

參考答案:C

103.SVM算法的性能取決于:

A、以上所有

30th

B、軟間隔參數

C、核函數的參數

D、核函數的選擇

參考答案:A

104.StandardScaler預處理方法可以表示為?=(?-?)/,其中?表

示特征所在列的

A、最大值

B、分解閾值

C、均值

D、方差

參考答案:D

105.K均值算法的K指的是什么?

A、K是均值的數值

B、K是均值的最大限值

C、K是分類的數量

D、K是分類的迭代次數

參考答案:B

106.KNN算法屬于一種典型的。算法

A、監督學習

B、無監督學習

C、半監督學習

D、弱監督學習

31st

參考答案:A

107.KNN算法是基于()

A、概率空間

B、顏色空間

C、距離空間

D、線性空間

參考答案:C

108.ID3決策樹算法以()為準則來選擇劃分屬性

A、信息增益

B、信息嫡

C、基尼系數

D、信息增益率

參考答案:A

109.EM算法是()學習算法

A、有監督

B、無監督

C、半監督

D、都不是

參考答案:B

HO.EM算法的停止條件()

A、已達到最大迭代輪數

B、數據樣本異常

32nd

C、訓練器異常

D、似然函數減小

參考答案:A

111.BP算法總結錯誤的是()。

A、當前層的連接權值梯度,取決于當前層神經元閾值梯度和上

一層神經元輸出

B、算法只要知道上一層神經元的閾值梯度,就能計算當前層神

經元的閾值梯度和連接權值梯度

C、隱層的閾值梯度只跟本層的神經元輸出值有關

D、隱層閾值梯度取決于隱層神經元輸出、輸出層閾值梯度和隱

層與輸出層的連接權值

參考答案:C

112.AGNES是一種()聚合策略的層次聚類算法

A、自頂向下

B、自底向上

C、由最近樣本決定

D、最遠樣本決定

參考答案:B

113.下列關于線性回歸說法錯誤的是()

A、在現有模型上,加入新的變量,所得到的R人2的值總會增加

B、線性回歸的前提假設之一是殘差必須服從獨立正態分布

C、殘差的方差無偏估計是SSE/(n-p)

33rd

D、自變量和殘差不一定保持相互獨立

參考答案:D

114.“學習向量量化”與一般聚類算法不同的是()

A、數據樣本帶有類別標記

B、結構不同

C、向量程度不同

D、簇的種類不同

參考答案:A

115.“沒有免費的午餐定理”告訴我們

A、我們不能對問題有先驗假設

B、沒有可以適應一切問題的算法

C、設計好的算法是徒勞的

D、對于一個特定的問題,任何算法都是一樣好的

參考答案:B

116.()是并行式集成學習方法最著名的代表

A、隨機森林

B、oosting

C、Bagging

DNAdaBoost

參考答案:C

判斷題

34th

1.最近鄰分離器的泛化錯誤率不會超過貝葉斯最優分類器錯誤

率的兩倍

A、正確

B、錯誤

參考答案:A

2.支持向量是最靠近決策表面的數據點

A、正確

B、錯誤

參考答案:A

3.在基于SGD隨機梯度下降算法的神經網絡中,每次打亂數據

是非常重要和必不可少

A、正確

B、錯誤

參考答案:A

4.在初始數據量足夠時,自助法比交叉險證法更為常用。

A、正確

B、錯誤

參考答案:B

5.預剪枝決策樹通常比后剪枝決策樹保留了更多的分支。

A、正確

B、錯誤

參考答案:B

35th

6.預剪枝決策樹的訓練時間開銷比后剪枝決策樹要大得多。

A、正確

B、錯誤

參考答案:B

7.由于貝努力貝葉斯比適合于貝努力(二項分布)分布,因此,

貝努力貝葉斯只能用于二分類任務

A、正確

B、錯誤

參考答案:B

8.硬投票計算出每個類別的平均估算概率,然后選出概率最高的

類別。

A、正確

B、錯誤

參考答案:B

9.一個貝葉斯網由結構和參數兩個部分構成

A、正確

B、錯誤

參考答案:A

10.一般情形下,后剪枝決策樹的欠擬合風險很小,泛化性能往往

優于預剪枝決策樹。

A、正確

B、錯誤

36th

參考答案:A

11.一般來說,查準率高時,查全率也高。

A、正確

B、錯誤

參考答案:B

12.訓練算法的目的就是要讓模型擬合訓練數據

A、正確

B、錯誤

參考答案:B

13.線性回歸模型只能處理具有線性關系的數據。

A、正確

B、錯誤

參考答案:B

14.無監督學習任務中研究最多、應用最廣的是聚類

A、正確

B、錯誤

參考答案:A

15.通常,我們認為對于一個系統來說,誤差越小越好,因此無論

是泛化誤差還是經驗誤差,都是越小越好。

A、正確

B、錯誤

參考答案:B

37th

16.梯度下降法中梯度方向是函數值下降最快方向。

A、正確

B、錯誤

參考答案:B

17.特征空間越大,過擬合的可能性越大。

A、正確

B、錯誤

參考答案:A

18.隨機森林的訓練效率通常低于Bagging

A、正確

B、錯誤

參考答案:B

19.隨機森林的兩個隨機指的是隨機選取樣本和隨機選取屬性

A、正確

B、錯誤

參考答案:A

20.數據有噪聲,有重復值,不會導致SVM算法性能下降

A、正確

B、錯誤

參考答案:B

21.輸出變量為連續變量的預測問題是分類問題

A、正確

38th

B、錯誤

參考答案:B

22.神經網絡算法不能用于數據降維

A、正確

B、錯誤

參考答案:B

23.若參數C(costparameter)被設為無窮,只要最佳分類超五面

存在,它就能將所有數據全部正確分類

A、正確

B、錯誤

參考答案:A

24.如果數據量較少,容易發生過擬合。

A、正確

B、錯誤

參考答案:A

25.任何一個有效的機器學習算法必須有其歸納偏好

A、正確

B、錯誤

參考答案:A

26.模型泛化能力與訓練樣本數量無關

A、正確

B、錯誤

39th

參考答案:B

27.密度直達和密度可達滿足對稱性

A、正確

B、錯誤

參考答案:B

28.邏輯回歸是一個回歸模型

A、正確

B、錯誤

參考答案:B

29.邏輯回歸和樸素貝葉斯都有對屬性特征獨立的要求

A、正確

B、錯誤

參考答案:B

30.邏輯回歸分類的精度不夠高,因此在業界很少用到這個算法

A、正確

B、錯誤

參考答案:B

31.流形學習是一種非線性的維數約簡方法

A、正確

B、錯誤

參考答案:A

32.決策樹是基于樹結構來進行決策的,決策樹學習的目的是為了

40th

產生一棵泛化能力強的決策樹。

A、正確

B、錯誤

參考答案:A

33.決策樹的適用面較廣,對于分類應用和回歸應用,決策樹都可

以被用來構建模型。

A、正確

B、錯誤

參考答案:A

34.決策樹的生成是一個遞歸過程在決策樹基本算法中,有三種情

形會導致遞歸返回。

A、正確

B、錯誤

參考答案:A

35.剪枝是決策樹學習算法對付“過擬合”的主要手段,決策樹剪

枝的基本策略有“預剪枝”和“后剪枝”。

A、正確

B、錯誤

參考答案:A

36.集成學習可得到比單一學習器更好的泛化性能,尤其是弱學習

器,泛化性能略大于50%

A、正確

41st

B、錯誤

參考答案:A

37.集成學習方法只能用于分類任務

A、正確

B、錯誤

參考答案:B

38.機器學習方法傳統上可以分為2類?

A、正確

B、錯誤

參考答案:B

39.回歸問題和分類問題都有可能發生過擬合

A、正確

B、錯誤

參考答案:A

40.過擬合是有監督學習的挑戰,而不是無監督學習

A、正確

B、錯誤

參考答案:B

41.過擬合是有監督學習的挑戰,而不是無監督學習

A、正確

B、錯誤

參考答案:A

42nd

42.過擬合比欠擬合更容易克服。

A、正確

B、錯誤

參考答案:B

43.關于特征選擇的說法,選擇的特征越多越好?

A、正確

B、錯誤

參考答案:B

44.給定n個數據點,如果其中一半用于訓練,另一半用于測試,

則訓練誤差和測試誤差之間的差別會隨著n的增加而減小

A、正確

B、錯誤

參考答案:A

45.概率模型的訓練過程就是參數估計的過程

A、正確

B、錯誤

參考答案:A

46.分類預測型任務從已分類的數據中學習模型,并對新的未知分

類的數據使用該模型進行解釋,得到這些數據的分類。根據標簽

的不同,分別稱為分類任務和預測任務,如果類標簽是連續的類

別,稱為預測任務。

A、正確

43rd

B、錯誤

參考答案:A

47.分類是預測數據對象的離散類別,預測是用于數據對象的連續

取值

A、正確

B、錯誤

參考答案:A

48.反應事件或對象在某方面的表現或性質的事項稱為屬性

A、正確

B、錯誤

參考答案:A

49.簇內相似度高且簇間相似度低的聚類結果比較好

A、正確

B、錯誤

參考答案:A

50.貝葉斯網不是因果關系網絡圖

A、正確

B、錯誤

參考答案:B

51.貝葉斯分類器中只有一個判別函數

A、正確

B、錯誤

44th

參考答案:B

52.SVM中的泛化誤差代表SVM對新數據的預測準確度

A、正確

B、錯誤

參考答案:A

53.PCA是有監督學習,是有參數限制的

A、正確

B、錯誤

參考答案:B

54.PCA是一種有效的降維去噪方法

A、正確

B、錯誤

參考答案:A

55.L2正則化往往用于防止過擬合,而L1正則化往往用于特征選

擇。

A、正確

B、錯誤

參考答案:A

56.K均值算法的E值越小則簇內樣本相似度越低

A、正確

B、錯誤

參考答案:B

45th

57.KNN算法的基本思路是近朱者赤,近墨者黑

A、正確

B、錯誤

參考答案:A

58.ICNN沒有顯示的訓練過程,它在訓練階段只是把數據保存下

來,訓練時間開銷為0,等收到測試樣本后進行處理。

A、正確

B、錯誤

參考答案:A

59.BP算法陷入局部極小值的問題可通過更換激活函數解決。

A、正確

B、錯誤

參考答案:B

60.BP算法的正向傳播是為獲取訓練誤差。

A、正確

B、錯誤

參考答案:A

61.BP算法的反向傳播是為了對權值進行調整。

A、正確

B、錯誤

參考答案:A

62.BP算法“喜新厭舊”,在學習新樣本后,會把舊樣本逐漸遺忘。

46th

A、正確

B、錯誤

參考答案:A

63.Boosting的訓練過程是有序的。

A、正確

B、錯誤

參考答案:A

64.Bagging只適用于二分類任務

A、正確

B、錯誤

參考答案:B

65.Bagging是基于自助采樣法的

A、正確

B、錯誤

參考答案:A

66.Bagging是并行式集成學習方法最著名的代表

A、正確

B、錯誤

參考答案:A

67.Bagging被譽為“代表集成學習技術水平的方法”

A、正確

B、錯誤

47th

參考答案:B

68.AGNES算法分為單鏈接、全鏈接、均鏈接算法

A、正確

B、錯誤

參考答案:A

69.“硬間隔”是指SVM允許分類時出現一定范圍的誤差

A、正確

B、錯誤

參考答案:B

70.“獨依賴估計”是半樸素貝葉斯分類器最常用的一種策略

A、正確

B、錯誤

參考答案:A

填空題

1.主成分分析方法(PCA)的主要應用是對數據進行。

答:數據壓縮

2.支持向量機的形式是要求所有樣本均滿足約束,這稱為

答:硬間隔

3,支持向量機的復雜程度主要與有關

答:支持向量的數目

4.在最小化錯誤率方面()的性能是最優的

48th

答:貝葉斯分類器

5.在研究對比不同算法的泛化性能時,我們用()上的判別效果

來估計模型在實際使用時的泛化能力,而把訓練數據另外劃分為

訓練集和驗證集,基于驗證集上的性能來進行模型選擇和調參。

答:測試集

6.在學習任務中,“分類”預測的是,“回歸”預測的是。

答:離散值|連續值

7.在學習任務的真實邊界比較復雜時,用決策樹解決會相當復

雜,此時采用():可以實現斜劃分甚至更復雜的劃分形式。

答:多變量決策樹

8.在現實生活中樸素貝葉斯分類器有多種使用方式,若任務數據

更替頻繁,則可以采用()方式,先不進行任何訓練,待收到預

測請求后再根據當前數據進行概率估值

答:懶惰學習

9.在機器學習中,對高維數據進行降維的主要目的是希望找到一

個合適的(),在此空間中進行學習能比原始空間性能更好。

答:低維空間

10.在“單位階躍函數”(unit-stepfunction)的作用下,若輸入實

值ZV0,則應將其判定為()(正/反)例。

答:反

H.再縮放(rescaling)策略的出現,主要是為了解決()問題。

答:類別不平衡

49th

12.一組數據類別數為N,則若該數據使用LDA算法降維,降維

之后的維數最多為0維。

答:N-1

13.一般的多層感知器包含哪三種類型層次的神經元(按順序填

寫)。

答:輸入層|隱含層|輸出層

14.一般的,一棵決策樹包含一個(),若干個內部結點和若干個

()o

答:根結點I葉結點

15.要獲得好的集成,個體學習器要有一定的()性和()性

答:準確性|多樣性

16.樣本的特征數也稱為(),當維數非常大時,也就是通常所說

的()

答:維數|維數災難

17.訓練誤差較大,測試誤差較大,是指模型出現了()的情況

答:欠擬合

18.訓練集的誤差稱為,測試集誤差稱為,是除訓練集以外所有樣

木誤差。

答:訓練/經驗誤差|測試誤差|泛化誤差

19.訓練SVM的最小時間復雜度為O(n2),那么()數據集不適

合用SVM

答:大

50th

2().學得模型適用于新樣本的能力稱為能力。

答:泛化

21.信息增益以為基礎。

答:信息嫡

22.寫出一個你知道的線性降維方法:()

答:PCA主成分分析|LDA判別分析|MDS多尺度分析

23.線性模型(linearmodcl)試圖學得一個通過屬性的()_組合

來進行預測的函數。

答:線性

24.填空:線性降維方法假設從高維空間到低維空間的函數映射是

0的

答:線性

25.填空:馬氏距離表示數據的()距離

答:協方差

26.梯度下降法,在使用的時候無非是考慮到兩個方面:一是(),

二是。。

答:方向|步長

27.隨機梯度下降是每次迭代使用()樣本來對參數進行更新。

答:一個

28.隨機森林通過()提高性能

答:降低方差

29.隨機森林的基本思想包括()()

51st

答:bagging集成學習理論|boosting集成學習理論

30.數據降維方法一般分為哪些種類

答:線性方法|非線性方法

31.是說,若有多個假設與觀察一致,則選擇最簡單的那個

答:奧卡姆剃刀

32.神經網絡中最基本的成分是。模型

答:神經元

33.神經網絡模型按照學習方式可分為有導師型和()

答:無導師型

34.神經網絡模型按照網絡的結構可分為前饋型和()。

答:反饋型

35.三種常用的替代損失函數包括hinge損失,損失,損失

答:指數|對率

36.任何一個核函數都隱式地定義了一個稱為的特征空間

答:再生核希爾伯特空間

37.人工神經網絡按性能可分為離散型和()

答:連續型

38.批量梯度下降法是指在每一次迭代時使用()樣木來進行梯度

的更新。

答:所有

39.目前的集成學習大致分為兩類:個體學習器間存在強依賴關系,

必須串行生成的是(),個體學習器間不存在強依賴關系,可同時

52nd

生成的是()。

答:序列化方法I并行化方法

40.邏輯回歸是()學習

答:有監督

41.兩個異類支持向量到超平面的距離之和被稱為

答:間隔

42.連續屬性在定義域上有()可能的取值,離散屬性在定義域上

有0取值。

答:無窮多個|有浪個

43.可以防止出現過擬合對策:、。

答:數據擴增|正則化|采用驗證集

44.可看作學習算法在給定數據和參數空間上的實例化

答:學習器

45.決策樹學習的關鍵是如何選擇最優劃分屬性。一般而言,隨著

劃分過程不斷進行,我們希望決策樹的分支結點的()越來越高

答:純度

46.決策樹ID3算法中每次分支都按照信息增益最大進行的,分

支后相比分之前,數據集的信息嫡變化情況是()_

答:變小

47.聚類性能度量分為()和()兩類。

答:外部指標|內部指標

48.聚類將數據集中的樣本劃分為()的子集。

53rd

答:若干個不相交

49.糾錯輸出碼(ErrcrCorrectingOutputCodes,簡稱ECOC)工作過

程中主要分為兩步,一步(),一步解碼。

答:編碼

50.將原始空間中的向量作為輸入向量,弁返回特征空間(轉換后

的數據空間,可能是高維)中向量的點積的函數稱為

答:核函數

51.剪枝處理分為()和(),前者使得決策樹的很多分支都沒有

展開,降低過擬合的風險,但也容易帶來欠擬合的風險,后者使

得決策樹完全展開,泛化性能往往優于前者,但訓練和測試時間

長。

答:預剪枝|后剪枝

52.假設現在只有兩個類,這種情況下SVM需要訓練幾次?

答:1

53.集成學習中常用的結合策略有(),(),()

答:平均法|投票法|學習法

54.機器學習的方式可分為、和。

答:監督學習|半監督學習|無監督學習

55.回歸任務最常用的性能度量是()

答:均方誤差

56.給定一定數量的紅細胞、白細胞圖像以及它們對應的標簽,設

計出一個紅、白細胞分類器,這屬于學習。

54th

答:監督

57.個體決策樹的構建過程中Bagging使用的是()型決策樹,而

隨森林使用的是0型決策樹

答:確定|隨機

58.高斯混合聚類采用()來表達聚類原型。

答:概率模型

59.多數投票法分為()和()

答:絕對多數投票法|相對多數投票法

6().多分類任務進行拆分的最經典的差

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

最新文檔

評論

0/150

提交評論