2026年廣西壯族自治區(qū)公務員考試大數(shù)據(jù)訓練題及答案_第1頁
2026年廣西壯族自治區(qū)公務員考試大數(shù)據(jù)訓練題及答案_第2頁
2026年廣西壯族自治區(qū)公務員考試大數(shù)據(jù)訓練題及答案_第3頁
2026年廣西壯族自治區(qū)公務員考試大數(shù)據(jù)訓練題及答案_第4頁
2026年廣西壯族自治區(qū)公務員考試大數(shù)據(jù)訓練題及答案_第5頁
已閱讀5頁,還剩40頁未讀 繼續(xù)免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

2026年廣西壯族自治區(qū)公務員考試(大數(shù)據(jù))訓練題及答案一、單項選擇題(共30題,每題1.5分,共45分)1.在大數(shù)據(jù)的“4V”特征中,指的是數(shù)據(jù)產生和處理速度快,要求實時或近實時處理的特點是()。A.Volume(大量)B.Variety(多樣)C.Velocity(高速)D.Value(價值)2.Hadoop分布式文件系統(tǒng)(HDFS)默認的底層存儲塊大小為()。A.32MBB.64MBC.128MBD.256MB3.在MapReduce計算模型中,負責將Map任務的輸出進行排序、分組并傳輸給Reduce任務的過程稱為()。A.SplitB.ShuffleC.PartitionD.Combine4.下列關于關系型數(shù)據(jù)庫與非關系型數(shù)據(jù)庫(NoSQL)的描述中,錯誤的是()。A.關系型數(shù)據(jù)庫遵循ACID原則,強一致性B.NoSQL數(shù)據(jù)庫通常支持CAP定理中的AP或CP,犧牲強一致性以換取高可用性或分區(qū)容錯性C.Redis屬于鍵值(Key-Value)存儲類型的NoSQL數(shù)據(jù)庫D.MongoDB適合存儲結構化數(shù)據(jù),支持復雜的SQL查詢5.在數(shù)據(jù)清洗過程中,對于缺失值的處理,下列哪種方法在數(shù)據(jù)量較大且缺失比例較低時最不推薦,因為它容易引入偏差?()A.刪除包含缺失值的記錄B.使用均值/中位數(shù)填充C.使用回歸模型預測填充D.不做處理,直接保留6.Python的Pandas庫中,用于讀取CSV文件并返回DataFrame對象的函數(shù)是()。A.pandas.read_table()B.pandas.read_csv()C.pandas.read_excel()D.pandas.load()7.ApacheSpark與HadoopMapReduce相比,主要優(yōu)勢在于()。A.磁盤I/O利用率更高B.支持更復雜的SQL查詢C.基于內存計算,迭代計算效率更高D.不需要分布式存儲系統(tǒng)支持8.2021年9月1日起施行的《中華人民共和國數(shù)據(jù)安全法》規(guī)定,國家建立數(shù)據(jù)分類分級保護制度,對數(shù)據(jù)實行()。A.自主保護B.集中保護C.分類分級保護D.強制加密保護9.在廣西壯族自治區(qū)的數(shù)字政府建設中,旨在打破信息孤島,實現(xiàn)跨部門、跨層級、跨地區(qū)數(shù)據(jù)共享和業(yè)務協(xié)同的平臺被稱為()。A.壯美廣西·云B.廣西數(shù)字政務一體化平臺C.廣西公共數(shù)據(jù)開放平臺D.中國—東盟信息港大數(shù)據(jù)中心10.下列哪種數(shù)據(jù)可視化圖表最適合用于展示兩個連續(xù)變量之間的相關性?()A.柱狀圖B.餅圖C.散點圖D.箱線圖11.在機器學習中,監(jiān)督學習與無監(jiān)督學習的主要區(qū)別在于()。A.監(jiān)督學習需要人工標注,無監(jiān)督學習不需要B.監(jiān)督學習處理數(shù)值型數(shù)據(jù),無監(jiān)督學習處理分類型數(shù)據(jù)C.監(jiān)督學習用于分類,無監(jiān)督學習用于聚類D.監(jiān)督學習速度快,無監(jiān)督學習速度慢12.下列關于HadoopYARN的描述,正確的是()。A.YARN是資源調度和管理系統(tǒng),負責集群資源的分配和任務調度B.YARN是一個分布式文件系統(tǒng)C.YARN僅能運行MapReduce任務D.YARN是Hadoop的數(shù)據(jù)倉庫工具13.在Hive數(shù)據(jù)倉庫工具中,用于創(chuàng)建外部表的關鍵字是()。A.INTERNALB.EXTERNALC.MANAGEDD.VIEW14.某市交通管理部門收集了全市出租車一個月的GPS軌跡數(shù)據(jù),數(shù)據(jù)量達到TB級。若要分析某區(qū)域在不同時間段的車流密度變化趨勢,最適合的大數(shù)據(jù)處理模式是()。A.流處理B.批處理C.交互式查詢D.事務處理15.信息熵是度量信息不確定性的指標,假設一個離散隨機變量X有n個可能的取值,其概率分布為p(),則信息熵A.HB.HC.HD.H16.在數(shù)據(jù)庫設計中,E-R圖(實體-聯(lián)系圖)用于描述現(xiàn)實世界的概念模型,其中菱形框通常代表()。A.實體B.屬性C.聯(lián)系D.主鍵17.下列哪項技術主要用于處理網(wǎng)頁爬蟲中的動態(tài)加載內容?()A.BeautifulSoupB.SeleniumC.urllibD.re(正則表達式)18.在數(shù)據(jù)挖掘的關聯(lián)規(guī)則挖掘中,著名的“啤酒與尿布”案例主要體現(xiàn)的關聯(lián)規(guī)則評估指標是()。A.支持度B.置信度C.提升度D.相關性19.廣西作為中國—東盟信息港的核心承載區(qū),正在積極推動跨境數(shù)據(jù)流動。跨境數(shù)據(jù)流動安全評估的首要原則是()。A.自由流動B.安全可控C.商業(yè)優(yōu)先D.技術中立20.在K-Means聚類算法中,確定簇數(shù)K的常用評估指標是()。A.準確率B.召回率C.輪廓系數(shù)D.均方誤差21.下列關于數(shù)據(jù)倉庫特征的描述,不正確的是()。A.面向主題的B.集成的C.相對穩(wěn)定的D.實時的22.Flume是Hadoop生態(tài)系統(tǒng)中用于日志收集、聚合和傳輸?shù)南到y(tǒng),它主要由()組成。A.Source,Channel,SinkB.Input,Process,OutputC.Producer,Broker,ConsumerD.Mapper,Reducer,Driver23.在Python科學計算庫NumPy中,用于創(chuàng)建一個元素全為0的數(shù)組的函數(shù)是()。A.np.ones()B.np.zeros()C.np.empty()D.np.full()24.所謂的“數(shù)據(jù)孤島”現(xiàn)象,主要指的是()。A.數(shù)據(jù)存儲在孤立的物理服務器上B.數(shù)據(jù)格式單一,無法多樣化展示C.不同系統(tǒng)、部門之間的數(shù)據(jù)不兼容、不共享,難以互通互聯(lián)D.數(shù)據(jù)量太小,無法形成價值25.在Spark中,RDD(ResilientDistributedDataset)的特性不包括()。A.彈性B.分布式C.只讀D.可變26.根據(jù)《廣西壯族自治區(qū)大數(shù)據(jù)發(fā)展條例》,公共數(shù)據(jù)按照()屬性分類,分為無條件開放、有條件開放和不予開放。A.共享B.開放C.安全D.隱私27.以下哪個過程屬于數(shù)據(jù)分析中的ETL環(huán)節(jié)?()A.Extract(抽?。?、Transform(轉換)、Load(加載)B.Enter,Test,LeaveC.Electronic,Text,LevelD.Event,Trigger,Log28.在時間序列分析中,ARIMA模型中的“I”代表()。A.自回歸B.移動平均C.單整D.季節(jié)性29.下列關于云計算服務模式的描述,PaaS(平臺即服務)主要提供()。A.虛擬機、存儲空間等硬件資源B.操作系統(tǒng)、數(shù)據(jù)庫中間件、開發(fā)環(huán)境等平臺資源C.完整的軟件應用,用戶直接使用D.網(wǎng)絡基礎設施30.某電商平臺利用用戶的歷史瀏覽、購買、收藏等數(shù)據(jù),通過算法向用戶推薦可能感興趣的商品。這種推薦系統(tǒng)最常使用的算法技術是()。A.深度學習中的卷積神經(jīng)網(wǎng)絡(CNN)B.協(xié)同過濾C.決策樹分類D.異常檢測算法二、多項選擇題(共15題,每題2.5分,共37.5分。多選、少選、錯選均不得分)31.下列屬于大數(shù)據(jù)典型應用場景的有()。A.智慧交通信號燈配時優(yōu)化B.個性化商品推薦C.金融風險控制與反欺詐D.疾病傳播趨勢預測E.簡單的個人記賬計算32.Hadoop生態(tài)系統(tǒng)包含的核心組件有()。A.HDFS(分布式文件系統(tǒng))B.MapReduce(分布式計算框架)C.YARN(資源管理器)D.HBase(分布式列式數(shù)據(jù)庫)E.Linux操作系統(tǒng)33.數(shù)據(jù)質量的高低通常從以下幾個維度進行評價()。A.完整性B.準確性C.一致性D.及時性E.唯一性34.Python進行數(shù)據(jù)分析時,常用的第三方庫包括()。A.NumPy(數(shù)值計算)B.Pandas(數(shù)據(jù)處理與分析)C.Matplotlib(數(shù)據(jù)可視化)D.Scikit-learn(機器學習)E.Django(Web框架,雖然常用但不屬于核心數(shù)據(jù)分析庫,視具體語境可選,但通常數(shù)據(jù)分析特指前四項。此處應選前四項作為核心分析庫)35.下列關于NoSQL數(shù)據(jù)庫的分類,正確的有()。A.Redis屬于鍵值存儲數(shù)據(jù)庫B.MongoDB屬于文檔型數(shù)據(jù)庫C.HBase屬于列族存儲數(shù)據(jù)庫D.Neo4j屬于圖形數(shù)據(jù)庫E.MySQL屬于NoSQL數(shù)據(jù)庫36.在進行數(shù)據(jù)可視化時,應遵循的原則包括()。A.真實準確,不歪曲數(shù)據(jù)B.簡潔明了,避免“圖表垃圾”C.突出重點,引導讀者關注核心信息D.使用盡可能多的顏色和動畫效果以吸引眼球E.選擇適合數(shù)據(jù)類型和分析目的的圖表類型37.機器學習中的過擬合現(xiàn)象,可能由以下哪些原因導致?()A.訓練數(shù)據(jù)量過少B.模型過于復雜(如決策樹深度過深)C.訓練數(shù)據(jù)噪聲過大D.模型過于簡單E.訓練時間過長38.《中華人民共和國個人信息保護法》規(guī)定,處理個人信息應當遵循的原則包括()。A.合法、正當、必要、誠信原則B.最小必要原則C.公開透明原則D.確保信息安全原則E.任意使用原則39.SparkSQL支持多種數(shù)據(jù)源,包括()。A.JSONB.ParquetC.JDBCD.HiveE.CSV40.下列關于數(shù)據(jù)標準化(歸一化)的描述,正確的有()。A.Min-Max標準化將數(shù)據(jù)映射到[0,1]區(qū)間B.Z-Score標準化處理后數(shù)據(jù)的均值為0,標準差為1C.數(shù)據(jù)標準化可以消除不同特征量綱的影響D.數(shù)據(jù)標準化對于基于距離的算法(如KNN)非常重要E.所有機器學習算法都必須進行數(shù)據(jù)標準化41.在數(shù)字政府建設中,電子政務網(wǎng)通常分為()。A.互聯(lián)網(wǎng)B.電子政務外網(wǎng)C.電子政務內網(wǎng)D.專用局域網(wǎng)E.物聯(lián)網(wǎng)42.下列屬于數(shù)據(jù)挖掘主要任務的有()。A.分類與預測B.聚類分析C.關聯(lián)規(guī)則挖掘D.異常檢測E.數(shù)據(jù)清洗43.在HDFS中,關于副本機制的描述,正確的有()。A.默認副本數(shù)為3B.副本存放策略遵循機架感知原則C.副本是為了提高數(shù)據(jù)的可靠性和讀取速度D.客戶端可以自行設定文件的副本數(shù)E.副本機制會顯著增加存儲成本,因此生產環(huán)境常設為144.Python中用于進行Web數(shù)據(jù)抓取的庫包括()。A.RequestsB.ScrapyC.BeautifulSoupD.LxmlE.PyTorch45.廣西推動數(shù)字經(jīng)濟發(fā)展的重點方向包括()。A.數(shù)字產業(yè)化B.產業(yè)數(shù)字化C.數(shù)字化治理D.數(shù)據(jù)價值化E.傳統(tǒng)農業(yè)化三、判斷題(共15題,每題1分,共15分。對的選“A”,錯的選“B”)46.結構化數(shù)據(jù)是指存儲在數(shù)據(jù)庫表中,行和列具有嚴格定義的數(shù)據(jù),而非結構化數(shù)據(jù)則包括文本、圖像、音頻、視頻等格式不規(guī)則的數(shù)據(jù)。()47.MapReduce框架中,Reduce任務的個數(shù)通常由輸入數(shù)據(jù)的大小決定,用戶無法顯式設置。()48.Python是一門解釋型語言,因此其運行速度通常比C++或Java等編譯型語言慢。()49.在關系型數(shù)據(jù)庫中,外鍵用于建立和加強兩個表數(shù)據(jù)之間的鏈接,它可以取空值。()50.隨著數(shù)據(jù)量的增加,大數(shù)據(jù)分析的準確性一定會越來越高。()51.SparkStreaming是基于微批處理的流計算框架,而Flink支持基于事件的真正流處理。()52.數(shù)據(jù)隱私保護和數(shù)據(jù)開發(fā)利用是完全對立的,無法共存。()53.決策樹算法既可以用于分類問題,也可以用于回歸問題。()54.HiveQL語法與標準SQL非常相似,但底層的執(zhí)行引擎依然是MapReduce、Tez或Spark。()55.K近鄰算法(KNN)是一種懶惰學習算法,它沒有顯式的訓練過程,而是直到收到測試樣本時才進行處理。()56.在廣西壯族自治區(qū),公共數(shù)據(jù)開放應當遵循“統(tǒng)籌規(guī)劃、依法有序、便民高效、安全可控”的原則。()57.數(shù)據(jù)倉庫是面向事務處理的,主要滿足企業(yè)的日常業(yè)務操作需求。()58.正則表達式是一種用于處理字符串的強大工具,可以用于匹配、查找、替換符合特定模式的文本。()59.深度學習是機器學習的一個子集,而機器學習是人工智能的一個子集。()60.使用`pandas.DataFrame.dropna()`方法刪除缺失值時,默認會刪除包含任何缺失值的行。()四、填空題(共10題,每題1.5分,共15分)61.在TCP/IP網(wǎng)絡協(xié)議中,HTTP協(xié)議默認使用的端口號是\_\_\_\_\_\_\_\_,而HTTPS協(xié)議默認使用的端口號是\_\_\_\_\_\_\_\_。62.在Linux系統(tǒng)中,用于查看當前目錄下文件列表的命令是\_\_\_\_\_\_\_\_,用于查看文件內容的命令是\_\_\_\_\_\_\_\_。63.在Pandas中,`df.groupby('column_name').agg({'math':'mean','english':'sum'})`這行代碼的作用是按\_\_\_\_\_\_\_\_列進行分組,并對數(shù)學列求\_\_\_\_\_\_\_\_,對英語列求和。64.關系型數(shù)據(jù)庫的完整性約束主要包括:實體完整性、參照完整性和\_\_\_\_\_\_\_\_。65.在Python中,\_\_\_\_\_\_\_\_數(shù)據(jù)類型是可變的,而\_\_\_\_\_\_\_\_數(shù)據(jù)類型是不可變的。66.一個二分類模型的混淆矩陣中,真正例(TP)=50,假正例(FP)=10,假反例(FN)=5,真反例(TN)=35。則該模型的準確率=\_\_\_\_\_\_\_\_%,精確率=\_\_\_\_\_\_\_\_%(保留一位小數(shù))。67.HDFS的讀寫流程中,客戶端讀取數(shù)據(jù)時,首先會從\_\_\_\_\_\_\_\_獲取數(shù)據(jù)塊的位置信息,然后直接與\_\_\_\_\_\_\_\_進行交互讀取數(shù)據(jù)。68.在推薦系統(tǒng)中,基于用戶的協(xié)同過濾算法的核心思想是:找到與目標用戶興趣相似的\_\_\_\_\_\_\_\_,然后將他們喜歡的且目標用戶未看過的物品推薦給目標用戶。69.數(shù)據(jù)挖掘中,Apriori算法的核心思想是通過\_\_\_\_\_\_\_\_迭代來找出頻繁項集,利用頻繁項集的性質來剪枝,減少搜索空間。70.2026年是“十四五”規(guī)劃實施的收官之年,廣西正大力推動建設中國—東盟信息港,打造面向東盟的\_\_\_\_\_\_\_\_中心。五、簡答題(共4題,每題7.5分,共30分)71.簡述CAP定理的內容,并說明在分布式系統(tǒng)中為什么通常無法同時滿足這三個屬性。72.請列舉數(shù)據(jù)預處理中常見的三個步驟,并簡要說明每個步驟的作用。73.簡述HadoopMapReduce的工作原理,包括Map階段和Reduce階段的主要任務。74.結合廣西壯族自治區(qū)的實際情況,談談大數(shù)據(jù)技術在鄉(xiāng)村振興戰(zhàn)略中可以發(fā)揮哪些作用?(至少列舉三點)六、綜合應用題(共3題,共52.5分)75.(16.5分)某電商平臺有如下兩張表:表1:用戶表user_iduser_namecity001ZhangSanNanning002LiSiGuilin003WangWuNanning表2:訂單表order_iduser_idamountorder_dateA10010012002026-01-01A10020011502026-01-05A10030023002026-01-02A1004004502026-01-03(1)請寫出SQL語句,查詢來自“Nanning”的所有用戶的姓名和用戶ID。(5分)(2)請寫出SQL語句,查詢每個用戶的總消費金額(amount),輸出列包括user_id和total_amount,并按total_amount降序排列。(5.5分)(3)若使用Pandas進行數(shù)據(jù)處理,寫出Python代碼實現(xiàn)左連接(LeftJoin)查詢,將表1和表2通過user_id關聯(lián),并打印合并后的結果(假設df1為用戶表DataFrame,df2為訂單表DataFrame)。(6分)76.(18分)已知有一個列表`data=[12,15,13,12,19,20,25,26,24,18,15,12,10,9,8]`。請使用Python(不使用統(tǒng)計庫,如statistics或numpy,請手動編寫邏輯)完成以下任務:(1)編寫一個函數(shù)`calculate_mean(data)`,計算該列表的算術平均值,并返回結果。(4分)(2)編寫一個函數(shù)`calculate_median(data)`,計算該列表的中位數(shù)。注意:需先對列表進行排序,然后根據(jù)元素個數(shù)的奇偶性判斷中位數(shù)。(6分)(3)編寫代碼統(tǒng)計列表中每個元素出現(xiàn)的頻率,并輸出出現(xiàn)次數(shù)最多的元素及其出現(xiàn)次數(shù)(即眾數(shù))。(8分)77.(17.5分)案例分析與論述:背景:近年來,廣西大力發(fā)展數(shù)字經(jīng)濟,建設了多個大數(shù)據(jù)中心。某市衛(wèi)生健康委員會計劃實施“智慧醫(yī)療”大數(shù)據(jù)項目,旨在整合全市各級醫(yī)院的電子病歷數(shù)據(jù)、醫(yī)保結算數(shù)據(jù)以及居民的健康檔案數(shù)據(jù),實現(xiàn)跨醫(yī)院的信息共享和互認,輔助醫(yī)生臨床決策,并進行流行病趨勢分析。然而,在項目推進過程中遇到了以下問題:1.各醫(yī)院使用的信息系統(tǒng)廠商不同,數(shù)據(jù)標準(如疾病編碼、藥品目錄)不統(tǒng)一。2.醫(yī)療數(shù)據(jù)包含大量患者隱私(姓名、身份證號、住址、病史),數(shù)據(jù)安全風險高。3.部分老舊醫(yī)院的數(shù)據(jù)存儲在本地甚至紙質檔案中,數(shù)字化程度低,數(shù)據(jù)清洗難度大。根據(jù)以上案例,請回答以下問題:(1)針對“數(shù)據(jù)標準不統(tǒng)一”的問題,作為大數(shù)據(jù)項目管理人員,你會提出哪些解決方案?(6分)(2)在涉及患者隱私數(shù)據(jù)時,應采取哪些技術和管理措施來保障數(shù)據(jù)安全?(6分)(3)結合大數(shù)據(jù)生命周期,簡述從數(shù)據(jù)采集到數(shù)據(jù)價值展現(xiàn)的大致流程。(5.5分)參考答案及詳細解析一、單項選擇題1.C解析:Volume指數(shù)據(jù)量大;Variety指數(shù)據(jù)類型繁多;Velocity指處理速度快;Value指價值密度低但整體價值高。題目描述為速度,選C。2.C解析:HDFS設計用于存儲大文件,默認塊大小在Hadoop2.x/3.x中通常為128MB(Hadoop1.x為64MB)。較大的塊大小可以減少尋址時間,提高傳輸效率。3.B解析:Shuffle階段是MapReduce的核心過程,負責將Map輸出的結果按照Key進行分發(fā)、排序并傳輸給對應的Reduce任務。4.D解析:MongoDB是文檔型數(shù)據(jù)庫,屬于NoSQL,不支持標準SQL(雖然有類似的查詢語言),它適合存儲半結構化或非結構化數(shù)據(jù),而非結構化數(shù)據(jù)。D選項錯誤。5.A解析:刪除記錄會丟失其他有效信息。當數(shù)據(jù)量大且缺失比例低時,直接刪除雖然簡單,但如果數(shù)據(jù)不是完全隨機缺失(MCAR),容易引入偏差。但在數(shù)據(jù)量極大時,刪除少量記錄通常也是可行的。相比之下,不做處理直接保留在大多數(shù)分析算法中是不可行的。題目問“最不推薦”且“容易引入偏差”,通常在數(shù)據(jù)分析中,如果缺失是非隨機的,刪除確實會導致樣本代表性偏差。但在“數(shù)據(jù)量較大且缺失比例較低”的具體場景下,不做處理往往導致后續(xù)代碼報錯或結果錯誤。不過,從統(tǒng)計學角度,若要嚴格避免偏差,填充通常優(yōu)于刪除(除非缺失完全隨機且樣本足夠)。但在實際操作中,A選項(直接刪除)是丟失信息最多的方式。注:此題意在考察對缺失值處理后果的理解,A常被視為“偷懶”且可能損失信息的方式。6.B解析:`pandas.read_csv()`是讀取CSV文件的標準函數(shù)。7.C解析:Spark的主要優(yōu)勢在于基于內存的計算,特別是在迭代算法(如機器學習)中,減少了磁盤I/O,速度遠超基于磁盤的MapReduce。8.C解析:《數(shù)據(jù)安全法》第二十一條規(guī)定,國家建立數(shù)據(jù)分類分級保護制度,對數(shù)據(jù)實行分類分級保護。9.B解析:廣西數(shù)字政務一體化平臺是廣西統(tǒng)一的政務服務平臺,用于跨部門數(shù)據(jù)共享和業(yè)務協(xié)同。10.C解析:散點圖是展示兩個連續(xù)變量之間相關關系的最佳圖表。柱狀圖用于比較分類數(shù)據(jù),餅圖用于展示占比,箱線圖用于展示數(shù)據(jù)分布。11.A解析:監(jiān)督學習的訓練數(shù)據(jù)有標簽,無監(jiān)督學習的訓練數(shù)據(jù)無標簽。12.A解析:YARN(YetAnotherResourceNegotiator)是Hadoop的資源管理器,負責集群資源的分配和任務調度。13.B解析:在Hive中,`EXTERNAL`關鍵字用于創(chuàng)建外部表。刪除外部表時,只刪除元數(shù)據(jù),不刪除實際數(shù)據(jù)。14.B解析:分析“一個月”的歷史數(shù)據(jù),屬于離線分析,適合使用批處理模式。15.A解析:信息熵公式為H(16.C解析:E-R圖中,矩形代表實體,橢圓代表屬性,菱形代表聯(lián)系。17.B解析:Selenium是一個自動化測試工具,常用于模擬瀏覽器操作,非常適合爬取動態(tài)加載的網(wǎng)頁內容。BeautifulSoup用于解析靜態(tài)HTML。18.C解析:提升度反映了商品A出現(xiàn)對商品B出現(xiàn)概率的影響程度。如果提升度>1,說明正相關;<1說明負相關;=1說明不相關。這是關聯(lián)規(guī)則中最能體現(xiàn)規(guī)則有效性的指標之一。19.B解析:跨境數(shù)據(jù)流動必須在安全可控的前提下進行,保障國家安全和個人隱私是首要原則。20.C解析:輪廓系數(shù)用于評估聚類效果的好壞,結合了內聚度和分離度。準確率和召回率用于分類問題。21.D解析:數(shù)據(jù)倉庫是面向主題的、集成的、相對穩(wěn)定的(非易失的)、反映歷史變化的數(shù)據(jù)集合,它主要用于分析和決策支持,而不是實時的業(yè)務處理(OLTP)。22.A解析:Flume架構由Source(源)、Channel(通道)、Sink(目的地)三部分組成。23.B解析:`np.zeros()`創(chuàng)建全0數(shù)組,`np.ones()`創(chuàng)建全1數(shù)組。24.C解析:數(shù)據(jù)孤島指不同系統(tǒng)間數(shù)據(jù)不兼容、不共享。25.D解析:RDD是只讀的、分區(qū)的記錄集合。一旦創(chuàng)建就不能修改(只能通過轉換生成新的RDD),所以它是不可變的。26.B解析:根據(jù)《廣西壯族自治區(qū)大數(shù)據(jù)發(fā)展條例》,公共數(shù)據(jù)按開放屬性分為無條件開放、有條件開放和不予開放。27.A解析:ETL分別代表Extract(抽?。?、Transform(轉換)、Load(加載)。28.C解析:ARIMA模型中,AR代表自回歸,I代表單整(差分次數(shù)),MA代表移動平均。29.B解析:PaaS提供平臺環(huán)境,如OS、中間件、運行環(huán)境。IaaS提供硬件資源,SaaS提供軟件服務。30.B解析:協(xié)同過濾是推薦系統(tǒng)中最經(jīng)典和常用的算法,分為基于用戶和基于物品的協(xié)同過濾。二、多項選擇題31.ABCD解析:簡單個人記賬不涉及大數(shù)據(jù)技術,E排除。32.ABCD解析:HDFS,MapReduce,YARN是Hadoop2.x/3.x的三大核心,HBase是Hadoop生態(tài)中的重要NoSQL數(shù)據(jù)庫。Linux是操作系統(tǒng),不屬于Hadoop組件。33.ABCD解析:數(shù)據(jù)質量維度通常包括完整性、準確性、一致性、及時性、唯一性等。題目列出五個,A,B,C,D,E均為常見維度。若必須四選,通??疾烨八膫€核心維度,但E也是維度之一。此處全選最嚴謹,但在考試中若限選4個,E常被歸入一致性或唯一性中。本題不限制數(shù)量,全選。34.ABCD解析:NumPy,Pandas,Matplotlib,Scikit-learn是Python數(shù)據(jù)分析四大金剛。Django是Web框架。35.ABCD解析:MySQL是關系型數(shù)據(jù)庫,不是NoSQL。36.ABCE解析:應避免不必要的顏色和動畫(“圖表垃圾”),D錯誤。37.ABC解析:模型過于簡單(欠擬合)不會導致過擬合;訓練時間過長不是直接原因,除非是在未正則化的情況下過度迭代。正確原因是A,B,C。38.ABCD解析:《個保法》第五條至第九條包含了合法正當必要、最小必要、公開透明、確保安全等原則。E錯誤。39.ABCDE解析:SparkSQL支持JSON,Parquet,JDBC,Hive,CSV,ORC等多種數(shù)據(jù)源。40.ABCD解析:并非所有算法都需要標準化,例如基于樹的算法對特征量綱不敏感。41.BC解析:電子政務網(wǎng)分為內網(wǎng)和外網(wǎng)?;ヂ?lián)網(wǎng)是公共網(wǎng)絡。42.ABCD解析:數(shù)據(jù)清洗是預處理,不屬于數(shù)據(jù)挖掘的核心任務(盡管是必須步驟)。挖掘任務包括分類、聚類、關聯(lián)、異常檢測等。43.ABCD解析:生產環(huán)境副本數(shù)通常為3,E說設為1是錯誤的。44.ABCD解析:PyTorch是深度學習框架,不專門用于Web抓取。45.ABCD解析:數(shù)字經(jīng)濟發(fā)展包括數(shù)字產業(yè)化、產業(yè)數(shù)字化、數(shù)字化治理、數(shù)據(jù)價值化。三、判斷題46.A解析:定義正確。47.B解析:Reduce任務的個數(shù)可以由用戶顯式設置(`job.setNumReduceTasks()`)。48.A解析:解釋型語言通常比編譯型語言慢。49.A解析:外鍵可以取空值,除非有NOTNULL約束。50.B解析:大數(shù)據(jù)分析不一定準確,如果數(shù)據(jù)本身有偏差(垃圾進垃圾出),分析結果依然不準確。51.A解析:SparkStreaming是微批處理,F(xiàn)link支持真正的流處理。52.B解析:可以通過脫敏、加密、聯(lián)邦學習等技術手段在保護隱私的同時開發(fā)利用數(shù)據(jù)。53.A解析:CART決策樹既可以分類也可以回歸。54.A解析:Hive將SQL轉換為MR/Tez/Spark任務執(zhí)行。55.A解析:KNN是懶惰學習。56.A解析:符合《廣西壯族自治區(qū)大數(shù)據(jù)發(fā)展條例》精神。57.B解析:數(shù)據(jù)倉庫面向分析(OLAP),數(shù)據(jù)庫面向事務(OLTP)。58.A解析:正則表達式的作用描述正確。59.A解析:AI>ML>DL。60.A解析:`dropna()`默認`how='any'`,即只要有缺失值就刪除該行。四、填空題61.80;44362.ls;cat63.column_name;平均值(或mean)64.用戶自定義完整性65.列表(List)/字典(Dict);元組(Tuple)/字符串注:填對一個可變和一個不可變即可。66.85.0;83.3計算:準確率=(TP+TN)/(TP+FP+FN+TN)=(50+35)/(50+10+5+35)=85/100=85.0%精確率=TP/(TP+FP)=50/(50+10)=50/60≈0.8333...=83.3%67.NameNode;DataNode68.用戶(Neighbors)69.逐層70.數(shù)字經(jīng)濟(或算力/數(shù)據(jù)要素)五、簡答題71.答案要點:CAP定理指出,在一個分布式系統(tǒng)中,Consistency(一致性)、Availability(可用性)、PartitionTolerance(分區(qū)容錯性)這三個要素最多只能同時實現(xiàn)兩點,不可能三者兼顧。一致性:所有節(jié)點在同一時間看到的數(shù)據(jù)是一致的??捎眯裕好看握埱蠖寄塬@取到非錯的響應(不保證獲取的是最新數(shù)據(jù))。分區(qū)容錯性:系統(tǒng)在遇到任意消息丟失或分區(qū)故障時,仍然能夠運行。原因:在分布式系統(tǒng)中,網(wǎng)絡是不可靠的,P(分區(qū)容錯)是必須具備的現(xiàn)實屬性。當發(fā)生網(wǎng)絡分區(qū)時,系統(tǒng)為了保證C(一致性),必須拒絕部分節(jié)點的請求,這就犧牲了A(可用性);若為了保證A,允許節(jié)點返回舊數(shù)據(jù),就犧牲了C。因此無法同時滿足三者。72.答案要點:(1)數(shù)據(jù)清洗:處理缺失值、異常值、重復值,糾正錯誤數(shù)據(jù),保證數(shù)據(jù)的準確性。(2)數(shù)據(jù)集成:將多個數(shù)據(jù)源(如不同數(shù)據(jù)庫、文件)的數(shù)據(jù)合并到一起,解決數(shù)據(jù)冗余和一致性問題。(3)數(shù)據(jù)變換:對數(shù)據(jù)進行規(guī)范化(如歸一化、標準化)、離散化,或通過構造新特征(特征工程)使數(shù)據(jù)更適合挖掘算法。73.答案要點:(1)Map階段:InputSplit:將輸入的大文件切分成splits。Map:用戶自定義的Map函數(shù)處理每個鍵值對,輸出中間鍵值對。(2)Shuffle階段:系統(tǒng)自動對Map輸出的中間結果進行分區(qū)、排序、分組,并發(fā)送到對應的Reducer。(3)Reduce階段:Reduce:用戶自定義的Reduce函數(shù)對一組具有相同Key的Value集合進行處理(如求和、計數(shù)),輸出最終結果。74.答案要點(結合廣西背景):(1)精準農業(yè)與產業(yè)幫扶:利用大數(shù)據(jù)分析土壤、氣候、作物生長數(shù)據(jù),指導農戶科學種植,提高農產品產量和質量;通過電商平臺數(shù)據(jù)分析,精準對接市場,助力“桂品出鄉(xiāng)”。(2)鄉(xiāng)村治理數(shù)字化:建設“數(shù)字鄉(xiāng)村”平臺,整合黨建、村務、治安數(shù)據(jù),提升基層治理效率;利用大數(shù)據(jù)監(jiān)控防止返貧,對低收入群體進行精準識別和幫扶。(3)農村公共服務優(yōu)化:通過大數(shù)據(jù)整合教育、醫(yī)療資源,實現(xiàn)遠程醫(yī)療、在線教育在偏遠山區(qū)的覆蓋,縮小城鄉(xiāng)公共服務差距。六、綜合應用題75.答案:(1)```sqlSELECTuser_name,user_idFROM用戶表WHEREcity='Nanning';```(2)```sqlSELECTuser_id,SUM(amount)astotal_amountFROM訂單表GROUPBYuser_idORDERBYtotal_amountDESC;```(3)```pythonimportpandasaspd#假設df1和df2已經(jīng)存在result=pd

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯(lián)系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網(wǎng)頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經(jīng)權益所有人同意不得將文件中的內容挪作商業(yè)或盈利用途。
  • 5. 人人文庫網(wǎng)僅提供信息存儲空間,僅對用戶上傳內容的表現(xiàn)方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯(lián)系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論