版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領
文檔簡介
項目11、單選題(1)以下哪個是大數據的特點()。A.數據體量巨大B.數據類型單一C.價值密度高D.數據變化慢(2)無法在一定時間范圍內用常規軟件工具進行捕捉、管理和處理的數據集合稱為()。A.大數據B.數據庫C.數據倉庫D.非結構化數據(3)以下不屬于非結構化數據的是()A.數字B.語音C.圖像D.文本(4)以下屬于結構化數據的數據是()A.PDFB.OWLC.網頁D.數據庫(5)數據度量單位從小到大的正確順序是()。A.EB、GB、PB、TBB.GB、TB、PB、EBC.EB、TB、PB、GBD.TB、PB、GB、EB(6)()不是大數據價值的關鍵詞。A.額外收入B.減少支出C.降低風險D.體量大(7)大數據產業鏈不包括()。A.綜合應用B.基礎支撐C.數據服務D.數據可視化(8)感知式系統的廣泛使用,導致了大量數據產生,這一階段的數據產生方式屬于(A)式的。A.自動B.被動C.主動D.手動(9)大數據思維不包括()。A.整體思維B.相關思維C.容錯思維D.形象思維(10)我們只需要知道是什么,不需要知道為什么,這種思維屬于()。A.整體思維B.相關思維C.容錯思維D.形象思維2、填空題(1)()思維就是根據全部樣本中得到的結論。(2)大數據時代出現了與“目標驅動型決策”思維不同的另一種思維模式,即()驅動型決策。(3)在大數據時代,數據不僅是一種“資源”,而更是一種重要的()。(4)從企業角度看,價值來自三個方面:增加額外收入、減少支出和()。3、判斷題(1)有價值的數據一定會帶來收入。(2)如果一個客戶流失預警模型,準確度為75%,說明模型很差。(3)數據思維比科學思維形成得更早。(4)容錯思維讓我們可以利用95%的非結構化數據,幫助我們進一步接近事實的真相。(5)一個數據產品能否幫助客戶帶來收入是判斷數據價值的金標準。(6)判斷數據價值的標準之一,一個數據產品即使沒有現在的收入,那也得有未來可預期的收入。(7)收入的增加往往具有很強的不確定性,但是成本的控制相對而言卻可以做到非常準確。4、簡單題(1)什么是數據要素?答:“數據要素”就是決定數據是否有價值、如何定價、怎樣流通的一套規則體系。(2)大數據與小數據的本質區別是什么?小數據是抽樣、靜態、有目的采集的數據,存在信息不對稱;大數據是全樣本、動態、自動產生的數據,強調數據間的相關關系而非因果關系,數據成為重要資產。項目21、單選題(1)查看主機IP的Linux命令是()。A.pwdB.jpsC.ifconfigD.ls(2)解壓.tar.gz結尾的HBase壓縮包使用的Linux命令是()。A.tar-zxvfB.tar-zxfvC.tar-zfxvD.tar-xzvf(3)在Linux中,如果要查看當前目錄可以使用()命令。A.pwdB.ifconfigC.viD.jps(4)Linux下使用tar命令解壓*.gz文件,一般需要指定參數()。A.-xzvfB.-zxfvC.-zxvfD.-vzxf(5)用戶查看某一文件的權限為660,則該用戶對此文件有()權限。A.可讀、可寫、可執行B.可讀、不可寫、不可執行C.不可讀、可寫、可執行D.可讀、可寫、不可執行(6)()不是Windows環境下Linux仿真工具。A.CentOSB.VMwareWorkstationC.SecureCRTD.SecureFX(7)Linux操作系統的關機指令為()。A.rebootB.shutdownC.quitD.exit(8)在CentOS7中,可以使用()命令查看隱藏目錄或文件。A.ls-aB.ls-lC.ls-bD.ls-C(9)在CentOS7中,如果要查看本機的IP地址,可以使用()命令。A.ipcatB.ifconfigC.IPD.ping2、填空題(1)編輯文件hosts.txt的Linux命令為()。(2)在Linux下用vi編輯文件后保存退出的命令為()。(3)將文件hosts.txt改名為hosts.xml的Linux命令為()。(4)查看文件hosts.txt的Linux命令為()。(5)查看當前目錄的Linux命令為()。(6)查看進程的Linux命令為()。(7)復制文件hosts.txt到/usr的Linux命令為()。(8)顯示當前目錄下信息的Linux命令為()。(9)建立test目錄的Linux命令為()。(10)返回根目錄的Linux命令為()。3、判斷題1.CentOS是RHEL的社區免費克隆版。√原文:“CentOS(RHEL的社區復制版本,免費版本)”。2.FedoraCore的穩定性優于RHEL,因此更適合做服務器系統。×原文明確說“FedoraCore的穩定性較差,最好只用于桌面應用”,而RHEL/CentOS“穩定性非常好,適合服務器”。3.國產COSIX系統基于Linux內核開發。×原文說COSIX是“基于Unix的中文開放式操作系統”,并未采用Linux內核。4.微軟黑屏事件是指盜版Windows用戶桌面每小時被換成純黑背景。√原文描述“每一小時就會出現一次純黑背景”,俗稱“黑屏事件”。5.銀河麒麟在2006年發布的首個版本即采用Linux作為內核。×原文指出2006年銀河麒麟“整合了mach、FreeBSD、Linux、Windows四種系統優勢”,直到2009年的3.0版才“開始使用Linux作為內核”。6.統信UOS與Deepin的關系是:UOS面向商業,Deepin面向社區,二者同源。√原文:“武漢深之度繼續發行Deepin社區版本,面向社區用戶,而統信UOS則面向商業用戶,相當于Deepin的商業版”。4、簡答題1.簡述RedHat系列與Debian系列在包管理上的核心差異。答:RedHat用RPM包與YUM/DNF二進制安裝;Debian用DEB包與APT,可在線獲取源碼或二進制,依賴解析更精細,APT被YUM借鑒。2.CCDOS在國產系統史上的兩大貢獻是什么?答:首次讓PC顯示漢字并兼容MS-DOS;公開源碼,為后續UCDOS等中文系統提供模板,推動個人電腦在國內普及。3.統信UOS如何解決應用生態不足?答:自建商店上架800+原生應用,Wine兼容層運行Windows軟件,同時適配六大CPU架構,聯合廠商做遷移適配,縮短生態差距。項目31、單選題(1)()不是VMware的網絡連接模式。A.橋接模式B.NAT模式C.僅主機模式D.本機模式(2)虛擬機和真實物理機在同一網段,屬于()模式。A.橋接模式B.NAT模式C.僅主機模式D.對等模式(3)()不是網絡連接模式。A.橋接模式B.NAT模式C.僅主機模式D.對等模式(4)使用虛擬交換機的屬于()網絡連接模式。A.橋接模式B.NAT模式C.僅主機模式D.對等模式(5)橋接模式的網絡配置在()位置。A.VMNet1B.VMNet2C.VMNet4D.VMNet8(6)命令systemctldisablechronyd的作用是禁止啟用()。A.同步時鐘B.防火墻C.網絡D.路由(7)命令chkconfigntpdon的作用是啟用()。A.同步時鐘B.防火墻C.網絡D.路由(8)命令servicenetworkrestart的作用是啟用()。A.同步時鐘B.防火墻C.網絡D.路由(9)NTP服務是()。A.上網模式B.防火墻C.時鐘同步D.免密(10)頁面丟失狀態碼是()。A.301B.403C.404D.500(11)服務器錯誤狀態碼是()。A.301B.403C.404D.500(12)配置同步ntp-server時間的文件是()A.ntpB.ifcfg-eth0C.ntp-serverD.ntp.conf(13)配置網絡的文件是()。A.networkB.ifcfg-eth0C.hostsD.ntp.conf(14)密鑰存放位置()。A./usrB./root/.ssC./rootD./etc(15)生成的密鑰有()種。A.1B.2C.3D.4(16)通過SSH訪問客戶端,默認端口為()。A.10B.11C.20D.22(17)配置Hadoop時,JAVA_HOME包含在()配置文件中。A.mapred-site.xmlB.hadoop-env.shC.core-site.xmlD.hdfs-site.xml(18)一般情況下,啟動Hadoop組件的腳本存放在組件安裝路徑的()下。A.confB.binC.sbinD.sys(19)Hadoop是用()語言開發的。A.pythonB.javaC.CD.C#(20)分布式調度器組件名稱是()。A.YARNB.ZookeeperC.HBaseD.Hive(21)數據倉庫組件是()。A.YARNB.ZookeeperC.HBaseD.Hive(22)分布式的海量日志采集組件名稱是()。A.YARNB.ZookeeperC.HBaseD.Flume(23)非關系型的列式數據庫組件名稱是()。A.YARNB.ZookeeperC.HBaseD.Hive(24)以下關于HDFS特性敘述中錯誤的是()。A.兼容廉價的硬件設備B.關注橫向擴展。C.適應大文件訪問D.適應動態數據訪問。(25)以下關于HDFS特性敘述中錯誤的是()。A.兼容廉價的硬件設備B.關注縱向擴展。C.適應大文件訪問D.適應靜態數據訪問。2、填空題(1)CentOS7中,在root用戶下查看firewalld防火墻狀態,使用的命令是systemctl()。(2)時鐘同步組件相關組件()。(3)網絡配置文件所在的目錄是/etc/sysconfig/()。(4)在CentOS7中,root用戶下查看firewalld防火墻狀態,使用的命令是systemctl()firewalld。(5)HTTPS是由SSL+()構建的可進行加密傳輸、身份認證的網絡協議,比HTTP安全。(6)免密測試命令關鍵詞()。(7)在配置SSH密鑰時,在.ssh目錄下()文件為公鑰,id_dsa文件為私鑰。(1)搭建完Hadoop集群后,在()節點上進行格式化集群。提示:格式化集群:haddopnamenode-format(在主節點上進行)。(2)啟動Hadoop集群時,在Hadoop的安裝目錄下使用sbin/()啟動所有集群。(3)啟動Hadoop集群的命令在Hadoop的安裝目錄下的()目錄下。(4)搭建完Hadoop集群后,在主節點上使用命令haddopnamenode-()進行格式化集群。3、判斷題(1)橋接模式上網需要地址轉換器NAT。()(2)生產環境上網使用NAT模式。()(3)HTTPS需要到CA申請證書,一般免費證書很少,需要交費。()(4)生成私鑰需要發給自己。()(5)生成公鑰需要發給其他節點。()(6)SSH可在不安全的網絡中為網絡服務提供安全的傳輸環境。()4、簡答題(1)Google“三駕馬車”對應Hadoop生態的哪三大核心組件?答:GFS→HDFS負責分布式存儲;MapReduce→HadoopMapReduce負責分布式計算;BigTable→HBase提供列式非關系數據庫,三者構成Hadoop最初雛形。(2)Hadoop設計目標里為何強調“橫向擴展”而非“縱向擴展”?答:橫向擴展通過增加廉價商用節點即可線性提升存儲與計算能力,成本低且避免單點瓶頸;縱向擴展需高價小型機,容量與性能上限固定,不符合海量GB-TB級數據低成本處理需求。(3)集群與分布式計算在同一套Hadoop平臺如何互補?答:分布式把采集/存儲/計算模塊解耦到不同節點,提升開發效率;集群讓多節點承擔同一模塊,實現負載均衡與容錯。二者疊加既解耦又冗余,兼顧高吞吐與高可用。(4)批處理與流式計算在數據特征上有何根本差異?答:批處理面向“有界、持久、大量”靜態數據集,一次裝入后離線計算;流式計算面對“無界、實時”數據,每到來一條記錄即刻處理并持續輸出結果,強調低延遲。(5)Zookeeper的Observer角色相比Follower有何特殊之處?答:Observer同樣接收客戶端讀請求并轉發寫請求給Leader,但不參與投票,不決定事務提交與Leader選舉,僅用于水平擴展讀性能,避免增加投票節點影響寫吞吐量。項目41、單選題(1)下列關于Flume可靠性的描述,錯誤的是()。A.當節點出現故障時,日志能夠被傳送到其他節點上而不丟失B.收到數據的Agent,首先將Even寫到磁盤上,當數據傳送成功后,再刪除;如果數據發送失敗,可以重新發送C.當數據接收方崩潰時,將數據寫到本地,待恢復后,繼續發送D.數據發送到接收方后,還要進行確認,如果沒接收成功還會再次發送(2)下列關于Flume組件中Channel的描述,錯誤的是()。A.Channel是連接Suorce和Sink的組件,是位于Suorce和Sink之間的數據緩沖區B.Channel數據的寫入是靠Source來完成的,數據的讀取是靠Sink來完成的C.Channel是非線程安全的,同一時刻只能處理一個Source的寫入操作和Sink的讀取操作D.當Source接收到一個Event時,Source會把這個Event存儲在一個或多個Channel中(3)Hadoop生態中的Flume屬于()組件。A.分布式存儲B.數據倉庫C.內存計算D.數據采集(4)高可用的、高可靠的、分布式的海量日志采集、聚合和傳輸的系統模塊名稱是()。A.YARNB.ZookeeperC.HBaseD.Flume130大數據運維圖解教程(5)監控指定目錄內數據變化的Source類型是()。A.AvroB.ThiftC.SpoolingDerictoryD.exec(6)采集UNIX的command在標準輸出設備上的數據,使用的Source類型是()。A.AvroB.ThiftC.SpoolingDerictoryD.exec(7)數據采集工具不包括()。A.FlumeB.KafkaC.HBaseD.Sqoop2、填空題(1)Sink負責持久化日志或者把事件推向另一個()。(2)Flume可靠性保障最弱方案是()。3、判斷題(1)一個Agent就是一個JVM。()(2)為了保證輸送一定成功,在送到目的地之前,會先緩存數據到Channel,待數據真正到達目的地后,刪除自己緩存的數據。()(3)攔截器的位置在Channel和Sink之間。4、簡答題(1)如何區分維度與度量?答:可參與求和、平均等聚合的數值型字段為度量(如訂單金額);僅用于分組或篩選的字段為維度(如地區、年齡)。同一字段可按分析需求角色互換。(2)為何說“裸數據→專家數據”是采集環節最耗時步驟?答:裸數據常含缺失、異常、多源異構;需結合業務理解做清洗、補全、歸一,才能得到高質量專家數據,整個過程依賴人工規則與反復驗證。(3)Sqoop底層用MapReduce而非普通JDBC批量導數據的好處?答:MR天然并行切片,容錯高;可把大表按主鍵范圍拆到多節點并發導入/導出,充分利用集群帶寬,避免單機瓶頸,且失敗可自動重試。(4)Kafka相比Flume在日志場景的核心優勢?答:Kafka以分布式日志結構持久化多副本,支持海量Topic并行寫入與回溯消費;能解耦生產速率與消費速率,實現實時流式處理,而Flume側重單次采集轉發。項目51、單選題(1)HBase來源于哪篇博文()?ATheGoogleFileSystemBMapReduceCBigTableDChubby(2)下面()不是HBase的特性?A
高可靠性B
高性能C
面向列D預先定義模式(3)以下有關NoSQL敘述中,錯誤的是()。A.不需要事先定義數據模式,預定義表結構。B.數據中的每條記錄都可能有不同的屬性和格式。C.當插入數據時,并不需要預先定義它們的模式。D.所有數據存儲到網絡中服務器上。(4)以下()是鍵值對數據庫產品。A.RedisB.Neo4jC.HBaseD.MongoDb(5)以下()是列式數據庫產品。A.RedisB.Neo4jC.HBaseD.MongoDb(6)以下()是圖數據庫產品。A.RedisB.Neo4jC.HBaseD.MongoDb(7)以下()是文檔數據庫產品。A.RedisB.Neo4jC.HBaseD.MongoDb(8)為了在HBase中確定一個單元格,需要()參數。A.1B.2C.3D.4(9)下列不屬于HBase基本元素的一項是()。?A.表??B.記錄??C.行鍵??D.單元格(10)HDFS的是基于流數據模式訪問和處理超大文件的需求而開發的,具有高容錯、高可靠性、高可擴展性、高吞吐率等特征,適合的讀寫任務是()。A.一次寫入,少次讀寫B.多次寫入,少次讀寫C.一次寫入,多次讀寫D.多次寫入,多次讀寫(11)不參與投票的節點是()。A.ObserverB.LeaderC.FollowerD.Looking(12)HDFS由NameNode、DataNode、secondaryNameNode組成,其中,DataNode的個數為()。A.1B.2C.3D.不限(13)HDFS由NameNode、DataNode、secondaryNameNode組成,其中,NameNode的個數為()。A.1B.2C.3D.不限(14)HDFS由NameNode、DataNode、secondaryNameNode組成,其中secondaryNameNode是NameNode的()。A.同步備份B.備份C.熱備份D.冷備份(15)以下關于HDFS設計理念敘述中錯誤的是()。A.兼容廉價的硬件設備B.關注橫向擴展。C.適應大文件訪問D.適應動態數據訪問。(16)以下關于HDFS設計理念敘述中錯誤的是()。A.兼容廉價的硬件設備B.關注縱向擴展。C.適應大文件訪問D.適應靜態數據訪問。(17)以下關于NameNode節點敘述中錯誤的是()。A.存儲元數據:文件、塊與DataNode之間的映射;B.元數據保存在HDFS;C.NameNode由FsImage、EditLog兩個文件組成。FsImage保存文件、塊的目錄結構、EditLog保存對文件、塊的操作,如:創建、刪除等;D.在NameNode統一調度下進行數據塊的創建、刪除和復制等操作。(18)在HDFS中,元數據保存在();A.NameNodeB.DataNodeC.從節點D.slave(19)以下關于HDFS存放數據策略的敘述中錯誤的是()。A.第一個副本放置在一臺磁盤不太滿、CPU不太忙的節點上。B.第二個副本放置在與第一個副本不同的機架的節點上。C.第三個副本與第一個副本相同機架的其他節點上。D.更多副本隨機節點。2、填空題(3)Hadoop的核心模塊HDFS的中文含義是()。(4)在HDFS中,文件、塊與DataNode之間的映射稱為()。(5)NameNode由FsImage和()兩個文件組成。(6)SecondaryNameNode稱為從元數據節點,是名稱節點的()。(7)HDFS存放數據的基本單位是()。(8)一個數據塊通常要備份()份。(9)DataNode定時向()發送狀態信息(心跳,Heartbeats)。(10)NoSQL中的復制,往往是基于()的異步復制。(11)()谷歌BigTable的開源實現。(12)HBase中“四維坐標”,指[行鍵,列族,列限定符,()]。(13)HBase包含()個Master主服務器。(14)HBase包含()個Region服務器。(15)HBase存儲的最小單位是()。3、判斷題(1)Hadoop安裝完成后,需要在所有結點格式化集群命令:haddopnamenode–format。(3)HDFS支持數據的隨機讀寫。(4)寫文件時,數據經過NameNode傳遞給DataNode。(5)HDFS的NameNode保存了一個文件包括哪些數據塊,分布在哪些數據節點上,這些信息也存儲在硬盤上。
(6)HDFS操作的路徑可以是絕對路徑,也可以是相對路徑。(7)大數據時代下,數據管理需要NoSQL技術。()(8)管理的粒度比操作系統要細,基本操作是對文件名的增、刪、改、查。()(9)傳統關系型數據庫是基于行式存儲的。()(10)成功的NoSQL必然會取代傳統的SQL。()4、簡答題(1)HDFS把塊大小設為128MB的主要動機是什么?答:遠大于傳統文件系統,最小化尋址開銷,使傳輸時間遠大于定位時間,提高順序讀寫吞吐量,適合大文件順序批處理。(2)SecondaryNameNode的“冷備份”能否直接頂替故障NameNode?答:不能。它僅定期合并fsimage與edits減小日志體積,不接收實時寫;需人工把合并后的fsimage拷回NameNode才能恢復,無法秒級切換。(3)HBase的四維坐標指哪四個元素?答:[行鍵,列族,列限定符,時間戳],唯一定義一個單元格,支持多版本存儲與快速列式檢索。(4)NoSQL的“無共享架構”相比傳統集中式數據庫有何優勢?答:數據分散在本地節點,無需共享存儲,避免單點瓶頸;可在線彈性擴容縮容,故障影響范圍小,并行度高,適應海量高并發場景。(5)列式存儲為何比行式更適合OLAP分析?答:同一列數據連續存放,壓縮比高;僅讀取查詢涉及列,減少I/O;便于向量化計算與聚合,提高批量分析性能,而行存需整行讀取開銷大。項目61、單選題(1)下面關于MapReduce的描述,正確的是()。A.MapReduce程序必須包含Mapper和ReducerB.MapReduce程序的MapTask可以任意指定C.MapReduce程序的ReduceTask可以任意指定D.MapReduce程序的默認數據讀取組件是TextInputFormat(2)在MapReduce中,()組件是用戶不指定也不會有默認的。A.CombinerB.TextOutputFormatC.PartitionerD.InputFormat(3)下列關于MapReduce工作流程的描述,正確的是()。A.所有的數據交換都是通過MapReduce框架自身去實現的B.不同的Map任務之間會進行通信C.不同的Reduce任務之間可以發生信息交換D.用戶可以顯式地從一臺機器向另一臺機器發送消息(4)()不是MapReduce體系結構的主要部分。A.ClientB.JobTrackerC.TaskTracker以及TaskD.Job(5)下列關于MapReduce體系結構的描述,錯誤的是()。A.用戶可通過Client提供的一些接口查看作業運行狀態B.用戶編寫的MapReduce程序通過Client提交到JobTracker端C.JobTracker負責資源監控和作業調度D.JobTracker會跟蹤任務的執行進度、資源使用量等信息,并將這些信息告訴任務調度器(TaskScheduler)(6)下列關于MapReduce體系結構的描述,錯誤的是()。A.Task分為MapTask和ReduceTask兩種,分別由JobTracker和TaskTracker啟動B.slot分為Mapslot和Reduceslot兩種,分別供MapTask和ReduceTask使用C.TaskTracker使用slot等量劃分本節點上的資源量(CPU、內存等)D.TaskTracker會周期性接收JobTracker發送過來的命令并執行相應的操作(如啟動新任務、殺死任務等)(7)下列說法有誤的是()。A.MapReduce是Google三駕馬車之一B.MapReduce具有非共享式、容錯性好特點C.MapReduce適用批處理、實時處理D.MapReduce采用“分而治之”策略(8)一個作業的Map個數是由()確定的。A.屬性mapred.map.tasks的設定B.JobTracker計算得出C.Inputsplit分片個數D.partition提示:一般情況下,在輸入源是文件的時候,一個task的Map數量由splitSize來決定一個task的Reduce數量由partition來決定。(9)在MapReduce體系結構中,JobTracker的主要任務是()。A.負責資源監控和作業調度,監控所有TaskTracker與Job的健康狀況B.使用slot等量劃分本節點上的資源量(CPU、內存等)C.會周期性地通過“心跳”將本節點上資源的使用情況和任務的運行進度匯報給TaskTrackerD.會跟蹤任務的執行進度、資源使用量等信息,并將這些信息告訴TaskScheduler(10)MapReduce全過程會產生()組鍵-值對。A.1B.2C.3D.4(11)MapReduce的Map函數產生很多的()。A.keyB.valueC.<key,value>D.Hash(12)在MapReduce計算架構中,()組件運行在NameNode節點上,提供集群資源的分配和工作調度管理。A.ClientB.JobTrackerC.TaskTrackerD.Task(13)在MapReduce計算架構中,()組件運行在DataNode上,具體管理本節點計算任務的執行。A.ClientB.JobTrackerC.TaskTrackerD.Task(14)下列關于JobTracker敘述不正確的一項為()。A.MapReduce框架的使用者B.協調MapReduce作業C.分配任務D.監控任務(15)下列關于Map/Reduce計算流程敘述不正確的一項為()。A.Mapper讀取分派給它的輸出split,并生成相應的本地緩存B.Mapper執行計算處理任務,將中間結果輸出保存到本地緩存C.ApplicationMaster調度Reducer讀取Mapper的中間輸出文件,執行Reduce任務D.Reducer將最后結果寫入輸出文件,保存到HDFS(16)MapReduce流程有()個階段。A.3B.2C.4D.5(17)在MapReduce中,()階段,Mapper執行TaskMap,將輸出結果寫入中間文件。A.ShuffleB.MapC.ReduceD.Sort(18)MapReduce的Shuffle過程中,()操作是最后做的。A.溢寫B.分區C.排序D.合并提示:在MapReduce的Shuffle階段,溢寫階段分為兩類:①環形緩沖區的數據到達80%時,會溢寫到本地磁盤,當再次達到80%時,會再次溢寫到磁盤,直到最后一次,不管環形緩沖區還有多少數據,都會溢寫到磁盤。然后會對這多次溢寫到磁盤的多個小文件進行合并,從而減少Reduce階段的網絡傳輸。②如果沒有達到80%,Map階段就結束了,則直接把環形緩沖區的數據寫到磁盤上,供下一步合并使用。(19)MapReduce編程模型中,以下組件()是最后執行的。A.MapperB.PartitionerC.ReducerD.shufle2、填空題(1)一個輸入split就是一個由單個()來處理的輸入塊。(2)每一個Map只處理一個()。(3)每個Job申請資源以()為單位。(4)當某個Job要開始執行時,先向()申請slot。102大數據運維圖解教程。(5)Hadoop的資源單位為()。(6)Hadoop利用()來管理分配節點的資源。(7)Hadoop里有兩種slot,即mapslot和()。(8)每個tasktracker會包含()個slot。(9)Job的一個task均對應于tasktracker中的一個()。(10)每個任務向()申請資源。(11)MapReduce采用“()”的策略。(12)Map的輸入數據來自()。(13)Combiner沒有默認的實現,需要顯式地設置在()中才有作用。(14)分片大小范圍可以在()中設置。3、判斷題(1)split存儲的是數據本身。()(2)InputFormat負責創建InputSplit并將它們分割成記錄(鍵-值對)。()(3)輸入分片split其實是對數據的引用。()(4)Map任務之間會進行通信。()(5)Reduce任務之間會進行通信。()(6)MapTask與Mapslot一一對應。()(7)區分Mapslot和Reduceslot,容易導致某一種資源緊張,而另一個資源卻有空閑。()(8)Shuffle數據來自HDFS。()(9)Map的輸出數據就是Reduce的輸入數據。()(10)每個TaskTracker節點必須包含Map過程。()(11)每個TaskTracker節點必須包含Reduce過程。()(12)每個TaskTracker節點的Map過程數大于Reduce過程數。()(13)Combiner的輸出是Map的Merge操作過程。()(14)所有的Job都適用Combiner。()(15)一般來說,Combiner和Reducer進行同樣的操作。()(16)*MapReduce的inputsplit一定是一個block。()(17)Hadoop是Java開發的,所以MapReduce只支持Java語言編寫。()(18)每個Map槽就是一個線程。()(19)Mapreduce的inputsplit就是一個block。()4、簡答題(1)什么是數據治理答:數據治理是一項全面的數據資產管理行為。(2)數據治理的主要目的答:數據治理的核心目的是提升數據價值,支持決策,制定同時降低數據風險和成本。
項目71、單選題(1)觀察離散數據分布的常用方法是()。A.直方圖B.餅圖C.密度圖D.箱線圖(2)交叉分析是基于()橫向地組合交叉。A.同一維度B.不同維度C.同一方向D.以上都不是(3)()不是常用對比分析方法。A.定基比B.同比C.環比D.縱橫比(4)()是指對數據在不同維度進行交叉展現,進行多角度結合分析的方法,彌補了“各自為政”分析方法所帶來的偏差。A.相關分析B.交叉分析C.主成分分析D.因子分子(5)()不屬于監督學習的數據模型。A.分類B.回歸分析C.聚類D.KNN(6)()不屬于無監督學習的數據模型。A.關聯分析B.回歸分析C.聚類D.K-均值(7)Spark生態圈不包含()。A.SparkCoreB.HBaseC.MLLibD.GraphX(8)Spark生態圈的核心是()。A.SparkCoreB.SparkStreaminC.MLLibD.GraphX(9)Spark生態圈中的MLLib功能是()。A.批量計算B.圖計算C.流式計算D.機器學習(10)以下有關Hive敘述中,錯誤的是()。A.Hive是建立在Hadoop上的數據倉庫基礎構架。B.Hive提供了一系列的工具,可以用來進行數據進行ETL。C.Hive定義了簡單的類SQL查詢語言,稱為HQL。D.Hive不直接使用存儲在Hadoop文件系統中的數據。2、判斷題(1)細分的方法更多的是基于同一維度的縱深展開,也就是OLAP中的鉆取,比如從省份的數據細分查看省份中各城市的數據,是基于地域維的下鉆。()(2)交叉分析涉及多維度的組合,通常以圖表為主進行展現。()(3)一般來說,環比可以與環比相比較,也可以與同比相比較。()(4)對比分析最關鍵的是A/B兩組只保持單一變量,其他條件保持一致。()(5)同比就是今年第n月與第n-1月或第n+1月比。()(6)環比就是今年第n月與去年第n月比。()(7)交叉分析基于多維模型,數據的維度越豐富,所能實現的交叉也越豐富和靈活,通過各種交叉分析能夠更加有效地發現問題,因此,對基層模型也沒有要求。()(8)對比分析中,對比的參照物不同,得到的判斷結論也就不同。()(9)數據細分時,可以按維度細分,有多少維度,就可以有多少種細分的方向,細分一步即可。()(10)考查兩個變量是否具有線性相關關系的最直觀的方法是直接繪制散點圖。()(11)需要同時考查多個變量間的相關關系時,可利用散點圖矩陣同時繪制各變量間的散點圖。()(12)細分策略中,分渠道用來分析不同時間段數據是否有變化。()(13)交叉分析不再局限于一個維度,就像數據立方體與OLAP中的立方體,是基于不同維度的交叉,時間維、地域維和產品維交叉在一起分析每個小立方的數據表現,可以通過OLAP的切片(Slice)和切塊(Dice)操作查看。()(14)為了更加準確地描述變量之間的線性相關程度,可以通過計算相關系數來進行相關分析。()(15)交叉分析是基于不同維度橫向地組合交叉。()3、填空題(1)Spark使用()語言編程。(2)Spark把中間數據放到()中,迭代運算效率高。(3)Hive提供了類似于關系數據庫SQL語言的查詢語言()。(4)Hive大部分的查詢、計算由()完成。(5)Hive驅動模塊(Driver)含編譯器、()、執行器等。(6)Spark靈魂是()。(7)在Spark中,Stage劃分的標準是()依賴。(8)Spark操作構建了RDD之間的關系,整個計算過程形成了一個由RDD和關系構成的()。(9)RDD的操作分為Transformation操作和()操作。4、簡答題(1)大數據分析與狹義數據分析在策略上的三點轉變是什么?答:①用全體數據而非抽樣;②重效率而非絕對精度;③關注相關性而非因果性。(2)何為“業務理解”中因變量Y與自變量X?答:Y是待解決的業務結果(如流失與否),X是可能影響Y的特征集合(如性別、消費),清晰定義Y、X才算把業務問題轉譯為數據可分析問題。(3)描述性分析常用的五類統計描述是什么?答:頻數分布、集中趨勢(均值等)、離散程度(方差等)、分布形態(偏度峰度)、統計圖形,用于快速刻畫數據基本特征與異常。(4)RDD的三大特性是什么?答:一組分片、一個計算函數、依賴關系;分片決定并行度,函數描述計算邏輯,依賴形成lineage用于容錯與調度。(5)Hive將HQL轉為MapReduce作業時需經過哪三大模塊?答:用戶接口接收HQL→驅動模塊(編譯器、優化器、執行器)生成并優化MR計劃→元數據存儲提供表結構信息,最終提交集群運行。項目81、單選題1.情感分析在零售中的核心價值是_____________。A.降低物流成本B.發現客戶真實態度并指導戰略C.提高庫存周轉D.減少人力開支【答案】B2.農夫山泉要求業務員每日拍攝門店照片的主要目的是_____________。A.考核考勤B.監測陳列與銷量關系C.培訓攝影D.收集競品價格【答案】B3.交通信號配時中“綠波速度”主要解決_________。A.路口事故B.連續路口停車等待C.尾氣排放D.行人過街【答案】B4.高德地圖實時路況圖最關鍵的數據來源是_____________。A.交警攝像頭B.用戶回傳GPS軌跡C.氣象站D.公交IC卡【答案】B5.智能停車系統通過________技術感知車位狀態?A.RFIDB.地磁/超聲波傳感器C.紅外遙控D.衛星遙感【答案】B6.谷歌預測流感疫情的核心數據是_____________。A.醫院掛號量B.用戶搜索關鍵詞C.藥品銷量D.微博文本【答案】B7.12306提供密切接觸者信息主要依賴:A.實名制票務大數據B.手機信令C.車載GPSD.社區登記【答案】A8.基因測序實現精準治癌的前提是_____________。A.建立大規模基因-疾病數據庫B.提高測序儀轉速C.降低血液采樣量D.增加醫院數量【答案】A9.農業大數據中用于指導灌溉的核心傳感器數據是_____________。A.風速B.土壤濕度C.光照強度D.空氣溫度【答案】B10.智慧大棚中無土栽培營養液監測最重要的指標是_____________。A.酸堿度與電導率B.顏色C.氣味D.濁度【答案】A11.水產養殖IoT最優先采集的水質參數是_____________。A.溶解氧B.鹽度C.氨氮濃度D.水位【答案】A12.精準扶貧中,大數據畫像最核心的輸出是_____________。A.貧困戶致貧原因與幫扶措施建議B.貧困村GDPC.財政撥款總額D.農產品價格【答案】A13.稅收大數據發現主播薇婭偷逃稅的主要方法是_____________。A.票據OCRB.多源數據比對與模型預警C.問卷調查D.隨機抽查【答案】B14.安全生產大數據模型的首要作用是_____________。A.事故后追責B.事前隱患預警C.設備維修D.工資核算【答案】B15.公安大數據將治理流程由“事后”轉向________。A.事中應急B.事前預測C.隨機抽查D.人工審批【答案】B16.輿情監測中“用數據說話”最強調________。A.可視化呈現事件全貌B.刪除負面帖C.關閉評論D.增加水軍【答案】A2、填空題(1)公安大數據將公共安全決策由“事后”轉向________。【答案】事前預測(2)農夫山泉讓業務員每日拍照回傳,用________數據研究陳列對銷量的影響。【答案】圖片(3)交通“綠波速度”建議司機按________行駛,以減少紅燈停車。【答案】提示車速(4)高德實時路況按________原理聚合用戶軌跡計算路段速度。【答案】大數據(5)谷歌利用________記錄預測流感疫情爆發區域。【答案】搜索關鍵詞(6)12306憑________數據快速定位確診旅客同車廂密切接觸者。【案】實名票務(7)農業傳感器監測________值實現自動灌溉與施肥。【答案】土壤濕度(8)教育大數據把“集體教育”推向________學習新模式。【答案】個性化(9)稅收大數據通過________比對鎖定主播偷逃稅風險。【答案】多源數據3、判斷題(1)沃爾瑪購物籃分析發現嬰兒護膚禮品主要是“新手媽媽”購買。×理由:原文明確70%為“商務卡客戶”買來送人,而非媽媽自用。(2)情感分析可幫助零售商在戰略層面洞察客戶真實態度。√(3)“綠波速度”旨在減少路口停車次數,提高通行效率。√(4)高德實時路況圖主要依賴交警攝像頭而非用戶回傳數據。×理由:原文強調利用用戶回傳GPS軌跡大數據計算路段速度。(5)12306提供密切接觸者信息的核心依據是實名制票務數據。√(6)農業中土壤濕度傳感器數據是精準灌溉決策的關鍵。√(7)智慧大棚無土栽培營養液監測最重要的是顏
溫馨提示
- 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
- 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
- 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
- 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
- 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
- 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
- 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。
最新文檔
- 老年患者康復鍛煉管理制度
- Linux的操作系統教程
- C031帶電粒子在電場中的運動
- gcjj2第2章工程經濟要素與現金流量
- 公司技術員試用期轉正工作小結
- EBZ掘進機電氣系統
- E私募基金運作模式報告
- 幼兒園健康娃娃
- 2026年節氣主題案例分析題目及答案
- 2026年設備監理師質量法規試卷
- 初級消防員理論知識考試題及答案
- 礦用防爆鋰離子蓄電池無軌膠輪車安全技術要求培訓
- 2026年村級污水助理筆試高頻考點解析
- 物業行業安全生產月培訓課件
- 私募基金投資盡職調查模板
- 擴音機電路安裝與調試詳細教案
- 2026年4399u3d筆試題及答案
- 無人機群飛行規劃員職業技能鑒定考試復習題庫(附答案)
- 心梗三項課件
- 中國絹云母礦化妝品填料市場與替代材料對比研究
- 2023-2025全國高考英語試題匯編:完形填空
評論
0/150
提交評論