大數據與信息采集簡介_第1頁
大數據與信息采集簡介_第2頁
大數據與信息采集簡介_第3頁
大數據與信息采集簡介_第4頁
大數據與信息采集簡介_第5頁
已閱讀5頁,還剩58頁未讀 繼續免費閱讀

下載本文檔

版權說明:本文檔由用戶提供并上傳,收益歸屬內容提供方,若內容存在侵權,請進行舉報或認領

文檔簡介

大數據與信息采集簡介提綱大數據的由來及現狀大數據帶來的挑戰:信息采集更多挑戰:大數據的管理與分析大數據與云計算世界是數字的數據的前世今生4step3step2step1step紙質數據文件系統數據庫管理系統數據倉庫和數據挖掘大數據時代BigData什么是大數據1KB=1024字節存儲單位1MB=1024KB1GB=1024MB1TB=1024GB1PB=1024TB=1,048,576GB1EB=1024PB=1,073,741,824GB1ZB=1024EB=1,099,511,627,776GB100萬G10億G1萬億G22億臺215萬臺2100臺500G硬盤電腦15寸電腦排成行可以往返一次月球Intel:人類文明開始到2003年地球共產生了5EB數據.2012年全年,全球產生數據2.7ZB是2003年以前的500倍2015年,全球估計產生數據8ZB,等于1800萬個美國國會圖書館2000年數字信息占全球數據量的25%75%都在報紙膠片磁帶等媒介2013年數字信息98%非數字信息2%2012年全球每秒鐘發送2.9百萬封電子郵件,一分鐘讀一篇的話,足夠一個人晝夜不息的讀5.5年…每天會有

2.88萬個小時的視頻上傳到Youtube,足夠一個人晝夜不息的觀看3.3年…推特上每天發布5千萬條消息,假設10秒鐘瀏覽一條信息,這些消息足夠一個人晝夜不息的瀏覽16年…每天亞馬遜上將產生6.3百萬筆訂單…每個月網民在Facebook上要花費7千億分鐘,被移動互聯網使用者發送和接收的數據高達1.3EB…Google上每天需要處理24PB的數據…新的時代,人們從信息的被動接受者變成了主動創造者大數據時代到來BigData什么是大數據商業數據現狀Twitter2007年5000條微博更新/天2008年30萬條微博更新/天2009年250萬條微博更新/天2010年3500萬條微博更新/天2011年2億條微博更新/天2013年4億條微博更新/天2013年上傳時長12年的視頻/天2013年用戶分享25億條信息/天一個單數據表幾億-幾百億條記錄下線商品14億件,在線商品8億件淘寶數據庫存了20PB數據平均每月增加1.5PB智能移動終端設備的巨量增長數據規模指數增長數字大爆炸GBTBPBEBZB地球上至今總共的數據量:在2006年,個人用戶才剛剛邁進TB時代,全球一共新產生了約180EB的數據;在2011年,這個數字達到了1.8ZB。而有市場研究機構預測:到2020年,整個世界的數據總量將會增長44倍,達到35.2ZB(1ZB=10億TB)!1GB

=2^30字節1TB=2^40字節1PB

=2^50字節1EB

=2^60字節1ZB=2^70字節為什么?facebook社交網絡淘寶、ebuy電子商務微博、Apps移動互聯21世紀是數據信息大發展的時代,移動互聯、社交網絡、電子商務等極大拓展了互聯網的邊界和應用范圍,各種數據正在迅速膨脹并變大。互聯網(社交、搜索、電商)、移動互聯網(微博)、物聯網(傳感器,智慧地球)、車聯網、GPS、醫學影像、安全監控、金融(銀行、股市、保險)、電信(通話、短信)都在瘋狂產生著數據。信息技術的廣泛應用提高了數據的處理能力,更提高了數據的產生能力,道高一尺,魔高一丈。這些由我們創造的信息背后產生的這些數據早已經遠遠超越了目前人力所能處理的范疇大數據時代正在來臨..數據規模指數增長數字大爆炸數據庫數據倉庫面向應用面向主題當前數據歷史數據數據是可更新的數據不可更新避免數據冗余有意引入冗余支持事務處理支持決策分析數據操作頻繁操作相對不頻繁10數據分析:數據庫和數據倉庫11數據倉庫和數據挖掘數據庫數據倉庫不可知的價值提取數據數據挖掘

示例:“尿布與啤酒”的故事示例:你開心他就買你焦慮他就拋

華爾街“德溫特資本市場”公司首席執行官保羅·霍廷每天的工作之一,就是利用電腦程序分析全球3.4億微博賬戶的留言,進而判斷民眾情緒,再以“1”到“50”進行打分。根據打分結果,霍廷再決定如何處理手中數以百萬美元計的股票。

霍廷的判斷原則很簡單:如果所有人似乎都高興,那就買入;如果大家的焦慮情緒上升,那就拋售。

這一招收效顯著——當年第一季度,霍廷的公司獲得了7%的收益率12大數據分析大數據分析:吃貨集中營大數據分析:關聯分析大數據分析:可視化大數據分析:趨勢預測從谷歌流感趨勢看大數據的應用價值“谷歌流感趨勢”,通過跟蹤搜索詞相關數據來判斷全美地區的流感情況大數據應用場景美國零售商和懷孕預測VISA信用卡與商戶推薦股票投資智能電表廣告投放中國糧食統計人的數字化京東信用貸款和淘寶數據魔方UPS快遞的最佳行車路徑數據源:規模龐大,通常在PB級數據結構:非結構化,需要進行量化打分,轉換成結構化、數值型數據以便理解和分析分析邏輯:更簡單,性能是瓶頸性能:實時性要求更高大數據分析的特點什么是大數據?BigDataisacollectionofdatasetssolargeandcomplexthatitbecomesdifficulttoprocessusingon-handdatabasemanagementtools.大數據(bigdata,megadata),或稱巨量資料,指的是需要新處理模式才能具有更強的決策力、洞察發現力和流程優化能力的海量、高增長率和多樣化的信息資產。大數據的4V特征“大量化(Volume)、多樣化(Variety)、快速化(Velocity)、價值密度低(Value)”就是“大數據”的顯著特征,或者說,只有具備這些特點的數據,才是大數據。體量Volume多樣性Variety價值密度Value速度Velocity非結構化數據的超大規模和增長總數據量的80~90%比結構化數據增長快10倍到50倍是傳統數據倉庫的10倍到50倍大數據的異構和多樣性很多不同形式(文本、圖像、視頻、機器數據)無模式或者模式不明顯不連貫的語法或句義大量的不相關信息對未來趨勢與模式的可預測分析深度復雜分析(機器學習、人工智能Vs傳統商務智能(咨詢、報告等)實時分析而非批量式分析數據輸入、處理與丟棄立竿見影而非事后見效Volume數據量PB是大數據層次的臨界點.KB->MB->GB->TB->PB->EB->ZB->YB->NB->DB根據IDC作出的估測,數據一直都在以每年50%的速度增長,也就是說每兩年就增長一倍(大數據摩爾定律)人類在最近兩年產生的數據量相當于之前產生的全部數據量預計到2020年,全球將總共擁有35ZB的數據量,相較于2010年,數據量將增長近30倍Volume數據量Dalles數據中心位于俄勒岡州的哥倫比亞河旁,河上的Dalles大壩為數據中心提供電力。數據中心有2座4層樓高的冷卻塔。Google數據中心Google數據中心以集裝箱為單位,每個集裝箱有1160臺服務器,每個數據中心有眾多集裝箱。23Google一次搜索查詢的能耗能點亮100瓦的燈泡11秒鐘。Microsoft數據中心微軟在美國芝加哥的數據中心.總面積為70萬平方英尺。即使只啟用半數服務器,能耗也達到30兆瓦。24Variety多樣性企業內部的經營交易信息;物聯網世界中商品,物流信息;互聯網世界中人與人交互信息,位置信息等是大數據的主要來源.

結構化數據、半結構化數據和非結構化數據如今的數據類型早已不是單一的文本形式,訂單、日志、音頻,能力提出了更高的要求結構化數據半結構化數據非結構化數據指關系型數據表指關系結構與內容混合在一起的數據類型,xml…文檔、視頻、音頻、圖片20%結構化80%非結構化企業數據2012年互聯網產生的數據25%結構化75%非結構化50%-70%源于人與人的互動Value價值挖掘大數據的價值類似沙里淘金,從海量數據中挖掘稀疏但珍貴的信息.價值密度低,是大數據的一個典型特征.Value價值未來大數據的產業規模將會至少以萬億美元來進行衡量美國醫療保健每年產值達3000億美金每年生產率增長約0.7%制造業最多可節省50%的產品研發、組裝成本最多可節約7%的營運資金美國零售業凈利率增長可能高達60%+每年生產率增長0.5-1.0%歐洲公共部門管理每年2500億歐元每年生產率增長約0.7%全球個人定位數據1000億+的服務供應商收入為終端用戶帶來高達7000億美的價值Velocity速度1s是臨界點.對于大數據應用而言,必須要在1秒鐘內形成答案,否則處理結果就是過時和無效的.大數據的驚人不止是在數量上,同時數據還是巨量具有動態分析價值的數據。訪問響應時間的加快,數據庫讀寫速度的加快,對電商企業來說就等于多成交。對于很多情況下,動態的數據價值遠大于靜態數據,比如氣象預測,災難預測,快消行業等。實時處理的要求,是區別大數據應用和傳統數據倉庫技術,BI技術的關鍵差別之一.6000萬用戶登錄/天20億次頁面訪問/天每天1.2億次網站訪問響應時間小于100毫秒Velocity速度數據的采集速度的加快導致處理時間都需要有相應的提高在線數據分析(OnlineDataAnalytics)決策的延誤

商機的消失實例網上營銷(E-Promotions):基于用戶當前的位置和過往的交易數據預測用戶的喜好在合適的時間和地點發送用戶感興趣的產品和店鋪健康監控(Healthcaremonitoring):利用穿戴式的傳感器監控用戶的生理和活動數據及時提供需要的醫療服務大數據提綱大數據的由來及現狀大數據帶來的挑戰:信息采集更多挑戰:大數據的管理與分析大數據與云計算大數據從哪里來?海量交易數據:企業內部的經營交易信息主要包括聯機交易數據和聯機分析數據,是結構化的、通過關系數據庫進行管理和訪問的靜態、歷史數據。通過這些數據,我們能了解過去發生了什么。大數據從哪里來?海量交互數據:源于Facebook、Twitter、微信,微博及其他來源的社交媒體數據構成。它包括了呼叫詳細記錄CDR、傳送的海量多媒體文件、Web文本和點擊流數據、科學信息、電子郵件等等。可以告訴我們未來會發生什么。馬云成功預測2008年經濟危機“2008年初,阿里巴巴平臺上整個買家詢盤數急劇下滑,歐美對中國采購在下滑。海關是賣了貨,出去以后再獲得數據;我們提前半年時間從詢盤上推斷出世界貿易發生變化了。”通常而言,買家在采購商品前,會比較多家供應商的產品,反映到阿里巴巴網站統計數據中,就是查詢點擊的數量和購買點擊的數量會保持一個相對的數值,綜合各個維度的數據可建立用戶行為模型。因為數據樣本巨大,保證用戶行為模型的準確性。因此在這個案例中,詢盤數據的下降,自然導致買盤的下降。大數據從哪里來?海量傳感器數據:源于各類傳感器,如攝像頭,可穿戴設備,智能家電,工業設備等。它包括了多種環境信息,人體運動記錄,操作記錄等等。這一部分數據規模將更加龐大。中國英特爾物聯技術研究院數據量的顛覆性變化每1天產生5EB數據每2天產生5EB數據1萬年產生5EB數據2015每人每天產生1.1TB時間2015數據量感知數據

=

社交媒體數據的10-20倍社交媒體數據大數據從哪里來?海量傳感器數據:大數據從哪里來?運營式系統階段用戶原創內容階段2感知式系統階段3?數據庫的出現使得數據管理的復雜度大大降低

,數據往往伴隨著一定的運營活動而產生并記錄在數據庫中的

,數據的產生方式是被動的?數據爆發產生于Web

2.0

時代,而Web

2.0

的最重要標志就是用戶原創內容?智能手機等移動設備加速內容產生?數據產生方式是主動的?感知式系統的廣泛使用?人類社會數據量第三次大的飛躍最終導致了大數據的產生信息采集的類型交易數據數據抽取與集成工具,ETL主動抽取,源與目的都非常明確交互數據網絡爬蟲,數據收集程序主動爬取,源與目的不太明確傳感器數據傳感器傳送被動傳送TimeVolume結構化數據非結構化數據可被處理的非結構化數據休眠數據大數據采集帶來的挑戰

網絡爬蟲數據的分布性:文檔散落在數以百萬計的不同服務器上,沒有預先定義的拓撲結構相連。不穩定的數據高比例:許多文檔迅速地添加或刪除(e.g.deadlinks).大規模:網絡數據量的指數增長,由此引發了一系列難以處理的規模問題。無結構和冗余信息:每個HTML頁面沒有統一的結構,許多網絡數據是重復的,將近30%的重復網頁.數據的質量:許多內容沒有經過編輯處理,數據可能是錯誤的,無效的。錯誤來源有錄入錯誤,語法錯誤,OCR錯誤等。異構數據:多媒體數據(images,video,VRML),語言,字符集等.提綱大數據的由來及現狀大數據帶來的挑戰:信息采集更多挑戰:大數據的管理與分析大數據與云計算現行計算技術面臨的挑戰(1)在大數據面前,人力/人腦幾乎無能為力,迫切需要有效、高效的方法、技術和工具,現有的計算技術需要革新、甚至革命性的發展!傳統以計算為中心的數據管理和處理模式的局限,無法應對“4V問題”數據僅是計算設備的輸入/輸出,靠提速擴容適應數據增長而大數據難以I/O,其爆炸式增長非單純提速擴容可對付

數據價值有效

利用率不足5%價值未充分利用?

①平均日產數據20TB②平均年增

數據超50%數據負擔沉重數據處理?數據管理?數據分析?傳統DB技術在應對大數據上的不足⑴DBMS網絡存儲:將存儲設備通過標準的網絡拓撲結構連接到一群計算機上,包括直連存儲、網絡附加存儲、存儲區域網絡等。如:OracleRAC、MySQLSharding集群、DB2Purescale⑵分布式數據庫代理:通過中間代理層來統一管理所有的數據源,后端數據庫集群對前端應用程序透明。如:MySQLProxy、Amoeba⑶數據倉庫:面向主題的、集成的、相對穩定的、反映歷史變化的數據集合,用于支持管理決策。如:Teradata、Greenplum、OracleExadata共享磁盤或共享內存的體系架構,使得依賴于scaleup方式的有限的可擴展性…..……缺乏對半結構化數據和非結構化數據的支持…………在處理大規模數據和執行復雜的統計模型計算上的限制…………現行計算技術面臨的挑戰(2)例:從“scale-up”到“scale-out”傳統縱向擴展的處理模式“scale-up”:依賴于專用站點的CPU/memory/storage/network更新(傳統并行模型),新型橫向擴展的處理模式“scale-out”:依賴于增加分布式低成本計算與存儲節點現有商業并行數據庫產品很少可管理100+節點;但是Yahoo!的Hadoop集群系統有4000+節點;Facebook也達到2750+節點怎樣有效、高效地管理、處理、應用大數據,對計算技術帶來了一系列挑戰數據管理面臨的挑戰來自兩個方面不斷涌現的大數據云計算平臺的特點⑴數據的規模龐大,需要海量的存儲空間和強大的計算能力⑵數據源豐富,數據類型多樣⑶用戶群體大,需要高并發、低延遲、高吞吐量的訪問⑷無法預計的存儲需求,可動態伸縮(5)多租戶共享的,第三方托管(6)大規模數據的密集型計算,執行更加復雜的分析挖掘任務⑴無共享的分布式系統架構、橫向擴展⑵數據被分片分散存放,自適應的數據劃分方式和動態遷移⑶為高可用和容錯,同一數據分片保存了多個副本⑷廉價的商品化硬件,故障常態化⑸各種資源通過網絡以服務形式提交,按需分配Pay-as-you-go⑹MapReduce、BSP、Dryad等并行計算范式

數據挖掘面臨的挑戰數據源規模龐大、多數據源……分布式存儲、數據多樣性……某電信運營商數據挖掘實例挖掘算法需高度匯總和集成數據……算法復雜度高、精確度低……數據倉庫規模1PB構建客戶流失預警模型:10小時建模,只能投入幾十萬行數據做訓練準確度只有60%-70%節點數的增加不一定能提高數據挖掘的效率算法的簡單并行化不能有效處理海量數據!提綱大數據的由來及現狀大數據帶來的挑戰:信息采集更多挑戰:大數據的管理與分析大數據與云計算你身邊的“云”?群雄逐鹿:國外有微軟SkyDrive、蘋果iCloud,亞馬遜CloudDriver等網盤產品,國內有百度云、新浪微盤、華為網盤、金山快盤、115網盤和360云盤等?不以空間大小論英雄:以100K/s的均速上傳,1T空間也需124天方可填滿,合計2976小時。而如若想占滿36T,估摸得熬上12年以上光景你身邊的“云”有道云筆記/video.html?auto=12011年6月28日網易旗下的有道推出的云筆記軟件,支持多種附件格式,擁有2G容量的初始免費存儲空間,能夠實時增量式同步,并采用“三備份存儲”技術,同時上線的還有網頁剪報功能。云電視、百度地圖、百度音樂、云殺毒、云端備份。。。。。還有木有?什么是云計算?云計算(cloudcomputing)是基于互聯網的相關服務的增加、使用和交付模式,通常涉及通過互聯網來提供動態易擴展且經常是虛擬化的資源。云是網絡、互聯網的一種比喻說法。過去在圖中往往用云來表示電信網,后來也用來表示互聯網和底層基礎設施的抽象。因此,云計算甚至可以讓你體驗每秒10萬億次的運算能力,擁有這么強大的計算能力可以模擬核爆炸、預測氣候變化和市場發展趨勢。用戶通過電腦、筆記本、手機等方式接入數據中心,按自己的需求進行運算。對云計算的定義有多種說法。對于到底什么是云計算,至少可以找到100種解釋。現階段廣為接受的是美國國家標準與技術研究院(NIST)定義:云計算是一種按使用量付費的模式,這種模式提供可用的、便捷的、按需的網絡訪問,進入可配置的計算資源共享池(資源包括網絡,服務器,存儲,應用軟件,服務),這些資源能夠被快速提供,只需投入很少的管理工作,或與服務供應商進行很少的交互。什么是云計算?云計算概念?通過整合、管理、調配分布在網絡各處的計算資源,通過互聯網以統一界面、同時向大量的用戶提供服務云計算特點超大規模計算、虛擬化、高可靠性和安全性、通用性、動態擴展性、按需服務、降低成本云計算應用場景Google個人云服務企業應用實例:阿里Amazon云計算示意圖云計算特點高可靠性前所未有的計算能力數據多副本,計算節點同構可互換等措施動態伸縮,滿足規模增長需要超大規模高可擴展性極其廉價任意獲取相應服務虛擬化通用性千變萬化,不針對特定應用按需服務龐大的資源池,按需購買CloudFeatures云計算特點數據在云端:不怕丟失,不必備份,可以任意點的恢復;軟件在云端:不必下載自動升級;無所不在的計算:在任何時間,任意地點,任何設備登錄后就可以進行計算服務;無限強大的計算:具有無限空間的,無限速度PCC/S云計算以硬件為中心以軟件為中心以服務為中心云計算的好處買設備開發系統互聯網/局域網支付設備和勞動力費用用戶單一買外部服務可擴展,有彈性,動態,多用戶所用即所付通過Internet使用IFaPs(IP,HTML,HTTP)傳統IT模式云計算實現模式人機界面商業模式技術模式云計算的好處云計算與傳統IT模式相比,具有相當明顯的優勢:

任何一臺可以上網的通訊設備包括手機、PDA、上網本均可

降低成本

全球購置計算機中,只有30%的計算能力被利用,甚至更低提高資源利用率

云端由成千上萬臺甚至更多服務器組成的集群為存儲和管理數據提供了幾乎無限大的空間和資源

用戶可以根據自己的需要或喜好定制相應的服務、應用及資源靈活定制動態遷移保證應用和計算的正常進行;在云計算服務器端提供了最可靠、最安全的數據存儲中心彈性計算和存儲能力高可靠性和安全性云計算的分類按服務類型分類云計算的分類按服務類型分類基礎設施云(InfrastructureCloud,IaaS)為用戶提供底層的、接近于直接操作硬件資源的服務接口。平臺云(PlatformCloud,PaaS)為用戶提供一個托管平臺,用戶可以將他們所開發和運營的應用托管到云平臺中。應用云(ApplicationCloud,SaaS)為用戶提供可以直接為其所用的應用,這些應用一般是基于瀏覽器的,針對某一特定功能。基礎設施即服務IaaS——InfrastructureasaSe

溫馨提示

  • 1. 本站所有資源如無特殊說明,都需要本地電腦安裝OFFICE2007和PDF閱讀器。圖紙軟件為CAD,CAXA,PROE,UG,SolidWorks等.壓縮文件請下載最新的WinRAR軟件解壓。
  • 2. 本站的文檔不包含任何第三方提供的附件圖紙等,如果需要附件,請聯系上傳者。文件的所有權益歸上傳用戶所有。
  • 3. 本站RAR壓縮包中若帶圖紙,網頁內容里面會有圖紙預覽,若沒有圖紙預覽就沒有圖紙。
  • 4. 未經權益所有人同意不得將文件中的內容挪作商業或盈利用途。
  • 5. 人人文庫網僅提供信息存儲空間,僅對用戶上傳內容的表現方式做保護處理,對用戶上傳分享的文檔內容本身不做任何修改或編輯,并不能對任何下載內容負責。
  • 6. 下載文件中如有侵權或不適當內容,請與我們聯系,我們立即糾正。
  • 7. 本站不保證下載資源的準確性、安全性和完整性, 同時也不承擔用戶因使用這些下載資源對自己和他人造成任何形式的傷害或損失。

評論

0/150

提交評論