發(fā)布時間:2022-02-07 15:35:05來源:魔方格
簡單而言大數(shù)據(jù)是數(shù)據(jù)多到爆表。即是一種規(guī)模大到在獲取,存儲,管理,分析方面大大超出了傳統(tǒng)數(shù)據(jù)庫軟件工具能力范圍的數(shù)據(jù)集合。那么,大數(shù)據(jù)的定義及其特點是什么?
大數(shù)據(jù)的定義是什么?
對于“大數(shù)據(jù)”研究機構(gòu)Gartner給出了這樣的定義。“大數(shù)據(jù)”是需要新處理模式才能具有更強的決策力、洞察發(fā)現(xiàn)力和流程優(yōu)化能力來適應(yīng)海量、高增長率和多樣化的信息資產(chǎn)。
隨著云時代的來臨,大數(shù)據(jù)也吸引了越來越多的關(guān)注。分析師團(tuán)隊認(rèn)為,大數(shù)據(jù)通常用來形容一個公司創(chuàng)造的大量非結(jié)構(gòu)化數(shù)據(jù)和半結(jié)構(gòu)化數(shù)據(jù),這些數(shù)據(jù)在下載到關(guān)系型數(shù)據(jù)庫用于分析時會花費過多時間和金錢。大數(shù)據(jù)分析常和云計算聯(lián)系到一起,因為實時的大型數(shù)據(jù)集分析需要像MapReduce一樣的框架來向數(shù)十、數(shù)百或甚至數(shù)千的電腦分配工作。
大數(shù)據(jù)需要特殊的技術(shù),以有效地處理大量的容忍經(jīng)過時間內(nèi)的數(shù)據(jù)。適用于大數(shù)據(jù)的技術(shù),包括大規(guī)模并行處理數(shù)據(jù)庫、數(shù)據(jù)挖掘、分布式文件系統(tǒng)、分布式數(shù)據(jù)庫、云計算平臺、互聯(lián)網(wǎng)和可擴(kuò)展的存儲系統(tǒng)。
大數(shù)據(jù)的特點是什么?
容量(Volume):數(shù)據(jù)的大小決定所考慮的數(shù)據(jù)的價值和潛在的信息。
種類(Variety):數(shù)據(jù)類型的多樣性。
速度(Velocity):指獲得數(shù)據(jù)的速度。
可變性(Variability):妨礙了處理和有效地管理數(shù)據(jù)的過程。
真實性(Veracity):數(shù)據(jù)的質(zhì)量。
復(fù)雜性(Complexity):數(shù)據(jù)量巨大,來源多渠道。
價值(value):合理運用大數(shù)據(jù),以低成本創(chuàng)造高價值。
大數(shù)據(jù)包括結(jié)構(gòu)化、半結(jié)構(gòu)化和非結(jié)構(gòu)化數(shù)據(jù),非結(jié)構(gòu)化數(shù)據(jù)越來越成為數(shù)據(jù)的主要部分。據(jù)IDC的調(diào)查報告顯示:企業(yè)中80%的數(shù)據(jù)都是非結(jié)構(gòu)化數(shù)據(jù),這些數(shù)據(jù)每年都按指數(shù)增長60%。