0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

大數(shù)據(jù)挖掘是什么,數(shù)據(jù)挖掘的方法主要有哪些?

jmiy_worldofai ? 來源:YXQ ? 2019-04-17 10:42 ? 次閱讀

數(shù)據(jù)挖掘(Data Mining)是從大量的、不完全的、有噪聲的、模糊的、隨機的數(shù)據(jù)中提取隱含在其中的、人們事先不知道的、但又是潛在有用的信息和知識的過程。

數(shù)據(jù)挖掘?qū)ο?/strong>

根據(jù)信息存儲格式,用于挖掘的對象有關(guān)系數(shù)據(jù)庫、面向?qū)ο髷?shù)據(jù)庫、數(shù)據(jù)倉庫、文本數(shù)據(jù)源、多媒體數(shù)據(jù)庫、空間數(shù)據(jù)庫、時態(tài)數(shù)據(jù)庫、異質(zhì)數(shù)據(jù)庫以及Internet等。

數(shù)據(jù)挖掘流程

定義問題:清晰地定義出業(yè)務(wù)問題,確定數(shù)據(jù)挖掘的目的。

數(shù)據(jù)準(zhǔn)備:數(shù)據(jù)準(zhǔn)備包括:選擇數(shù)據(jù)–在大型數(shù)據(jù)庫和數(shù)據(jù)倉庫目標(biāo)中 提取數(shù)據(jù)挖掘的目標(biāo)數(shù)據(jù)集;數(shù)據(jù)預(yù)處理–進行數(shù)據(jù)再加工,包括檢查數(shù)據(jù)的完整性及數(shù)據(jù)的一致性、去噪聲,填補丟失的域,刪除無效數(shù)據(jù)等。

數(shù)據(jù)挖掘:根據(jù)數(shù)據(jù)功能的類型和和數(shù)據(jù)的特點選擇相應(yīng)的算法,在凈化和轉(zhuǎn)換過的數(shù)據(jù)集上進行數(shù)據(jù)挖掘。

結(jié)果分析:對數(shù)據(jù)挖掘的結(jié)果進行解釋和評價,轉(zhuǎn)換成為能夠最終被用戶理解的知識。

數(shù)據(jù)挖掘分類

直接數(shù)據(jù)挖掘:目標(biāo)是利用可用的數(shù)據(jù)建立一個模型,這個模型對剩余的數(shù)據(jù),對一個特定的變量(可以理解成數(shù)據(jù)庫中表的屬性,即列)進行描述。

間接數(shù)據(jù)挖掘:目標(biāo)中沒有選出某一具體的變量,用模型進行描述;而是在所有的變量中建立起某種關(guān)系。

數(shù)據(jù)挖掘的方法

神經(jīng)網(wǎng)絡(luò)方法

神經(jīng)網(wǎng)絡(luò)由于本身良好的魯棒性、自組織自適應(yīng)性、并行處理、分布存儲和高度容錯等特性非常適合解決數(shù)據(jù)挖掘的問題,因此近年來越來越受到人們的關(guān)注。

遺傳算法

遺傳算法是一種基于生物自然選擇與遺傳機理的隨機搜索算法,是一種仿生全局優(yōu)化方法。遺傳算法具有的隱含并行性、易于和其它模型結(jié)合等性質(zhì)使得它在數(shù)據(jù)挖掘中被加以應(yīng)用。

決策樹方法

決策樹是一種常用于預(yù)測模型的算法,它通過將大量數(shù)據(jù)有目的分類,從中找到一些有價值的,潛在的信息。它的主要優(yōu)點是描述簡單,分類速度快,特別適合大規(guī)模的數(shù)據(jù)處理。

粗集方法

粗集理論是一種研究不精確、不確定知識的數(shù)學(xué)工具。粗集方法有幾個優(yōu)點:不需要給出額外信息;簡化輸入信息的表達空間;算法簡單,易于操作。粗集處理的對象是類似二維關(guān)系表的信息表。

覆蓋正例排斥反例方法

它是利用覆蓋所有正例、排斥所有反例的思想來尋找規(guī)則。首先在正例集合中任選一個種子,到反例集合中逐個比較。與字段取值構(gòu)成的選擇子相容則舍去,相反則保留。按此思想循環(huán)所有正例種子,將得到正例的規(guī)則(選擇子的合取式)。

統(tǒng)計分析方法

在數(shù)據(jù)庫字段項之間存在兩種關(guān)系:函數(shù)關(guān)系和相關(guān)關(guān)系,對它們的分析可采用統(tǒng)計學(xué)方法,即利用統(tǒng)計學(xué)原理對數(shù)據(jù)庫中的信息進行分析。可進行常用統(tǒng)計、回歸分析、相關(guān)分析、差異分析等。

模糊集方法

即利用模糊集合理論對實際問題進行模糊評判、模糊決策、模糊模式識別和模糊聚類分析。系統(tǒng)的復(fù)雜性越高,模糊性越強,一般模糊集合理論是用隸屬度來刻畫模糊事物的亦此亦彼性的。

數(shù)據(jù)挖掘任務(wù)

關(guān)聯(lián)分析

兩個或兩個以上變量的取值之間存在某種規(guī)律性,就稱為關(guān)聯(lián)。數(shù)據(jù)關(guān)聯(lián)是數(shù)據(jù)庫中存在的一類重要的、可被發(fā)現(xiàn)的知識。關(guān)聯(lián)分為簡單關(guān)聯(lián)、時序關(guān)聯(lián)和因果關(guān)聯(lián)。關(guān)聯(lián)分析的目的是找出數(shù)據(jù)庫中隱藏的關(guān)聯(lián)網(wǎng)。一般用支持度和可信度兩個閥值來度量關(guān)聯(lián)規(guī)則的相關(guān)性,還不斷引入興趣度、相關(guān)性等參數(shù),使得所挖掘的規(guī)則更符合需求。

聚類分析

聚類是把數(shù)據(jù)按照相似性歸納成若干類別,同一類中的數(shù)據(jù)彼此相似,不同類中的數(shù)據(jù)相異。聚類分析可以建立宏觀的概念,發(fā)現(xiàn)數(shù)據(jù)的分布模式,以及可能的數(shù)據(jù)屬性之間的相互關(guān)系。

分類

分類就是找出一個類別的概念描述,它代表了這類數(shù)據(jù)的整體信息,即該類的內(nèi)涵描述,并用這種描述來構(gòu)造模型,一般用規(guī)則或決策樹模式表示。分類是利用訓(xùn)練數(shù)據(jù)集通過一定的算法而求得分類規(guī)則。分類可被用于規(guī)則描述和預(yù)測。

預(yù)測

預(yù)測是利用歷史數(shù)據(jù)找出變化規(guī)律,建立模型,并由此模型對未來數(shù)據(jù)的種類及特征進行預(yù)測。預(yù)測關(guān)心的是精度和不確定性,通常用預(yù)測方差來度量。

時序模式

時序模式是指通過時間序列搜索出的重復(fù)發(fā)生概率較高的模式。與回歸一樣,它也是用己知的數(shù)據(jù)預(yù)測未來的值,但這些數(shù)據(jù)的區(qū)別是變量所處時間的不同。

偏差分析

在偏差中包括很多有用的知識,數(shù)據(jù)庫中的數(shù)據(jù)存在很多異常情況,發(fā)現(xiàn)數(shù)據(jù)庫中數(shù)據(jù)存在的異常情況是非常重要的。偏差檢驗的基本方法就是尋找觀察結(jié)果與參照之間的差別。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 算法
    +關(guān)注

    關(guān)注

    23

    文章

    4551

    瀏覽量

    92017
  • 數(shù)據(jù)挖掘
    +關(guān)注

    關(guān)注

    1

    文章

    406

    瀏覽量

    24148

原文標(biāo)題:大數(shù)據(jù)挖掘是什么,數(shù)據(jù)挖掘的方法主要有哪些?

文章出處:【微信號:worldofai,微信公眾號:worldofai】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏

    評論

    相關(guān)推薦

    中科曙光受邀參加第十屆中國數(shù)據(jù)挖掘會議

    近日,國內(nèi)數(shù)據(jù)挖掘領(lǐng)域最主要的學(xué)術(shù)活動之一—第十屆中國數(shù)據(jù)挖掘會議(CCDM2024)于山東泰安舉行,中科曙光參與并分享了曙光AI構(gòu)建產(chǎn)學(xué)研
    的頭像 發(fā)表于 08-01 10:43 ?458次閱讀

    編碼器的類型主要有哪幾種?

    編碼器類型主要有兩種:絕對編碼器和增量編碼器。
    的頭像 發(fā)表于 02-20 18:14 ?1590次閱讀

    請問TC234和TC275主要有哪些區(qū)別?

    TC234 和TC275主要有哪些區(qū)別?
    發(fā)表于 02-20 06:30

    數(shù)據(jù)挖掘的應(yīng)用領(lǐng)域,并舉例說明

    數(shù)據(jù)挖掘(Data Mining)是一種從大量數(shù)據(jù)中提取出有意義的信息和模式的技術(shù)。它結(jié)合了數(shù)據(jù)庫、統(tǒng)計學(xué)、機器學(xué)習(xí)和人工智能等領(lǐng)域的理論和方法
    的頭像 發(fā)表于 02-03 14:19 ?2328次閱讀

    如何通過能源數(shù)據(jù)管理挖掘智慧樓宇的節(jié)能空間

    性能的同時優(yōu)化能耗,對此我們需要了解建筑內(nèi)各種能源的使用結(jié)構(gòu)、使用時間等信息。對此,物通博聯(lián)提供智慧樓宇的能源數(shù)據(jù)管理系統(tǒng),實現(xiàn)樓宇內(nèi)各種能源的數(shù)據(jù)采集與可視化監(jiān)控,并建立能源全面數(shù)據(jù)視圖,幫助確定可以
    的頭像 發(fā)表于 12-23 15:55 ?633次閱讀
    如何通過能源<b class='flag-5'>數(shù)據(jù)</b>管理<b class='flag-5'>挖掘</b>智慧樓宇的節(jié)能空間

    大數(shù)據(jù)技術(shù)如何為精益管理賦能?

    管理提供數(shù)據(jù)支持 精益管理強調(diào)以數(shù)據(jù)為基礎(chǔ),通過數(shù)據(jù)分析和挖掘,發(fā)現(xiàn)企業(yè)運營中的問題和瓶頸,進而優(yōu)化流程、提高效率。大數(shù)據(jù)技術(shù)能夠?qū)崟r收集、
    的頭像 發(fā)表于 12-19 09:58 ?477次閱讀

    充分挖掘SiC FET的性能

    充分挖掘SiC FET的性能
    的頭像 發(fā)表于 12-07 09:30 ?292次閱讀
    充分<b class='flag-5'>挖掘</b>SiC FET的性能

    php的數(shù)據(jù)類型主要有哪幾種

    PHP是一種強類型編程語言,它支持多種數(shù)據(jù)類型。以下是PHP的主要數(shù)據(jù)類型: 字符串(String): 表示文本數(shù)據(jù),可以使用單引號或雙引號來定義字符串。例如:$str = "Hell
    的頭像 發(fā)表于 12-04 16:05 ?533次閱讀

    數(shù)據(jù)挖掘示波器與傳統(tǒng)示波器的區(qū)別在哪里?

    數(shù)據(jù)采集方式:傳統(tǒng)示波器通過將模擬信號轉(zhuǎn)換為數(shù)字信號進行采集和顯示。而數(shù)據(jù)挖掘示波器主要用于數(shù)字信號的采集和分析,例如從數(shù)字通信系統(tǒng)、傳感器網(wǎng)絡(luò)等獲取的數(shù)字信號進行處理和分析。
    的頭像 發(fā)表于 12-04 14:28 ?334次閱讀
    <b class='flag-5'>數(shù)據(jù)</b><b class='flag-5'>挖掘</b>示波器與傳統(tǒng)示波器的區(qū)別在哪里?

    電梯物聯(lián)網(wǎng)大數(shù)據(jù)平臺是什么意思?

    電梯物聯(lián)網(wǎng)大數(shù)據(jù)化平臺是將電梯的使用時間和管理中的各項數(shù)據(jù)進行采集,整合及利用大數(shù)據(jù)分析能力和計算機視覺技術(shù)、結(jié)合關(guān)聯(lián)分析、空間分析和多維分析等多種分析手段,挖掘對應(yīng)
    的頭像 發(fā)表于 11-23 11:01 ?650次閱讀

    電源變頻驅(qū)動主要有哪2種驅(qū)動方式?

    電源變頻驅(qū)動主要有哪2種驅(qū)動方式? 電源變頻驅(qū)動是一種通過調(diào)節(jié)電源輸出頻率的方法來控制電機的轉(zhuǎn)速和運行模式。它適用于各種需要控制電機轉(zhuǎn)速和降低能耗的應(yīng)用,如工業(yè)生產(chǎn)線、空調(diào)系統(tǒng)、通風(fēng)系統(tǒng)、泵站等
    的頭像 發(fā)表于 11-16 14:47 ?454次閱讀

    mysql主從復(fù)制主要有幾種模式

    MySQL主從復(fù)制是MySQL數(shù)據(jù)庫中常用的一種數(shù)據(jù)復(fù)制方式,用于實現(xiàn)數(shù)據(jù)的備份、負(fù)載均衡、故障恢復(fù)等目的。主從復(fù)制主要有以下幾種模式: 異步復(fù)制 異步復(fù)制是MySQL主從復(fù)制的默認(rèn)模
    的頭像 發(fā)表于 11-16 14:15 ?1032次閱讀

    現(xiàn)在32位和64位mcu主要有哪些?哪種性價比高呢?

    現(xiàn)在32位和64位mcu主要有哪些?哪種性價比高?
    發(fā)表于 11-08 08:26

    機器學(xué)習(xí)與數(shù)據(jù)挖掘方法和應(yīng)用

    機器學(xué)習(xí)與數(shù)據(jù)挖掘方法和應(yīng)用(經(jīng)典)
    發(fā)表于 09-26 07:56

    基于大數(shù)據(jù)分析的5G智能工廠如何實現(xiàn)

    、應(yīng)用和未來的發(fā)展前景,以及它們?nèi)绾蜗嗷ソY(jié)合,推動智能制造的未來發(fā)展。 大數(shù)據(jù)分析是指通過對海量數(shù)據(jù)進行分析,挖掘出其中有價值的信息和知識,以指導(dǎo)業(yè)務(wù)決策和創(chuàng)新的過程。與傳統(tǒng)數(shù)據(jù)
    的頭像 發(fā)表于 09-25 17:08 ?461次閱讀