亚州最新精品一区二区三区,AV免费不卡国产观看,一本之道AV免费

自然語言處理知識太龐大了，網(wǎng)上也都是一些零零散散的知識，比如單獨講某些模型，也沒有來龍去脈，學(xué)習(xí)起來較為困難，于是我自己總結(jié)了一份知識體系結(jié)構(gòu)，內(nèi)容來源主要參考黃志洪老師的自然語言處理課程，主要參考書為宗成慶老師的《統(tǒng)計自然語言處理》，可能很多內(nèi)容寫的不清楚，但好像中文NLP書籍就這一本全一些。

▌一、自然語言處理概述

1）自然語言處理：利用計算機為工具，對書面實行或者口頭形式進(jìn)行各種各樣的處理和加工的技術(shù)，是研究人與人交際中以及人與計算機交際中的演員問題的一門學(xué)科，是人工智能的主要內(nèi)容。

2）自然語言處理是研究語言能力和語言應(yīng)用的模型，建立計算機（算法）框架來實現(xiàn)這樣的語言模型，并完善、評測、最終用于設(shè)計各種實用系統(tǒng)。

3）研究問題（主要）：

信息檢索

機器翻譯

文檔分類

問答系統(tǒng)

信息過濾

自動文摘

信息抽取

文本挖掘

輿情分析

機器寫作

語音識別

研究模式：自然語言場景問題，數(shù)學(xué)算法，算法如何應(yīng)用到解決這些問題，預(yù)料訓(xùn)練，相關(guān)實際應(yīng)用

自然語言的困難：

場景的困難：語言的多樣性、多變性、歧義性

學(xué)習(xí)的困難：艱難的數(shù)學(xué)模型（hmm,crf,EM,深度學(xué)習(xí)等）

語料的困難：什么的語料？語料的作用？如何獲取語料？

▌二、形式語言與自動機

語言：按照一定規(guī)律構(gòu)成的句子或者字符串的有限或者無限的集合。

描述語言的三種途徑：

窮舉法

文法（產(chǎn)生式系統(tǒng)）描述

自動機

自然語言不是人為設(shè)計而是自然進(jìn)化的，形式語言比如：運算符號、化學(xué)分子式、編程語言形式語言理論朱啊喲研究的是內(nèi)部結(jié)構(gòu)模式這類語言的純粹的語法領(lǐng)域，從語言學(xué)而來，作為一種理解自然語言的句法規(guī)律，在計算機科學(xué)中，形式語言通常作為定義編程和語法結(jié)構(gòu)的基礎(chǔ)形式語言與自動機基礎(chǔ)知識：

集合論

圖論

自動機的應(yīng)用：

單詞自動查錯糾正

詞性消歧（什么是詞性？什么的詞性標(biāo)注？為什么需要標(biāo)注？如何標(biāo)注？）

形式語言的缺陷：

對于像漢語，英語這樣的大型自然語言系統(tǒng)，難以構(gòu)造精確的文法

不符合人類學(xué)習(xí)語言的習(xí)慣

有些句子語法正確，但在語義上卻不可能，形式語言無法排出這些句子

解決方向：基于大量語料，采用統(tǒng)計學(xué)手段建立模型

▌三、語言模型

1）語言模型（重要）：通過語料計算某個句子出現(xiàn)的概率（概率表示），常用的有2-元模型，3-元模型

2）語言模型應(yīng)用：

語音識別歧義消除例如，給定拼音串：tashiyanyanjiusaunfade

可能的漢字串：踏實煙酒算法的他是研究酸法的他是研究算法的，顯然，最后一句才符合。

3）語言模型的啟示：

開啟自然語言處理的統(tǒng)計方法

統(tǒng)計方法的一般步驟：

收集大量語料

對語料進(jìn)行統(tǒng)計分析，得出知識

針對場景建立算法模型

解釋和應(yīng)用結(jié)果

4）語言模型性能評價，包括評價目標(biāo)，評價的難點，常用指標(biāo)（交叉熵，困惑度）

5）數(shù)據(jù)平滑：

數(shù)據(jù)平滑的概念，為什么需要平滑？

平滑的方法，加一法，加法平滑法，古德-圖靈法，J-M法，Katz平滑法等。

6）語言模型的缺陷：

語料來自不同的領(lǐng)域，而語言模型對文本類型、主題等十分敏感。

n與相鄰的n-1個詞相關(guān)，假設(shè)不是很成立。

▌四、概率圖模型，生成模型與判別模型，貝葉斯網(wǎng)絡(luò)，馬爾科夫鏈與隱馬爾科夫模型（HMM）

1）概率圖模型概述（什么的概率圖模型，參考清華大學(xué)教材《概率圖模型》）

2）馬爾科夫過程（定義，理解）

3）隱馬爾科夫過程（定義，理解）

HMM的三個基本問題（定義，解法，應(yīng)用）

注：第一個問題，涉及最大似然估計法，第二個問題涉及EM算法，第三個問題涉及維特比算法，內(nèi)容很多，要重點理解，（參考書李航《統(tǒng)計學(xué)習(xí)方法》，網(wǎng)上博客，筆者github）

▌五、馬爾科夫網(wǎng)，最大熵模型，條件隨機場（CRF）

1)HMM的三個基本問題的參數(shù)估計與計算

2）什么是熵

3）EM算法（應(yīng)用十分廣泛，好好理解）

4）HMM的應(yīng)用

5）層次化馬爾科夫模型與馬爾科夫網(wǎng)絡(luò)

提出原因，HMM存在兩個問題

6）最大熵馬爾科夫模型

優(yōu)點：與HMM相比，允許使用特征刻畫觀察序列，訓(xùn)練高效

缺點：存在標(biāo)記偏置問題

7）條件隨機場及其應(yīng)用(概念，模型過程，與HMM關(guān)系)

參數(shù)估計方法（GIS算法，改進(jìn)IIS算法）

CRF基本問題：特征選?。ㄌ卣髂０澹⒏怕视嬎?、參數(shù)訓(xùn)練、解碼（維特比）

應(yīng)用場景：

詞性標(biāo)注類問題（現(xiàn)在一般用RNN+CRF）

中文分詞（發(fā)展過程，經(jīng)典算法，了解開源工具jieba分詞）

中文人名，地名識別

8）CRF++

▌六、命名實體識別，詞性標(biāo)注，內(nèi)容挖掘、語義分析與篇章分析（大量用到前面的算法）

1）命名實體識別問題

相關(guān)概率，定義

相關(guān)任務(wù)類型

方法（基于規(guī)程->基于大規(guī)模語料庫）

2）未登錄詞的解決方法(搜索引擎，基于語料)

3）CRF解決命名實體識別（NER）流程總結(jié)：

訓(xùn)練階段：確定特征模板，不同場景（人名，地名等）所使用的特征模板不同，對現(xiàn)有語料進(jìn)行分詞，在分詞結(jié)果基礎(chǔ)上進(jìn)行詞性標(biāo)注（可能手工），NER對應(yīng)的標(biāo)注問題是基于詞的，然后訓(xùn)練CRF模型，得到對應(yīng)權(quán)值參數(shù)值

識別過程：將待識別文檔分詞，然后送入CRF模型進(jìn)行識別計算（維特比算法），得到標(biāo)注序列，然后根據(jù)標(biāo)注劃分出命名實體

4）詞性標(biāo)注（理解含義，意義）及其一致性檢查方法（位置屬性向量，詞性標(biāo)注序列向量，聚類或者分類算法）

▌七、句法分析

1）句法分析理解以及意義

1、句法結(jié)構(gòu)分析

完全句法分析

淺層分析（這里有很多方法。。。）

2、依存關(guān)系分析

2）句法分析方法

基于規(guī)則的句法結(jié)構(gòu)分析

基于統(tǒng)計的語法結(jié)構(gòu)分析

▌八、文本分類，情感分析

1）文本分類，文本排重

文本分類：在預(yù)定義的分類體系下，根據(jù)文本的特征，將給定的文本與一個或者多個類別相關(guān)聯(lián)

典型應(yīng)用：垃圾郵件判定，網(wǎng)頁自動分類

2）文本表示，特征選取與權(quán)重計算，詞向量

文本特征選擇常用方法：

基于本文頻率的特征提取法

信息增量法

X2（卡方）統(tǒng)計量

互信息法

3）分類器設(shè)計

SVM，貝葉斯，決策樹等

4）分類器性能評測

召回率

正確率

F1值

5）主題模型（LDA）與PLSA

LDA模型十分強大，基于貝葉斯改進(jìn)了PLSA，可以提取出本章的主題詞和關(guān)鍵詞，建模過程復(fù)雜，難以理解。

6）情感分析

借助計算機幫助用戶快速獲取，整理和分析相關(guān)評論信息，對帶有感情色彩的主觀文本進(jìn)行分析，處理和歸納例如，評論自動分析，水軍識別。

某種意義上看，情感分析也是一種特殊的分類問題

7）應(yīng)用案例

▌九、信息檢索，搜索引擎及其原理

1）信息檢索起源于圖書館資料查詢檢索，引入計算機技術(shù)后，從單純的文本查詢擴展到包含圖片，音視頻等多媒體信息檢索，檢索對象由數(shù)據(jù)庫擴展到互聯(lián)網(wǎng)。

點對點檢索

精確匹配模型與相關(guān)匹配模型

檢索系統(tǒng)關(guān)鍵技術(shù)：標(biāo)引，相關(guān)度計算

2）常見模型：布爾模型，向量空間模型，概率模型

3）常用技術(shù)：倒排索引，隱語義分析（LDA等）

4）評測指標(biāo)

▌十、自動文摘與信息抽取，機器翻譯，問答系統(tǒng)

1）統(tǒng)計機器翻譯的的思路，過程，難點，以及解決

2）問答系統(tǒng)

基本組成：問題分析，信息檢索，答案抽取

類型：基于問題-答案，基于自由文本

典型的解決思路

3）自動文摘的意義，常用方法

4）信息抽取模型（LDA等）

▌十一、深度學(xué)習(xí)在自然語言中的應(yīng)用

1）單詞表示，比如詞向量的訓(xùn)練（wordvoc）

2）自動寫文本

寫新聞等

3）機器翻譯

4）基于CNN、RNN的文本分類

5）深度學(xué)習(xí)與CRF結(jié)合用于詞性標(biāo)注

聲明：本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人，不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用，如有內(nèi)容侵權(quán)或者其他違規(guī)問題，請聯(lián)系本站處理。舉報投訴

自然語言

自然語言

+關(guān)注

關(guān)注
1

文章
279

瀏覽量
13295
nlp

nlp

+關(guān)注

關(guān)注
1

文章
481

瀏覽量
21932

原文標(biāo)題：自然語言處理（NLP）知識結(jié)構(gòu)總結(jié)

文章出處：【微信號：rgznai100，微信公眾號：rgznai100】歡迎添加關(guān)注！文章轉(zhuǎn)載請注明出處。

python自然語言

最近，python自然語言是越來越火了，那么什么是自然語言。自然語言（Natural Language ）廣納了眾多技術(shù)，對自然或人類語言進(jìn)

發(fā)表于 05-02 13:50

NLPIR語義分析是對自然語言處理的完美理解

和邏輯表示。語義分析就是對信息所包含的語義的識別，并建立一種計算模型，使其能夠像人那樣理解自然語言。語義分析是自然語言理解的根本問題，它在自然語言處理、信息檢索、信息過濾、信息分類、語

發(fā)表于 10-19 11:34

【推薦體驗】騰訊云自然語言處理

結(jié)構(gòu)化抽取，有效輔助人工，降低人力參與成本。因為現(xiàn)在騰訊云自然語言處理產(chǎn)品公測免費，所以我注冊了騰訊云賬號去專門體驗了一下，最直觀的感受就是確實如產(chǎn)品介紹中說的：開箱即用的NLP能力，滿足各種文本智能需求

發(fā)表于 10-09 15:28

自然語言處理的分詞方法

自然語言處理——75 自動分詞基本算法

發(fā)表于 03-19 11:46

自然語言處理的語言模型

自然語言處理——53 語言模型（數(shù)據(jù)平滑）

發(fā)表于 04-16 11:11

自然語言處理的詞性標(biāo)注方法

自然語言處理——78 詞性標(biāo)注方法

發(fā)表于 04-21 11:38

求自然語言處理筆記

自然語言處理筆記9-哈工大關(guān)毅

發(fā)表于 06-04 16:34

自然語言處理——總結(jié)、習(xí)題

自然語言處理——79 總結(jié)、習(xí)題

發(fā)表于 06-19 11:22

什么是自然語言處理

什么是自然語言處理？自然語言處理任務(wù)有哪些？自然語言處理的方法是什么？

發(fā)表于 09-08 06:51

基于自然語言處理的知識檢索算法研究

基于自然語言處理的知識檢索算法研究_賈潤亮

發(fā)表于 01-07 21:39 ?1次下載

什么是自然語言處理_自然語言處理常用方法舉例說明

自然語言處理是計算機科學(xué)領(lǐng)域與人工智能領(lǐng)域中的一個重要方向。它研究能實現(xiàn)人與計算機之間用自然語言進(jìn)行有效通信的各種理論和方法。自然語言處理是

發(fā)表于 12-28 16:56 ?1.8w次閱讀

什么是<b class='flag-5'>自然語言</b><b class='flag-5'>處理</b>_<b class='flag-5'>自然語言</b><b class='flag-5'>處理</b>常用方法舉例說明

自然語言處理怎么最快入門_自然語言處理知識了解

自然語言處理就是實現(xiàn)人機間自然語言通信，實現(xiàn)自然語言理解和自然語言生成是十分困難的，造成困難的根本原因是

發(fā)表于 12-28 17:10 ?5255次閱讀

自然語言處理（NLP）知識結(jié)構(gòu)總結(jié)

自然語言處理知識太龐大了，網(wǎng)上也都是一些零零散散的知識，比如單獨講某些模型，也沒有來龍去脈，學(xué)習(xí)起來較為困難，于是我自己總結(jié)了一份知識體系結(jié)構(gòu)

發(fā)表于 08-29 09:58 ?4589次閱讀

自然語言處理的概念和應(yīng)用 自然語言處理屬于人工智能嗎

　　自然語言處理(Natural Language Processing)是一種人工智能技術(shù)，它是研究自然語言與計算機之間的交互和通信的一門學(xué)科。自然語言

發(fā)表于 08-23 17:31 ?1137次閱讀

自然語言處理和人工智能的概念及發(fā)展史 自然語言處理和人工智能的區(qū)別

自然語言處理(Natural Language Processing, NLP)的定義是通過電腦軟件程序?qū)崿F(xiàn)人們?nèi)粘?b class='flag-5'>語言的機器自動處理。為了幫助計算機理解，掌握

發(fā)表于 08-23 18:22 ?731次閱讀

搜索歷史

淺析自然語言處理知識體系結(jié)構(gòu)

評論