越看水流的越多的故事,国产真实迷奷系列在线免费看

從前年開始，海外谷歌、亞馬遜、蘋果、微軟、三星，國內(nèi)阿里、小米、京東等都已先后涉足智能音箱這一領(lǐng)域。隨著其快速發(fā)展，作為核心技術(shù)之一的語音識別技術(shù)也逐步進入人們的視線，本篇我們就來談?wù)務(wù)Z音識別技術(shù)。

語音識別技術(shù)簡介

語音識別，也被稱為自動語音識別（Automatic Speech Recognition，ASR）技術(shù)，就是讓機器通過識別和理解過程把語音信號轉(zhuǎn)變?yōu)橄鄳?yīng)的文本或命令的高技術(shù)，也就是讓機器聽懂人類的語音。

所謂聽懂，有兩層意思，一是指把用戶所說的話逐詞逐句轉(zhuǎn)換成文本；二是指正確理解語音中所包含的要求，作出正確的應(yīng)答。

語音識別技術(shù)目前在桌面系統(tǒng)、智能手機、導(dǎo)航設(shè)備等嵌入式領(lǐng)域均有一定程度的應(yīng)用。

語音識別系統(tǒng)及過程

不同的語音識別系統(tǒng)，雖然具體實現(xiàn)細節(jié)有所不同，但所采用的基本技術(shù)相似，一個典型語音識別系統(tǒng)的實現(xiàn)過程如下圖所示。

語音識別的基本過程有兩個部分組成。一是學(xué)習(xí)和訓(xùn)練，二是識別過程。

訓(xùn)練（Training）：預(yù)先分析出語音特征參數(shù)，制作語音模板（Template）并存放在語音參數(shù)庫中。

識別（Recognition）：待識語音經(jīng)過與訓(xùn)練時相同的分析，得到語音參數(shù)，將它與庫中的參考模板一一比較，并采用判決的方法找出最接近語音特征的模板，得出識別效果。

語音識別系統(tǒng)的分類

（1）根據(jù)對說話人說話方式的要求，可以分為孤立字（詞）語音識別系統(tǒng)，連接字語音識別系統(tǒng)以及連續(xù)語音識別系統(tǒng)。

孤立單詞識別（Isolated Word Recognition）：識別的單元為字、詞或短語，它們組成識別的詞匯表（Vocabulary），對它們中的每一個通過訓(xùn)練建立模板或模型。

連續(xù)單詞識別（Connected Word Recognition）：以比較少的詞匯為對象，能夠完全識別每個詞。識別的詞匯表和標準樣板或模型也是字、詞或短語，但識別時可以是它們中間幾個的連續(xù)。

連續(xù)語音識別（Continuous Speech Recognition）：以多數(shù)詞匯為對象，待識語音是一些完整的句子。雖不能完全準確識別每個單詞，但能夠理解其意義，連續(xù)語音識別也叫會話語音識別。可理解為在語音識別之后，根據(jù)語言學(xué)知識來推斷語音的含義內(nèi)容。

（2）根據(jù)對說話人的依賴程度可以分為特定人和非特定人語音識別系統(tǒng)。

特定人語音識別（Speaker-Dependent）：語音識別的標準模板或模型只適應(yīng)于某個人。實際上，該模板或模型就是該人通過輸入詞匯表中的每個字、詞或短語的語音建立起來的。其他人使用時，需同樣建立自己的標準模板或模型。

非特定人語音識別（Speaker-Independent）：語音識別的標準模板或模型適應(yīng)于指定的某一范疇的說話人（比如標準普通話），標準模板或模型由該范疇的多個人通過訓(xùn)練而產(chǎn)生。識別時可供參加訓(xùn)練的發(fā)音人使用，也可供未參加訓(xùn)練的同一范疇的發(fā)音人使用。

（3）根據(jù)詞匯量大小，可以分為有限詞匯以及無限詞匯量語音識別系統(tǒng)。

有限詞匯識別：按詞匯表中字、詞或短句個數(shù)的多少，大致分為:100以下小詞匯量；100-1000中等詞匯量；1000以上為大詞匯量。

無限詞匯識別（全音節(jié)識別）：當識別基元為漢語普通話中對應(yīng)所有漢字的可讀音節(jié)時，稱其為全音節(jié)語音識別，是實現(xiàn)無線詞匯或中文文本輸入的基礎(chǔ)。

語音識別技術(shù)的“前世今生”

下面我們來看看語音識別技術(shù)的“前世今生”：

（1）起始階段

1952年AT& T Bell實驗室實現(xiàn)了一個單一發(fā)音人孤立發(fā)音的十個英文數(shù)字的語音識別系統(tǒng)，方法主要是度量每個數(shù)字的元音音段的共振峰。

1960年英國的Denes等人研究成功了第一個計算機語音識別系統(tǒng)。在此期間，提出的一些思想沿用至今。

理論：模式識別思想、動態(tài)規(guī)劃算法、時間規(guī)劃算法、動態(tài)因素跟蹤法。

（2）快速發(fā)展階段

70年代孤立詞發(fā)音和孤立語句發(fā)音的識別成為了可行的有用技術(shù)，大規(guī)模的語音識別研究在這個時期得到很大的發(fā)展。

80年代研究的重點轉(zhuǎn)向了詞匯量的積累，以及連續(xù)的語音識別，也就是從傳統(tǒng)的基于標準模板匹配的技術(shù)思路轉(zhuǎn)變基于統(tǒng)計模型的技術(shù)思路。此外，再次提出了將神經(jīng)網(wǎng)絡(luò)技術(shù)引入語音識別的技術(shù)思路。

理論：聲學(xué)模型—隱馬爾科夫模型（Hidden Markov Model，HMM）

語言模型—N-gram模型

（3）應(yīng)用開發(fā)

90年代，語音識別研究的重點轉(zhuǎn)向自然語言的識別處理，任務(wù)轉(zhuǎn)移到航空旅行信息的索取。同時，語音識別技術(shù)不斷應(yīng)用于電話網(wǎng)絡(luò)，增強話務(wù)員服務(wù)和自動化。

2000年以來，人機語音交互成為研究的焦點。研究重點包括即興口語的識別和理解，自然口語對話，以及多語種的語音同聲翻譯。

理論：聲學(xué)模型—隱馬爾科夫模型—深度神經(jīng)網(wǎng)絡(luò)（Deep Neural Network，DNN）

語言模型—N-gram模型—反饋神經(jīng)網(wǎng)絡(luò)（Feedback Neural Network，F(xiàn)NN）

語音識別領(lǐng)域公司

科大訊飛，騰訊，百度，蘇州思必馳，捷通華聲，云知聲等等。

結(jié)語

隨著語音識別技術(shù)的不斷發(fā)展，無論是Siri、Echo，還是其他的智能語音助手都可以接觸和管理消息、郵件和日程帳號，還能控制聯(lián)網(wǎng)家居，播放音樂，甚至完成網(wǎng)絡(luò)搜索或者更多的事情。而我們，只需滿懷期待。

聲明：本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人，不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用，如有內(nèi)容侵權(quán)或者其他違規(guī)問題，請聯(lián)系本站處理。舉報投訴

語音識別

語音識別

+關(guān)注

關(guān)注
38

文章
1696

瀏覽量
112248

簡述半導(dǎo)體材料的發(fā)展史

半導(dǎo)體材料的發(fā)展史是一段漫長而輝煌的歷程，它深刻地影響了現(xiàn)代信息社會的發(fā)展軌跡。從最初的發(fā)現(xiàn)到如今的廣泛應(yīng)用，半導(dǎo)體材料經(jīng)歷了從第一代到第三代的演變，每一次進步都帶來了技術(shù)上的巨大飛躍。

發(fā)表于 08-15 16:03 ?499次閱讀

三菱電機功率器件發(fā)展史

三菱電機從事功率半導(dǎo)體開發(fā)和生產(chǎn)已有六十多年的歷史，從早期的二極管、晶閘管，到MOSFET、IGBT和SiC器件，三菱電機一直致力于功率半導(dǎo)體芯片技術(shù)和封裝技術(shù)的研究探索，本篇章帶你了解三菱電機功率器件發(fā)展史。

發(fā)表于 07-24 10:17 ?343次閱讀

電阻柜的發(fā)展史

電阻柜發(fā)展史

發(fā)表于 03-08 15:22 ?299次閱讀

機器人技術(shù)的發(fā)展史簡介

機器人的誕生地在美國，1962年美國研制出世界上第一臺工業(yè)機器人，經(jīng)過30多年的發(fā)展，美國現(xiàn)已成為世界上的機器人強國之一，基礎(chǔ)雄厚，技術(shù)先進。綜觀它的發(fā)展史，道路是曲折不平坦的。

發(fā)表于 12-20 10:17 ?1139次閱讀

情感語音識別：技術(shù)發(fā)展與挑戰(zhàn)

一、引言情感語音識別是人工智能領(lǐng)域的重要研究方向，它通過分析人類語音中的情感信息，實現(xiàn)人機之間的情感交互。本文將探討情感語音識別

發(fā)表于 11-28 18:26 ?484次閱讀

離線語音識別及控制是怎樣的技術(shù)？

引言：　隨著人工智能的飛速發(fā)展，離線語音識別技術(shù)成為了一項備受矚目的創(chuàng)新。離線語音識別

發(fā)表于 11-24 17:41

情感語音識別：技術(shù)發(fā)展與跨文化應(yīng)用

一、引言情感語音識別是人工智能領(lǐng)域的前沿研究領(lǐng)域，它通過分析人類語音中的情感信息，實現(xiàn)更加智能化和個性化的人機交互。隨著技術(shù)的不斷發(fā)展，情

發(fā)表于 11-22 10:54 ?433次閱讀

情感語音識別技術(shù)的挑戰(zhàn)與未來發(fā)展

情感語音識別技術(shù)作為人工智能領(lǐng)域的重要分支，已經(jīng)取得了顯著的進展。然而，在實際應(yīng)用中，情感語音識別技術(shù)

發(fā)表于 11-16 16:48 ?351次閱讀

情感語音識別技術(shù)的發(fā)展趨勢與前景

一、引言情感語音識別技術(shù)是近年來人工智能領(lǐng)域的研究熱點之一，它通過分析人類語音中的情感信息實現(xiàn)更加智能化和個性化的人機交互。本文將探討情感語音

發(fā)表于 11-16 16:13 ?536次閱讀

你不知道的FPC，它的發(fā)展史竟然是這樣的！

你不知道的FPC，它的發(fā)展史竟然是這樣的！

發(fā)表于 11-15 10:48 ?847次閱讀

情感語音識別技術(shù)的應(yīng)用與未來發(fā)展

一、引言隨著科技的飛速發(fā)展，情感語音識別技術(shù)已經(jīng)成為人機交互的重要發(fā)展方向。情感語音

發(fā)表于 11-12 17:30 ?597次閱讀

語音識別技術(shù)的行業(yè)應(yīng)用與發(fā)展趨勢

一、引言隨著科技的不斷發(fā)展，語音識別技術(shù)已經(jīng)滲透到各個行業(yè)中，并逐漸改變著人們的生活方式。本文將探討語音

發(fā)表于 10-18 16:10 ?778次閱讀

語音識別技術(shù)的優(yōu)化與發(fā)展趨勢

一、引言語音識別技術(shù)是一種將人類語音轉(zhuǎn)化為計算機可理解數(shù)據(jù)的技術(shù)。隨著人工智能和深度學(xué)習(xí)的發(fā)展

發(fā)表于 10-12 18:33 ?625次閱讀

語音識別技術(shù)：現(xiàn)狀、挑戰(zhàn)與未來發(fā)展

一、引言語音識別技術(shù)是一種將人類語音轉(zhuǎn)化為計算機可讀文本的技術(shù)，它在許多領(lǐng)域都有廣泛的應(yīng)用，如智能助手、智能家居、醫(yī)療診斷等。本文將探討

發(fā)表于 10-12 16:57 ?1966次閱讀

語音識別技術(shù)的現(xiàn)狀及發(fā)展趨勢

一、引言隨著科技的快速發(fā)展，語音識別技術(shù)得到了廣泛應(yīng)用。語音識別

發(fā)表于 09-28 16:55 ?2865次閱讀

搜索歷史

語音識別技術(shù)的發(fā)展史

評論

簡述半導(dǎo)體材料的發(fā)展史

三菱電機功率器件發(fā)展史

電阻柜的發(fā)展史

機器人技術(shù)的發(fā)展史簡介

情感語音識別：技術(shù)發(fā)展與挑戰(zhàn)

離線語音識別及控制是怎樣的技術(shù)？

情感語音識別：技術(shù)發(fā)展與跨文化應(yīng)用

情感語音識別技術(shù)的挑戰(zhàn)與未來發(fā)展

情感語音識別技術(shù)的發(fā)展趨勢與前景

你不知道的FPC，它的發(fā)展史竟然是這樣的！

情感語音識別技術(shù)的應(yīng)用與未來發(fā)展

語音識別技術(shù)的行業(yè)應(yīng)用與發(fā)展趨勢

語音識別技術(shù)的優(yōu)化與發(fā)展趨勢

語音識別技術(shù)：現(xiàn)狀、挑戰(zhàn)與未來發(fā)展

語音識別技術(shù)的現(xiàn)狀及發(fā)展趨勢