chinese直男口爆体育生外卖, 99久久er热在这里只有精品99, 又色又爽又黄18禁美女裸身无遮挡, gogogo高清免费观看日本电视,私密按摩师高清版在线,人妻视频毛茸茸,91论坛 兴趣闲谈,欧美 亚洲 精品 8区,国产精品久久久久精品免费

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

語音識別技術(shù)的發(fā)展史

454398 ? 來源:工程師吳畏 ? 2019-04-30 11:49 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

從前年開始,海外谷歌、亞馬遜、蘋果、微軟、三星,國內(nèi)阿里、小米、京東等都已先后涉足智能音箱這一領(lǐng)域。隨著其快速發(fā)展,作為核心技術(shù)之一的語音識別技術(shù)也逐步進入人們的視線,本篇我們就來談談語音識別技術(shù)。

語音識別技術(shù)簡介

語音識別,也被稱為自動語音識別(Automatic Speech Recognition,ASR)技術(shù),就是讓機器通過識別和理解過程把語音信號轉(zhuǎn)變?yōu)橄鄳奈谋净蛎畹母呒夹g(shù),也就是讓機器聽懂人類的語音。

所謂聽懂,有兩層意思,一是指把用戶所說的話逐詞逐句轉(zhuǎn)換成文本;二是指正確理解語音中所包含的要求,作出正確的應答。

語音識別技術(shù)目前在桌面系統(tǒng)、智能手機、導航設備等嵌入式領(lǐng)域均有一定程度的應用。

語音識別系統(tǒng)及過程

不同的語音識別系統(tǒng),雖然具體實現(xiàn)細節(jié)有所不同,但所采用的基本技術(shù)相似,一個典型語音識別系統(tǒng)的實現(xiàn)過程如下圖所示。

語音識別的基本過程有兩個部分組成。一是學習和訓練,二是識別過程。

訓練(Training):預先分析出語音特征參數(shù),制作語音模板(Template)并存放在語音參數(shù)庫中。

識別(Recognition):待識語音經(jīng)過與訓練時相同的分析,得到語音參數(shù),將它與庫中的參考模板一一比較,并采用判決的方法找出最接近語音特征的模板,得出識別效果。

語音識別系統(tǒng)的分類

(1)根據(jù)對說話人說話方式的要求,可以分為孤立字(詞)語音識別系統(tǒng),連接字語音識別系統(tǒng)以及連續(xù)語音識別系統(tǒng)。

孤立單詞識別(Isolated Word Recognition):識別的單元為字、詞或短語,它們組成識別的詞匯表(Vocabulary),對它們中的每一個通過訓練建立模板或模型。

連續(xù)單詞識別(Connected Word Recognition):以比較少的詞匯為對象,能夠完全識別每個詞。識別的詞匯表和標準樣板或模型也是字、詞或短語,但識別時可以是它們中間幾個的連續(xù)。

連續(xù)語音識別(Continuous Speech Recognition):以多數(shù)詞匯為對象,待識語音是一些完整的句子。雖不能完全準確識別每個單詞,但能夠理解其意義,連續(xù)語音識別也叫會話語音識別??衫斫鉃樵谡Z音識別之后,根據(jù)語言學知識來推斷語音的含義內(nèi)容。

(2)根據(jù)對說話人的依賴程度可以分為特定人和非特定人語音識別系統(tǒng)。

特定人語音識別(Speaker-Dependent):語音識別的標準模板或模型只適應于某個人。實際上,該模板或模型就是該人通過輸入詞匯表中的每個字、詞或短語的語音建立起來的。其他人使用時,需同樣建立自己的標準模板或模型。

非特定人語音識別(Speaker-Independent):語音識別的標準模板或模型適應于指定的某一范疇的說話人(比如標準普通話),標準模板或模型由該范疇的多個人通過訓練而產(chǎn)生。識別時可供參加訓練的發(fā)音人使用,也可供未參加訓練的同一范疇的發(fā)音人使用。

(3)根據(jù)詞匯量大小,可以分為有限詞匯以及無限詞匯量語音識別系統(tǒng)。

有限詞匯識別:按詞匯表中字、詞或短句個數(shù)的多少,大致分為:100以下小詞匯量;100-1000中等詞匯量;1000以上為大詞匯量。

無限詞匯識別(全音節(jié)識別):當識別基元為漢語普通話中對應所有漢字的可讀音節(jié)時,稱其為全音節(jié)語音識別,是實現(xiàn)無線詞匯或中文文本輸入的基礎(chǔ)。

語音識別技術(shù)的“前世今生”

下面我們來看看語音識別技術(shù)的“前世今生”:

(1)起始階段

1952年AT& T Bell實驗室實現(xiàn)了一個單一發(fā)音人孤立發(fā)音的十個英文數(shù)字的語音識別系統(tǒng),方法主要是度量每個數(shù)字的元音音段的共振峰。

1960年英國的Denes等人研究成功了第一個計算機語音識別系統(tǒng)。在此期間,提出的一些思想沿用至今。

理論:模式識別思想、動態(tài)規(guī)劃算法、時間規(guī)劃算法、動態(tài)因素跟蹤法。

(2)快速發(fā)展階段

70年代孤立詞發(fā)音和孤立語句發(fā)音的識別成為了可行的有用技術(shù),大規(guī)模的語音識別研究在這個時期得到很大的發(fā)展。

80年代研究的重點轉(zhuǎn)向了詞匯量的積累,以及連續(xù)的語音識別,也就是從傳統(tǒng)的基于標準模板匹配的技術(shù)思路轉(zhuǎn)變基于統(tǒng)計模型的技術(shù)思路。此外,再次提出了將神經(jīng)網(wǎng)絡技術(shù)引入語音識別的技術(shù)思路。

理論:聲學模型—隱馬爾科夫模型(Hidden Markov Model,HMM)

語言模型—N-gram模型

(3)應用開發(fā)

90年代,語音識別研究的重點轉(zhuǎn)向自然語言的識別處理,任務轉(zhuǎn)移到航空旅行信息的索取。同時,語音識別技術(shù)不斷應用于電話網(wǎng)絡,增強話務員服務和自動化。

2000年以來,人機語音交互成為研究的焦點。研究重點包括即興口語的識別和理解,自然口語對話,以及多語種的語音同聲翻譯。

理論:聲學模型—隱馬爾科夫模型—深度神經(jīng)網(wǎng)絡(Deep Neural Network,DNN)

語言模型—N-gram模型—反饋神經(jīng)網(wǎng)絡(Feedback Neural Network,F(xiàn)NN)

語音識別領(lǐng)域公司

科大訊飛,騰訊,百度,蘇州思必馳,捷通華聲,云知聲等等。

結(jié)語

隨著語音識別技術(shù)的不斷發(fā)展,無論是Siri、Echo,還是其他的智能語音助手都可以接觸和管理消息、郵件和日程帳號,還能控制聯(lián)網(wǎng)家居,播放音樂,甚至完成網(wǎng)絡搜索或者更多的事情。而我們,只需滿懷期待。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學習之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 語音識別
    +關(guān)注

    關(guān)注

    39

    文章

    1795

    瀏覽量

    115078
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關(guān)推薦
    熱點推薦

    語音識別系統(tǒng)的技術(shù)核心:從聲音到文字的智能轉(zhuǎn)換

    ? ? ? 語音識別技術(shù),也稱為自動語音識別(ASR),其核心目標是將人類語音信號轉(zhuǎn)換為對應的文
    的頭像 發(fā)表于 09-05 14:04 ?302次閱讀

    語音識別---大家怎么看呢?

    語音識別是一門交叉學科。近二十年來,語音識別技術(shù)取得顯著進步,開始從實驗室走向市場。人們預計,未來10年內(nèi),
    發(fā)表于 08-09 10:54

    普強信息入選2024語音識別技術(shù)公司TOP30榜單

    普強憑借在語音識別領(lǐng)域多年的技術(shù)積淀與持續(xù)的創(chuàng)新突破,成功入選“2024語音識別技術(shù)公司TOP3
    的頭像 發(fā)表于 04-18 17:25 ?908次閱讀

    半導體材料發(fā)展史:從硅基到超寬禁帶半導體的跨越

    半導體材料是現(xiàn)代信息技術(shù)的基石,其發(fā)展史不僅是科技進步的縮影,更是人類對材料性能極限不斷突破的見證。從第一代硅基材料到第四代超寬禁帶半導體,每一代材料的迭代都推動了電子器件性能的飛躍。 1 第一代
    的頭像 發(fā)表于 04-10 15:58 ?1853次閱讀

    語音識別技術(shù)在通信領(lǐng)域中的應用實例

    語音識別技術(shù)也被稱為自動語音識別(Automatic Speech Recognition,ASR),是通過計算機對
    的頭像 發(fā)表于 02-21 17:12 ?919次閱讀

    詳解語音識別技術(shù)在通信領(lǐng)域中的應用

    語音識別技術(shù)也被稱為自動語音識別(Automatic Speech Recognition,ASR),是通過計算機對
    的頭像 發(fā)表于 02-21 17:05 ?948次閱讀
    詳解<b class='flag-5'>語音</b><b class='flag-5'>識別</b><b class='flag-5'>技術(shù)</b>在通信領(lǐng)域中的應用

    離線語音識別技術(shù)引領(lǐng)智能語音燈具市場——NRK3502

    智能語音燈具集高科技與人性化設計,內(nèi)置NRK3502離線語音識別芯片,支持遠場識別與自定義指令,提供便捷智能體驗,推動智能家居行業(yè)發(fā)展。
    的頭像 發(fā)表于 12-30 15:04 ?1081次閱讀
    離線<b class='flag-5'>語音</b><b class='flag-5'>識別</b><b class='flag-5'>技術(shù)</b>引領(lǐng)智能<b class='flag-5'>語音</b>燈具市場——NRK3502

    基于語音識別的智能會議系統(tǒng)具備哪些交互功能

    標貝科技專注智能語音交互領(lǐng)域多年,在語音識別語音合成領(lǐng)域有著多項大型企業(yè)合作案例,標貝與多個智能會議系統(tǒng)廠商合作,成功將語音
    的頭像 發(fā)表于 12-20 10:35 ?785次閱讀

    淺談顯示屏的發(fā)展史

    顯示器如今已成為日常辦公、娛樂不可或缺的一部分,它是人們與機器之間交互的窗口,隨著顯示器技術(shù)的不斷發(fā)展,也讓人機交互體驗提升了一個又一個新的臺階,時至今日,歷經(jīng)超100年的發(fā)展。從早期的黑白世界到彩色世界,顯示器走過了漫長而艱辛
    的頭像 發(fā)表于 12-18 09:12 ?3358次閱讀

    語音識別技術(shù)在醫(yī)療領(lǐng)域的應用

    語音識別技術(shù)在醫(yī)療領(lǐng)域的應用已經(jīng)越來越廣泛,為醫(yī)療服務帶來了諸多便利和效率提升。以下是對語音識別技術(shù)
    的頭像 發(fā)表于 11-26 09:35 ?1535次閱讀

    語音識別在智能家居中的應用

    隨著科技的飛速發(fā)展,智能家居逐漸成為人們生活中不可或缺的一部分。智能家居系統(tǒng)通過物聯(lián)網(wǎng)技術(shù)將家中的各種設備連接起來,實現(xiàn)遠程控制和自動化管理。在眾多的控制方式中,語音識別
    的頭像 發(fā)表于 11-26 09:31 ?1812次閱讀

    語音識別與自然語言處理的關(guān)系

    在人工智能的快速發(fā)展中,語音識別和自然語言處理(NLP)成為了兩個重要的技術(shù)支柱。語音識別
    的頭像 發(fā)表于 11-26 09:21 ?1916次閱讀

    語音識別技術(shù)的應用與發(fā)展

    語音識別技術(shù)發(fā)展可以追溯到20世紀50年代,但直到近年來,隨著計算能力的提升和機器學習技術(shù)的進步,這項
    的頭像 發(fā)表于 11-26 09:20 ?2054次閱讀

    ASR與傳統(tǒng)語音識別的區(qū)別

    ASR(Automatic Speech Recognition,自動語音識別)與傳統(tǒng)語音識別在多個方面存在顯著的區(qū)別。以下是對這兩者的對比: 一、
    的頭像 發(fā)表于 11-18 15:22 ?1801次閱讀

    ASR語音識別技術(shù)應用

    ASR(Automatic Speech Recognition)語音識別技術(shù),是計算機科學與人工智能領(lǐng)域的重要突破,能將人類語音轉(zhuǎn)換為文本,廣泛應用于智能家居、醫(yī)療、交通等多個領(lǐng)域。
    的頭像 發(fā)表于 11-18 15:12 ?2552次閱讀