91欧美超碰AV自拍|国产成年人性爱视频免费看|亚洲 日韩 欧美一厂二区入|人人看人人爽人人操aV|丝袜美腿视频一区二区在线看|人人操人人爽人人爱|婷婷五月天超碰|97色色欧美亚州A√|另类A√无码精品一级av|欧美特级日韩特级

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

微軟或?qū)l(fā)布深度神經(jīng)網(wǎng)絡(luò)語音系列產(chǎn)品

璟琰乀 ? 來源:智能相對論 ? 作者:智能相對論 ? 2020-12-01 16:23 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

以往,談及對合成語音的刻板印象,很多人會聯(lián)想到《星球大戰(zhàn)》中的C-3PO——那個有著近似人類外形金光閃閃的家伙,它是整個系列影片中毫無爭議的搞笑擔(dān)當(dāng),其動作僵硬而滑稽,說起話來喋喋不休,聲音中混雜著輕微的交流聲和金屬質(zhì)感的回聲。直到今天,它那獨特的嗓音,仍然是很多科幻片中人工智能發(fā)聲的模板。

第一部《星球大戰(zhàn)》公映于1977年,彼時,個人電腦才剛剛走出實驗室,人們對于人工智能的想象力仍受限于時代。去年,該系列推出了最后一部作品《星球大戰(zhàn):天行者崛起》,C-3PO的聲音還是人們熟悉的老樣子。而現(xiàn)實中,智能語音技術(shù)飛速發(fā)展,取而代之的是聽感越來越趨于自然、逼真的“合成人聲”,讓越來越多的企業(yè)于實現(xiàn)了與客戶的多模態(tài)互動。

合成人聲的用途相當(dāng)廣泛,我們熟知的便是手機(jī)中的語音助手,用戶可通過簡單的人機(jī)對話,獲知天氣、路況等實時信息,也可命令手機(jī)完成撥號、查詢等任務(wù)。這一類應(yīng)用被稱作實時語音合成,它對基于云的計算力提出了很高的要求,除了需要對聲音的自然度不斷地進(jìn)行優(yōu)化外,實時合成對于語音合成引擎和平臺架構(gòu)也都有著極高的要求,必須保障在極低的延遲下,提供準(zhǔn)確、穩(wěn)定、自然的聲音內(nèi)容。另一類常見的應(yīng)用是利用人工智能語音合成有聲內(nèi)容,這類應(yīng)用通常會在語音服務(wù)端進(jìn)行非實時的批量合成,然后再將有聲內(nèi)容文件提供給用戶。有聲內(nèi)容合成的主要挑戰(zhàn)在于如何通過多種角色扮演和豐富情感表達(dá),降低聽眾單向接收有聲內(nèi)容的聽覺疲勞。

以往,有聲書需要由專業(yè)朗誦者來錄制,制作周期長達(dá)數(shù)月且成本高昂。如今,通過智能合成語音錄制有聲書,制作周期可縮短至幾小時,甚至是幾分鐘。即便在需要人工干預(yù)校對和聲音編輯的情況下,制作周期也可縮短至數(shù)周,節(jié)省了大量的人力、物力及時間成本,且得到的效果幾乎與真人朗誦別無二致。今年的“世界讀書日”,由周迅與公益組織紅丹丹聯(lián)合發(fā)起的為視障人士讀書活動,向我們展示了語音合成技術(shù)的新高度。在此之前,創(chuàng)建一個高質(zhì)量的語音合成模型需要以大量真人原聲為樣本進(jìn)行機(jī)器學(xué)習(xí),樣本量通常會超過10小時或10000句。而這次公益活動的主辦方采用了由微軟最新開發(fā)的深度神經(jīng)網(wǎng)絡(luò)語音合成定制系統(tǒng),只采集了半小時大約500句的周迅原聲錄音,便通過深度定制的語音模型,惟妙惟肖地復(fù)原了周迅的聲音。

這里所說的“復(fù)原”不只是周迅頗具特色的聲線,也包括周迅在朗讀時的語氣、情緒、語調(diào)、抑揚頓挫等。可以想象,隨著這一技術(shù)的普及,有聲書行業(yè)也將隨之發(fā)生巨大的改變。微軟將在國際殘疾人日捐贈的100小時有聲書籍正昭示著這種改變的開始。

微軟深度神經(jīng)網(wǎng)絡(luò)是基于Azure云的端到端語音合成系統(tǒng),由前端、聲學(xué)模型和聲碼器三部分組成。前端主要解決基于語義理解的文本發(fā)音問題,比如“2020”在表示年份和數(shù)字時的讀法不一樣,這是上下文關(guān)聯(lián)問題;再比如“堡”字,用于地名時應(yīng)讀作“鋪”,“解”用在姓氏上應(yīng)讀作“謝”,這都是多音字問題;還有“一會兒”這類詞,不能讀成三個字,后兩個字應(yīng)合并為兒化音,這是語言習(xí)慣問題。聲學(xué)模型負(fù)責(zé)為語音賦予韻律,比如語速、語調(diào)、停頓、重音和情緒變化等。最后一部分聲碼器負(fù)責(zé)還原語音的聲學(xué)特征,也就是一般所說的嗓音或聲線,如振幅、頻率、波長等。

深度神經(jīng)網(wǎng)絡(luò)模型是當(dāng)前最先進(jìn)的語音合成技術(shù),但相應(yīng)的主流產(chǎn)品在合成效率、效果,以及所需聲音樣本量上,卻存在很大差異。以樣本量為例,微軟的語音合成定制技術(shù)處于行業(yè)領(lǐng)先地位,一般情況下,只需要不超過2000句的內(nèi)容,就可以做到非常逼真的還原。那么,在周迅的案例中,是如何做到只需500句甚至更少的聲音素材就達(dá)到類似效果呢?微軟還有一個“殺器”——通用模型。通用模型是在對海量語料庫進(jìn)行大數(shù)據(jù)分析的基礎(chǔ)上,不斷訓(xùn)練深度神經(jīng)網(wǎng)絡(luò)去學(xué)習(xí)人類語言與發(fā)聲特征后得到的。目前微軟通用語料庫的容量已經(jīng)超過3000小時,覆蓋了50多個語種,通過它提煉出來的通用模型已經(jīng)熟練掌握了這50多種語言的幾乎全部發(fā)聲規(guī)律,甚至包括真人說話時換氣和咽口水的細(xì)節(jié)都可以模仿出來。當(dāng)微軟需要基于像周迅這樣只有500句話甚至更少內(nèi)容的語料庫做語音定制時,便可以在通用模型基礎(chǔ)上,通過遷移學(xué)習(xí)法來建立周迅聲音的擴(kuò)展模型。

目前,微軟的語音合成定制系統(tǒng)只需要半小時左右的聲音樣本便可建立定制語音模型,與傳統(tǒng)TTS建模所需的至少10小時或10000句的聲音樣本量相比,是一個從量到質(zhì)的飛躍。這一飛躍使得面向更多的企業(yè)甚至于普通消費者的個人聲音定制成為可能。

微軟之所以能在語音合成領(lǐng)域保持領(lǐng)先地位,主要得益于其20多年來在算法和定制模型上所積累的深厚功力。自從1991年微軟研究院成立以來,微軟一直將語音作為主要的研究領(lǐng)域,儲備、積累了大量的人工智能相關(guān)技術(shù)。2018年9月,微軟率先開始測試基于深度神經(jīng)網(wǎng)絡(luò)的端到端語音合成系統(tǒng),為人工智能語音技術(shù)的發(fā)展揭開了新的一頁。

前不久,微軟將其定制的通用中文發(fā)聲與市場上的主流產(chǎn)品進(jìn)行了盲測對比,微軟的MOS得分(5分制)為4.35,居于領(lǐng)先地位,表明合成語音與真人聲音已經(jīng)非常接近(真人的MOS得分為4.41)。

除了語音助手和有聲書籍錄制外,語音合成技術(shù)還廣泛應(yīng)用于智能語音客服領(lǐng)域,這也是微軟目前在to B領(lǐng)域的主要發(fā)力點,比如很多航空公司、電商平臺、電信運營商等都在嘗試使用微軟的智能語音客服來緩解人工壓力。智能語音客服可以解決很多常見的標(biāo)準(zhǔn)化問題,減少客戶的等待時間,為客戶帶來更好的服務(wù)體驗。在應(yīng)對突發(fā)事件方面,智能語音客服更有得天獨厚的優(yōu)勢,很多突發(fā)事件都會造成客戶咨詢量在短時間內(nèi)爆發(fā)式增長,在這種情況下,企業(yè)如果增設(shè)人工客服,一方面可能在時間上來不及,另一方面?zhèn)}促上崗也可能導(dǎo)致服務(wù)質(zhì)量的難以保證。

目前,微軟為企業(yè)定制智能語音客服大致需要300至2000句語料訓(xùn)練,以滿足特定應(yīng)用場景的需求;對于需要定制適用于多場景、富有多種情緒甚至涵蓋多語種的品牌聲音的企業(yè)而言,語料訓(xùn)練則有更高要求。

上述兩種定制目前都會有人工參與測試和適當(dāng)調(diào)校并向客戶提供靈活的接入方式,即通過APISDK接入微軟的Azure公有云,實現(xiàn)端到端的實時合成。如果客戶有特殊需求,產(chǎn)品也可部署在私有云甚至離線設(shè)備中。未來,這兩種系統(tǒng)都將實現(xiàn)自動化定制。實際上,微軟已經(jīng)邀請合作伙伴開始小范圍的自動化系統(tǒng)測試,可能在不久的將來正式發(fā)布此系列產(chǎn)品。

可以預(yù)期,伴隨著相關(guān)技術(shù)的發(fā)展,智能語音在個人及商業(yè)領(lǐng)域中的應(yīng)用場景將更加豐富,不斷細(xì)分的合成語音服務(wù)也會給我們帶來更多的體驗和驚喜。同時,微軟提出了人工智能六項倫理道德準(zhǔn)則:公平、可靠和安全、隱私和保證、包容、透明和責(zé)任。倡導(dǎo)負(fù)責(zé)任的人工智能。這些原則將為人工智能的發(fā)展保駕護(hù)航,予力全球每一人、每一組織,成就不凡!

責(zé)任編輯:haq

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 微軟
    +關(guān)注

    關(guān)注

    4

    文章

    6749

    瀏覽量

    108035
  • 神經(jīng)網(wǎng)絡(luò)

    關(guān)注

    42

    文章

    4839

    瀏覽量

    108052
  • 人工智能
    +關(guān)注

    關(guān)注

    1819

    文章

    50218

    瀏覽量

    266508
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關(guān)推薦
    熱點推薦

    面向嵌入式部署的神經(jīng)網(wǎng)絡(luò)優(yōu)化:模型壓縮深度解析

    1.為什么需要神經(jīng)網(wǎng)絡(luò)模型壓縮? 神經(jīng)網(wǎng)絡(luò)已經(jīng)成為解決復(fù)雜機(jī)器學(xué)習(xí)問題的強(qiáng)大工具。然而,這種能力往往伴隨著模型規(guī)模和計算復(fù)雜度的增加。當(dāng)輸入維度較大(例如長時序窗口、高分辨率特征空間)時,模型需要
    的頭像 發(fā)表于 02-24 15:37 ?5332次閱讀
    面向嵌入式部署的<b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>優(yōu)化:模型壓縮<b class='flag-5'>深度</b>解析

    【新品發(fā)布】艾為重磅發(fā)布端側(cè)AI高性能NPU語音芯片,打造智能語音體驗新標(biāo)桿

    數(shù)模龍頭艾為電子全新推出高性能NPU神經(jīng)網(wǎng)絡(luò)智能語音處理芯片:AWA89601,集成音頻專用NPU(神經(jīng)網(wǎng)絡(luò)處理器),通過聲音模型訓(xùn)練與NPU硬件結(jié)合,該芯片在AI降噪、AI人聲增強(qiáng)、AI遠(yuǎn)場拾音
    的頭像 發(fā)表于 01-07 18:33 ?479次閱讀
    【新品<b class='flag-5'>發(fā)布</b>】艾為重磅<b class='flag-5'>發(fā)布</b>端側(cè)AI高性能NPU<b class='flag-5'>語音</b>芯片,打造智能<b class='flag-5'>語音</b>體驗新標(biāo)桿

    神經(jīng)網(wǎng)絡(luò)的初步認(rèn)識

    日常生活中的智能應(yīng)用都離不開深度學(xué)習(xí),而深度學(xué)習(xí)則依賴于神經(jīng)網(wǎng)絡(luò)的實現(xiàn)。什么是神經(jīng)網(wǎng)絡(luò)?神經(jīng)網(wǎng)絡(luò)的核心思想是模仿生物
    的頭像 發(fā)表于 12-17 15:05 ?423次閱讀
    <b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>的初步認(rèn)識

    自動駕駛中常提的卷積神經(jīng)網(wǎng)絡(luò)是個啥?

    在自動駕駛領(lǐng)域,經(jīng)常會聽到卷積神經(jīng)網(wǎng)絡(luò)技術(shù)。卷積神經(jīng)網(wǎng)絡(luò),簡稱為CNN,是一種專門用來處理網(wǎng)格狀數(shù)據(jù)(比如圖像)的深度學(xué)習(xí)模型。CNN在圖像處理中尤其常見,因為圖像本身就可以看作是由像素排列成的二維網(wǎng)格。
    的頭像 發(fā)表于 11-19 18:15 ?2177次閱讀
    自動駕駛中常提的卷積<b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>是個啥?

    NMSIS神經(jīng)網(wǎng)絡(luò)庫使用介紹

    NMSIS NN 軟件庫是一組高效的神經(jīng)網(wǎng)絡(luò)內(nèi)核,旨在最大限度地提高 Nuclei N 處理器內(nèi)核上的神經(jīng)網(wǎng)絡(luò)的性能并最??大限度地減少其內(nèi)存占用。 該庫分為多個功能,每個功能涵蓋特定類別
    發(fā)表于 10-29 06:08

    在Ubuntu20.04系統(tǒng)中訓(xùn)練神經(jīng)網(wǎng)絡(luò)模型的一些經(jīng)驗

    , batch_size=512, epochs=20)總結(jié) 這個核心算法中的卷積神經(jīng)網(wǎng)絡(luò)結(jié)構(gòu)和訓(xùn)練過程,是用來對MNIST手寫數(shù)字圖像進(jìn)行分類的。模型圖像作為輸入,通過卷積和池化層提取圖像的特征,然后通過全連接層進(jìn)行分類預(yù)測。訓(xùn)練過程中,模型通過最小化損失函數(shù)來優(yōu)化
    發(fā)表于 10-22 07:03

    CICC2033神經(jīng)網(wǎng)絡(luò)部署相關(guān)操作

    讀取。接下來需要使用擴(kuò)展指令,完成神經(jīng)網(wǎng)絡(luò)的部署,此處僅對第一層卷積+池化的部署進(jìn)行說明,其余層與之類似。 1.使用 Custom_Dtrans 指令,權(quán)重數(shù)據(jù)、輸入數(shù)據(jù)導(dǎo)入硬件加速器內(nèi)。對于權(quán)重
    發(fā)表于 10-20 08:00

    液態(tài)神經(jīng)網(wǎng)絡(luò)(LNN):時間連續(xù)性與動態(tài)適應(yīng)性的神經(jīng)網(wǎng)絡(luò)

    1.算法簡介液態(tài)神經(jīng)網(wǎng)絡(luò)(LiquidNeuralNetworks,LNN)是一種新型的神經(jīng)網(wǎng)絡(luò)架構(gòu),其設(shè)計理念借鑒自生物神經(jīng)系統(tǒng),特別是秀麗隱桿線蟲的神經(jīng)結(jié)構(gòu),盡管這種微生物的
    的頭像 發(fā)表于 09-28 10:03 ?1459次閱讀
    液態(tài)<b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>(LNN):時間連續(xù)性與動態(tài)適應(yīng)性的<b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>

    神經(jīng)網(wǎng)絡(luò)的并行計算與加速技術(shù)

    隨著人工智能技術(shù)的飛速發(fā)展,神經(jīng)網(wǎng)絡(luò)在眾多領(lǐng)域展現(xiàn)出了巨大的潛力和廣泛的應(yīng)用前景。然而,神經(jīng)網(wǎng)絡(luò)模型的復(fù)雜度和規(guī)模也在不斷增加,這使得傳統(tǒng)的串行計算方式面臨著巨大的挑戰(zhàn),如計算速度慢、訓(xùn)練時間長等
    的頭像 發(fā)表于 09-17 13:31 ?1246次閱讀
    <b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>的并行計算與加速技術(shù)

    如何在機(jī)器視覺中部署深度學(xué)習(xí)神經(jīng)網(wǎng)絡(luò)

    圖 1:基于深度學(xué)習(xí)的目標(biāo)檢測可定位已訓(xùn)練的目標(biāo)類別,并通過矩形框(邊界框)對其進(jìn)行標(biāo)識。 在討論人工智能(AI)深度學(xué)習(xí)時,經(jīng)常會出現(xiàn)“神經(jīng)網(wǎng)絡(luò)”、“黑箱”、“標(biāo)注”等術(shù)語。這些概
    的頭像 發(fā)表于 09-10 17:38 ?997次閱讀
    如何在機(jī)器視覺中部署<b class='flag-5'>深度</b>學(xué)習(xí)<b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>

    無刷電機(jī)小波神經(jīng)網(wǎng)絡(luò)轉(zhuǎn)子位置檢測方法的研究

    摘要:論文通過對無刷電機(jī)數(shù)學(xué)模型的推導(dǎo),得出轉(zhuǎn)角:與三相相電壓之間存在映射關(guān)系,因此構(gòu)建了一個以三相相電壓為輸人,轉(zhuǎn)角為輸出的小波神經(jīng)網(wǎng)絡(luò)來實現(xiàn)轉(zhuǎn)角預(yù)測,并采用改進(jìn)遺傳算法來訓(xùn)練網(wǎng)絡(luò)結(jié)構(gòu)與參數(shù),借助
    發(fā)表于 06-25 13:06

    神經(jīng)網(wǎng)絡(luò)專家系統(tǒng)在電機(jī)故障診斷中的應(yīng)用

    摘要:針對傳統(tǒng)專家系統(tǒng)不能進(jìn)行自學(xué)習(xí)、自適應(yīng)的問題,本文提出了基于種經(jīng)網(wǎng)絡(luò)專家系統(tǒng)的并步電機(jī)故障診斷方法。本文小波神經(jīng)網(wǎng)絡(luò)和專家系統(tǒng)相結(jié)合,充分發(fā)揮了二者故障診斷的優(yōu)點,很大程度上降低了對電機(jī)
    發(fā)表于 06-16 22:09

    神經(jīng)網(wǎng)絡(luò)RAS在異步電機(jī)轉(zhuǎn)速估計中的仿真研究

    眾多方法中,由于其結(jié)構(gòu)簡單,穩(wěn)定性好廣泛受到人們的重視,且已被用于產(chǎn)品開發(fā)。但是MRAS仍存在在低速區(qū)速度估計精度下降和對電動機(jī)參數(shù)變化非常敏感的問題。本文利用神經(jīng)網(wǎng)絡(luò)的特點,使估計更為簡單、快速
    發(fā)表于 06-16 21:54

    基于FPGA搭建神經(jīng)網(wǎng)絡(luò)的步驟解析

    本文的目的是在一個神經(jīng)網(wǎng)絡(luò)已經(jīng)通過python或者M(jìn)ATLAB訓(xùn)練好的神經(jīng)網(wǎng)絡(luò)模型,訓(xùn)練好的模型的權(quán)重和偏置文件以TXT文件格式導(dǎo)出,然后通過python程序txt文件轉(zhuǎn)化為coe
    的頭像 發(fā)表于 06-03 15:51 ?1430次閱讀
    基于FPGA搭建<b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>的步驟解析

    AI神經(jīng)網(wǎng)絡(luò)降噪算法在語音通話產(chǎn)品中的應(yīng)用優(yōu)勢與前景分析

    語音保真度以及更低的延遲,能夠有效應(yīng)對復(fù)雜噪聲場景。本文探討AI神經(jīng)網(wǎng)絡(luò)降噪在語音通話產(chǎn)品中的核心優(yōu)勢,并分析其未來發(fā)展趨勢和市場前景
    的頭像 發(fā)表于 05-16 17:07 ?1708次閱讀
    AI<b class='flag-5'>神經(jīng)網(wǎng)絡(luò)</b>降噪算法在<b class='flag-5'>語音</b>通話<b class='flag-5'>產(chǎn)品</b>中的應(yīng)用優(yōu)勢與前景分析