91欧美超碰AV自拍|国产成年人性爱视频免费看|亚洲 日韩 欧美一厂二区入|人人看人人爽人人操aV|丝袜美腿视频一区二区在线看|人人操人人爽人人爱|婷婷五月天超碰|97色色欧美亚州A√|另类A√无码精品一级av|欧美特级日韩特级

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

探索自動(dòng)語音識(shí)別技術(shù)的獨(dú)特應(yīng)用

星星科技指導(dǎo)員 ? 來源:NVIDIA ? 作者:David Taubenheim ? 2022-10-11 09:55 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

自動(dòng)語音識(shí)別( ASR )正在成為日常生活的一部分,從與數(shù)字助理交互到聽寫文本信息。由于以下方面的最新進(jìn)展, ASR 研究繼續(xù)取得進(jìn)展:

ASR 為多個(gè)架構(gòu)建模以滿足需求

在特定行業(yè)的行話、語言、口音和方言方面具有定制靈活性

云、預(yù)部署或混合部署選項(xiàng)

這篇文章首先介紹了常見的 ASR 應(yīng)用程序,然后介紹了兩個(gè)初創(chuàng)公司,他們正在探索 ASR 作為核心產(chǎn)品功能的獨(dú)特應(yīng)用。

語音識(shí)別系統(tǒng)的工作原理

自動(dòng)語音識(shí)別 或語音識(shí)別,是計(jì)算機(jī)系統(tǒng)從音頻中破譯口語單詞和短語并將其轉(zhuǎn)錄成書面文本的能力。開發(fā)人員也可以將 ASR 稱為語音到文本,不要與文本到語音( TTS )混淆。

ASR 系統(tǒng)的文本輸出可能是語音 AI 接口的最終產(chǎn)品,或 會(huì)話人工智能 系統(tǒng)可能會(huì)消耗文本。

常見 ASR 應(yīng)用

ASR 已經(jīng)成為新型交互式產(chǎn)品和服務(wù)的網(wǎng)關(guān)。即使現(xiàn)在,您也可以考慮使用下面詳細(xì)介紹的用例的品牌系統(tǒng):

現(xiàn)場字幕和轉(zhuǎn)錄

實(shí)時(shí)字幕和轉(zhuǎn)錄是兄弟。兩者之間的主要區(qū)別是字幕產(chǎn)生字幕 根據(jù)需要,為流媒體電影等視頻節(jié)目直播。相比之下,轉(zhuǎn)錄可以在現(xiàn)場或批處理模式下進(jìn)行,其中錄制的音頻片段的轉(zhuǎn)錄速度比實(shí)時(shí)快幾個(gè)數(shù)量級(jí)。

虛擬助理和聊天機(jī)器人

虛擬助手和聊天機(jī)器人與人們互動(dòng),既提供幫助,也提供娛樂。他們可以從用戶輸入的文本或 ASR 系統(tǒng)接收基于文本的輸入,因?yàn)?ASR 系統(tǒng)識(shí)別并輸出用戶的單詞。

助手和機(jī)器人需要足夠快地向用戶發(fā)出響應(yīng),因此處理延遲是不可察覺的。響應(yīng)可能是純文本、合成語音或圖像。

語音命令和聽寫

語音命令和聽寫系統(tǒng)是社交媒體平臺(tái)和醫(yī)療行業(yè)使用的常見 ASR 應(yīng)用。

為了提供一個(gè)社交媒體示例,在移動(dòng)設(shè)備上錄制視頻之前,用戶可能會(huì)發(fā)出語音命令以激活美容過濾器:“給我紫色頭發(fā)”。該社交網(wǎng)絡(luò)應(yīng)用程序涉及一個(gè)支持 ASR 的子系統(tǒng),該子系統(tǒng)以命令的形式接收用戶的話語,同時(shí)應(yīng)用程序同時(shí)處理攝像機(jī)輸入并應(yīng)用過濾器進(jìn)行屏幕顯示。

聽寫系統(tǒng)存儲(chǔ)語音中的文本,擴(kuò)展了 語音人工智能系統(tǒng) 超越命令。為了提供醫(yī)療保健行業(yè)的一個(gè)例子,醫(yī)生口述包含醫(yī)學(xué)術(shù)語和名稱的語音注釋。準(zhǔn)確的文本輸出可以添加到患者電子病歷中的就診摘要中。

獨(dú)特的 ASR 應(yīng)用

除了這些常見用例之外,研究人員和企業(yè)家正在探索各種獨(dú)特的 ASR 應(yīng)用。以下兩個(gè)初創(chuàng)公司正在開發(fā)以新穎方式使用該技術(shù)的產(chǎn)品。

互動(dòng)學(xué)習(xí): Tarteel AI

ASR 的創(chuàng)造性應(yīng)用開始出現(xiàn)在教育材料中,特別是以互動(dòng)學(xué)習(xí)的形式出現(xiàn)在兒童和成人中。

挑戰(zhàn)和解決辦法

雖然應(yīng)用程序現(xiàn)在運(yùn)行順利,但 Tarteel 面臨著一系列艱難的初始挑戰(zhàn)。首先,古蘭經(jīng)阿拉伯語沒有合適的 ASR 模型,最初迫使塔特爾嘗試通用 ASR 模型。

Tarteel Anas-Abou Allaban 的聯(lián)合創(chuàng)始人兼首席執(zhí)行官說:“我們從設(shè)備上的語音人工智能框架開始,就像智能手機(jī)一樣,但它們的設(shè)計(jì)更多是為了命令和短句,而不是精確的背誦?!??!八鼈円膊皇巧a(chǎn)級(jí)別的工具,甚至不接近。”

為了克服這一挑戰(zhàn), Tarteel 構(gòu)建了一個(gè)自定義數(shù)據(jù)集來完善現(xiàn)有的 ASR 模型,以滿足應(yīng)用程序的性能目標(biāo)。然后,在他們的下一個(gè)原型中, ASR 模型確實(shí)以較低的字錯(cuò)誤率( WER )運(yùn)行,但仍不能滿足應(yīng)用程序的實(shí)際精度和延遲要求。

阿拉班指出,他在一些電話會(huì)議記錄中看到了 10-15% 的正確率,但在古蘭經(jīng)研究中看到高正確率是另一回事。他說,應(yīng)用程序中超過 300 毫秒的處理延遲“變得非常煩人”。

Tarteel 通過調(diào)整其在 NVIDIA NeMo 框架中的 ASR 模型并在使用 Riva 在 Triton 推理服務(wù)器上部署之前使用 TensorRT 進(jìn)一步優(yōu)化其延遲來應(yīng)對(duì)這些挑戰(zhàn)。

數(shù)字人類服務(wù):Ex-human

創(chuàng)業(yè)公司 Ex human 正在創(chuàng)造超現(xiàn)實(shí)的數(shù)字人 與模擬人(你和我)互動(dòng)。他們目前的重點(diǎn)是為娛樂利基開發(fā) B2B 數(shù)字人類服務(wù),使之能夠創(chuàng)建具有獨(dú)特個(gè)性、知識(shí)和現(xiàn)實(shí)說話聲音的聊天機(jī)器人或游戲角色。

在公司 Botify AI 應(yīng)用 ,人工智能實(shí)體包括名人,通過口頭和圖形交互與用戶互動(dòng),無論您是在智能手機(jī)聊天窗口中打字還是使用語音。 NVIDIA Riva 自動(dòng)語音識(shí)別為數(shù)字人類的自然語言處理子系統(tǒng)提供文本輸入,作為大型語言模型( LLM )的一部分。

為了使虛擬交互可信,需要精確和快速的 ASR 。由于 LLM 是計(jì)算密集型的,并且需要大量的處理資源,因此對(duì)于交互來說,它們可能運(yùn)行得太慢。

例如, Botify AI 應(yīng)用最先進(jìn)的 TTS 來產(chǎn)生語音音頻響應(yīng),進(jìn)而使用另一種 AI 模型驅(qū)動(dòng)面部動(dòng)畫。該團(tuán)隊(duì)觀察到,當(dāng)響應(yīng)的周轉(zhuǎn)時(shí)間短于約三分之一秒時(shí),機(jī)器人與用戶的可信交互處于最佳狀態(tài)。

挑戰(zhàn)和解決辦法

雖然 Botify 人工智能正在努力彌合人工智能生成的真實(shí)視頻與真實(shí)人類之間的差距,但 Ex-human 團(tuán)隊(duì)對(duì)其客戶行為數(shù)據(jù)的分析感到驚訝。“他們正在打造自己的新動(dòng)漫人物,”Ex-human 的創(chuàng)始人兼首席執(zhí)行官阿泰姆·羅迪切夫( Artem Rodichev )說。

通過使用為 Botify AI 生態(tài)系統(tǒng)微調(diào)的 ASR 模型,用戶可以與自己喜愛的個(gè)性進(jìn)行交流或創(chuàng)建自己的個(gè)性。在上傳自定義人臉的背景下,構(gòu)建新動(dòng)畫角色的令人驚訝的模式出現(xiàn)了,通過自定義角色將對(duì)話帶入生活。 Rodichev 解釋說,他的團(tuán)隊(duì)需要快速調(diào)整他們的人工智能模型,以處理例如在風(fēng)格上只是一個(gè)點(diǎn)或一條線的嘴。

Rodichev 和他的團(tuán)隊(duì)通過仔細(xì)選擇工具和 SDK 以及評(píng)估并行處理的機(jī)會(huì),克服了 Ex-human 架構(gòu)中的許多挑戰(zhàn)。 Rodichev 警告說:“由于延遲非常重要,我們使用 NVIDIA TensorRT 優(yōu)化了 ASR 模型和其他模型,并依賴于 Triton 推理服務(wù)器。”

Botify AI 用戶是否準(zhǔn)備好與數(shù)字人類而不是模擬人類互動(dòng)?數(shù)據(jù)顯示,用戶平均每天花 40 分鐘與 Botify 人工智能數(shù)字人在一起,在這段時(shí)間內(nèi)發(fā)送他們最喜歡的數(shù)百條信息。

開始使用 ASR

您可以開始在自己的設(shè)計(jì)和項(xiàng)目中包括 ASR 功能,從免提語音命令到實(shí)時(shí)轉(zhuǎn)錄。 Riva 等高級(jí) SDK 在世界級(jí)的準(zhǔn)確性、速度、延遲和易集成性方面表現(xiàn)出高性能,所有這些都與您的新想法一致。

關(guān)于作者

David Taubenheim 是 NVIDIA Inception 項(xiàng)目的高級(jí)解決方案架構(gòu)師,該項(xiàng)目是初創(chuàng)企業(yè)的加速器。他目前的技術(shù)重點(diǎn)領(lǐng)域是加速計(jì)算和對(duì)話 AI 使能器。 David 擁有國立技術(shù)大學(xué)的電氣工程碩士學(xué)位和伊利諾伊大學(xué)香檳分校的電氣工程學(xué)士學(xué)位。

審核編輯:郭婷

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • NVIDIA
    +關(guān)注

    關(guān)注

    14

    文章

    5598

    瀏覽量

    109810
  • 語音識(shí)別
    +關(guān)注

    關(guān)注

    39

    文章

    1812

    瀏覽量

    116071
收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評(píng)論

    相關(guān)推薦
    熱點(diǎn)推薦

    瑞芯微(EASY EAI)RV1126B 語音識(shí)別

    1.語音識(shí)別簡介語音識(shí)別技術(shù),也被稱為自動(dòng)語音
    的頭像 發(fā)表于 01-21 10:43 ?861次閱讀
    瑞芯微(EASY EAI)RV1126B <b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>

    語音識(shí)別IC分類,語音識(shí)別芯片的工作原理

    語音識(shí)別芯片,也叫語音識(shí)別集成電路,是一種集聲音存儲(chǔ)、播放、錄音及語音識(shí)別功能于一體的專用芯片。
    的頭像 發(fā)表于 01-14 15:22 ?254次閱讀
    <b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>IC分類,<b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>芯片的工作原理

    語音識(shí)別芯片有哪些(語音識(shí)別芯片AT680系列)

    在人工智能技術(shù)飛速發(fā)展的今天,語音識(shí)別芯片作為人機(jī)交互的重要橋梁,正逐漸成為各類智能設(shè)備不可或缺的核心部件。與傳統(tǒng)的語音芯片不同,語音
    的頭像 發(fā)表于 11-14 17:11 ?1396次閱讀

    廣州唯創(chuàng)電子WTK6900H-32N語音識(shí)別芯片:智能語音控制賦能LED燈帶創(chuàng)新應(yīng)用 | 語音IC廠家

    在智能家居快速發(fā)展的今天,語音控制技術(shù)正以其獨(dú)特的便捷性和智能化特性,重新定義著人們與家居環(huán)境的交互方式。廣州唯創(chuàng)電子作為國內(nèi)領(lǐng)先的語音IC廠家,推出的WTK6900H-32N(S00
    的頭像 發(fā)表于 11-04 08:53 ?690次閱讀
    廣州唯創(chuàng)電子WTK6900H-32N<b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>芯片:智能<b class='flag-5'>語音</b>控制賦能LED燈帶創(chuàng)新應(yīng)用 | <b class='flag-5'>語音</b>IC廠家

    什么是離線語音識(shí)別芯片(離線語音識(shí)別芯片有哪些優(yōu)點(diǎn))

    離線語音識(shí)別芯片,是一種集成了語音信號(hào)采集、前端處理和本地識(shí)別功能的專用集成電路,無須聯(lián)網(wǎng)也可以進(jìn)行語音控制。它內(nèi)設(shè)先進(jìn)的數(shù)字信號(hào)處理模塊及
    的頭像 發(fā)表于 10-31 15:27 ?526次閱讀

    如何選擇合適的語音識(shí)別芯片型號(hào)

    語音識(shí)別芯片(又稱語音識(shí)別IC)是現(xiàn)代智能設(shè)備的核心組件,與傳統(tǒng)語音芯片相比,其最大特點(diǎn)是能夠主動(dòng)識(shí)別
    的頭像 發(fā)表于 10-30 16:32 ?632次閱讀

    語音識(shí)別系統(tǒng)的技術(shù)核心:從聲音到文字的智能轉(zhuǎn)換

    ? ? ? 語音識(shí)別技術(shù),也稱為自動(dòng)語音識(shí)別(ASR),其核心目標(biāo)是將人類
    的頭像 發(fā)表于 09-05 14:04 ?858次閱讀

    瑞芯微RK3576語音識(shí)別算法

    1.語音識(shí)別簡介語音識(shí)別技術(shù),也被稱為自動(dòng)語音
    的頭像 發(fā)表于 08-15 15:13 ?2202次閱讀
    瑞芯微RK3576<b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>算法

    語音識(shí)別---大家怎么看呢?

    語音識(shí)別是一門交叉學(xué)科。近二十年來,語音識(shí)別技術(shù)取得顯著進(jìn)步,開始從實(shí)驗(yàn)室走向市場。人們預(yù)計(jì),未來10年內(nèi),
    發(fā)表于 08-09 10:54

    EASY EAl Orin Nano(RK3576) whisper語音識(shí)別訓(xùn)練部署教程

    1Whisper簡介Whisper是OpenAI開源的,識(shí)別語音識(shí)別能力已達(dá)到人類水準(zhǔn)自動(dòng)語音識(shí)別
    的頭像 發(fā)表于 07-25 15:21 ?862次閱讀
    EASY EAl Orin Nano(RK3576) whisper<b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>訓(xùn)練部署教程

    EASY EAl Orin Nano(RK3576) whisper語音識(shí)別訓(xùn)練部署教程

    Whisper是OpenAI開源的,識(shí)別語音識(shí)別能力已達(dá)到人類水準(zhǔn)自動(dòng)語音識(shí)別系統(tǒng)。Whispe
    的頭像 發(fā)表于 07-17 14:55 ?1789次閱讀
    EASY EAl Orin Nano(RK3576) whisper<b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>訓(xùn)練部署教程

    NRK3502語音識(shí)別芯片:開啟自動(dòng)炒菜機(jī)智能烹飪新時(shí)代

    "動(dòng)口不動(dòng)手"的烹飪革命來了!NRK3502語音芯片讓自動(dòng)炒菜機(jī)聽懂你的每句話,3-5米遠(yuǎn)場精準(zhǔn)識(shí)別,在油煙嘈雜中也能秒懂指令。從此預(yù)熱、炒菜、暫停全語音操控,邊做飯邊處理其他事,廚房
    的頭像 發(fā)表于 06-25 13:57 ?622次閱讀

    語音識(shí)別芯片選型有哪些技術(shù)參數(shù)要注意

    語音識(shí)別芯片的使用場景越來越多涉及的范圍也越來越廣!那么語音芯片的選型就很重要了,選型不對(duì)直接影響產(chǎn)品的使用體驗(yàn),下面小編從不同的維度來給大家介紹語音
    的頭像 發(fā)表于 06-23 17:31 ?888次閱讀
    <b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>芯片選型有哪些<b class='flag-5'>技術(shù)</b>參數(shù)要注意

    普強(qiáng)信息入選2024語音識(shí)別技術(shù)公司TOP30榜單

    普強(qiáng)憑借在語音識(shí)別領(lǐng)域多年的技術(shù)積淀與持續(xù)的創(chuàng)新突破,成功入選“2024語音識(shí)別技術(shù)公司TOP3
    的頭像 發(fā)表于 04-18 17:25 ?1227次閱讀

    廠家芯資訊|廣州唯創(chuàng)電子語音識(shí)別芯片技術(shù)解析

    ?一、公司及產(chǎn)品概述作為國內(nèi)領(lǐng)先的語音芯片研發(fā)企業(yè),深耕語音技術(shù)領(lǐng)域25年,其產(chǎn)品以高穩(wěn)定性、低功耗和多場景適應(yīng)性著稱。公司推出的語音識(shí)別
    的頭像 發(fā)表于 03-19 08:46 ?819次閱讀
    廠家芯資訊|廣州唯創(chuàng)電子<b class='flag-5'>語音</b><b class='flag-5'>識(shí)別</b>芯片<b class='flag-5'>技術(shù)</b>解析