各位编程爱好者,有没有想过,为什么我们在手机里说“Hi Siri”,手机就能立刻响应呢?其实,这就是语音唤醒技术(KWS)的功劳。今天,我就来跟大家聊聊这个技术,看看它是怎么在手机里实现的。
首先,我们来了解一下语音唤醒技术的背景。由于目前手机的CPU还不够强大,无法直接在手机上运行复杂的语音识别算法,所以通常会将语音识别的工作交给服务器(云端)来完成。这样一来,虽然存在隐私泄露和网络依赖等问题,但也是目前比较常见的解决方案。
那么,是不是意味着手机上就无法实现语音识别了呢?其实并不是。手机上的语音唤醒功能就是需要在手机上实现的。它的工作原理是,我们设定一个唤醒词,比如“Hi Siri”,只有当我们说出这个唤醒词时,手机上的语音识别功能才会启动,否则就会处于休眠状态,这样可以降低功耗,延长续航时间。
接下来,我们来看看不同的公司是如何实现语音唤醒技术的。
Google:基于CNN实现的算法,属于Deep KWS方案。他们的算法在“漏警率”(FRR)方面表现优秀,比DNN方案提升了27%~44%。
Baidu:基于CRNN实现的算法KWS方案。CRNN(卷积循环神经网络)结合了CNN和RNN的优势,对信噪比大的场景很有帮助。
Apple:基于DNN实现的算法KWS方案。Apple的方案使用了两个DNN模型,一个计算量较小,用于预检,另一个计算量较大,用于精确计算。如果识别结果满足阈值要求,就会触发Siri。
以上就是语音唤醒技术KWS的介绍。希望这篇文章能帮助大家更好地理解这项技术。
——顺亿/趣航编程网(www.vqhf.com)
