|
|
1
8
这是一个巨大的问题,我不知道如何开始。。。所以,让我试着给你正确的“术语”,这样你就可以完善你的任务: 首先,要了解语音识别是一门多样而复杂的学科,它有许多不同的应用。人们倾向于将这个领域映射到他们想到的第一件事(通常是计算机理解你在IVR系统中所说的话)。因此,首先让我们将概念划分为以下几类: 人机对话: 处理理解人类所说内容的应用程序,但人类知道他正在与机器和 语法 这是非常有限的。例如
人与人之间
现在,从语音到文本不是你应该说的,你关心的。你关心的是解决一个问题。不同的技术被用来解决不同的问题。请参阅概述 here 他们中的一些人。总之,其他方法有语音转录、LVCSR和基于直接的。 另外,你有兴趣成为这项技术的博士吗?你需要一个硕士学位 信号处理 语音引擎 . 像Nuance和IBM这样的公司是大公司,但菲利普斯和其他初创公司也存在。
别误会我的意思,在IBM/Nuance的世界之外,还有很多关于搜索质量的工作要做。引擎通常是非常开放的,有很多算法调整要做,可以极大地影响性能。每个业务应用程序都有不同的约束条件和成本/收益函数,因此您可以进行多年的实验,构建更好的基于语音识别的应用程序。 还有一件事:一般来说,您还希望在堆栈的较低位置具有良好的统计背景。 很好,我们在这里会合。。。那么你对“从语音到文本”就没有兴趣了。这些流行语把你带到了完全转录的世界,一个你不需要去的地方。您应该关注一些更人性化的技术,如语音XML和IVR系统中使用的技术(Nuance是其中最大的参与者) |
|
|
2
3
我绝对会推荐你去拿 a book 如果你是这个领域的新手,那就来两个。我没有这方面的经验,所以不能推荐。如果你还在上大学(或者关系密切),你应该看看你的教授是否能推荐你。
|
|
|
3
2
对于OS X,请查看以下内容: OS X Speech Technologies 对于Windows,请查看以下内容: Microsoft Speech API |
|
|
4
2
IBMs ViaVoice product . 它有一个很好的ASR(自动语音识别)引擎和一个很好的文本到语音引擎。 网站不是很好,但这是一个嵌入式版本的链接 http://www-01.ibm.com/software/voice/support/ 不过,它与平台无关,并且所有内容都通过MVC体系结构工作,使用vxml(一种用于语音目的的xml变体)。 |
|
|
5
0
你的目标是什么平台?。有 Microsoft Speech APIs 如果它适用于windows,则可以使用它。 |
|
|
6
0
还有 Speech Recognition Service 对于Android。 |