超越级联系统:端到端语音大模型设计解析
转载a year ago
超越级联系统:端到端语音大模型设计解析

虽然文本大语言模型最近取得了很多的关注,但是对于人类而言,语音交互是更自然的方式。在语音交互常见中一个直接的方法是直接级联ASR-LLM-TTS这三个模型,然而这种直接的方式存在诸多问题。为了解决级联系统的问题端到端的语音大模型(Speec…

29 0 0
如何给AI一双“懂节奏”的耳朵?
转载a year ago
如何给AI一双“懂节奏”的耳朵?

如何将一段连续的、信息密度不均的波形,变成一串 AI 能够理解和处理的“密码”?关键在于语音分词器——它就像是 AI 的“语音耳朵”,负责将声音信号转换成离散的符号序列。 然而,现有的语音分词器大多采用固定帧率,比如每秒生成 75 个 to…

19 0 0