论文统计每月更新一次,主要跟踪语音合成和语音识别的发展状况。很多文章都是在会议后才发出,但不影响统计。统计过程难免存在疏漏,因此统计结果仅供参考。
所有文章语音合成领域统计列表请访问:
http://yqli.tech/page/tts_paper.html
语音识别领域论文统计请访问:
http://yqli.tech/page/asr_paper.html
开源语音数据查询:
http://yqli.tech/page/data.html
如何查找语音资料请参考文章:
https://mp.weixin.qq.com/s/eJcpsfs3OuhrccJ7_BvKOg
表一给出具体分类说明。2023年1月的语音合成相关的文章有34篇,比前两年同期增加很多。表二和图2是语音合成的具体方向文章的情况。本月的文章的关键词有Diffusion、prompt、xxLM等等大家可注意一下。另外Vall-E这篇文章方法可成为未来的热点。

| 1月 | |
| 前端 | 1 |
| 声学模型 | 7 |
| 声码器 | 1 |
| 个性化 | 0 |
| 多语言 | 2 |
| 歌唱合成 | 8 |
| 情感风格 | 3 |
| 多模态 | 6 |
| 声音转换 | 1 |
| s2s | 1 |
| 其它 | 4 |



语音识别篇
语音识别的文章分类参照表三说明。图3是语音识别文章总数,本月有17篇,相比去年同期减少很多。语音识别的研究方向具体情况参见表4和图4,其中、speechion。
| robust | 鲁棒性 |
| speaker diarization | speaker diarization |
multichannel | 多通道 |
| speech translation | 语音翻译 |
| multi-modal | 多模态 |
图3 语音识别文章数量统计(单位:篇)

表4 语音识别研究方向分布情况

图4 语音识别研究方向柱状图

语音识别的文章列表请访问


