今日论文合集:cs.SD语音8篇,eess.AS音频处理10篇。 本文经arXiv每日学术速递授权转载 cs.SD语音 【1】 Leveraging LLM Embeddings for Cross Dataset Label Alignm…
声浪
启英泰伦 成都启英泰伦科技有限公司(以下简称“启英泰伦”)于2015年11月在成都高新区注册成立,是集语音芯片、语音算法、应用方案、开发平台于一体的行业领导型语音解决方案供应商。公司致力于为用户提供更自然、更简单、更智能的人机交互体验,让“…
Akulaku Akulaku是东南亚市场交易量较大,用户活跃度较高,团队成熟和发展速度较快的互联网金融平台。目前已覆盖印度尼西亚、菲律宾、越南等市场,致力于提供更本地化的产品服务。 Akulaku目前的主要产品是一款提供虚拟信用卡的分期购…
主流的 ASR 模型包括 CTC [1]、transducer [2] 和混合系统 CTC/AED [3]。CTC 是其中最为简单,最便于部署的方法,但由于它的性能通常明显落后于 transducer 和 CTC/AED,限制了它的实际应用…
北京远鉴信息技术有限公司 北京远鉴信息技术有限公司(下称“远鉴”或“公司”)是一家高科技创新型企业,是国内领先的声纹技术及人工智能服务企业。公司发展始于为公安部、国家网信办等部委提供人工智能技术服务,具备成熟的实战经验。在多个核心技术远鉴拥…
汉王科技 汉王科技股份有限公司成立于1998年,作为国内人工智能产业的先行者,汉王科技潜心深耕二十余载,始终致力于多领域智能交互技术的研究与应用。在手写识别、光学字符识别(OCR)、人脸识别、笔迹输入等领域拥有多项具有自主知识产权的核心技术…
中科智加 中科智加是中科院自动化所旗下技术产业化公司,致力于用AI技术为行业赋能,为客户提供以语音识别、机器翻译、自然语言理解、知识图谱、图像视频智能处理等技术为核心的应用产品与解决方案,相关服务案例覆盖国内30余地市。 招聘岗位 语音识别…
来源丨GitHubStore Omni SenseVoice 基于SenseVoice构建,针对闪电般的快速推理和精确的时间戳进行了优化,可以提供更智能、更快速的方式来处理音频转录! 项目链接:https://github.com/life…
