当前位置：首页 > news >正文

中文连续视觉语音识别挑战赛

news 2026/2/10 12:11:07

视觉语音识别，也称唇语识别，是一项通过口唇动作来推断发音内容的技术。该技术在公共安全、助老助残、视频验真等领域具有重要应用。当前，唇语识别的研究方兴未艾，虽然在独立词、短语等识别上取得了长足进展，但在大词表连续识别方面仍面临巨大挑战。特别是对于中文而言，由于缺乏相应的数据资源，该领域的研究进展受到了限制。为此，清华大学在2023年发布了CN-CVS数据集，成为首个大规模的中文视觉语音识别数据库，为进一步推动大词表连续视觉语音识别 (LVCVSR) 提供了可能。

为推动这一研究方向的发展，由清华大学、北京邮电大学、海天瑞声、语音之家联合举办2023 NCMMSC特殊议题：中文连续视觉语音识别挑战赛（CNVSRC, Chinese Continuous Visual Speech Recognition Challenge）正式对外发布。本次赛事以 CN-CVS 中文视觉语音识别数据库为基础数据，评估在录音室朗读 (Reading) 和网络演讲 (Speech) 两类场景下的 LVCVSR 系统的性能。比赛结果将在 NCMMSC 2023 会议上宣布并颁奖。

任务设置

CNVSRC 2023 共设有两个任务：

T1：特定说话人视觉语音识别 (Single-speaker VSR)
T2：多个说话人视觉语音识别 (Multi-speaker VSR)

前者侧重于针对某一特定说话人进行大量数据调优后的性能，后者侧重于系统对非特定说话人的基础性能。每个任务根据训练数据不同，又分为固定赛道 (Fixed Track) 和开放赛道 (Open Track)。

固定赛道仅允许使用 CN-CVS 数据集即各任务发布的开发集作为训练集，旨在验证算法的先进性。开放赛道则可以使用任何数据进行训练，旨在验证当前技术能够达到的性能上限。清华大学将提供固定赛道上的基线系统代码，供参赛者作为参考。

数据集

• CN-CVS: CN-CVS包含2557名说话人超过300小时的音视频数据，覆盖新闻播报与公开演讲场景，是目前最大的开源中文音视频数据集。主办方为本次竞赛提供了该数据库的文本标注。更多关于CN-CVS的信息请访问数据库官网CN-Celeb。该数据集作为本次竞赛闭集任务的训练集。

• CNVSRC-Single: CNVSRC2023单人大数据。包含一名说话人超过100小时的音视频数据，数据来源于网络视频，其中十分之九的数据构成开发集，剩余十分之一的数据作为测试集。

• CNVSRC-Multi: CNVSRC2023多人限量数据。包含43名说话人的音视频数据，每人的数据量接近1小时，其中每个人的三分之二数据构成开发集，剩余数据构成测试集。其中23名说话人的数据来源于受控环境下朗读固定机位录制，且单条数据时长相对较短。另20名说话人的数据来源于网络的演讲视频，单条数据时长较长，环境和内容较为复杂。

对于训练集和开发集，主办方提供音频、视频和对应的转录文本；对于测试集，则仅提供视频数据。参赛者不得以任何方式使用测试集，包括但不限于使用测试集帮助模型训练或者微调等。

数据集	CNVSRC-Single		CNVSRC-Multi
数据集	开发集 Dev	测试集 Eval	开发集 Dev	测试集 Eval
视频条数	25947	2881	20450	10269
视频时长(小时)	94.00	8.41	29.24	14.49

参赛方式

参赛者需在CNCeleb官网上注册CNVSRC账号

请访问如下网址进行注册：CN-Celeb

注册以后，用户可以依据提示下载数据资源（CN-CVS, CNVSRC-Single, CNVSRC-Multi)。

CNVSRC 2023 以字错误率（Character Error Rate, CER）为评测准则。结果提交时，参赛者需要登录CNVSRC账号，进入CNVSRC 2023结果提交页面，选择对应的任务和赛道，提交结果文件。结果文件中每一行对应一条测试视频，以该视频的ID开始，后接对应的转录文本。内容提交后，系统自动计算CER并显示给参赛者。对每个任务每个赛道，参赛者有5次提交机会。

基线系统

主办方提供了固定赛道条件下多说话人和特定说话人两个任务的基线系统供。该基线系统采用基于Conformer的结构，模型性能如下。

Task	Single-speaker VSR	Multi-speaker VSR
CER on Dev Set	48.57%	58.77%
CER on Eval Set	48.60%	58.37%

参赛者可以通过下面网址获得基线系统的代码：https://github.com/MKT-Dataoceanai/CNVSRC2023Baseline

赛程安排

2023/09/20 开启报名，训练数据集、开发数据集、基线系统发布

2023/10/10 测试数据集发布

2023/11/01 提交系统开放

2023/12/01 晚12点提交结果截止

2023/12/09 NCMMSC 2023 Workshop，公布成绩、优秀竞赛方案分享

组委会

· DONG WANG, Center for Speech and Language Technologies, Tsinghua University, China
· CHEN CHEN, Center for Speech and Language Technologies, Tsinghua University, China 
· LANTIAN LI, Beijing University of Posts and Telecommunications, China
· KE LI, Beijing Haitian Ruisheng Science Technology Ltd., China
· HUI BU, Beijing AIShell Technology Co. Ltd, China

报名传送门

2023 中文连续视觉语音识别挑战赛

Chinese Continuous Visual Speech Recognition Challenge 2023

Step1. 注册CNVSRC账号

CN-Celeb

*注册后可下载数据资源：CN-CVS, CNVSRC-Single, CNVSRC-Multi

Step2. 基线系统代码

https://github.com/MKT-Dataoceanai/CNVSRC2023Baseline

CNVSRC 2023 Website

CN-Celeb

中文连续视觉语音识别挑战赛

任务设置

数据集

参赛方式

基线系统

赛程安排

组委会

报名传送门

CNVSRC 2023 Website

相关文章：

中文连续视觉语音识别挑战赛

(ubuntu) 安装JDK

工程管理系统源码之全面+高效的工程项目管理软件

网络安全常见问题隐患及其应对措施

《机器学习分类器二》——朴素的贝叶斯算法，项目实践，算法实践。

亚马逊英国站手机/笔记本电脑电池和充电器的合规标准是什么？

亚马逊云科技顾凡解读云计算助力初创快速抢滩生成式AI新风口

Unity之ShaderGraph如何实现积雪效果

实现mnist手写数字识别

Camera BSP之GPIO/I2C/PMIC简介

Spring 数据校验：Validation

网页构造与源代码

辅助驾驶功能开发-功能对标篇(14)-NOA领航辅助系统-集度

论坛介绍 | COSCon'23 云计算（C）

Spring 国际化：i18n

【APP源码】基于Typecho博客程序开发的博客社区资讯APP源码

Spring Security登录表单配置（3）

代理模式（初学）

Spring底层架构核心概念

为什么高精度机器人普遍使用谐波减速器而不是普通减速器？

挑战杯推荐项目

Prompt Tuning、P-Tuning、Prefix Tuning的区别

服务器硬防的应用场景都有哪些？

什么是库存周转？如何用进销存系统提高库存周转率？

macOS多出来了：Google云端硬盘、YouTube、表格、幻灯片、Gmail、Google文档等应用

HBuilderX安装（uni-app和小程序开发）

【HTML-16】深入理解HTML中的块元素与行内元素

基于 TAPD 进行项目管理

Python 高效图像帧提取与视频编码：实战指南

车载诊断架构 --- ZEVonUDS（J1979-3）简介第一篇