ICASSP 2026 | 南京大学音频声学实验室(NJU-AALab)10篇论文展示+2项赛事冠军
ICASSP(International Conference on Acoustics, Speech, and Signal Processing)是由IEEE信号处理学会主办的年度学术会议,是全球规模最大、最全面的声学、语音与信号处理领域的顶级国际会议。2026年5月4日至8日,第51届ICASSP会议(ICASSP 2026)在西班牙巴塞罗那隆重召开,汇聚了来自世界各地的信号处理、语音及声学领域的5700余名专家学者。
本届会议,南京大学音频声学实验室(NJU-AALab)共有10篇论文被录用,研究方向涵盖语音编解码、语音增强、说话人日志、语音对话系统、主动噪声控制、主动啸叫抑制等多个领域,充分展现了实验室在智能音频前沿方向上的持续积累与创新活力。会议由卢晶、钟家鑫两位老师带队,携10名研究生赴现场参会,全面展示了团队的最新研究进展与成果。以下是相关情况。
Progressive Refinement Training for Low-Resource Neural Speech Coding and Enhancement
作者:胡荣惠,杨乐岩,徐洋,卢晶
单位:南京大学,地平线机器人
论文链接:https://ieeexplore.ieee.org/abstract/document/11463952
语音编解码是通信系统中的一项核心技术难题。在此类系统中,设备端部署不仅需要满足实时处理的要求,还严格受限于比特率与计算复杂度。此外,真实声学环境中的噪声与混响问题,也要求系统必须集成语音增强功能。为此,本文提出了一种新颖的渐进优化(Progressive Refinement,PR)策略,通过构建三阶段协同训练框架加以实现。基于该策略,我们训练得到 PR-Vocodec——一个兼具低延迟、高保真与低比特率特性的编解码器模型,能够以较低的计算开销同时完成降噪与去混响。PR-Vocodec 在 2025 年低资源音频编解码器(LRAC)挑战赛的赛道二(语音增强编解码器)中荣获第一名,充分展示了其在统一架构下高效处理多任务的能力。
KD-Vocodec: A Low-Complexity Model for Joint Speech Coding And Enhancement Using Knowledge Distillation
作者:徐洋,胡荣惠,杨乐岩,卢晶
单位:南京大学,地平线机器人
论文链接:https://ieeexplore.ieee.org/document/11461554
资源受限环境下语音接口的发展,对神经语音编解码器提出了兼顾计算效率、极低码率与低延迟的需求。此类编解码器还必须在恶劣的声学环境中保持高感知质量,对真实噪声与混响具有强鲁棒性。为了应对这一挑战,本文提出了 KD-Vocodec,这是一个通过特征级知识蒸馏实现联合语音编码与增强的框架。该方法的核心在于,训练一个轻量级的学生编码器,从含噪语音中直接重建纯净语音对应的目标表征——该表征来自于预训练教师编解码在纯净语音上的输出。这一蒸馏策略有效赋予了编码器对噪声与混响的强鲁棒性。KD-Vocodec 在 2025 年低资源音频编解码器(LRAC)挑战赛的赛道二中获第二名,在低资源约束下主客观评价均表现优异,系统延时低至 30 毫秒(低于赛道要求的 50 毫秒),支持 1 至 6 kbps 的可扩展码率。
VoCodec: An Efficient Lightweight Low-Bitrate Speech Codec
作者:杨乐岩,胡荣惠,徐洋,卢晶
单位:南京大学,地平线机器人
论文链接:
https://ieeexplore.ieee.org/abstract/document/11464230
端到端神经语音编解码器近年来取得显著突破,能够在极低比特率下实现高保真音频重建。然而,面向实时通信的实际部署还需兼顾低计算复杂度与低延迟的要求。为此,本文提出 VoCodec,一个计算复杂度仅为349.29 M MACs/s、延迟低至 30 毫秒的轻量级语音编解码器。该模型以高性能声码器 Vocos 为骨干网络,在 2025 年低资源音频编解码器(LRAC) 挑战赛的赛道一中获得第四名,同时在干净语音测试集上取得了最高的主观 MUSHRA 分数。此外,我们还在前端级联了一个轻量级语音增强神经网络,使系统额外具备对噪声与混响的鲁棒性。实验结果表明,两套系统在多项评测指标上均展现出优异性能。
The NJU-AALab Systems for the CHiME-9 MCoRec Challenge
作者:宋则延,王雨石,卢晶
单位:南京大学,地平线机器人
论文链接:https://www.isca-archive.org/chime_2026/song26_chime.html
这篇技术报告介绍了我们提交至 CHiME-9 MCoRec Challenge 的系统方案。该任务关注高度重叠对话场景下的多说话人转录与多会话聚类,核心难点在于多人同时发言所致的严重语音重叠与说话人干扰。我们的工作主要围绕两大模块展开:音视频语音识别(AVSR)与会话聚类模块。具体而言,我们研究了两种 AVSR 配置,并设计了更贴合目标数据集重叠模式的数据模拟策略;同时,引入大语言模型(LLM)进行会话聚类,并对 AVSR 的识别结果进行后处理纠错。在开发集上,该系统取得了 42.81% 的词错误率(WER)和 97.77% 的会话聚类 F1 分数,最终在测试集上荣获第三名。
Attention-Based Encoder-Decoder Target-Speaker Voice Activity Detection for Robust Speaker Diarization
作者:宋则延,谭天懿,王雨石,王政,卢晶
单位:南京大学,地平线机器人
论文链接:https://ieeexplore.ieee.org/document/11464003
目标说话人语音活动检测(TS-VAD)是说话人日志领域中一种颇具前景的方法。然而,目前尚缺乏在不同真实世界数据集上的全面评测。本文提出了一种基于注意力机制的编码器-解码器网络——AED-TSVAD,在大规模真实世界数据集上结合复合训练策略验证了其潜力,同时保持了模型架构的简洁性与可复现性。我们进一步引入了一种轻量级门控机制,将说话人配置文件中的吸引子风格得分与解码器的线性投影输出相融合。此外,我们还探究了初始系统质量对 AED-TSVAD 的影响,并发现将 WavLM 前端与强初始化相结合,可在多个数据集上取得最先进的结果。
Joint Multichannel Acoustic Feedback Cancellation and Speaker Extraction via Kalman Filter and Deep Non-Linear Spatial Filter
作者:李泽,郭昊诚,葛晓阳,陈锴,卢晶
单位:南京大学,地平线机器人,华为
论文链接:https://ieeexplore.ieee.org/document/11464513
声学反馈消除(AFC)与语音增强是音频系统中的关键技术,已有多种传统多通道信号处理方法被开发用于将二者结合。本文提出了一种数据驱动的麦克风阵列算法——AFC-SPEX。该算法将深度非线性空间滤波器(DNSF)与自适应反馈消除模块相结合,能够在存在声学反馈和干扰的情况下实现目标语音提取,且无需依赖干扰源方向的先验知识。AFC 模块采用分块频域卡尔曼滤波器实现,以确保低延迟和快速收敛。DNSF 则通过教师强制策略进行离线训练,并构建了开环数据集以加速训练过程。仿真结果表明,AFC-SPEX 在声学反馈消除能力和语音质量两方面,均持续优于近年的传统方法,性能提升显著。
Generating Localized Audible Zones Using a Single-Channel Parametric Loudspeaker
作者:庄韬,李绍哲,牛锋,钟家鑫,卢晶
单位:南京大学,地平线机器人,中国计量科学研究院,宾夕法尼亚州立大学
论文链接:https://ieeexplore.ieee.org/abstract/document/11462667
先进的声场分区控制(SZC)技术通常依赖大规模多通道扬声器阵列来创建高对比度的个人声区,这使得单扬声器 SZC 看似不可能实现。本文挑战了这一传统认知,引入多载波参量扬声器(MCPL),仅凭单个扬声器即可实现 SZC。具体而言,我们将不同的音频信号被调制到不同频率的独立超声波载波上,合成为一个复合信号。该信号由单通道超声波换能器发射,经空气中的非线性解调作用后,音频信号相互交互,虚拟地形成多通道输出。这一新特性使得原本面向多通道扬声器阵列的现有 SZC 算法可直接迁移应用。仿真结果验证了所提单通道 MCPL 的有效性,证明其作为一种有前景的替代方案,能够在简化系统结构的同时实现高对比度 SZC,为轻量化 SZC 系统设计开辟了新路径。
Synchronous Secondary Path Modeling and Kronecker-Factorized Adaptive Algorithm for Multichannel Active Noise Control
作者:廉思源,白璐,李天佑,陈锴,卢晶
单位:南京大学,地平线机器人
论文链接:https://ieeexplore.ieee.org/abstract/document/11464800
精确的次级通路建模对主动噪声控制系统中自适应算法的稳定性与有效性具有决定性作用。传统的顺序白噪声建模方法虽然实现简单,但耗时较长;基于维纳滤波的同步建模虽可提高效率,却需进行高维矩阵求逆,计算成本较高。针对上述问题,本文提出了一种基于克罗内克积分解的次级通路同步建模方法,利用次级通路矩阵的低秩特性,在保证建模精度的同时实现了对全部次级通路的快速建模,并有效降低了计算复杂度。在此基础上,进一步提出了一种克罗内克分解自适应算法,直接由分解得到的克罗内克因子构造滤波参考信号,无需重建完整次级通路响应,从而进一步降低了算法计算量。在会议室环境下构建的 1×8×8 主动噪声控制系统上的实验结果表明,所提方法仅利用 1 秒建模信号即可实现低于 -20 dB 的建模误差,并在显著降低计算复杂度的同时,仍保持了与精确通路模型相当的降噪性能。
A Dual-Stream Cognitive Enhancement Dialogue System For The ICASSP 2026 Humdial Challenge
作者:汪大涵,雷桐,张远铭,胡沁雯,李安冬,王泰辉, 赵金政, 陈日林,于蒙,俞栋,卢晶
单位:南京大学,腾讯,中科院声学所
论文链接:https://ieeexplore.ieee.org/abstract/document/11460952
ICASSP 2026类人对话系统(HumDial)挑战赛中的情感智能赛道,为下一代对话系统树立了重要评测基准,从三个关键维度上评估系统性能:情感轨迹检测、情感推理与共情评估。为应对上述挑战性任务,我们提出了一种双流认知增强框架。该框架中,认知流进行深度情感分析并生成动态提示,进而引导感知流合成最终的共情音频响应。我们的系统在该赛道中排名第二,验证了所提框架在构建类人情感智能体方面的有效性。
GAP-URGENet: A Generative-Predictive Fusion Framework for Universal Speech Enhancement
作者:容晓彬,王雨石,王政,卢晶
单位:南京大学,地平线机器人
论文链接:https://ieeexplore.ieee.org/abstract/document/11463702
本文提出 GAP-URGENet,一个面向 ICASSP 2026 URGENT 挑战赛的赛道一的生成-预测融合框架。该系统包含生成式与预测式两个分支:生成式分支在自监督表征域中进行全类型语音恢复,并通过神经声码器重建波形;预测式分支在频谱域进行增强,为生成式分支提供互补信息。两分支的输出通过后处理模块进行融合,该模块同时执行带宽扩展以生成 48 kHz 的增强波形,随后降采样回原始采样率。这一生成-预测融合策略显著提升了系统的感知质量与鲁棒性,在盲测数据集上表现优异,并在客观评测阶段斩获第一名。
文编 | 容晓彬
美编 | 容晓彬
审核 | 卢 晶
使用本文内容请标注出处