1. 项目背景与核心价值
语音增强技术在现代通信系统中扮演着关键角色,特别是在噪声环境下的语音质量提升方面。相敏感掩膜(Phase-Sensitive Mask, PSM)作为频域语音增强的重要方法,相比传统幅度谱处理方法能更好地保留语音的相位信息。而基于非负矩阵分解(Non-negative Matrix Factorization, NMF)的基底补偿算法,则通过字典学习的方式为语音和噪声建立更精确的数学模型。
这个项目的独特之处在于将PSM与NMF基底补偿相结合,在Matlab平台上实现了以下创新:
- 利用NMF学习到的语音和噪声基底构建更精确的补偿模型
- 通过相敏感掩膜处理同时优化幅度和相位信息
- 在低信噪比条件下仍能保持较好的语音可懂度
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 核心算法原理详解
2.1 非负矩阵分解(NMF)基础
NMF的核心思想是将一个非负矩阵V分解为两个非负矩阵W和H的乘积:
V ≈ W×H
其中:
- V ∈ R^(F×T)+ 是语谱图矩阵(F为频率点数,T为时间帧数)
- W ∈ R^(F×K)+ 是基底矩阵(K为基底数量)
- H ∈ R^(K×T)+ 是编码矩阵
在语音增强应用中,我们通常会分别训练语音字典W_speech和噪声字典W_noise。测试阶段通过固定这两个字典,仅更新对应的编码矩阵H来分解带噪语音。
2.2 相敏感掩膜(PSM)原理
传统幅度谱掩膜只考虑频谱幅度信息,而PSM同时考虑相位差异:
PSM(t,f) = |S(t,f)|/|Y(t,f)| × cos(θ_s(t,f)-θ_y(t,f))
其中:
- |S(t,f)|和|Y(t,f)|分别是纯净语音和带噪语音的幅度谱
- θ_s(t,f)和θ_y(t,f)是对应的相位角
这种掩膜能更准确地反映语音成分在带噪信号中的真实占比。
2.3 基底补偿算法设计
本项目的创新点在于将NMF与PSM结合,具体步骤:
-
离线训练阶段:
- 收集纯净语音和典型噪声样本
- 分别训练W_speech和W_noise字典
- 优化字典大小K和稀疏性约束参数
-
在线增强阶段:
- 对输入信号分帧、加窗、STFT变换
- 用预训练字典分解带噪语音:Y ≈ W_speech×H_speech + W_n
