文章来源 Macnica Engineer

英飞凌 AI MCU 在语音噪声抑制及其语音识别的应用

本文主要介绍英飞凌 PSOC™ Edge 平台如何利用 AI (机器学习) 实现高效的语音噪声抑制,并说明 Audio Front End 软件组件及其配置工具使用,通过实际音频对比降噪后的音频,发现降噪效果显著。 

  

一、前言

近年来,利用语音识别技术的设备和应用程序正在迅速普及。然而,在现实环境中,由于周围存在大量杂音和回声,语音噪声抑制已成为影响识别精度的瓶颈。以往,通常采用生成噪声的反相来抵消语音信号的方法,但这种方法存在一个问题,即仅在目标语音信号已知的情况下才有效。

英飞凌 (Infineon) 的 PSOC™ Edge 利用人工智能 AI (机器学习) 解决了这一难题。通过利用学习模型自动识别并分离“所需语音”与“噪声”,即使在以往难以处理的情况下,也能实现高精度的噪声抑制。此外,AI 模型可作为示例提供,因此可在基于 ModusToolbox® 的开发环境中轻松进行评估和部署。由此,相比传统方式,能够以更短的时间内开发出高精度的语音噪声抑制系统,并能显著提升语音识别率。

  

二、Audio Front End 是什么?

Audio Front End (AFE) 是英飞凌提供的用于音频信号处理的软件组件群的总称。在音频输入设备和语音识别应用中,它负责对从麦克风采集的音频进行预处理,使其更加清晰、更易于识别。

英飞凌还提供了一款名为“Audio Front-End Configurator”的专用工具,可用于轻松构建和优化这些 AFE 组件。通过该工具的图形用户界面 (GUI),可以直观地组合各个处理模块,并调整参数以设计出最优的音频处理管道。与 PSOC™ Edge 结合使用时,可实现基于边缘 AI 的噪声抑制和波束成形功能。

主要功能模块

在 Audio Front End 中,您可以通过启用或禁用以下功能模块,灵活设计系统架构。

功能模块

概要

Equalizer

通过调整频率特性,对特定频段的声音进行增强或衰减。

Acoustic Echo Canceller (AEC)

检测扬声器发出的自生声音,并消除回声。在免提通话等场景中效果显著。

Beamforming

增强指定方向的声音,并抑制其他方向的声音。需利用多个麦克风输入。

Dereverb

可降低室内等环境中产生的混响成分,提取清晰的语音。

Noise Suppression

通过基于 AI 模型的运算,可实时降低周围的环境噪声。

通过自由组合这些模块,可以根据应用程序的用途构建灵活的语音处理管道。此外,各模块的参数可在 GUI 上直观地进行设置,因此即使没有专业的 DSP 知识,也能自定义语音处理流程。

Audio Front End 概要

图1 Audio Front End 概要
图1 Audio Front End 概要

Audio Front End 构建工具

Audio Front End 的构建工具可通过英飞凌的开发工具 ModusToolbox™ 获取。利用 ModusToolbox™ 中的 Audio Front-End Configurator 图形用户界面 (GUI),可以对各功能模块进行配置。GUI 可实现的主要操作包括:

  • 启用/禁用功能模块
  • 设置各类参数

配置界面示例:Audio Front-End Configurator GUI

图2 配置界面示例 (左图:参数及功能块设置 右图:波束成形设置)
图2 配置界面示例 (左图:参数及功能块设置 右图:波束成形设置)

  

三、通过演示音频感受噪声抑制效果

您可以通过实际音频文件对比,体验 PSOC™ Edge 的噪声抑制效果。

降噪前的音频 (语音+噪声)

降噪后的音频 (AI 处理完成)

经过 AI 处理后,背景噪音得到了大幅抑制,说话者的声音变得更加清晰易懂。该技术不仅能提高语音识别精度,还能在多种应用场景中发挥作用。

  

四、总结

本文介绍了英飞凌 PSOC™ Edge 平台如何利用 AI (机器学习) 实现高效的语音噪声抑制,并说明 Audio Front End 软件组件及其配置工具,通过实际音频对比展示语音识别率的显著提升。如果您对本套件、开发工具 ModusToolbox™ 以及 Audio Front-End Configurator 感兴趣,或欲了解关于更多英飞凌相关方案或技术信息,请与骏龙科技当地的办事处联系或点击下方「联系我们」,提交您的需求,骏龙科技公司愿意为您提供更详细的技术解答。

更多信息: