乐鑫科技ESP APA DOA 组件,用多麦克风阵列估计声源方向
在语音交互设备里,麦克风负责采集声音,语音前端负责处理音频,这套分工已经相当成熟,降噪、去混响、回声消除与波束形成,多通道前端基本都能覆盖。但当设备走进会议室、客厅、车内或机器人机身之后,问题会多出一层:设备还需要知道说话的人是在左边还是右边、在前方还是侧后方。只有拿到这个方向,云台摄像机才能把镜头转过去,服务机器人才能转身面向说话人,智能音箱才能在嘈杂环境里对目标方向做定向拾音,而不是被迫处理全向拾音的结果。过去的做法各有代价:自行推导方向需要投入不小的信号处理研发;交给算力更充裕的独立平台,会增加成本与系统复杂度;干脆放弃方向能力,则只能用机械结构或人工干预替代。声源到达方向估计,正是补上这一环的技术。
乐鑫近期发布的 ESP APA DOA 组件,正是面向这一环节的轻量级方案。它归属于乐鑫新推出的 ESP-APA 端侧音频算法组件集合,该集合采用模块化设计,各项算法能力可按需集成并对外提供标准化 API,DOA 是这个集合中首个公开发布的组件。组件的定位很明确:以较低的资源开销,在主控芯片本地完成多麦克风阵列的声源方位角估计。它支持两路、三路、四路麦克风阵列,音频输入既可以是交织格式,也可以是平面格式,并能直接对接 ESP-SR、AFE 等多通道音频前端,便于与降噪、波束形成、语音识别等既有算法串联。支持的芯片覆盖 ESP32、ESP32-C3、ESP32-C5、ESP32-C6、ESP32-C61、ESP32-S3、ESP32-S31 与 ESP32-P4 共八款,方向能力因此不再是某个特定型号的专属特性,而可以在整条产品线上按成本与性能需求灵活部署。官方列出的适用范围包括智能音箱、语音家电、会议终端、云台摄像机、服务机器人、车载语音设备与智能玩具。官方还同步提供了在 ESP32-S31 开发板上运行的实时采集示例,两路麦克风开箱即可复现完整链路,评估门槛并不高。
从原理上看,声源定向做的事情并不玄妙,难点全在精度与稳定性。声音从某个方向传来时,到达不同麦克风的时间会有细微差异,这个差异称为到达时间差。组件通过互相关分析测出各通道之间的时延,再结合每颗麦克风在板上的坐标反推声源的水平角度,几何关系越充分,解算结果越可靠。为了让输出真正可用,引擎内部设置了三类质量门限:一是信号电平,低于阈值直接拒绝;二是互相关峰值锐度,用来衡量相关峰是否足够突出;三是在三路及以上阵列中还会评估几何拟合残差,判断解算结果与阵列几何是否自洽。门限全部通过,结果才会被标记为有效,并附带一个 0 至 10 的质量评分供上层裁剪使用。角度的参考系同样需要提前约定:原点取阵列中心,正前方为 0 度,方位角顺时针递增,也就是 90 度对应右侧、180 度对应后方、270 度对应左侧。
阵列怎么摆,直接决定能测多大范围。组件内置了四种常用布局的坐标宏,参数都是相邻麦克风的间距:两麦共线只输出 0 至 180 度,因为它无法区分前后镜像;三麦等边三角形、四麦正方形与四麦长方形都可以输出完整的 360 度。间距越大,角度分辨率通常越好,这一点需要在板级设计阶段与结构、开孔位置一并考虑。形状不规则的板子,也可以逐颗填写麦克风坐标。这里有一条硬约束必须强调:第 i 路音频通道必须来自坐标数组第 i 项所描述的那颗物理麦克风,两者严格对应。如果实际接线顺序与几何逻辑顺序不一致,应在采集路径中重排后再填入坐标,而不能反过来只调整坐标数组,否则输出的方位角会系统性出错。此外,若音频前端输出的是含参考通道与噪声通道的混合槽位流,可以用配套的数据布局组件剔除无关数据,但它只负责丢弃槽位,不负责通道重排。
接口设计延续了 ESP-IDF 组件的惯例,上手路径很短。初始化阶段填充配置结构体并调用创建接口,引擎会自动校验配置并构建阵列几何;随后把采集到的音频数据持续送入处理接口,当分析窗口填满且质量门限通过时,即可读取方位角与质量评分。组件提供了复位接口,建议在外部语音活动检测判断出语音起止边界时调用,以获得更干净的新估计;但不要在语音进行中频繁复位,否则会引起角度抖动与收敛变慢。为控制算力开销,组件提供经济、均衡、灵敏三档预设,分别对应每四个、每两个、每一个内部数据块执行一次完整解算,跟踪速度与算力开销成反比,被跳过的数据块会沿用上一次结果。需要留意的是,所有接口都不是中断安全的,同一句柄也不支持多线程并发调用,任务划分时需要规避。
资源开销是这套方案最值得关注的部分。以 ESP32-S3 在 240 兆赫兹主频、16 千赫兹采样条件下实测为例,两麦配置占用约 23KB 堆内存,四麦配置约 30KB;在均衡档设置下,两麦的 CPU 占用约 3.8%,三麦约 6.3%,四麦约 10.3%,若放宽到较低的解算频率,四麦也能压到 5.7% 左右。精度方面,理想平面波条件下两麦的平均绝对误差约 0.3 度,三麦与四麦在 0.1 度上下,两麦在端射方向的最大误差约 3 至 3.8 度。方位角的刷新延迟由解算频率决定,典型值在 16 至 64 毫秒之间。这组数字意味着,方向估计可以与网络协议栈、语音识别、本地自动化逻辑共存于同一颗芯片,不必额外增加一颗处理器。
需要区分的是,乐鑫在 ESP-SR 中也提供嵌入式声源定向模块,它基于最小方差无失真响应算法,支持 2 至 8 路麦克风与任意阵列几何,角度分辨率为 10 度,目前仅支持 ESP32-P4,适合对阵列自由度要求更高且算力充足的场景。ESP APA DOA 则以低开销与广泛的芯片支持见长,两者互补,选型时按精度需求、阵列规模与主控型号判断即可。落到产品形态上,这套能力可以支撑会议终端与桌面音箱的发言者方向指示与定向拾音、云台摄像机与视频会议设备的自动取景、服务机器人与智能家电的转向与朝向交互,以及车载语音设备的座位区分。对以语音为入口的整机产品而言,多一项方向能力往往意味着交互逻辑可以重新设计,例如只对目标方向拾音以提升识别率,或在多人场景中区分主要说话人。
作为乐鑫科技一级代理商,飞睿科技可为客户提供从芯片选型、模组配套到专业技术支持的服务,帮助客户缩短评估周期、降低试错成本,更快完成从原型验证到规模量产的过渡。如需 ESP APA DOA 组件的技术资料、评估套件或选型建议,欢迎与我们联系。