2026-09-10 14:43 1005 次浏览

苹果端侧声学AI落地:实时传译、智能降噪与音轨剥离全面进驻系统

苹果将Audio Intelligence音频智能深度集成至iOS 27、macOS Golden Gate及新一代AirPods固件,带来面对面实时传译、智能人声隔离、音轨剥离与自适应听感等功能,全部在端侧完成计算,9月14日起逐步开放。

端侧听觉感知成苹果AI新阵地

在最新一轮硬件与操作系统更新中,苹果将人工智能的触角从文本和图像延伸至听觉领域,正式推出名为“音频智能”(Audio Intelligence)的端侧深度学习声学功能集。该体系被深度整合进iOS 27、macOS Golden Gate以及新一代AirPods 5与AirPods Pro固件,标志着苹果AI战略在模态拓展上迈出关键一步。

与依赖云端推理的常见方案不同,这套音频智能管线依托设备本地的新一代神经处理引擎运行,在响应速度与隐私保护之间寻求平衡。行业观察者认为,将高带宽、低功耗的神经算力直接嵌入系统声学底层,意味着耳机等配件正从单纯的播放设备向具备实时计算能力的终端演进。

实时传译与智能降噪重塑沟通体验

音频智能体系中最受关注的功能是面对面实时同声传译。佩戴兼容AirPods的用户在与不同语言对象交谈时,系统可自动识别对方语种,并在耳机内完成低延迟双向转译;用户也能通过语音指令或轻按耳机柄,调用iPhone外放合成后的自然语音。由于整套翻译流程在端侧闭环运行,私人对话无需上传云端,即时性与隐私防护得以兼顾。

在通话与音频拾取场景,升级后的“智能人声隔离”(Voice Isolation 2.0)利用经数百万小时复杂环境声学数据训练的神经分离模型,能够从嘈杂开放空间中精准提取主要人声。地铁呼啸、餐厅盘碟碰撞、风噪及周围交谈声被压制为背景底噪,使免提通话、FaceTime视频会议乃至语音备忘录获得接近专业录音棚的清晰度。针对多方会议,该模型还可结合人脸朝向与麦克风波束成形角,自适应追踪主要发言人。

创作者工具与自适应听感同步进阶

面向内容创作者,音频智能工具集提供了音轨级的内容重构能力。在搭载M系列芯片的Mac及最新一代iPhone上,用户编辑视频或多音轨音频工程时,可通过原生AI声学工具将单一音轨一键拆分为纯净人声、伴奏乐器与环境音轨。该“音轨剥离”功能支持无损导出,并允许对不同成分独立调节音量增益或施加混响特效,降低了影视后期配音替换、播客去噪与混音创作的技术门槛。

播放体验方面,进阶版“自适应听感”(Adaptive Hearing)算法利用耳机麦克风阵列实时检测耳道密封状态、外部环境声级及空间声学混响反射,以每秒数千次的频率动态重构均衡曲线与空间音频定位,力求在不同佩戴姿态和复杂动态环境下维持一致且精准平衡的听觉声场。

端侧AI实用化再进一步

声学与软件工程分析人士指出,此次音频智能功能集表明端侧AI在手机与耳机等边缘终端上的落地正变得愈发具象。通过将自研芯片的超高带宽与极低功耗神经算力紧密咬合在系统声学底层,苹果不仅赋予AirPods等配件更强的计算终端属性,也进一步巩固了其软硬件无缝协同的技术护城河。全套功能将随9月14日推送的系统正式版更新以及新硬件发售逐步向全球用户开放。