过去几年,人工智能取得巨大进步。先是大语言模型通过海量文本训练,彻底掌握「智能问答」能力。紧接着是多模态世界模型在海量图像、视频训练下,实现更高级的「空间智能」能力。
这一度让我们以为AI足够聪明了。但今天它依然做不到一件事:听世界。
波士顿大学与 Google DeepMind 的MMA-Bench 多模态鲁棒性研究发现:主流多模态大模型存在明显模态偏好,文本获得最高注意力权重,视觉次之,音频最容易被忽略。
AI的训练严重偏向文本、图像和视频,声音却始终被当作次要模态。它的价值被严重低估——我们对它的想象力,还停留在听音乐和语音交互上,很少有人想到:声音同样能感知物理世界、预测意图、推演事件变化。
很多时候人对事件的感知,听觉都先于视觉,如:有人从拐角走来,你先听到脚步声(就能辨人),然后才看到;在黑暗的房间,人摔倒了,眼睛看不见,也能凭借声音判断方向;人还是胎儿的时候,眼睛还未张开,也是先用听觉感知世界的。
当大语言模型教会AI“回答问题”,多模态世界模型教会机器“看世界”后。AI的下一个前沿,很可能是听觉世界模型。我爱音频网呼吁所有AI相关从业者,重新理解声音的价值。
在这篇文章中,我将解释声音为何重要?什么是认知声学,如何用听觉来预测、听世界、理解物理世界,如何构建听觉世界模型,以及未来对消费电子与具身智能行业将带来的颠覆性变化与影响。
本篇文章内容来自中国科学院声学所 副所长 杨军老师与我爱音频网 创始人 蔡千寻(豆总)长达3小时的深度对谈,非常感谢杨军老师的分享,为我们打开了“声世界”的大门,AI智能体的发展也因此迎来全新挑战。仅以此文投石问路,邀请大家一起探索充满未知的“听觉世界模型”。
在AI时代,声音为何重要?
人类最早先用听觉感知世界
人类感官的发育顺序,直接决定了AI感知物理世界的底层逻辑。胎儿在发育的过程中,最早用听觉感知“世界”,孕18周左右就形成完整听觉结构,能感知母亲的心跳、血流声,孕24至26周可感知外界声音并做出移动反应。而视觉发育相对较晚,胎儿眼睑长期闭合,直到孕26周后才逐渐睁开。
新生儿出生后,仅能近距离捕捉模糊光影,看不清世界,完全依靠听觉辨识亲人、感知环境、判断危险。不同于视觉、语言的后天习得,听觉是人类与生俱来、最早介入世界认知、感知物理世界的感官。
听觉是唯一“全向、全天候、远距离、穿透障碍”的感官
人类主要拥有五大经典感官:视觉、听觉、嗅觉、味觉、触觉。视觉通过眼睛看世界、看空间、看物体形态,有视野边界和盲区,严重依赖光线,黑暗中视觉基本失效;嗅觉、味觉属于化学感知,触觉能感知温度、痛感,这些感知维度偏单一。
唯有听觉,能全向360度,不用转头,隔着墙,感知几十米甚至更远的动态事件。听觉提供的是全向、全天候、远距离和穿透性的环境感知。更为独特的是,在五大感官中,听觉还是唯一能通过声音辨别“人”的语气、情绪、意图的感官,它甚至能在同一句话“他说好”中,判断对方是真诚还是假意。这对未来AI智能体理解人的“意图”,做AI智能服务是至关重要的。
过去只拿声音来听音乐、录音、语音交互
过去音频行业数十年、上百年发展中,我们对声音的利用主要局限在听音乐,为了追求极致音质与声波完整还原,声学技术的研发目标始终聚焦于优化频响、信噪比与降噪能力。后面出现数码录音笔,人们对声音的利用演进到把会议、交谈的声音内容记录下来。伴随AI技术发展,耳机端侧实现AI降噪、回声消除、波束成形,对声音的利用进一步扩展到AI语音交互。但现在我们对声音的利用仍主要停留在听音乐、记录、语音交互等浅层应用,并未挖掘声音更深层的价值。
听觉不是记录声音,而是预测
在AI时代,一个反直觉的命题,正成为声学与AI研究的焦点:听觉不是对声音的记录,而是对声音所预示的未来进行预测。过去我们追求保存完整声波,却忽略听觉从来不是对外界声音信号的被动记录,而是人类为了生存与行动,对世界做出的主动预测。
为何听觉能做出主动预测?万物振动产生的声波,随物理事件同步生成、实时变化,玻璃碎裂、物体坠落、脚步移动,每一种声音都对应真实发生的物理形态,自带时间、空间与因果信息。视觉只告诉你“这里有什么”,而听觉能告诉你“正在发生什么、即将发生什么”。听觉系统可以根据获取的声波信息持续生成预测、用预测误差来更新模型。
神经科学经典的MMN失匹配负波实验早已证实:人脑会提前建立声音序列预期,当外界声音偏离预判时,100-250ms内会自动产生脑电波反馈,无需主观注意力参与。所以听觉不是被动接收声波信号,而是主动预测事件发生的走向。
相比其他五官,听觉具有预测事件走向、感知物理世界的超强能力,这种能力在AI时代将发挥重要作用。但当前我们习惯用语音语料训练AI对话,AI在听觉能力上与人类的水平相差甚远。今天真正应该做的是用声音背后的空间信息、物理规律、因果逻辑训练AI模型,教AI“听世界”的能力。
听“世界”:时间、空间与因果
在佛经中,“世”为迁流,指时间、事件时序;“界”为方位,指空间。“听世界”并不是“听见声音”,而是要听懂声学事件发生的时空。传统语音AI只利用了声音的一半价值,把声音压缩成事件轴上的文字序列(声音记录:你什么时候说了什么话),完全丢掉空间信息。它不知道声源在哪个方位,所处空间什么样,说话者具体是谁。
声学行业将迈入认知声学阶段
声学发展已经历了三次浪潮,物理声学解决“声音是什么”,计算声学解决“声音怎么算”,智能声学解决“声音怎么用”。AI时代将开启第四次浪潮,从智能声学迈入认知声学。智能声学与认知声学有明显区别,前者是以“全量采集+后端处理”为逻辑,用AI算法在采集后做降噪、增强与识别;后者是研究人耳如何感知声音,追求“听得懂”世界。认知声学不再追求波形的完美还原、噪声的完美滤除,反直觉的是它会把噪声蕴含的声波信息一同作为“线索”,反推说话者所处的空间环境。认知声学追求信息的有效提取、选择性感知和主动预测的能力。
光学领域已率先完成从“看得清”到“看得懂”的跃迁,事件相机不再完整拍摄画面,只捕捉光强变化,依靠“光学编码+算法解码”重构世界。沿着同样的逻辑,李飞飞把“看懂”进一步推向空间智能,通过多模态世界模型教会机器“看世界”。声学完全可以复制这条路径,事件麦克风只记录声场突变,认知阵列用波束成形加语义筛选,存算一体的声学传感器在物理层完成预处理,然后构建听觉世界模型,让AI学会“听世界”。
认知声学还缺两块拼图
认知声学还缺两块关键拼图。第一是具身感知闭环,机器人需分辨:是声源本身在移动,还是自身运动带来声场变化,这是高级物理AI感知的前提。第二是基础数据集,当前音频领域AudioSet只是分类基准,缺少场景、因果、意图标注,行业需要类似视觉领域的“ImageNet”,听觉智能才能追得上空间智能的发展速度。
回顾,ImageNet的缔造者李飞飞,为了让机器学会“看”,最初用着笨方法,人工标注1400万张图片做ImageNet数据集,今天所有图像识别模型都吃着这套数据长大。在听觉领域,我们极度需要SoundNet(ImageNet for Sound)。
听觉智能进化的终局方向
听觉智能的进化可分为七级阶段:信号处理(降噪)、语音识别(单词)、说话者理解(身份)、空间听觉(三维定位)、声学场景理解(非语言事件)、上下文感知(意图)、听觉世界模型(预测未来状态)。前三级是“听声”,中间两级是“听事”,第六级是“听意”,第七级最高阶是“听势”,依靠声学信号预判声源位置与未来事件走向。当前行业大多停留在前三层,高阶认知听觉才刚刚起步。
如何构建听觉世界模型?
传统声学系统停留在感知层面,而未来要构建的听觉世界模型需具备更高阶的AI能力,实现从“听到”到“听清”、“听懂”,再到“预测”的跃升。
听觉世界模型必须具备三大核心能力:
听觉世界模型对行业的颠覆性影响
听觉世界模型彻底打破传统声学“采集、记录、音质”的底层逻辑,重新回到人类听觉的本源处,利用声波信息理解、感知物理世界、提前预判事件以及洞悉人的情绪与意图。这将对消费电子、机器人、具身智能行业产生颠覆性重塑。
消费电子行业
长期以来,耳机、音箱等消费音频产品,陷入极致的音质内卷,产品同质化严重。声学世界模型的出现,将彻底改写消费电子的竞争逻辑,让音频硬件从“影音设备”升级为“AI感知终端”。
未来的音频硬件,不再执着于单纯的降噪、音质优化,而是依托听觉世界模型实现场景认知、意图识别、事态预判、无指令主动交互。耳机能够通过环境声判断用户出行场景,并通过用户说话声判断情绪、理解用户意图,提供AI智能服务。
机器人行业
当前人形机器人、服务机器人、工业机器人快速发展,模仿人类的外形与动作,当它们跑得很快、跳得很高时,我们为之震惊,以为机器人已经足够聪明了。但坦率地说,机器人的AI能力远未达到人类水平。
仅依靠视觉、激光雷达的感知方案,存在天然盲区,无法适配复杂、动态、遮挡的真实场景。机器人行业需要更深度的思考,特别是听觉的短板,一定不是给它装上一只高保真的录音笔记录声音。
听觉世界模型的落地,将为具身智能补齐最后一块感知拼图。依托听觉的时序因果感知能力,机器人可以突破视觉局限,在黑暗、烟雾、遮挡环境中,通过脚步声、物体摩擦声、设备振动声、环境异响,精准判断空间状态、物理运动轨迹、潜在风险,推演物理事件的发展趋势。
更重要的是,听觉世界模型将让机器人摆脱“被动执行指令”的局限,实现主动感知、自主预判、闭环行动。大脑用预测解释声音,物理用声音编码因果,机器用世界模型预测未来。未来听觉世界模型必然走向具身智能,推动具身智能彻底摆脱“形似人类”的困局。
听觉智能,是AI下一个十年前沿
「当前AI只能“描述世界”,为何无法“理解物理世界、预测世界”?」这个问题值得所有人重新思考。
大语言模型教会了AI回答,视觉世界模型教会了AI看见,但AI还学不会“听世界”。
听觉世界模型,将教会AI听懂、预判、感知真实物理世界的因果与未来。
过去,我们低估了声音的价值,将其局限于听音乐、录音、语音交互的浅层场景。但这完全背离人类听觉对声音利用的底层逻辑。
随着认知声学第四次浪潮全面到来,声学将彻底摆脱边缘地位,与视觉、语言并肩,成为AI感知体系的核心支柱。听觉世界模型,将彻底重塑消费电子、机器人、具身智能等核心产业,让机器真正实现“听见世界、听懂因果、预判未来”。
未来,AI的终极竞争,不再是语言与视觉的比拼,而是认知声学、因果预判、主动感知的能力较量。AI下一个前沿,终将是听觉世界模型。
文中内容欢迎大家一起交流、分享,我们希望更多伙伴一起加入研究认知声学的世界,探究 AI 智能体听懂、预判的能力。











