• 当AI学会“不说话”

  • □四川日报全媒体记者 唐泽文
      9月9日,京东全球科技探索者大会在北京举行。整个探索者大会上,最让我印象深刻的,是一副看上去并不起眼的AI眼镜。让我记住它的,不是它“看见了什么”,而是它“学会了什么时候不开口”。
      这副眼镜接入的,是京东今年6月开源的JoyAI-VL-Interaction全模态交互模型。戴上它之后,视力障碍的人走到十字路口,它就会在车辆靠近时提示说:“注意,左后方有电动车正在接近。”当不需要提示的时候,它也不会一直“聒噪”。
      让我记住它的原因在于,它解决了一个此前几乎没人认真对待的问题——AI不能一直说话。
      今天的多模态大模型,大多遵循一种逻辑:用户提问,模型回答。你问,它答。这种“回合制”交互在写文案、查资料时够用,但真实世界并非静态,它一直在变化,当变化发生时,人未必有空开口。而且,一个时时刻刻都在主动说话的AI,不会显得更智能,只会更烦。
      JoyAI-VL-Interaction把“沉默”设计成了一个需要学习的动作。每秒都在做判断:继续观察,保持沉默,还是主动回应。遇到复杂任务,交给后台智能体处理,自己继续盯着眼前,形成一套“前台实时助手+后台智能大脑”的协作机制。
      这可能是人机交互的一次重要转向——AI不再只是“你问我才答”的工具,而是开始学习如何“在场”。
      在这次大会上,京东还发布了实时可交互世界模型JoyAI-EchoWM。它既能根据用户移动和视角变化持续生成世界,也能同步生成720P视频、环境音、音乐和语音。
      实际上,在大会前不久,斯坦福大学教授李飞飞创办的World Labs也发布了全球首个多模态世界模型——Atlas。Atlas 最核心的能力,是把文字、图像、视频和3D信息放进统一的空间上下文。只需一张或几张图片,它就能重建三维场景、生成新的观察视角,并让相机沿指定轨迹在其中移动,同时保持空间结构的一致性。与主要生成二维画面的传统视频模型不同,Atlas将文本、图像、视频、相机位姿和三维深度信息纳入同一个模型框架。
      李飞飞本人将这一时刻称为“里程碑”。其实早在今年3月,国内空间智能团队影溯开源的世界模型InSpatio-World就已经具备了类似能力——输入一段普通视频,就能构建一个可以继续探索的动态4D场景。
      Atlas和InSpatio-World虽然技术路径不同,但指向了同一种变化:世界模型正在从“生成一段看起来合理的视频”,走向“围绕一个持续存在的空间状态,生成不同位置、不同视角下的观测结果”。
      据此推导,AI正在从“数字空间”走向“物理空间”。
      谁参数量更大、谁上下文更长、谁推理能力更强已经是过去式。下一阶段的竞争,是谁能让AI真正理解物理世界的运行规律,并能与真实环境进行闭环互动。
      这个互动,很难。但不管怎样,这段路,大家当下已经开始走了。
      希望这副懂得“不说话”的AI眼镜,能成为AI从“识别世界”走向“理解世界”的那个转折点。

分享到微信朋友圈