热点资讯

探索下一代空间智能的挑战与机遇

datetime

2026-09-12

阅读数量

9425

“空间智能”不仅仅是海量信息的堆砌,更是对当前环境的判断与行动规划。 AI经历了几年的学习,终于能够流利地描述世界,但接下来它要面对更为复杂的现实:真正融入世界。 大模型能够轻松制定周末计划,推荐餐厅、总结评价、制定游览路线,但现实的问题随之而来:推荐的店是否营业?会不会排队?汽车该停哪里?从地铁哪个出口出?地图上的入口是否有施工?等等,这些问题都不能仅用语言回答,现实并非是一份静态的文本。路况、商家变动、气候等都在不断变化,而人的每个选择也在推动世界向不同的方向发展。

因此,越来越多的AI研究人员将注意力转向了“空间智能”。斯坦福大学教授李飞飞指出,空间智能是人类认知的基础,它关乎我们如何识别物体、理解环境、判断空间关系,并支持我们在现实中进行感知、推理与行动。人类正是通过这种能力在复杂环境中建立了认知模型,从而预测变化并与周围环境互动。

如果说大语言模型标志着人工智能的第一阶段,那么空间智能可能是下一个更亟待解决的重要领域。大语言模型的训练有明确目标:根据上下文预测下一个词。而现实世界并没有这样一致且明晰的数据格式。机器不仅要识别物体,还要理解物体之间的关系和动态;它需记住空间结构,判断时间和行动如何改变该结构。当场景扩展至街道和城市时,挑战愈加复杂。机器需要理解“这里发生了什么”以及“接下来可能发生什么”。 龙8头号玩家国际

因此,世界模型成为实现空间智能的重要路径,它旨在让AI在内部构建一个关于外部世界的模型,通过此模型表达空间、模拟变化并规划行动。不同公司为实现这一目标选择了不同的方式。李飞飞的World Labs从三维空间的生成与重建入手,2025年将推出Marble,能根据文本、图像和视频生成可探索和编辑的三维世界。2026年,新一代世界模型Atlas将推出,整合文字、图片及视频信息,并可以模拟空间随时间的变化。

Google DeepMind采取了另一种方式,推出的Genie 3能根据文字描述实时生成可操控的环境,并针对智能体在其中的移动不断生成世界的下一帧。英伟达的Cosmos则专注机器人和自动驾驶,提供多种条件下的未来场景以供测试和训练。

高德则选择了独特的技术路径。高德的空间智能重心在于理解一个已经存在的、持续变化的世界,而非从零开始生成。作为一款拥有十亿用户的C端产品,高德积累了丰富的现实世界数据,包括道路连接、商家的分布、交通变化、用户选择的目的地和行驶路线等。 龙8头号玩家国际

高德的目标是识别现实世界的状态,预测其变化,并提供合理的用户建议。这也使得其评价标准与生成式世界模型不同:在地图和导航中,现实中通常只有一个正确答案。

高德CEO郭宁认为,地图过去主要记录地点和道路,导航则计算路线。进入AI时代,他希望高德能够实现更深层次的理解。他把这一能力分为四个层面,提升从二维世界到多维空间的连接和理解能力。