9 月 10 日,阿里巴巴集团旗下的高德地图发布新模型 ABot-Earth 0.7,高德称之为全球首个「3D 原生」城市世界模型。它的核心能力是:输入一张卫星照片或一句文字描述,10 分钟内在普通显卡上生成一片公里级的立体城市,用户可以走进去、自由探索、实时交互。官方口径称,这一生成方式的效率比传统做法提升 1000 倍,模型覆盖超过 196 个国家和地区。

主角是谁:高德和它的世界模型

高德是阿里巴巴旗下做地图导航的公司,也是中国用户量最大的出行导航 App——官方口径称其日调用北斗卫星定位峰值接近一万亿次,服务覆盖全球 200 多个国家和地区。ABot-Earth 是它推出的城市世界模型系列,0.7 是最新版本。

先解释「世界模型」:主流大模型(用海量文本训练、能理解和生成文字的程序)理解的是语言;世界模型要理解的是真实世界——三维空间长什么样、车流人流怎么流动、时间变化如何影响一切。ABot-Earth 0.7 就属于这一类,只是它的舞台聚焦在城市。

3D 原生:直接生成,而不是把照片贴上去

过去二十年的数字地球(在电脑里复刻真实世界的三维模型,也叫数字孪生),主要靠把卫星影像、航拍照片和点云拼接后贴在屏幕上。用户能看到什么、从哪个角度「飞」,受制于素材有没有拍到。

ABot-Earth 0.7 换了路线:用涵盖空间、时间信息的时空数据训练模型,让模型建立对三维空间的原生理解,端到端一次生成 3DGS(三维高斯泼溅)格式的城市场景。3DGS 是一种较新的三维表示技术,把场景表示为大量微小光点,渲染快、细节接近照片。模型还能自主补全未拍摄的区域,生成完整连续的空间,用户因此可以连续进入、自由探索,获得实时交互反馈。

关键数据:10 分钟、1000 倍、全尺寸

官方给出的量化指标:输入一张卫星图像或一段文字描述,10 分钟即可在一块消费级 GPU(普通工作站级别的显卡)上生成公里级 3D 城市场景,效率比传统模式提升1000 倍。

「全尺寸」指同一个模型覆盖从星球、城市到街景地标的连续生成:城市级生成要保持路网、街区和建筑群的整体关系;推进到地标近景,要还原单栋建筑的几何轮廓、立面层次和材质纹理。官方称视角从城市全貌推进到地标细节时,模型仍能保持空间结构一致、达到照片级效果。

已经在用的地方

目前 ABot-Earth 0.7 的体验官网已上线,能力已接入飞行街景 2.0:用户进入复杂建筑、大型景区,可以用摇杆在 3D 场景中漫游。生态方面,高德对外宣布梅赛德斯-奔驰成为其全球首个汽车合作伙伴;高德表示空间智能正通过手机、车机、具身机器人(拥有身体、能在物理世界行动的机器人)、智能眼镜、智能手表等终端进入真实生活。

高德把它放在什么位置

高德 CEO 郭宁的表述是:「大模型理解语言,高德空间智能理解世界。」他将空间智能拆为三层:三维空间表达(还原真实世界的细节与层次)、动态感知(捕捉车流人流、路况、昼夜的变化)、时空推演(结合上下文给出最优解)。ABot-Earth 0.7 承担第一层,也是后两层的地基——它把卫星图像、文字描述转化为可进入、可交互的三维世界,成为 AI 理解世界如何连接、如何变化、如何运行的入口。

一句话带走:ABot-Earth 0.7 第一次把「数字地球」从只能看的拼接照片,变成 10 分钟就能生成一座的立体城市,代表着高德把海量导航数据转化为「空间智能」的第一步;它的地基铺得稳不稳,将决定高德能否兑现这套三层空间智能的路线。