本文首次系统研究了最先进的生成式视觉语言模型(VLM)作为独立、零样本的地理定位系统,在具有现实限制的黑盒设置下的表现。研究考虑了固定文本提示、语义等价文本提示和语义等价查询图像三种场景,并引入模型一致性作为评估指标。结果表明,VLM在粗粒度定位和导航先验方面表现良好,但在现实变化下细粒度定位性能显著下降,凸显了在鲁棒开放世界机器人导航系统中部署VLM的可靠性挑战。

核心观点

技术要点

黑盒VLM(通过API访问,无法获取训练数据、特征和梯度,无法重训练),零样本地理定位(仅使用单一文本提示进行行星尺度定位),生成式VLM的自动回归和概率特性,模型一致性度量

应用场景

机器人绑架问题中的全局重定位阶段,机器人通过视觉数据恢复姿态(无先验位置信息),开放世界机器人导航系统