本文首次系统研究了最先进的生成式视觉语言模型(VLM)作为独立、零样本的地理定位系统,在具有现实限制的黑盒设置下的表现。研究考虑了固定文本提示、语义等价文本提示和语义等价查询图像三种场景,并引入模型一致性作为评估指标。结果表明,VLM在粗粒度定位和导航先验方面表现良好,但在现实变化下细粒度定位性能显著下降,凸显了在鲁棒开放世界机器人导航系统中部署VLM的可靠性挑战。
核心观点
- 首次系统研究黑盒VLM在零样本地理定位中的表现
- 考虑三种现实场景:固定提示、语义等价提示、语义等价查询图像
- 引入模型一致性指标以评估生成式VLM的自动回归和概率特性
- VLM在粗粒度定位表现良好,但细粒度定位在现实变化下显著退化
技术要点
黑盒VLM(通过API访问,无法获取训练数据、特征和梯度,无法重训练),零样本地理定位(仅使用单一文本提示进行行星尺度定位),生成式VLM的自动回归和概率特性,模型一致性度量
应用场景
机器人绑架问题中的全局重定位阶段,机器人通过视觉数据恢复姿态(无先验位置信息),开放世界机器人导航系统