声明
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。
国内刊号:21-1137/TP
国际刊号:1002-0446
发布日期:
作者:陈鹏, 陈旭, 罗文, 林斌
关键词:跨视图地理定位, 视觉语言模型, 多模态, 图像匹配, 无人机
无人机跨视图地理定位通过在卫星拒止条件下匹配机载图像与地理参照图像实现自主定位,主要挑战在于跨视图图像间的显著外观差异。现有方法多局限于局部特征提取,缺乏对上下文关联和全局语义的深入挖掘。为此,本文提出了一种基于视觉语言模型的多模态无人机跨视图地理定位模型。利用CLIP(contrastive language-image pre-training)模型构造了一个视图文本描述生成模块,将CLIP模型从海量数据集中学习到的图像级视觉概念作为外部知识,引导模型的特征提取过程。采用混合ViT(视觉Transformer)架构作为骨干网络,使模型在提取图像特征时兼顾局部特征与全局上下文特征的提取。此外,为了使模型能够更有效地学习到不同视图间的关联,还引入了基于逻辑得分标准化KL(Kullback-Leibler)散度的互学习损失函数来监督模型的训练过程。实验结果表明,在CLIP模型生成的文本描述结果引导下,所提模型更容易学习到深层语义信息,从而能够更好地应对跨视图地理定位过程中存在的视角差异、拍摄时间差异等挑战。
来源:2025年第3期
《机器人》期刊编辑部
严正声明:本站非期刊官网,非中介代理。
本站仅提供学术规范服务:快速预审、润色编辑服务、中英文查重、降重、去重服务、推荐合适的期刊投稿等学术规范服务。 如需提供学术规范服务请联系在线编辑。