Hierarchical Language Models for Semantic Navigation and Manipulation in an Aerial-Ground Robotic System
1月 1, 2026·,,,,,,·
1 分钟阅读时长
Haokun Liu
Zhaoqi Ma
Yunong Li
Junichiro Sugihara
Yicheng Chen
Jinjie Li
Moju Zhao

摘要
异构多机器人系统在需要协同混合协作的复杂任务中潜力巨大,但依赖静态模型的 传统方法难以应对任务多样性与动态环境。我们提出一个分层框架,融合提示工程 驱动的大语言模型(LLM)与经 GridMask 增强微调的视觉语言模型(VLM):LLM 负责任务分解与全局语义地图构建,VLM 从航拍图像中提取任务指定的语义标签和 二维空间信息以支持局部规划。空中机器人沿全局优化的语义路径飞行,并持续提供 鸟瞰图像,引导地面机器人的局部语义导航与操作(包括目标缺失场景下的隐式对齐)。 据我们所知,这是首个将 VLM 感知与 LLM 任务推理和运动规划相融合的空地异构 系统演示。
类型
出版物
Advanced Intelligent Systems