On the capabilities of LLMs for classifying and segmenting time series of fruit picking motions i...
2026/10/11 5:15:44
网站建设
项目流程
一、文章主要内容总结
本文聚焦于探索大型语言模型(LLMs)在水果采摘动作时间序列的分类与分割中的能力,旨在将复杂采摘动作分解为预定义的基本动作(如拉、滑、摆动、倾斜、扭转),为机器人示教学习(LbD)提供支持。
- 研究背景:在机器人学中,将复杂动作分割为基本动作是通过示教学习人类运动行为的关键步骤,但现有分析方法或深度学习模型(如DNN、TCN)存在部署难度高或依赖专业技能的问题。
- 研究方法:基于GPT-4-turbo构建自定义模型,比较三种微调策略:
- 仅使用基本动作的语言描述(方法A);
- 仅使用少量代表性动作示例数据(每种动作5个样本,方法B);
- 结合语言描述与示例数据(方法C)。
- 数据与实验:通过UR10e机器人手动引导捕获水果采摘动作的时间序列数据(包含位置、速度等信息),经预处理(如插值、求导)后用于模型训练与测试。实验评估了20个复杂动作序列(含56个基本动作)的分类与分割效果。
- 结果:方法C性能最优(分类准确率28%),优于方法A(19%)和方法B(14%);引入反馈机制后,性能进一步提升(44%)。
二、创新点
- 首次将LLMs应用于水果采摘动作的分类与分割:突破传统依赖DNN、TCN或分析方法的局限,探索LLMs在运动时间序列处理中的潜力,提升方法的实