该杂志刊期列表
- 2022年
- 24期
国内刊号:44-1259/TH
国际刊号:1001-3881
发布日期:
作者:卓鹏涛,赵纪元,范玲玲,姚纪阳,李忠豪
单位:北京信息科技大学自动化学院;北京信息科技大学自动化学院;北京信息科技大学自动化学院;北京信息科技大学自动化学院;北京信息科技大学自动化学院
关键词:欠驱动灵巧手;重定向任务;近端策略优化;多头自注意力;课程学习
欠驱动灵巧手执行重定向任务场景时,由于自身自由度的限制以及任务本身的复杂性,常面临奖励稀疏、难以学习到有效策略、任务成功率低等问题。为此,提出一种基于近端策略优化算法(PPO)、多头自注意力机制(MHSA)和课程学习策略(CL)的策略优化算法MHSA-CL-PPO。在策略网络输入归一化层与原有隐藏层之间加入多头自注意力层,通过注意力计算生成带权重的多维状态表示,使网络能够聚焦于对任务进展影响更大的状态维度;另外,引入课程学习策略并搭建奖励函数,根据翻转程度逐渐提升手内物块翻转的难度,以缓解策略学习过程中的稀疏奖励问题。最后,构建仿真场景,通过MUJOCO物理引擎进行实验验证。结果表明:相比传统PPO算法和DDPG算法,所提MHSA-CL-PPO算法获得了更高的平均奖励值,任务成功率明显提升,在物块90°翻转任务中,10 000次测试成功率达到82.31%,验证了改进算法在策略学习上的优越性,同时也证明了欠驱动灵巧手在手内物块重定向等灵巧操作任务中的可行性。
来源:2026年第6期
《机床与液压》期刊编辑部