学位论文 > 优秀研究生学位论文题录展示
基于增强学习的移动机器人运动控制研究
作 者: 张洪宇
导 师: 徐昕
学 校: 国防科学技术大学
专 业: 控制科学与工程
关键词: 移动机器人 动力学模型 运动控制 非完整系统 机器学习 增强学习 策略迭代 马尔可夫决策过程 近似策略迭代
分类号: TP242.6
类 型: 硕士论文
年 份: 2008年
下 载: 192次
引 用: 2次
阅 读: 论文下载
内容摘要
|
增强学习(Reinforcement learning:RL)是近年来机器学习和人工智能领域研究的热点之一。与监督学习不同,增强学习强调在与环境的交互中进行学习,以极大化(或极小化)从环境获得的评价性反馈信号为学习目标,因此增强学习在求解无法获得教师信号的复杂优化决策问题中具有广泛的应用前景。作为移动机器人系统的一项关键技术,运动控制的目标是实现机器人位姿对期望轨迹或路径的快速精确跟踪。由于环境的复杂性以及动力学模型的不确定性,移动机器人运动控制器的优化设计仍然是目前研究的难点和热点之一。本文在研究探索面向连续空间优化决策问题的高效增强学习方法的基础上,研究了基于增强学习的移动机器人运动控制器优化设计方法。具体完成的主要工作包括:(1)对增强学习的近似策略迭代方法进行了分析研究。针对最小二乘策略迭代(Least-Squares Policy Iteration:LSPI)增强学习算法中的值函数逼近问题,提出了一种采用相关分析的线性基函数自动选择方法,实现了多项式基函数的自动选择,提高了值函数逼近器的逼近精度和泛化性能,从而改善了学习算法的性能。(2)提出了一种基于近似策略迭代的移动机器人路径跟随控制器设计方法。通过将机器人运动控制器的优化设计问题建模为Markov决策过程,采用近似策略迭代算法(包括LSPI和Kernel-based LSPI:KLSPI)实现控制器参数的自学习优化。其中,KLSPI算法在策略评价中应用核方法进行特征选择和值函数逼近,从而提高了泛化性能和学习效率。(3)在P3-AT型轮式移动机器人实验平台上进行了基于增强学习的路径跟随控制研究。将移动机器人实际采样数据作为学习样本,采用增强学习的近似策略迭代算法优化控制策略,从而实现了路径跟随控制器的优化设计,实验结果验证了本文方法的有效性。(4)将以上研究成果推广应用到多机器人编队控制问题中,设计了一种结合距离-角度(l-φ)反馈控制与增强学习的多机器人队形保持控制器。通过应用LSPI和KLSPI等近似策略迭代算法实现(l-φ)反馈控制中参数向量的学习优化,并在多机器人仿真与实验环境中对以上方法进行了测试。本文研究工作一方面对增强学习算法的基函数选择问题进行了探讨和改进,另一方面,有利于推进增强学习在移动机器人运动控制等不确定优化决策问题中的应用。
|
全文目录
摘要 7-9 ABSTRACT 9-11 第一章 绪论 11-25 1.1 研究背景 11-14 1.1.1 基于增强学习的优化控制方法 11-13 1.1.2 移动机器人系统的发展概述及其关键技术 13-14 1.2 增强学习的研究现状与发展趋势 14-19 1.2.1 增强学习算法的研究进展 15-17 1.2.2 增强学习应用的研究进展 17-19 1.3 移动机器人运动控制的研究概况 19-22 1.3.1 移动机器人运动控制方法研究概述 19-21 1.3.2 多机器人编队控制问题 21-22 1.3.3 多机器人编队控制的研究进展 22 1.4 本文主要研究工作 22-25 1.4.1 本文的主要研究内容及组织结构 22-23 1.4.2 论文的主要贡献 23-25 第二章 增强学习的近似策略迭代方法及其改进 25-42 2.1 Markov决策过程 25-29 2.1.1 Markov链 25-28 2.1.2 Markov决策过程 28-29 2.2 近似策略迭代算法的理论框架 29-35 2.2.1 近似策略迭代和时域差值学习 29-31 2.2.3 最小二乘策略迭代算法 31-33 2.2.3 基于核的最小二乘策略迭代算法 33-35 2.3 采用基函数自动选择的改进LSPI算法 35-41 2.3.1 多项式基函数 35-37 2.3.2 基函数相关分析 37-38 2.3.3 仿真实例 38-41 2.4 本章小结 41-42 第三章 基于近似策略迭代的移动机器人控制器设计与实现 42-59 3.1 轮式移动机器人特性分析 42-44 3.1.1 轮式移动机器人动力学分析 43 3.1.2 轮式移动机器人反馈控制器设计分类 43 3.1.3 轮式移动机器人约束分析 43-44 3.2 双轮驱动移动机器人的学习控制器设计仿真研究 44-52 3.2.1 问题描述 44-47 3.2.2 双轮驱动移动机器人的学习控制器设计 47-50 3.2.3 仿真结果 50-52 3.3 轮式移动机器人的路径跟随学习控制实验研究 52-58 3.3.1 P3-AT型移动机器人的学习控制任务 52-53 3.3.2 样本的采集 53-54 3.3.3 直线跟随实验 54-56 3.3.4 曲线跟随实验 56-58 3.4 本章小结 58-59 第四章 增强学习在多机器人编队控制中应用研究 59-71 4.1 多机器人编队问题概述 59-60 4.1.1 多机器人编队主要研究内容 59-60 4.1.2 多机器人编队的优点 60 4.2 基于增强学习的多机器人队形保持控制器设计 60-66 4.2.1 多机器人编队问题描述 61-62 4.2.2 基于距离角度信息的l-φ反馈控制方法 62-64 4.2.3 基于l-φ控制与增强学习的队形保持控制器设计 64-66 4.3 多机器人队形保持控制仿真与实验 66-70 4.3.1 多机器人仿真平台的设计 66-67 4.3.2 多机器人编队仿真与实验研究 67-70 4.4 本章小结 70-71 第五章 总结与展望 71-73 5.1 本文工作总结 71 5.2 今后工作展望 71-73 致谢 73-74 参考文献 74-78 作者在攻读硕士学位期间完成和发表的论文 78
|
相似论文
- 自主移动机器人导航与控制中的增强学习方法研究,TP242.6
- 自主泊车系统关键技术研究,TP273.5
- 基于逻辑马尔可夫决策过程的关系强化学习研究,TP181
- 控制系统的学习和优化:马尔可夫性能势理论与方法,O211.62
- 淀粉样β蛋白神经毒作用的α7烟碱型胆碱能受体机制:在体动物电生理和行为学研究,R749.16
- 在线学习及其在智能交通与金融工程中的应用,U495;F830
- 基于决策理论的多智能体系统规划问题研究,TP18
- 网络化制造模式下MES系统研究与实现,TH166
- 认知无线电系统中自适应跨层优化机制的研究,TN925
- 基于值函数逼近与状态空间分解的增强学习方法研究,TP242
- 基于网上拍卖的库存控制研究,F713.359;F49
- 认知无线网络中频谱检测机制及频谱资源分配研究,TN925
- 部分可观察Markov决策过程中基于内部状态的强化学习研究,TP181
- 马氏决策规划在股票价格预测中的应用,F830.91
- 基于马尔可夫理论埋地燃气钢管腐蚀预测研究,TU996.7
- 图规划框架下的决策概率规划的研究与实现,TP18
- 基于增强学习的小型无人直升机控制方法研究,TP273
- 基于自学习的社会关系抽取的研究,TP391.1
- 数据挖掘在邮件反垃圾系统中的应用,TP393.098
- 社会化网络中的推荐算法及其应用,TP391.3
中图分类: > 工业技术 > 自动化技术、计算机技术 > 自动化技术及设备 > 机器人技术 > 机器人 > 智能机器人
© 2012 www.xueweilunwen.com
|