学位论文 > 优秀研究生学位论文题录展示
强化学习在足球机器人仿真中的应用
作 者: 刘飞
导 师: 陈焕文
学 校: 长沙理工大学
专 业: 通信与信息系统
关键词: 强化学习 多智能体 SARSA算法 仿真足球机器人 瞬时差分算法
分类号: TP18
类 型: 硕士论文
年 份: 2012年
下 载: 62次
引 用: 0次
阅 读: 论文下载
内容摘要
|
机器人足球的研究涉及了人工智能、机器人学、计算机视觉及智能控制等多个领域,是目前机器人研究中的一个热点。由于机器人足球具有分布性、实时性、动态性、异步性等特点,使其成为分布式人工智能研究的一个标准的平台。仿真足球机器人比赛相对于实体比赛而言有不需要昂贵的高性能设备、环境要求低等优点,仿真比赛可以从软件来模拟实体比赛,学者可以将更多的算法应用于该平台,从而检验这些算法的优劣。强化学习不需要具备先验的知识,它可以直接通过与环境的交互来获取知识,从而改变策略。由于强化学习具有不需要环境模型、能够处理噪声的干扰和随机性的特性,当状态空间很大的时候也可以通过状态压缩、函数近似等方法来解决。所以强化学习在足球机器人中得到了很广泛的应用。本文首先对足球机器人的研究背景和现实意义进行了简单的介绍,并介绍了所使用的仿真平台。其次,研究了强化学习的基本原理,并研究了几种经典的强化学习算法,即瞬时差分算法、Q算法和SARSA算法。最后,将SARSA学习算法应用在单智能体仿真环境中,使用强化学习方法时需要考虑状态的离散化,动作函数的设计,奖赏函数的设计,动作选择的方法等方面。将一种改进的SARSA学习算法应用在多智能体环境中,使智能体的学习效率更高,并与SARSA算法的实验效果进行比对,验证了这种改进的算法的优越性。
|
全文目录
摘要 5-6 ABSTRACT 6-11 第一章 绪论 11-16 1.1 机器人足球比赛的起源及发展 11-13 1.1.1 FIRA 简介 11-12 1.1.2 RoboCup 的发展 12-13 1.2 足球机器人仿真的研究现状 13-14 1.3 足球机器人研究的目的与意义 14 1.4 本文研究的主要内容 14-16 第二章 MSRS 11vs11 足球机器人仿真比赛平台 16-23 2.1 机器人足球系统简介 16-18 2.1.1 机器人子系统 17 2.1.2 视觉子系统 17 2.1.3 决策子系统 17-18 2.1.4 无线通讯子系统 18 2.2 足球机器人仿真平台 18-22 2.2.1 MSRS 仿真平台简介 18-19 2.2.2 MSRS 仿真平台的结构 19 2.2.3 MSRS 仿真平台模式 19-21 2.2.4 比赛场地环境 21-22 2.3 本章小结 22-23 第三章 强化学习 23-33 3.1 强化学习的发展及研究现状 23-24 3.2 强化学习的基本原理和模型 24-28 3.2.1 基本原理 25 3.2.2 强化学习模型 25-27 3.2.3 马尔可夫决策过程(MDP) 27-28 3.3 强化学习的几种经典算法 28-32 3.3.1 瞬时差分算法 TD(Temporal Difference Algorithm) 28-29 3.3.2 Q 学习算法 29-30 3.3.3 SARSA 学习算法 30-31 3.3.4 一种改进的 SARSA 学习算法 31-32 3.4 强化学习的主要应用 32 3.5 本章小结 32-33 第四章 基于强化学习的比赛策略的应用研究 33-46 4.1 强化学习应用在单智能体的学习过程中 33-38 4.1.1 仿真环境的离散化 33-34 4.1.2 动作函数的设计 34 4.1.3 Q 值的更新和动作选择的方式 34-36 4.1.4 奖赏函数的设置 36 4.1.5 仿真实验数据分析 36-38 4.2 强化学习在 1VS1 对抗比赛中的应用 38-40 4.2.1 仿真环境的离散化 38-39 4.2.2 动作函数的设计 39 4.2.3 奖赏函数的设计 39-40 4.2.4 Q 值的更新和动作的选择 40 4.2.5 仿真实验数据分析 40 4.3 多智能体的学习 40-45 4.3.1 任务描述 41 4.3.2 智能体可以采取的动作 41-42 4.3.3 状态变量的设置 42-44 4.3.4 奖赏函数的设定 44 4.3.5 仿真实验数据分析 44-45 4.4 本章小结 45-46 第五章 结论与展望 46-48 参考文献 48-53 致谢 53-54 附录 A:(攻读硕士学位期间发表论文目录) 54-55 附录 B:(攻读硕士学位期间获得证书) 55-57 摘要 57-60 Abstract 60-63
|
相似论文
- 基于强化学习的改进遗传算法研究,TP18
- 基于强化学习的蚁群聚类研究及应用,TP18
- 异构双腿机器人步态规划与控制研究,TP242
- 微分进化算法及其在无人机航迹规划中的应用研究,V279
- 网络效应软件产品定价多智能体仿真研究,F224
- 复杂网络中软件新产品信息扩散的延迟特征研究,O157.5
- 基于LMI方法的多智能体复杂动态网络的一致性,O157.5
- 基于进化博弈的项目型组织团队—任务互动集成模拟研究,F272.92
- 复杂制造系统中机加—热处理综合调度方法,TH186
- 基于多Agent的河北冀通路桥公路施工智能决策支持系统研究,TP311.52
- 多智能体的一致性,TP18
- 基于多Agent Q学习算法的气候合作策略研究与仿真,TP181
- 基于模型的动态分层强化学习算法研究,TP181
- PSO算法在单层建筑物人群疏散仿真中的应用,TP301.6
- 多智能体差分进化算法及其在发酵过程优化中的应用,TP18
- 城市交通诱导与控制系统一体化集成理论与技术研究,U495
- 基于多智能体间协作模型及其学习方法研究,TP18
- 多智能体救援仿真系统研究,TP18
- 解决强化学习中维数灾问题的方法研究,TP181
- 神经网络拓扑结构的自动生成方法研究,TP183
- 基于带权与或树和AOE-网的多智能体动态任务规划研究,TP18
中图分类: > 工业技术 > 自动化技术、计算机技术 > 自动化基础理论 > 人工智能理论
© 2012 www.xueweilunwen.com
|