-
强化学习导论:Reinforcement learning - An introduction
【实例简介】(最新)强化学习导论:Reinforcement learning - An introduction
2020英文版
作者:Richard S. Sutton and Andrew G. Barto
强化学习权威之作
- 2021-07-16 00:31:51下载
- 积分:1
-
基于深度学习字符型图片数字验证码识别完整过程及Python实现(深度学习学习、实现数字、字符模型训练、详细介绍附源码)
基于深度学习字符型图片数字验证码识别完整过程及Python实现(深度学习学习、实现数字、字符模型训练、详细介绍附源码)
- 2019-06-19下载
- 积分:1
-
python绘制一个图形示例源码(tkinter)
python绘制一个图形示例源码(tkinter)
- 2018-09-18下载
- 积分:1
-
伟哥的python私房菜(中国程序员).epub
前有《鸟哥的Linux私房菜》,今有伟哥的python私房菜。伟哥对鸟哥,都是不可或缺的好基友,一天一粒,保证你无限活力。 Python具有易读、易学、易维护、可移植性、跨平台等特点,在最近几年深受欢迎而迅速崛起。python属于所想即所得的语言,实现功能简单浅显易懂。但是Python的创立者有意设计了限制性很强的语法,使得不好的编程习惯都不能通过编译,本书主要是笔者在实践中所遇到的经常使用的技巧性文章,希望对读者有所帮助。 作者:菜鸟飞不动链接:https://www.jianshu.com/p/980d4a399d71来源:简书著作权归作者所有。商业转载请联系作者获得授权,非商业转载请注明出处。
- 2020-06-18下载
- 积分:1
-
猫-非猫图二分类识别
代码用于猫-非猫图片的二分类问题(附件内给出h5格式的数据集),基于Pytorch神经网络工具包,采用比较经典的逻辑回归(Logistic Regression)算法。
- 2020-12-03下载
- 积分:1
-
计算机视觉 opencv 超像素分割.ipynb
计算机视觉 opencv 超像素分割.ipynb
- 2020-11-29下载
- 积分:1
-
012345手势识别神经网络代码
采用全连接神经网络对012345的手势图片进行识别,基于Pytorch编写,附h5格式数据集
- 2020-12-03下载
- 积分:1
-
图像处理(scipy.misc.bytescale.py)
图像处理(scipy.misc.bytescale.py)
- 2020-12-01下载
- 积分:1
-
python打印玫瑰花
python打印玫瑰花
- 2020-12-31 15:38:59下载
- 积分:1
-
俄罗斯方块强化学习实验报告
一、俄罗斯方块DQN算法实验报告1. 网络结构图1 DQN网络结构2. 超参数 GAMMA = 0.99 # decay rate of past observations 设置增强学习更新公式中的累计折扣因子 OBSERVE = 500. # timesteps to observe before training 设置观察期的迭代次数 EXPLORE = 500. # frames over which to anneal epsilon 设置探索期的观察次数 FINAL_EPSILON = 0.002 # final value of epsilon 设置ε的最终最小值 INITIAL_EPSILON = 10.0 # starting value of epsilon 设置ε的初始值 REPLAY_MEMORY = 5900 # number of previous transitions to remember 设置replay memory的容量 BATCH = 32 # size of mini batch 设置每次网络参数更新世用的样本数目 K = 1 # only select an action every Kth frame, repeat prev for others,设置几帧图像进行一次动作, # K越大让控制台输出的速度变慢,游戏画面速度变快,机器人动作的速度变越迟缓。ACTIONS = 6 # number of valid actions 游戏动作数3.实验结果训练前期的self.score分数很低150左右,EPSILON=1.0,Q_MAX= 2.061341e-02:图2 EPSILON=1.0设置超参数EPSILON=0.05在1000步迭代之后:EPSILON固定在0.04999999999999416 Q_MAX = -1.163765e-01Self.score有明显的提升,但是之后无论训练多久都没有明显提升了。图3 EPSILON=0.05设置超参数EPSILON= 0.002在1001步迭代之后:EPSILON固定在0.000004 Q_MAX = 1.728995e 02Self.score可以轻松达到200以上。图4 EPSILON=0.000004设置超参数EPSILON= 0.000001在1001步迭代之后:EPSILON固定在-0.001998997999987482 Q_MAX = 1.899879e 03Self.score可以轻松达到200以上。图5 EPSILON=-0.002 【核心代码】用DQN来玩俄罗斯方块 tetrix_DQN ├── Wrapped Game Code│ └── tetris_fun.py├── deep_q_network.py├── logs_tetris│ ├── hidden.txt│ └── readout.txt└── saved_networks ├── tetris-dqn-10000.data-00000-of-00001 ├── tetris-dqn-10000.index ├── tetris-dqn-10000.meta └── tetris-dqn-316600003 directories, 8 files
- 2020-12-01下载
- 积分:1