RL workflow
1 环境,环境中存在什么,是模拟仿真还是真实的物理设备
2 奖励,思考最终想要智能体做什么,并设计奖励函数来激励智能体,按照期望执行任务
3 策略,我们希望如何构造智能体(决策涉及的参数和逻辑)
4 训练算法,寻找最优策略
5 部署验证,利用策略,部署到智能体,并验证结果
智能体由策略+学习算法组成,
免责声明:本文系网络转载或改编,未找到原创作者,版权归原作者所有。如涉及版权,请联系删
姓名不为空
手机不正确
公司不为空