当前位置：首页 > news >正文

如何分辨on-policy和off-policy

news 2026/2/8 17:45:22

on-policy的定义：behavior policy和target-policy相同的是on-policy，不同的是off-policy。

behavior policy：采样数据的策略，影响的是采样出来s,a的分布。
target policy：就是被不断迭代修改的策略。

如果是基于深度的算法，那么非常好分辨：目标函数里面一定有s和a的期望，而计算梯度的时候使用了SGD，把一个采样作为了期望的值。但是这里面还有一个隐含的限制就是采样遵循的分布必须是s,a的分布。

因此分辨是否是on-policy的，只需要看目标函数。如果目标函数中s,a的分布和策略相关的，那么一定是on-policy的，如果是策略无关的，那么一定是off-policy的。

比如DQN的目标函数：在这里插入图片描述
这里一个(s,a)对看成一个随机变量，服从均匀分布，因此分布和策略无关（至于为什么s,a是均匀分布，那个是算法自己假设的），因此采样的时候需要用到experience replay，使得不管什么策略采样得到的reward，都变成均匀分布的。

因此用了experice replay之后，随便什么策略采样，虽然采样出来s,a服从那个策略的分布，但是经过experice replay之后还是变成了均匀分布。

比如PG:
在这里插入图片描述

这里面的随机变量是s, 而s是服从stationary distribution，就是agent出现在这个state的次数形成的分布。而这个分布和策略pi是相关的，因此是on-policy的(改变策略之后，agent出现的概率也改变了)

比如DPG:

在这里插入图片描述
这里面的分布d是一个常数(这是为了计算梯度方便)，因此DPG中s,a的采样和策略无关，是off-policy的。

比如PPO:

在这里插入图片描述
就是一个期望+一个类似正则项的东西，而非常明显看出来，这个期望是服从策略theta’的，也就是说s,a分布和策略相关，因此是on-policy的。

简单说下PPO：PPO用两个网络表示策略，一个是theta’一个是theta，用theta’网络的策略采样reward，得到的reward给theta的网络梯度下降。看起来怎么用了两个策略? 其实两个策略最后慢慢收敛到一起的，是一个策略。如果是off-policy是完全和策略无关的。

如何分辨on-policy和off-policy

on-policy的定义：behavior policy和target-policy相同的是on-policy，不同的是off-policy。 behavior policy：采样数据的策略，影响的是采样出来s,a的分布。 target policy：就是被不断迭代修改的策略。如果是基于深度…...

编程日记 2023/5/15 9:05:38

第三讲：ambari编译后的安装包制作流程说明

一、概述前两讲，我们已经将 Ambari 源码编译成功。现在我们想将 Ambari 编译后的 rpm 包，都放到 yum 本地仓库中，这样 Ambari 与 HDP 在安装部署时，就直接使用的我们自己编译的安装包了。 Ambari 的 rpm 包，有这么几类： ambari-server rpmambari-agent rpmambari metr…...

编程日记 2023/5/15 9:05:16

Python进阶-----面对对象6.0（绑定方法[类方法、静态方法]与内置方法）

目录前言： 1.绑定方法 （1）实例方法 （2）类方法 （3）静态方法 2.类型检测 （1）issubclass() 函数 （2）isinstance() 函数 3.内置方法&#xf…...

编程日记 2023/5/15 9:05:03

java8四大基本函数式接口

1.什么是函数式接口? 只包含一个抽象方法的接口，称为函数式接口你可以通过Lambda表达式来创建该接口的对象。（若Lambda表达式抛出一个受检异常，那么该异常需要在目标接口的抽象方法上进行声明）我们可以在任意函数式接口上使用Fu…...

编程日记 2023/5/15 9:04:47

Junit测试框架

一、简介 Junit框架是一个开源的Java语言单元测试框架，Java方向使用最广泛的单元测试框架，使用Java开发者都应该学习Junit并能掌握单元测试的编写。对于Junit和Selenium的关系：通俗点来说Selenium如果比喻为灯泡，那么Junit就是电…...

编程日记 2023/5/15 9:04:16

操作系统复习题

什么是线程？ 线程（Thread）：轻量级进程，是操作系统进行调度的最小单位。一个线程是一个任务（一个程序段）的一次执行过程。线程不占有内存空间，它包括在进程的内存空间中。在同一个进程…...

编程日记 2023/5/15 9:03:52

web项目的初始化

Tomcat 安装配置 Tomcat 官方站点：Apache Tomcat - Welcome! 。安装得到下载的安装包（一般是 zip 文件），并解压到你指定的目录（建议不要解压在 c 盘）；（这里以 windows10 系统为例…...

编程日记 2023/5/15 9:03:29

29- 迁移学习 (TensorFlow系列) (深度学习)

知识要点迁移学习: 使用别人预训练模型参数时，要注意别人的预处理方式。常见的迁移学习方式： 载入权重后训练所有参数.载入权重后只训练最后几层参数.载入权重后在原网络基础上再添加一层全连接层，仅训练最后一个全连接层.训练数据是 10_m…...

编程日记 2023/5/19 23:02:11

$\lim\limits_{x\to a} f(x)$

工具篇（五）炫酷排版，尽在LaTeX：让你的文档飞升吧！

作者的话作为一个文本排版工具，latex一直以来都备受科研工作者、学生和出版社的青睐。但是对于初学者来说，latex的学习曲线可能会有些陡峭。因此，我写这篇博客旨在为初学者提供一个简单易懂的latex教程，让大家能够快速入门并掌握…...

编程日记 2023/5/19 23:02:08

【蓝桥杯PythonB组备赛】【Acwing周赛】第93场 4867. 整除数 4868. 数字替换 python解

目录 A AcWing 4867. 整除数 1.题目描述 2.思路分析 3.代码实现 B AcWing 4868. 数字替换 1.题目描述 2.思路分析 3.代码实现 A AcWing 4867. 整除数 1.题目描述 2.思路分析为什么不能直接暴力？ 数据：1 ≤ n, k ≤ 10 ** 9 1s内最多…...

编程日记 2023/5/19 23:02:02

KNN学习报告

原理 KNN算法就是在其表征空间中，求K个最邻近的点。根据已知的这几个点对其进行分类。如果其特征参数只有一个，那么就是一维空间。如果其特征参数只有两个，那么就是二维空间。如果其特征参数只有三个，那么就是三维空间。如果其特征…...

编程日记 2023/5/17 11:51:10

Java奠基】方法的讲解与使用

目录方法概述方法的定义与调用方法的重载方法的值传递方法概述方法是程序中最小的执行单元，在实际开发中会将重复的具有独立功能的代码抽取到方法中，这样可以提高代码的复用性和可维护性。方法的定义与调用在Java中定义方法的格式都是相同…...

编程日记 2023/5/19 23:02:00

字符串hash

K - 子串翻转回文串2020ccpc河南省赛字符串哈希：将字符串变成x进制数对公式的理解：举个十进制数的例子：123456h[1]1；h[2]1*10212;h[3]12*103123;h[4]123*1041234;.........h[i]h[i-1]*xa[i];h[i]代表的恰巧是整个数的前缀用p[i]表…...

编程日记 2023/5/15 9:02:56

试题算法训练转圈游戏

问题描述 n个小伙伴（编号从0到n-1）围坐一圈玩游戏。按照顺时针方向给n个位置编号，从0到n-1。　　最初，第0号小伙伴在第0号位置，第1号小伙伴在第 1 号位置，……，依此类推。　　游戏规则如下&am…...

编程日记 2023/5/19 23:01:57

【uni-app教程】九、运行环境判断与跨端兼容

（1）开发环境和生产环境 uni-app 可通过 process.env.NODE_ENV 判断当前环境是开发环境还是生产环境，一般用于连接测试服务器或生产服务器的动态切换。在HBuilderX 中，点击「运行」编译出来的代码是开发环境，点击「发行…...

编程日记 2023/5/19 23:01:55

扩展WSL2虚拟硬盘的大小

扩展WSL2虚拟硬盘的大小 1、在 Windows PowerShell 中终止所有 WSL 实例 wsl --shutdown2、查看 WSL 实例运行状态，确认关闭，并记住发行版的名称 wsl -l -v如果没有更改移动过发行版安装包位置，那么可以通过以下方法查找到发行版的安装包位…...

编程日记 2023/5/19 23:01:53

Win系统蓝牙设备频繁卡顿/断连 - 解决方案

Win系统蓝牙设备频繁卡顿/断连 - 解决方案前言常见网卡Intel无线网卡（推荐）Realtek无线网卡总结查看本机网卡解决方案更新驱动更换网卡（推荐）前言无线网卡有2个模块，一个是WiFi，一个是蓝牙，因…...

编程日记 2023/5/19 23:01:51

Git学习入门（2）- 基本命令操作总结

个人博客：我的个人博客，各位大佬来玩1 创建 git仓库1.1 从现有工作目录中初始化新仓库需要到你需要用git管理的项目中输入以下命令：git init便会创建一个空的git项目，并且当前目录下会出现一个名为 .git 的目录， Git 需…...

编程日记 2023/5/19 23:01:48

SPringCloud：Nacos快速入门及相关属性配置

目录一、Nacos快速入门 1、在父工程中添加spring-cloud-alilbaba的管理依赖 2、如果有使用eureka依赖，将其注释 3、添加nacos的客户端依赖 4、修改yml文件，注释eureka配置 5、启动测试二、Nacos相关属性配置 1、Nacos服务分级存储 2、根据集群…...

编程日记 2023/5/19 23:01:46

医疗器械之模糊算法（嵌入式部分）

模糊控制所谓模糊控制，就是对难以用已有规律描述的复杂系统，采用自然语言（如大，中，小）加以描述，借助定性的，不精确的以及模糊的条件语句来表达，模糊控制是一种基于语言的…...

编程日记 2023/5/19 23:01:43

测试微信模版消息推送

进入“开发接口管理”--“公众平台测试账号”，无需申请公众账号、可在测试账号中体验并测试微信公众平台所有高级接口。获取access_token: 自定义模版消息： 关注测试号：扫二维码关注测试号。发送模版消息： import requests da…...

编程新知 2026/2/8 4:37:13

【根据当天日期输出明天的日期(需对闰年做判定)。】2022-5-15

缘由根据当天日期输出明天的日期(需对闰年做判定)。日期类型结构体如下： struct data{ int year; int month; int day;};-编程语言-CSDN问答 struct mdata{ int year; int month; int day; }mdata; int 天数(int year, int month) {switch (month){case 1: case 3:…...

编程新知 2025/11/27 21:52:13

深入剖析AI大模型：大模型时代的 Prompt 工程全解析

今天聊的内容，我认为是AI开发里面非常重要的内容。它在AI开发里无处不在，当你对 AI 助手说 "用李白的风格写一首关于人工智能的诗"，或者让翻译模型 "将这段合同翻译成商务日语" 时，输入的这句话就是 Prompt。…...

编程新知 2026/2/7 5:56:30

树莓派超全系列教程文档--(61)树莓派摄像头高级使用方法

树莓派摄像头高级使用方法配置通过调谐文件来调整相机行为使用多个摄像头安装 libcam 和 rpicam-apps依赖关系开发包文章来源： http://raspberry.dns8844.cn/documentation 原文网址配置大多数用例自动工作，无需更改相机配置。但是，一…...

编程新知 2026/2/5 4:39:03

Swift 协议扩展精进之路：解决 CoreData 托管实体子类的类型不匹配问题（下）

概述在 Swift 开发语言中，各位秃头小码农们可以充分利用语法本身所带来的便利去劈荆斩棘。我们还可以恣意利用泛型、协议关联类型和协议扩展来进一步简化和优化我们复杂的代码需求。不过，在涉及到多个子类派生于基类进行多态模拟的场景下，…...

编程新知 2026/1/23 4:56:05

Python爬虫实战：研究feedparser库相关技术

1. 引言 1.1 研究背景与意义在当今信息爆炸的时代，互联网上存在着海量的信息资源。RSS（Really Simple Syndication）作为一种标准化的信息聚合技术，被广泛用于网站内容的发布和订阅。通过 RSS，用户可以方便地获取网站更新的内容，而无需频繁访问各个网站。然而，互联网…...

编程新知 2025/8/18 9:54:31

12.找到字符串中所有字母异位词

🧠 题目解析题目描述： 给定两个字符串 s 和 p，找出 s 中所有 p 的字母异位词的起始索引。返回的答案以数组形式表示。字母异位词定义： 若两个字符串包含的字符种类和出现次数完全相同，顺序无所谓，则互为…...

编程新知 2026/1/31 12:52:29

数据库分批入库

今天在工作中，遇到一个问题，就是分批查询的时候，由于批次过大导致出现了一些问题，一下是问题描述和解决方案： 示例： // 假设已有数据列表 dataList 和 PreparedStatement pstmt int batchSize 1000; // …...

编程新知 2026/1/8 11:38:36

在WSL2的Ubuntu镜像中安装Docker

Docker官网链接: https://docs.docker.com/engine/install/ubuntu/ 1、运行以下命令卸载所有冲突的软件包： for pkg in docker.io docker-doc docker-compose docker-compose-v2 podman-docker containerd runc; do sudo apt-get remove $pkg; done2、设置Docker…...

编程新知 2026/2/4 16:23:56

C++.OpenGL （20/64）混合（Blending）

混合（Blending）透明效果核心原理 #mermaid-svg-SWG0UzVfJms7Sm3e {font-family:"trebuchet ms",verdana,arial,sans-serif;font-size:16px;fill:#333;}#mermaid-svg-SWG0UzVfJms7Sm3e .error-icon{fill:#552222;}#mermaid-svg-SWG0UzVfJms7Sm3e .error-text{fill…...

编程新知 2026/1/20 5:33:17

相关文章：