From d65ef2c00ebc6082f9df11541e1b191655eddb00 Mon Sep 17 00:00:00 2001 From: jingyaogong Date: Fri, 21 Aug 2026 16:49:00 +0800 Subject: [PATCH] [update] readme content --- README.md | 32 +++++++++++++++++--------------- README_en.md | 32 +++++++++++++++++--------------- 2 files changed, 34 insertions(+), 30 deletions(-) diff --git a/README.md b/README.md index 44600d4..71eda81 100644 --- a/README.md +++ b/README.md @@ -911,15 +911,17 @@ response = client.chat.completions.create( 在介绍实现具体算法之前,我先以个人理解的极简视角,阐述所有Policy Optimization (PO)算法的统一共性。 -所有RL算法的本质都只是在优化一个期望: +说到底,这里讨论的 PO 算法都只是在优化一个期望: -$$\mathcal{J}_{PO} = \mathbb{E}_{q \sim P(Q), o \sim \pi(O|q)} \left[ \underbrace{f(r_t)}_{\text{策略项}} \cdot \underbrace{g(A_t)}_{\text{优势项}} - \underbrace{h(\text{KL}_t)}_{\text{正则项}} \right]$$ +$$\mathcal{J}_{PO} = \mathbb{E}_{q \sim P(Q),\, o \sim \pi_\theta(\cdot \mid q)} \left[ \underbrace{\Phi(r_t, A_t)}_{\text{策略目标}} - \underbrace{h(\text{KL}_t)}_{\text{正则项}} \right]$$ -训练时,只需**最小化负目标函数**,即: $\mathcal{L}_{PO} = -\mathcal{J}_{PO}$ +训练时,只需**最小化负目标函数**,即: + +$$\mathcal{L}_{PO} = -\mathcal{J}_{PO}$$ 这个框架只包含三个核心组件: -* **策略项** $f(r_t)$: 如何使用概率比 $r_t$? 即告诉模型新旧策略偏差有多大,是否探索到了更好的token -* **优势项** $g(A_t)$: 如何计算优势 $A_t$, 这很重要!大模型算对定积分也不足为奇,小模型回答对加减法优势通常都是正的 +* **策略项** $\Phi(r_t, A_t)$: 如何结合概率比 $r_t$ 和优势 $A_t$ 更新策略 +* **优势项** $A_t$: 如何计算优势,这很重要!大模型算对定积分也不足为奇,小模型回答对加减法优势通常都是正的 * **正则项** $h(\text{KL}_t)$: 如何约束变化幅度 $\text{KL}_t$, 既防止跑偏又防止管的太死
@@ -929,7 +931,7 @@ $$\mathcal{J}_{PO} = \mathbb{E}_{q \sim P(Q), o \sim \pi(O|q)} \left[ \underbrac |------|------|------|------| | $q$ | 问题/提示词 | 从数据集 $P(Q)$ 中采样 | - | | $o$ | 模型输出序列 | 由策略 $\pi$ 生成 | - | -| $r_t$ | 概率比 | $r_t = \frac{\pi_\theta(o_t \mid q, o_{ @@ -929,7 +931,7 @@ This framework contains only three core components: |--------|---------|-------------|-------| | $q$ | Question/Prompt | Sampled from dataset $P(Q)$ | - | | $o$ | Model output sequence | Generated by policy $\pi$ | - | -| $r_t$ | Probability ratio | $r_t = \frac{\pi_\theta(o_t \mid q, o_{