强化学习基础:从回报定义到贝尔曼方程的推导

假设我们要构建一个 Agent,在谈 Policy 或 Action 之前,先要回答一个问题:目标怎么量化,又怎么让机器使用这个量化结果? 在强化学习里,这个介质就是 Reward。 奖励与轨迹 在这个框架下,我更愿意把 Reward 看成我们和 Agent 沟通的语言。我们通过设计 Reward 函数来引导 Agent 的行为。这里有一个容易忽略的点:在强化学习语境下,“没有奖励”本身也可能是一种惩罚,比如时间流逝带来的代价;反过来也一样。这些情况在数学上可以统一处理。 ...

November 20, 2025 · 4 min · chengyongru