|
|
|
|
@ -142,7 +142,7 @@ $$
|
|
|
|
|
人工策略定义为:
|
|
|
|
|
|
|
|
|
|
$$
|
|
|
|
|
a_t=\operatorname{clip}\bigl(0.5(g-o_t),-1,1\bigr),
|
|
|
|
|
a_t=\mathrm{clip}\bigl(0.5(g-o_t),-1,1\bigr),
|
|
|
|
|
$$
|
|
|
|
|
|
|
|
|
|
状态转移为:
|
|
|
|
|
@ -158,7 +158,7 @@ $$
|
|
|
|
|
$$
|
|
|
|
|
\begin{aligned}
|
|
|
|
|
o_0 &= x_0=2,\\
|
|
|
|
|
a_0 &= \operatorname{clip}(0.5\times(5-2),-1,1)=1,\\
|
|
|
|
|
a_0 &= \mathrm{clip}(0.5\times(5-2),-1,1)=1,\\
|
|
|
|
|
x_1 &= x_0+a_0=2+1=3.
|
|
|
|
|
\end{aligned}
|
|
|
|
|
$$
|
|
|
|
|
@ -168,7 +168,7 @@ $$
|
|
|
|
|
$$
|
|
|
|
|
\begin{aligned}
|
|
|
|
|
o_1 &= x_1=3,\\
|
|
|
|
|
a_1 &= \operatorname{clip}(0.5\times(5-3),-1,1)=1,\\
|
|
|
|
|
a_1 &= \mathrm{clip}(0.5\times(5-3),-1,1)=1,\\
|
|
|
|
|
x_2 &= x_1+a_1=3+1=4.
|
|
|
|
|
\end{aligned}
|
|
|
|
|
$$
|
|
|
|
|
@ -324,4 +324,4 @@ while True:
|
|
|
|
|
- [Hugging Face gym-pusht](https://github.com/huggingface/gym-pusht):后续完整推物实验使用的 Gymnasium 环境,上游项目采用 Apache-2.0 许可证。
|
|
|
|
|
- [Diffusion Policy 项目主页](https://diffusion-policy.cs.columbia.edu/):PushT 任务及扩散策略的代表性工作,后续第五章会展开介绍。
|
|
|
|
|
|
|
|
|
|
本章文字和一维控制代码为本教程原创。示例仅使用 Python 标准库,没有复制上游项目代码。引用外部项目时请同时遵守对应仓库的许可证。
|
|
|
|
|
本章文字和一维控制代码为本教程原创。示例仅使用 Python 标准库,没有复制上游项目代码。
|
|
|
|
|
|