| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| reinforcement learning (RL) | 强化学习 | 让智能体(如机器人)通过与环境反复试错交互、根据奖励信号学习最优行为的学习范式。 |
| model-free reinforcement learning | 无模型强化学习 | 不建立环境动力学模型、直接靠交互数据学策略的强化学习,适合接触多、不确定性大的机器人系统。 |
| neural network controller | 神经网络控制器 | 用神经网络把「机器人观测」直接映射成「控制指令」的控制器。 |
| reward engineering | 奖励工程 | 设计奖励项并调权重的手工活——奖励项常超过十个,调参极其耗时,是 RL 训练机器人最大的痛点。 |
| reward term / reward coefficient | 奖励项 / 奖励系数 | 奖励项描述一个期望(如走得快、姿态稳),奖励系数决定它在总奖励里的相对权重。 |
| constraint | 约束 | 策略必须满足的硬性条件(如关节角度限制、步态模式),把解空间限制在工程师期望的区域内。 |
| constrained RL (safe RL) | 约束强化学习(安全强化学习) | 在满足约束的前提下最大化奖励的强化学习分支,本工作借鉴其算法思想。 |
| policy | 策略 | 「看到什么状态 → 采取什么动作」的决策规则;训练控制器就是在学一个策略。 |
| policy optimization | 策略优化 | 不断更新策略参数、让累计奖励上升(同时满足约束)的优化过程。 |
| locomotion controller | 运动(步态)控制器 | 控制机器人迈腿行走、保持平衡、跟踪速度指令的控制器。 |
| legged robot | 腿足机器人 | 靠腿行走的机器人(四足、双足、人形),比轮式机器人更能适应复杂地形。 |
| quadrupedal / bipedal robot | 四足 / 双足机器人 | 四条腿 / 两条腿的机器人;本工作训练了 6 台四足和 1 台双足机器人。 |
| gait pattern | 步态模式 | 腿的周期性摆动方式(如小跑 trotting、行走 walking);可作为跨机器人的通用约束。 |
| inductive bias | 归纳偏置 | 设计网络结构时注入的先验假设(如输入输出维度匹配),让学习更容易。 |
| URDF | 统一机器人描述格式 | 描述机器人几何、关节、惯量的标准文件;约束限位甚至可以从 URDF 自动读取。 |
| kernel function | 核函数 | 本工作中定义约束惩罚形状的函数(如二次函数),不同核函数对应不同约束特性。 |
| morphology | 构型 / 形态 | 机器人的身体结构设计(腿的数量、机械腿设计),构型不同是约束可泛化性的试金石。 |
| imitation learning | 模仿学习 | 用专家示范数据训练控制器;因机器人示范数据稀缺,RL 成为主流。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Constrained Reinforcement Learning 约束强化学习 | Legged Robot Locomotion 腿足机器人运动 | Reward Engineering 奖励工程 | Policy Optimization 策略优化
先盲听一遍→再看对照稿→再听一遍。目标是听出:single reward coefficient(只调一个奖励系数)、two constraint types(两种约束类型)、quadrupedal / bipedal(四足/双足)、simulation and real-world experiments(仿真与真机实验)、legged robot locomotion(腿足机器人运动)。