| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| Digital Twin | 数字孪生 | 物理设备的虚拟「双胞胎」,与真实设备实时同步状态,可在里面先试错。 |
| Reinforcement Learning (RL) | 强化学习 | 智能体靠「试错 + 奖励/惩罚」自己学会策略,不需要人工标注数据。 |
| Soft Actor-Critic (SAC) | 软演员-评论家算法 | 一种高效的深度强化学习算法,在「探索新行为」和「稳定收敛」之间平衡得很好。 |
| sim-RL agent | 仿真强化学习智能体 | 只在虚拟仿真环境里训练出来的强化学习智能体,还没有碰过真实机器人。 |
| Digital Twin Synchronization | 数字孪生同步 | 虚拟机器人与真实机器人的状态实时对齐,仿真里学会的动作能搬到现实里。 |
| Sim-to-Real Transfer | 仿真到现实迁移 | 把虚拟环境学到的策略「搬家」到真实环境,是机器人 RL 的核心挑战。 |
| Unity | Unity 引擎 | 游戏/仿真引擎,本文用它搭虚拟机器人环境(和做游戏的是同一个工具)。 |
| ROS2 | 机器人操作系统 2 | 机器人领域的软件「总线」,各模块(感知、控制、仿真)靠它通信。 |
| Hierarchical Reward Structure (HRS) | 分层奖励结构 | 把一个大目标拆成「子目标 + 主目标」多层奖励,引导智能体一步步学,避免迷失。 |
| Transfer Learning | 迁移学习 | 把在一个任务/环境上训练好的模型,稍作调整用到另一个任务/环境。 |
| Policy Convergence | 策略收敛 | 训练中策略逐渐稳定、不再剧烈波动——收敛快 = 训练省时间。 |
| Sample Efficiency | 样本效率 | 用尽量少的「尝试次数」就能学好——真实机器人试错代价极高,所以很重要。 |
| Target-reaching / Goal-following Task | 到达目标点 / 跟踪目标任务 | 本文的两个任务场景:机械臂末端精确到达一个固定点;实时跟踪一个移动的目标。 |
| Cumulative Reward / Policy Loss | 累计奖励 / 策略损失 | 评估训练效果的两类指标:累计奖励看「干得有多好」,策略损失看「学得稳不稳」。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Digital Twin 数字孪生 | Reinforcement Learning 强化学习 | Soft Actor-Critic SAC | Robotic Additive Manufacturing 机器人增材制造 | Sim-to-Real 仿真到现实
先盲听一遍→再看对照稿→再听一遍。目标是听出每个术语(Soft Actor-Critic、digital twin synchronization、hierarchical reward structure、Viper X300s、convergence)和连接词(However、Moreover、Additionally)。