| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| reinforcement learning (RL) | 强化学习 | 让智能体「试错学习」:做动作、得反馈(奖励)、改策略,像训练小狗一样训练 AI。 |
| agent | 智能体 | 做决策的「人」——可以是程序、机器人或一个望远镜控制模块。 |
| environment | 环境 | 智能体所在的世界,它会对智能体的动作给出反馈。 |
| reward | 奖励(回报) | 环境给智能体的「打分」,强化学习的目标就是让累计得分最大化。 |
| state / action | 状态 / 动作 | 状态是智能体「看到的世界」,动作是它「做的事」——RL 任务就是一连串「状态→动作」的序列。 |
| policy | 策略 | 智能体的「行为手册」:看到什么状态,就做什么动作。 |
| Q-table / Q-value | Q 表 / Q 值 | 一张「状态×动作」的账本,记着每个状态下做每个动作能赚多少,Q 表迭代是最经典的表格型 RL 算法。 |
| model-free RL | 无模型强化学习 | 不建模环境、直接靠试错学策略,代表作有 Q-learning、TD3、SAC。 |
| model-based RL | 基于模型的强化学习 | 先学一个「环境的模拟器」,在脑子里排练,再据此决策。 |
| TD3 / SAC | TD3 / SAC 算法 | 两个主流的连续动作空间深度强化学习算法(分别处理「确定性策略」与「随机策略」)。 |
| adaptive optics | 自适应光学 | 实时变形镜面抵消大气抖动,让望远镜看得更清楚——RL 可以自动控制它。 |
| hyper-parameter tuning | 超参数调优 | 给算法调「旋钮」(学习率、批大小等),RL 被用来自动调这些旋钮。 |
| hint-assisted RL | 提示辅助强化学习 | 本文提出的机制:把现有天文方法的「经验」作为提示传给 RL 智能体,让它学得更快。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Reinforcement Learning 强化学习 | Deep RL 深度强化学习 | Astronomy 天文学 | Autonomous Agents 自主智能体
注:上段为原文结论中的代码开放声明。
先盲听一遍→再看对照稿→再听一遍。目标是听出每个关键词(reinforcement learning、agents of artificial intelligence、state of the art overview、benefit astronomy)。