| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| regret | 遗憾(悔值) | 学习算法的累计性能与「事后最优策略」性能之差,衡量在线学习到底亏了多少。 |
| logarithmic regret | 对数遗憾 | 遗憾随交互次数呈对数增长——学习几乎「不亏」,是快速学习的标志。 |
| sublinear regret | 次线性遗憾 | 遗憾增长慢于线性(如 √N),保证算法最终能逼近最优策略。 |
| nonlinear dynamical system | 非线性动力系统 | 状态演化由非线性方程描述的系统,比线性系统难控制、难学习得多。 |
| persistent excitation | 持续激励 | 输入信号持续「足够丰富」,让未知参数能被辨识出来的条件。 |
| Fisher information matrix | Fisher 信息矩阵 | 刻画观测数据携带多少参数信息的矩阵;在最优策略处正定 ⇒ 参数可辨识。 |
| certainty equivalent controller | 确定性等价控制器 | 把参数估计值当成真值代入设计出的控制器,「估计到哪、控制到哪」。 |
| exploration-exploitation trade-off | 探索-利用权衡 | 探索未知参数 vs 利用当前最优策略之间的博弈,在线学习的核心矛盾。 |
| closed-loop identifiability | 闭环可辨识性 | 闭环运行下,能否从数据中辨识出系统真实参数的问题。 |
| dual nature of control | 控制的对偶性 | 控制既影响系统状态,又影响参数学习获得的信息量(Feldbaum 提出)。 |
| Markov Decision Process (MDP) | 马尔可夫决策过程 | 序贯决策问题的标准数学框架,强化学习的「母语」。 |
| LQR (Linear Quadratic Regulator) | 线性二次调节器 | 线性系统 + 二次代价的最优控制经典问题,本科最优控制入门必学。 |
| tabular RL | 表格型强化学习 | 状态-动作空间有限、可直接查表的强化学习设定。 |
| single-trajectory setting | 单轨迹设定 | 只从一次长轨迹中学习,不依赖多次独立实验的更难设定。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Regret 遗憾 | Nonlinear Control 非线性控制 | Online Learning 在线学习 | Persistent Excitation 持续激励 | Adaptive Control 自适应控制
先盲听一遍→再看对照稿→再听一遍。目标是听出每个关键词(logarithmic regret、square root、persistently exciting)和数字(square root of the number of interactions)。