| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| Vision Transformer (ViT) | 视觉 Transformer | 把图像切成小块(patch)当作「词」、送入自注意力网络处理的架构,是 CNN 之外的另一大视觉主干。 |
| patch token | 图像块令牌 | 图像被分成的小块对应的向量表示,ViT 的基本输入单位。 |
| inductive bias | 归纳偏置 | 模型自带的先验假设(如 CNN 假设邻近像素相关),能帮模型用更少数据学习。 |
| long-tailed distribution | 长尾分布 | 少数类别样本极多、大量类别样本极少的真实数据分布,形状像「头大尾长」。 |
| head / tail classes | 头部类 / 尾部类 | 样本多的「热门」类与样本稀少的「冷门」类(后者也叫少数类)。 |
| knowledge distillation | 知识蒸馏 | 用强模型(教师)的输出指导小模型(学生)学习,把知识「蒸馏」过去。 |
| distillation token (DIST) | 蒸馏令牌 | DeiT 中专门承载教师知识的一个特殊 token,与分类令牌并列。 |
| CLS token | 分类令牌 | ViT 中汇总全局信息、用于输出分类结果的特殊 token。 |
| OOD images | 分布外图像 | 这里指用强数据增强生成、超出教师训练数据分布的图像。 |
| Sharpness Aware Minimization (SAM) | 锐度感知最小化 | 一种专门寻找「平坦极小值」的优化方法,得到的模型泛化性更好。 |
| low-rank features | 低秩特征 | 冗余少、结构紧凑的特征,通常泛化能力更强。 |
| flat teacher | 平坦教师 | 用 SAM 训练出的、损失曲面平坦的教师模型。 |
| imbalance ratio (ρ) | 不均衡比 | 样本最多类与最少类的样本数之比,衡量数据倾斜程度。 |
| training from scratch | 从零训练 | 不使用大规模预训练权重,直接在小数据集上从头训练模型。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Vision Transformer 视觉 Transformer | Long-Tailed Recognition 长尾识别 | Knowledge Distillation 知识蒸馏 | Training from Scratch 从零训练
先盲听一遍→再看对照稿→再听一遍。目标是听出每个数字(如 CIFAR-10 LT、iNaturalist-2018)和术语(如 distillation token、long-tailed、SAM)。