| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| sub-semantic image segmentation | 亚语义图像分割 | 介于「低级纹理分割」和「语义分割」之间的新任务:按「能用语言描述的外观规律」切图,而不是按物体类别切图。 |
| texture segmentation | 纹理分割 | 只靠颜色、梯度、重复等视觉统计特征,把图像分成不同纹理区域。 |
| semantic segmentation | 语义分割 | 给每个像素打上物体类别标签(如人、车、树)的分割方式。 |
| vision-language model (VLM) | 视觉语言模型 | 能同时理解图像和文字、并在两者之间推理的模型,例如 Qwen3-VL。 |
| promptable segmentation | 可提示分割模型 | 根据用户给的提示(点、框或文字)生成对应掩码的模型,典型代表是 SAM 系列。 |
| SAM 3 | SAM 3 模型 | 「分割一切」系列第三代,自带原生文字通路(native text pathway),可以把文字描述直接落地成掩码。 |
| [SEG] hidden states / grounding token | [SEG] 隐状态(定位令牌) | 专门为掩码预测预留的特殊令牌,是 VLM 与分割模型之间的「连接件」。 |
| Bridge | 桥接层 | 把 VLM 的 [SEG] 隐状态变换到 SAM 3 文字空间的「桥梁」,让两个模型说同一种「视觉-空间方言」。 |
| language leakage | 语言泄漏 | 失败模式之一:一个纹理区域的文字描述「串」到另一个区域,导致掩码张冠李戴。 |
| prompt competition | 提示竞争 | 失败模式之一:SAM 内部的多个提示槽位争抢同一批像素。 |
| semantic distortion | 语义失真 | 失败模式之一:压缩投影器在「语言→掩码」接口处把语义弄变形。 |
| Winner-Takes-All assignment | 胜者全取分配 | 把互相重叠的掩码分数转化为互不重叠的最终分区(每个像素只属于一个纹理)。 |
| open-vocabulary | 开放词汇 | 不限于固定类别词表,能理解任意自由文本描述。 |
| TextureADE | TextureADE 数据集 | 作者用自研系统从 ADE20K 派生的亚语义图像分割数据集——此前该任务没有现成数据。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Sub-Semantic Segmentation 亚语义分割 | Vision-Language Model 视觉语言模型 | SAM 3 | TextureADE | DETECTURE
先盲听一遍→再看对照稿→再听一遍。目标是听出每个关键术语(sub-semantic、SAM 3、TextureADE、DETECTURE)和结构词(failure modes、dataset、baselines)。