| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| referring image segmentation (RIS) | 指代图像分割 | 根据一句文字描述(如「桌上的两个杯子」),把图中对应的物体分割出来。 |
| visual RIS | 视觉指代分割 | 给一张参考图,分割出图中与它相似的同类物体(靠「看图找相似」)。 |
| omni-prompt | 全模态提示 | 文本指令、参考图及其空间提示(掩码、框、涂鸦)的任意组合,一起指代目标。 |
| omni-modal | 全模态(输入) | 文本与视觉两种模态同时可用、可自由切换的输入方式。 |
| granular attribute referring | 细粒度属性指代 | 文字的长处:精确描述属性与空间关系,如「桌上有两个杯子」。 |
| uncommon object grounding | 罕见物体定位 | 视觉参考的长处:定位难以用语言描述的罕见物体。 |
| one v.s. many / many v.s. many | 一对多 / 多对多 | 分割设定:一个提示对应多个目标,或多个提示对应多个目标(多对多在 RIS 任务中首次引入)。 |
| no-target | 无目标 | 图中没有所指物体时,模型应输出「无目标」而不是乱切。 |
| omni-prompt encoder | 全模态提示编码器 | OmniSegNet 的核心模块:把文本与视觉提示统一编码进同一多模态空间。 |
| OmniRef | OmniRef 数据集 | 本文构建的大规模数据集:186,939 个全模态提示、30,956 张图像,规模超过 RefCOCO/+/g 与 gRefCOCO。 |
| OmniSegNet | OmniSegNet 模型 | 本文提出的强基线:能同时处理单模态与全模态提示的通用分割模型。 |
| referring conflict | 指代冲突 | 多对多设定下,文本提示与视觉提示指向不同物体时产生的歧义。 |
| grounding | 指代落地(定位) | 把提示对应到图像中具体区域/像素的过程。 |
| GRES (Generalized Referring Expression Segmentation) | 广义指代表达分割 | 把指代分割扩展到多目标或无目标设定,OmniRIS 在其基础上进一步引入多对多。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Referring Image Segmentation 指代图像分割 | Omni-Modal 全模态 | OmniRef 数据集 | OmniSegNet
先盲听一遍→再看对照稿→再听一遍。目标是听出每个数字(186,939、30,956)和术语(omni-prompts、OmniRef、OmniSegNet、granular attribute referring、uncommon object grounding)。