| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| EQA (Embodied Question Answering) | 具身问答 | 智能体基于对环境的感知(如图像)回答问题;本文是「记忆式」EQA——在预先给定的图像集上回答。 |
| EM-EQA (Episodic Memory EQA) | 情景记忆具身问答 | 智能体不主动探索环境,而是在已有图像记忆中检索、推理并回答问题。 |
| Inspection EQA | 检测式具身问答 | 本文提出的新问题类别:以基础设施检测为场景的 EQA。 |
| VLM (Vision-Language Model) | 视觉语言模型 | 同时理解图像和文本的大模型,如 Gemini、Grok 系列。 |
| Multi-Frame VLM | 多帧 VLM 基线 | OpenEQA 中处理多图 EQA 的强基线方法:把所有图像一次性塞进上下文让模型回答。 |
| MDP (Markov Decision Process) | 马尔可夫决策过程 | 「状态-动作-奖励」序贯决策的数学框架;本文用它把问答建模成「在场景图上走」。 |
| scene graph | 场景图 | 用节点和边描述场景结构的图;本文把「图像」作为节点,构建图像级场景图。 |
| allocentric map | 以环境为中心的地图 | 与「以自我为中心」相对,是客观的、与环境坐标绑定的空间表征。 |
| NBI (National Bridge Inventory) | 国家桥梁档案(评分体系) | 美国桥梁构件的标准化 0–9 评分体系,是检测员的「标准答案」。 |
| Image Citation Relevance | 图像引用相关性 | 本文新提出的指标,衡量模型引用的证据图像与专家参考图像集合的语义一致性。 |
| LLM-as-a-judge | 大模型当裁判 | 用大模型对开放式回答打分,替代人工评测。 |
| positional bias(lost in the middle) | 位置偏差(中间迷失) | 长上下文模型对序列开头/结尾内容记忆更好、中间信息容易丢失的现象。 |
| open-vocabulary QA | 开放词汇问答 | 答案不限于选项,可以是任意自然语言表述。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
📌 引言中的另一组对比数字(Grok 4 Fast):EMVR improves condition rating accuracy ±1 by 9.34 percentage point, Image Citation Relevance by 20.2 percentage point, and Answer Correctness by 7.2 percentage point over Multi-Frame VLM using Grok 4 Fast.(9.34 与结论中的 9.3 为素材原文的不同精度写法,均原样保留。)
先盲听一遍→再看对照稿→再听一遍。目标是听出每个数字(2,200、200、47.93)和术语(Embodied Question Answering、Image Citation Relevance、Markov decision process、vision-language models)。