| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| MLLM (Multimodal Large Language Model) | 多模态大语言模型 | 以 LLM 为「大脑」、能接收/推理/输出多模态信息(图像、视频、音频等)的模型,GPT-4V 是代表。 |
| LLM (Large Language Model) | 大语言模型 | 十亿级参数的语言模型,靠放大数据与规模涌现出指令跟随、上下文学习等能力。 |
| LVM (Large Vision Model) | 大型视觉模型 | 「看得清」但推理能力弱的视觉大模型,如 SAM、DINOv2。 |
| GPT-4V | GPT-4V | OpenAI 发布的多模态大模型,掀起了 MLLM 研究热潮的时代标杆。 |
| emergent ability | 涌现能力 | 模型规模增大后突然出现、小模型没有的能力(如看图写故事、免 OCR 数学推理)。 |
| In-Context Learning (ICL) | 上下文学习 | 不用微调,给几个示例模型就能学会做新任务。 |
| Chain of Thought (CoT) | 思维链 | 引导模型「先逐步推理、再给答案」,显著提升复杂推理表现。 |
| multimodal instruction tuning | 多模态指令微调 | 用「图文指令-回答」数据微调模型,让它学会服从新指令。 |
| discriminative paradigm | 判别式范式 | 如 CLIP:把图像与文本投影到统一表征空间,为下游多模态任务搭桥。 |
| generative paradigm | 生成式范式 | 如 OFA:用「序列到序列」方式统一各类多模态任务。 |
| multimodal hallucination | 多模态幻觉 | 模型「一本正经地胡说」——描述出图像/视频里并不存在的内容。 |
| M-ICL / M-CoT / LAVR | 多模态上下文学习 / 多模态思维链 / LLM 辅助视觉推理 | 三个代表性扩展技术:M-ICL 用于推理阶段提升少样本性能,M-CoT 用于复杂推理,LAVR 是用 LLM 搭建系统解决复合推理任务。 |
| OCR-free math reasoning | 免 OCR 数学推理 | 直接看题目图片做数学推理,不需要先做文字识别——MLLM 的招牌涌现能力。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Multimodal Large Language Model 多模态大语言模型 | GPT-4V | Multimodal Hallucination 多模态幻觉 | M-ICL / M-CoT / LAVR
先盲听一遍→再看对照稿→再听一遍。目标是听出每个术语(MLLM、GPT-4V、hallucination、M-ICL、M-CoT、LAVR)和那个 GitHub 链接。