| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| token | 令牌(词元) | 模型处理信息的最小基本单元,文本、图像都被切成 token 序列。 |
| MLLM (Multimodal Large Language Model) | 多模态大语言模型 | 能同时处理文字和图像(乃至音频)的大模型,如 GPT-4o、Gemini。 |
| vision tokenizer | 视觉分词器 | 把图像切成视觉 token 的模块,是「图像→模型」的入口。 |
| neural codec | 神经编解码器 | 用神经网络做的压缩/解压器,端到端学习「怎么压得小且保得住信息」。 |
| entropy model | 熵模型 | 估计压缩码流真实比特数的概率模型,用来精确控制传输的比特数。 |
| reconstruction prior | 重建先验 | 解码器重建出的图像,作为后续视觉 token 的「参考底稿」。 |
| adapter | 适配器 | 把压缩特征转换成视觉 token、并注入分词器中间层的小网络。 |
| visual-language semantic alignment | 视觉-语言语义对齐 | 让「模型看到的图像 token」和「对应文字描述」在语义上保持一致。 |
| distillation loss | 蒸馏损失 | 让新模块模仿已有分支的中间特征,用它「预热」适配器。 |
| SigLIP loss | SigLIP 损失 | 一种图文对比对齐损失,让图像与文本的语义向量靠近。 |
| QP (quantization parameter) | 量化参数 | 控制压缩强度的旋钮——QP 越大压得越狠、传得越少。 |
| FiLM (feature-wise linear modulation) | 特征级线性调制 | 用条件信息对特征做「缩放+平移」,让一个适配器适配多种 QP。 |
| coding for machines | 面向机器的编码 | 不为给人看、而为给机器任务用的压缩编码范式。 |
| bitstream | 比特流 | 压缩后传输的二进制码流。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
关键词 Keywords:Token Communication Token 通信 | Multimodal Large Language Model 多模态大语言模型 | Neural Codec 神经编解码器 | Visual-Language Alignment 视觉-语言对齐
先盲听一遍→再看对照稿→再听一遍。目标是听出每个数字(trillion scale 万亿级、two-stage 两阶段)和术语(token communication、neural codec、adapter、SigLIP、QP、FiLM)。