| 英文标题 | From Tokens to Energy Flexibility: Quantization-Enabled Demand Response for Data Centers with LLM Inference Workloads |
|---|---|
| 中文标题 | 从 Token 到能量弹性:面向 LLM 推理负载数据中心的量化赋能需求响应 |
| 作者 | Bojun Du, Xiaoyi Fan, Ershun Du, Long Chen, Jianpei Han, Qingchun Hou, Ning Zhang, Chongqing Kang |
| 发布时间 | 2026年6月17日(v1)|分类:eess.SY(系统与控制) |
| 原文链接 | arxiv.org/abs/2606.18851 · 全文 HTML 版(CC BY 4.0 开放获取) |
| 一句话概括 | 把 LLM 模型量化变成「可调度的精度旋钮」参与需求响应,数据中心总成本降 34.3% 且不掉 token。 |
| 英文术语 | 中文 | 大白话解释 |
|---|---|---|
| demand response (DR) | 需求响应 | 电网紧张时,用户主动调整用电方式帮电网减负,通常还能获得补偿。 |
| LLM inference | 大语言模型推理 | 模型收到问题后逐 token 生成回答的过程,是数据中心耗电的大头。 |
| token | 词元 | LLM 处理文本的最小单位;生成一个 token 就要做一次数值计算,所以「服务多少 token」≈「耗多少电」。 |
| model quantization | 模型量化 | 把模型权重从 16 位精度压到 8 位 / 4 位,省内存、省算力、省电,精度损失很小且可调。 |
| temporal / spatial workload shifting | 时间 / 空间负荷转移 | 把计算任务推迟做(时间),或搬到电价更低、电网更宽松的园区做(空间)。 |
| grid-responsive | 电网响应型 | 能根据电网状态(电价、供需、碳信号)主动调节自身用电的设备或系统。 |
| quantization-to-power mapping | 量化—功率映射 | 把「模型 + 量化精度」的配置翻译成功率系统能调度的参数(容量、功耗、服务质量等)。 |
| dispatchable parameters | 可调度参数 | 调度员(或优化模型)能直接操作、按需调整的量。 |
| model instance switching | 模型实例切换 | 在 GPU 上加载/卸载不同精度的模型实例,切换服务配置。 |
| QoS degradation | 服务质量下降 | 量化带来的回答质量轻微损失;本文把它当作「可控、有界」的代价。 |
| multi-campus co-optimization | 多园区协同优化 | 多个数据中心园区一起优化,统筹考虑负载路由、本地能源资产、电价与碳信号。 |
| carbon signal | 碳信号 | 电网发电的碳排放强度信息,用于引导用户在高碳时段少用电。 |
| GPU occupancy | GPU 占用率 | GPU 计算资源被任务占用的程度,影响吞吐与单位能耗。 |
| batching / parallel serving | 批处理 / 并行服务 | 把多个请求打包一起算,提高硬件利用率、摊薄单位 token 能耗。 |
🎧 音频在文末,可先听一遍原文再读;每个英文句都配了逐句翻译。
领域关键词 Keywords:LLM Inference 大模型推理 | Model Quantization 模型量化 | Demand Response 需求响应 | Multi-Campus Co-optimization 多园区协同优化
先盲听一遍→再看对照稿→再听一遍。目标是听出每个数字(34.3%、20.8%、945 TWh、10 GW)和术语(quantization、demand response、token)。