💻 计算机科学与技术 · Bilingual Paper Reading

计算机科学与技术 · 论文精读

大模型、机器学习、计算机视觉、分布式系统与算法
0篇论文
0份精读版
0段朗读音频
0大细分领域
01

全部论文

Complete Archive · 41
大模型

推测解码加速大模型推理:基于推测搜索(Speculative Search / SpecSearch)的大语言模型推理加速框架

Accelerating Large Language Model Reasoning via Speculative Search
让一个小模型替大模型「打草稿」生成推理思路、大模型负责把关——在保持推理质量的前提下,把树搜索式慢思考推理最高加速 2.12 倍。
arXiv:2505.02865 · 2025年5月3日(v1) · 机构未标注
01
计算机视觉视觉

计算机视觉联邦学习:联邦学习在计算机视觉中的应用综述(含技术分类体系、安全威胁与隐私保护方法)

Federated Learning for Computer Vision
数据不出本地也能训出好模型——这篇综述首次系统梳理联邦学习在计算机视觉各任务中的进展,给出技术分类、安全威胁与隐私保护方法全景图。
arXiv:2308.13558 · 2023年8月24日(v1) · 雅典大学、沙迦大学
02
大模型通信

Token 通信:面向多模态大语言模型的令牌传输方案

Token Communication for Multimodal Large Language Model
把神经编解码器「塞进」视觉分词器,边压缩边给多模态大模型喂「原生的视觉 token」——在相同传输数据量下,任务性能优于传统「重建图像再喂模型」的方案。
arXiv:2608.07279 · 2026年8月7日(v1) · 清华大学、香港科技大学
03
大模型

大语言模型推理失败分析(首份系统性综述)

Large Language Model Reasoning Failures
把散落在各处的「大模型推理翻车案例」收拢成第一份系统综述,用「推理类型 × 失败类型」两条轴分类,并为每种失败给出定义、已有研究、根因与缓解策略。
arXiv:2602.06176 · 2026年2月5日(v1) · 加州理工学院、斯坦福大学
04
大模型

ChemMLLM:化学多模态大语言模型(分子的统一理解与生成)

ChemMLLM: Chemical Multimodal Large Language Model
第一个「能看懂也能画分子」的统一化学多模态大模型——文本、SMILES、分子图像三模态一把抓;在分子图像优化任务上比最强基线 GPT-4o 高出 116.75%(性质提升 4.27 vs 1.97)。
arXiv:2505.16326 · 2025年5月22日(v1) · 中国科学技术大学
05
大模型

多模态大语言模型能否进行类比推理?

Can Multimodal Large Language Model Think Analogically?
把多模态大模型当成「讲解员」和「答题者」两种角色来考——看它到底会不会人类式的类比推理。
arXiv:2411.01307 · 2024年11月2日(v1) · 机构未标注
06
强化学习

强化学习(深度强化学习现状综述及其在天文学中的应用)

Reinforcement learning
一篇面向天文新手的强化学习「导航图」:从理论到算法再到实战,告诉你 AI 智能体怎么帮天文学家自动盯望远镜、排观测、处理数据。
arXiv:2405.10369 · 2024年5月16日(v1) · 机构未标注
07
大模型视觉

LaVy:越南语多模态大语言模型(含越南语视觉语言评测基准 LaVy-Bench)

LaVy: Vietnamese Multimodal Large Language Model
英语多模态模型一大堆,越南语却几乎没有——LaVy 补上这块拼图:既做出越南语多模态大模型,又建了评测基准 LaVy-Bench,模型和「考卷」一起发布。
arXiv:2404.07922 · 2024年4月11日(v1) · 机构未标注
08
数据

DeiT-LT:让知识蒸馏「卷土重来」——面向长尾数据集的 Vision Transformer 从零训练

DeiT-LT: Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets
让 ViT 摆脱「必须大规模预训练」的枷锁:用 CNN 蒸馏 + 长尾重加权 + 双令牌「专家分工」,从零训练也能在长尾数据上达到 SOTA。
arXiv:2404.02900 · 2024年4月3日(v1) · 印度理工学院
09
计算机视觉视觉数据

「跳启动」外科计算机视觉:自监督预训练的数据构成决定下游价值

Jumpstarting Surgical Computer Vision
把研究重心从「模型」转向「数据」——300+ 次受控实验证明:手术 AI 自监督预训练的价值,关键不在模型,而在「预训练数据怎么凑」。
arXiv:2312.05968 · 2023年12月10日(v1) · 斯特拉斯堡大学
10
神经网络推荐系统

RekomGNN:图神经网络推荐结果的可视化、情境化与评估

RekomGNN: Visualizing, Contextualizing and Evaluating Graph Neural Networks Recommendations
给 GNN 的推荐结果配一个「可视化体检室」:让机器学习专家逐条审视、标注推荐质量,从而改进模型。
arXiv:2310.11562 · 2023年10月17日(v1) · 机构未标注
11
大模型视觉导航

多模态大语言模型用于视觉导航(面向视觉导航的多模态大语言模型)

Multimodal Large Language Model for Visual Navigation
别人把指令、观察、历史全写成超长提示词喂给大模型;这篇论文反其道而行——用「观察-动作对」直接微调大语言模型,输入简单文字+当前观察+历史,输出下一步动作的概率分布。
arXiv:2310.08669 · 2023年10月12日(v1) · 北卡罗来纳大学
12
图像处理

亚语义图像分割:介于纹理分割与语义分割之间,用自由语言把图像划分成稳定的外观模式

Sub-Semantic Image Segmentation
把通用视觉语言模型(Qwen3-VL-8B)接到 SAM 3 上,让模型自动「看图说话 + 按话切图」,完成更细粒度的亚语义图像分割。
arXiv:2606.14754 · 2026年6月7日(v1) · 特拉维夫大学、斯坦福大学
13
推荐系统

生成式对话推荐系统(GCRS):在单一自回归框架内统一「推荐」与「对话生成」

Generative Conversational Recommender System
物品用「语义 ID」表示、直接参与文本生成,模型先想清楚「回复意图 + 推荐哪个」再开口说话,端到端搞定对话推荐。
arXiv:2605.21987 · 2026年5月21日(v1) · 机构未标注
14
图像处理

全模态指代图像分割(OmniRIS):文本指令 + 参考图(掩码/框/涂鸦)联合指代的高度泛化图像分割

Omni-Referring Image Segmentation
把「文字指代」和「看图找相似」合二为一:文本 + 带掩码/框/涂鸦的参考图任意组合,一套模型通吃多种分割设定。
arXiv:2512.06862 · 2025年12月7日(v1) · 厦门大学
15
神经网络语音

TinyML 语音识别:在高度资源受限的 IoT 边缘设备上部署量化一维卷积神经网络模型

TinyML for Speech Recognition
先用板载麦克风采集 1 小时语音数据建新数据集,再借 Edge Impulse 平台训练量化 1D CNN,部署到只有 256 KB 内存的 Arduino Nano 33 BLE Sense 上,实现 23 个关键词、最高 97% 准确率的语音识别。
arXiv:2504.16213 · 2025年4月22日(v1) · 机构未标注
16
推荐系统

联邦对话式推荐系统(FedCRS):对话中说的偏好不再上传服务器,本地差分隐私保护用户隐私

Federated Conversational Recommender System
对话式推荐系统(CRS)会在聊天中收集你的偏好——这些偏好能反推出财务状况、政治立场等敏感信息。本文首次为 CRS 定义隐私保护准则,并提出 FedCRS:偏好不上传、只传加噪梯度,用用户级本地差分隐私严格限制泄露。
arXiv:2503.00999 · 2025年3月2日(v1) · 机构未标注
17
图像处理

贝叶斯多重分形图像分割:在小波领导者域中联合估计多重分形参数与像素标签,实现无监督的纹理图像分割

Bayesian Multifractal Image Segmentation
自然图像由多种纹理拼成,每种纹理有自己「多重分形」的粗糙程度。本文用 Fourier 域 Whittle 近似高效估计多重分形参数,用多尺度 Potts 马尔可夫随机场给标签建先验,再用吉布斯采样联合推断「参数 + 标签」,像素级无监督分割,性能超过深度学习方法。
arXiv:2501.08694 · 2025年1月15日(v1) · 赫瑞瓦特大学
18
知识图谱

《知识图谱结构与知识图谱嵌入研究综述》

A Survey on Knowledge Graph Structure and Knowledge Graph Embeddings
第一篇系统梳理「知识图谱结构 ↔ 嵌入模型性能 ↔ 超参数偏好」三者关系的综述:结构既是偏差来源,也在一定程度上决定模型好坏,文中还给出了开放问题清单。
arXiv:2412.10092 · 2024年12月13日(v1) · 机构未标注
19
科研

《单调异常检测》

Monotonic anomaly detection
提出两种「不对称距离」(ramp 距离与 signed 距离),让异常检测只对属性偏高(或只对偏低)敏感;实验表明 ramp 距离在 246 个基准问题与真实数据上都明显优于传统绝对距离。
arXiv:2410.23158 · 2024年10月30日(v1) · 机构未标注
20
知识图谱

《德国旅游知识图谱》

German Tourism Knowledge Graph
德国国家旅游局委托构建的行业知识图谱:整合德国 16 个联邦州的旅游数据,基于 schema.org、RDF(S)、SPARQL、SHACL 与 RML 等标准技术,每日更新,并通过 GUI 与 API 公开开放。
arXiv:2404.09587 · 2024年4月15日(v1) · 机构未标注
21
预测推荐系统

共形群组推荐系统(CGRS):把共形预测引入群组推荐,让每次推荐都附带置信度与错误上界

Conformal Group Recommender System
传统群组推荐是「黑盒」——只告诉一群人推荐什么,不告诉有多靠谱;这篇论文用共形预测给推荐集附上「置信度 (1−ε)」,系统说 80% 置信度,犯错概率就至多 20%。
arXiv:2307.12034 · 2023年7月22日(v1) · 德里大学、马欣德拉大学
22
大模型

多模态大语言模型综述:以 GPT-4V 为代表的 MLLM 之基础配方、扩展方向、幻觉问题与三大关键技术

A Survey on Multimodal Large Language Models
LLM 会「读」不会「看」,视觉模型会「看」不会「想」——两者融合出的多模态大语言模型(MLLM)以 GPT-4V 为代表,能看图写故事、免 OCR 做数学推理;本文是第一篇系统梳理 MLLM 的综述,并配套持续更新的 GitHub 论文库。
arXiv:2306.13549 · 2023年6月23日(v1) · 机构未标注
23
大模型

剖析大型语言模型推理中的失效动力学

Dissecting Failure Dynamics in Large Language Model Reasoning
推理错误不是均匀分布的——它们往往在轨迹早期几个「转折点」集中爆发;GUARD 用词元级熵信号在这些点做局部分支干预,不改底层模型就提升了推理可靠性。
arXiv:2604.14528 · 2026年4月16日(v1) · 机构未标注
24
计算机视觉视觉图像处理

横向联邦计算机视觉:联邦目标检测、识别与图像分割

Horizontal Federated Computer Vision
把目标检测(联邦 Faster R-CNN)和图像分割(联邦 FCN)搬进联邦学习:数据不出本地,用 5000 个 COCO2017 样本与整个 CamVid 训练集完成训练,兼顾隐私与效率。
arXiv:2401.00390 · 2023年12月31日(v1) · 机构未标注
25
强化学习

无需强化学习的逆强化学习:用专家状态分布加速模仿学习

Inverse Reinforcement Learning without Reinforcement Learning
传统 IRL 要在内循环里反复求解「比模仿更难」的强化学习问题;本文利用专家状态分布做「专家重置」,理论上把最坏情况复杂度从指数级降到多项式级,实践中显著加速连续控制任务。
arXiv:2303.14623 · 2023年3月26日(v1) · 机构未标注
26
知识图谱

迈向教学知识图谱:为知识图谱课程打造教学资源知识图谱

Towards a Knowledge Graph for Teaching Knowledge Graphs
用语义网技术把「知识图谱课程」的主题、课程、讲义、实验材料与讲师互连成一张可检索、可复用的教学知识图谱——用知识图谱来教知识图谱。
arXiv:2411.01304 · 2024年11月2日(v1) · 机构未标注
27
预测图像处理

Step Saver:预测扩散模型图像生成所需的最少去噪步数

Step Saver: Predicting Minimum Denoising Steps for Diffusion Model Image Generation
用一个微调过的 NLP 模型, 根据文本提示词实时预测「最少需要多少步去噪」, 在不牺牲画质的前提下大幅节省扩散模型的算力。
arXiv:2408.02054 · 2024年8月4日(v1) · 机构未标注
28
图像处理数据

纵向联邦图像分割:让没有标签的数据方也能参与隐私保护的图像分割

Vertical Federated Image Segmentation
在纵向联邦学习(VFL)里, 让持有图像但没有标签的那一方也能用 FCN 参与训练——首个(也是目前唯一)能在 VFL 约束下保持正常精度的图像分割系统。
arXiv:2401.07931 · 2024年1月15日(v1) · 机构未标注
29
推荐系统

影响力驱动的推荐系统:主动引导用户兴趣的推荐新范式

Influential Recommender System
不再是「你喜欢什么就推什么」,而是沿一条精心挑选的物品序列(影响路径),一步步把用户「引导」到喜欢某个目标物品。
arXiv:2211.10002 · 2022年11月18日(v1) · 机构未标注
30
视觉数据

以数据为中心的视觉 Transformer(ViT)高效训练

Effective Vision Transformer Training: A Data-Centric Perspective
训练 ViT 时每个阶段真正「有效」的样本其实少得可怜——动态调节样本难度分布,再用 PatchErasing 防过拟合,让每个阶段都有充足的有效样本可学。
arXiv:2209.15006 · 2022年9月29日(v1) · 机构未标注
31
知识图谱信号处理

面向信号推理的信号知识图谱(Signal Knowledge Graph)

Signal Knowledge Graph
传感器收到信号后别急着「信信号」——把攻击者行为、信号发射、接收机特性、信号摘要都建模进知识图谱,才能推断出信号背后的真实原因。
arXiv:2206.12111 · 2022年6月24日(v1) · 机构未标注
32
视觉

探究基于 DINO 训练的视觉 Transformer的对抗攻击与防御

Exploring Adversarial Attacks and Defenses in Vision Transformers trained with DINO
首次系统检验 DINO 自监督视觉 Transformer 的对抗鲁棒性,并给出算力受限下的轻量防御方案。
arXiv:2206.06761 · 2022年6月14日(v1) · 机构未标注
33
图像处理

双曲空间图像分割

Hyperbolic Image Segmentation
把像素级分割从欧氏空间搬进双曲空间,白送不确定性估计与边界信息,还提升零标签泛化与低维性能。
arXiv:2203.05898 · 2022年3月11日(v1) · 机构未标注
34
科研

鲁棒音频异常检测

Robust Audio Anomaly Detection
在「脏」训练集上学出离群鲁棒的音频异常检测器——不靠标注异常,也能听出从未见过的机器异响。
arXiv:2202.01784 · 2022年2月3日(v1) · 机构未标注
35
图像处理

自回归无监督图像分割

Autoregressive Unsupervised Image Segmentation
用掩码卷积给同一张图构造多种「像素遍历顺序」作为不同视图,训练模型最大化视图输出间的互信息——不靠任何标签也能学会图像分割与表示学习。
arXiv:2007.08247 · 2020年7月16日(v1) · 机构未标注
36
推荐系统

归纳共形推荐系统

Inductive Conformal Recommender System
在共形推荐框架上做「归纳式」改造——给每个推荐都配上精确的置信度(错误概率有严格上界),同时把计算时间大幅降下来。
arXiv:2109.08949 · 2021年9月18日(v1) · 机构未标注
37
语音

无监督语音识别(wav2vec-U)

Unsupervised Speech Recognition
只用无标注语音+无标注文本训练语音识别模型——wav2vec-U 把 TIMIT 音素错误率从 26.1 压到 11.3,Librispeech 词错误率 5.9。
arXiv:2105.11084 · 2021年5月24日(v1) · 机构未标注
38
科研

多视角异常检测

Multi-Perspective Anomaly Detection
把多个相机视角的图像在早期/晚期融合进 Deep SVDD——第一个用单一目标函数做多视角异常检测的工作,还自建了 dices 数据集。
arXiv:2105.09903 · 2021年5月20日(v1) · 机构未标注
39
语音

回声状态语音识别——受 ESN 启发,随机化部分 RNN 层的语音识别模型

Echo State Speech Recognition
语音模型不必全参数训练:把解码器 RNN 换成「随机初始化、不训练」的 ESN 层,质量几乎不降,训练提速 37%。
arXiv:2102.09114 · 2021年2月18日(v1) · 机构未标注
40
知识图谱

恶意软件知识图谱生成——面向威胁情报的开源知识图谱 TINKER

Malware Knowledge Graph Generation
从 83 份威胁报告(2006–2021)中人工标注约 3000 条 RDF 三元组,构建出开源恶意软件威胁情报知识图谱 TINKER。
arXiv:2102.05583 · 2021年2月10日(v1) · 机构未标注
02

推荐阅读路线

Reading Path
TIER 01

入门

基础概念扫盲,零基础可读。先建立对本方向核心问题的直觉。

TIER 02

进阶

核心方法与代表性应用,配合专业基础与数学工具食用更佳。

TIER 03

硬核

前沿专题与工程细节,打好基础后再啃,收益最大。

03

两周听力计划

Two-Week Plan
🛡️

创作不易
禁止一切形式爬取

本站为公益学习平台,全部精读内容均由编者逐篇人工制作,倾注大量时间与心血。

本站内容受版权保护,未经许可不得批量抓取、转载或商用,违者必究。任何形式的自动化抓取、镜像复制与二次分发,均属侵权行为。

恳请尊重劳动成果,以直接访问的方式阅读与分享。