推测解码加速大模型推理:基于推测搜索(Speculative Search / SpecSearch)的大语言模型推理加速框架
Accelerating Large Language Model Reasoning via Speculative Search
让一个小模型替大模型「打草稿」生成推理思路、大模型负责把关——在保持推理质量的前提下,把树搜索式慢思考推理最高加速 2.12 倍。
arXiv:2505.02865 · 2025年5月3日(v1) · Zhihai Wang, Jie Wang, Jilai Pan, Xilin
计算机视觉联邦学习:联邦学习在计算机视觉中的应用综述(含技术分类体系、安全威胁与隐私保护方法)
Federated Learning for Computer Vision
数据不出本地也能训出好模型——这篇综述首次系统梳理联邦学习在计算机视觉各任务中的进展,给出技术分类、安全威胁与隐私保护方法全景图。
arXiv:2308.13558 · 2023年8月24日(v1) · Yassine Himeur, Iraklis Varlamis, Hamza
Token 通信:面向多模态大语言模型的令牌传输方案
Token Communication for Multimodal Large Language Model
把神经编解码器「塞进」视觉分词器,边压缩边给多模态大模型喂「原生的视觉 token」——在相同传输数据量下,任务性能优于传统「重建图像再喂模型」的方案。
arXiv:2608.07279 · 2026年8月7日(v1) · Jingkai Ying, Zhijin Qin, Yuan Shen, Kha
大语言模型推理失败分析(首份系统性综述)
Large Language Model Reasoning Failures
把散落在各处的「大模型推理翻车案例」收拢成第一份系统综述,用「推理类型 × 失败类型」两条轴分类,并为每种失败给出定义、已有研究、根因与缓解策略。
arXiv:2602.06176 · 2026年2月5日(v1) · Peiyang Song, Pengrui Han, Noah Goodman(
ChemMLLM:化学多模态大语言模型(分子的统一理解与生成)
ChemMLLM: Chemical Multimodal Large Language Model
第一个「能看懂也能画分子」的统一化学多模态大模型——文本、SMILES、分子图像三模态一把抓;在分子图像优化任务上比最强基线 GPT-4o 高出 116.75%(性质提升 4.27 vs 1.97)。
arXiv:2505.16326 · 2025年5月22日(v1) · Qian Tan, Dongzhan Zhou, Peng Xia, Wanha
多模态大语言模型能否进行类比推理?
Can Multimodal Large Language Model Think Analogically?
把多模态大模型当成「讲解员」和「答题者」两种角色来考——看它到底会不会人类式的类比推理。
arXiv:2411.01307 · 2024年11月2日(v1) · Diandian Guo, Cong Cao, Fangfang Yuan, D
强化学习(深度强化学习现状综述及其在天文学中的应用)
Reinforcement learning
一篇面向天文新手的强化学习「导航图」:从理论到算法再到实战,告诉你 AI 智能体怎么帮天文学家自动盯望远镜、排观测、处理数据。
arXiv:2405.10369 · 2024年5月16日(v1) · Sarod Yatawatta(机构未在素材中标注)
LaVy:越南语多模态大语言模型(含越南语视觉语言评测基准 LaVy-Bench)
LaVy: Vietnamese Multimodal Large Language Model
英语多模态模型一大堆,越南语却几乎没有——LaVy 补上这块拼图:既做出越南语多模态大模型,又建了评测基准 LaVy-Bench,模型和「考卷」一起发布。
arXiv:2404.07922 · 2024年4月11日(v1) · Chi Tran, Huong Le Thanh(机构未在素材中标注)
DeiT-LT:让知识蒸馏「卷土重来」——面向长尾数据集的 Vision Transformer 从零训练
DeiT-LT: Distillation Strikes Back for Vision Transformer Training on Long-Tailed Datasets
让 ViT 摆脱「必须大规模预训练」的枷锁:用 CNN 蒸馏 + 长尾重加权 + 双令牌「专家分工」,从零训练也能在长尾数据上达到 SOTA。
arXiv:2404.02900 · 2024年4月3日(v1) · Harsh Rangwani, Pradipto Mondal, Mayank
「跳启动」外科计算机视觉:自监督预训练的数据构成决定下游价值
Jumpstarting Surgical Computer Vision
把研究重心从「模型」转向「数据」——300+ 次受控实验证明:手术 AI 自监督预训练的价值,关键不在模型,而在「预训练数据怎么凑」。
arXiv:2312.05968 · 2023年12月10日(v1) · Deepak Alapatt, Aditya Murali, Vinkle Sr
RekomGNN:图神经网络推荐结果的可视化、情境化与评估
RekomGNN: Visualizing, Contextualizing and Evaluating Graph Neural Networks Recommendations
给 GNN 的推荐结果配一个「可视化体检室」:让机器学习专家逐条审视、标注推荐质量,从而改进模型。
arXiv:2310.11562 · 2023年10月17日(v1) · Camelia D. Brumar, Gabriel Appleby, Jen
多模态大语言模型用于视觉导航(面向视觉导航的多模态大语言模型)
Multimodal Large Language Model for Visual Navigation
别人把指令、观察、历史全写成超长提示词喂给大模型;这篇论文反其道而行——用「观察-动作对」直接微调大语言模型,输入简单文字+当前观察+历史,输出下一步动作的概率分布。
arXiv:2310.08669 · 2023年10月12日(v1) · Yao-Hung Hubert Tsai, Vansh Dhar, Jialu
亚语义图像分割:介于纹理分割与语义分割之间,用自由语言把图像划分成稳定的外观模式
Sub-Semantic Image Segmentation
把通用视觉语言模型(Qwen3-VL-8B)接到 SAM 3 上,让模型自动「看图说话 + 按话切图」,完成更细粒度的亚语义图像分割。
arXiv:2606.14754 · 2026年6月7日(v1) · Aviad Cohen Zada, Nadav Orenstein, Shai
生成式对话推荐系统(GCRS):在单一自回归框架内统一「推荐」与「对话生成」
Generative Conversational Recommender System
物品用「语义 ID」表示、直接参与文本生成,模型先想清楚「回复意图 + 推荐哪个」再开口说话,端到端搞定对话推荐。
arXiv:2605.21987 · 2026年5月21日(v1) · Sixiao Zhang, Mingrui Liu, Cheng Long(机构
全模态指代图像分割(OmniRIS):文本指令 + 参考图(掩码/框/涂鸦)联合指代的高度泛化图像分割
Omni-Referring Image Segmentation
把「文字指代」和「看图找相似」合二为一:文本 + 带掩码/框/涂鸦的参考图任意组合,一套模型通吃多种分割设定。
arXiv:2512.06862 · 2025年12月7日(v1) · Qiancheng Zheng, Yunhang Shen, Gen Luo,
TinyML 语音识别:在高度资源受限的 IoT 边缘设备上部署量化一维卷积神经网络模型
TinyML for Speech Recognition
先用板载麦克风采集 1 小时语音数据建新数据集,再借 Edge Impulse 平台训练量化 1D CNN,部署到只有 256 KB 内存的 Arduino Nano 33 BLE Sense 上,实现 23 个关键词、最高 97% 准确率的语音识别。
arXiv:2504.16213 · 2025年4月22日(v1) · Andrew Barovic, Armin Moin(机构未在素材中标注)
联邦对话式推荐系统(FedCRS):对话中说的偏好不再上传服务器,本地差分隐私保护用户隐私
Federated Conversational Recommender System
对话式推荐系统(CRS)会在聊天中收集你的偏好——这些偏好能反推出财务状况、政治立场等敏感信息。本文首次为 CRS 定义隐私保护准则,并提出 FedCRS:偏好不上传、只传加噪梯度,用用户级本地差分隐私严格限制泄露。
arXiv:2503.00999 · 2025年3月2日(v1) · Allen Lin, Jianling Wang, Ziwei Zhu, Jam
贝叶斯多重分形图像分割:在小波领导者域中联合估计多重分形参数与像素标签,实现无监督的纹理图像分割
Bayesian Multifractal Image Segmentation
自然图像由多种纹理拼成,每种纹理有自己「多重分形」的粗糙程度。本文用 Fourier 域 Whittle 近似高效估计多重分形参数,用多尺度 Potts 马尔可夫随机场给标签建先验,再用吉布斯采样联合推断「参数 + 标签」,像素级无监督分割,性能超过深度学习方法。
arXiv:2501.08694 · 2025年1月15日(v1) · Kareth M. León-López, Abderrahim Halimi,
《知识图谱结构与知识图谱嵌入研究综述》
A Survey on Knowledge Graph Structure and Knowledge Graph Embeddings
第一篇系统梳理「知识图谱结构 ↔ 嵌入模型性能 ↔ 超参数偏好」三者关系的综述:结构既是偏差来源,也在一定程度上决定模型好坏,文中还给出了开放问题清单。
arXiv:2412.10092 · 2024年12月13日(v1) · Jeffrey Sardina, John D. Kelleher, Decla
《单调异常检测》
Monotonic anomaly detection
提出两种「不对称距离」(ramp 距离与 signed 距离),让异常检测只对属性偏高(或只对偏低)敏感;实验表明 ramp 距离在 246 个基准问题与真实数据上都明显优于传统绝对距离。
arXiv:2410.23158 · 2024年10月30日(v1) · Oliver Urs Lenz, Matthijs van Leeuwen(机构
《德国旅游知识图谱》
German Tourism Knowledge Graph
德国国家旅游局委托构建的行业知识图谱:整合德国 16 个联邦州的旅游数据,基于 schema.org、RDF(S)、SPARQL、SHACL 与 RML 等标准技术,每日更新,并通过 GUI 与 API 公开开放。
arXiv:2404.09587 · 2024年4月15日(v1) · Umutcan Serles, Elias Kärle, Richard Hun
共形群组推荐系统(CGRS):把共形预测引入群组推荐,让每次推荐都附带置信度与错误上界
Conformal Group Recommender System
传统群组推荐是「黑盒」——只告诉一群人推荐什么,不告诉有多靠谱;这篇论文用共形预测给推荐集附上「置信度 (1−ε)」,系统说 80% 置信度,犯错概率就至多 20%。
arXiv:2307.12034 · 2023年7月22日(v1) · Venkateswara Rao Kagita, Anshuman Singh,
多模态大语言模型综述:以 GPT-4V 为代表的 MLLM 之基础配方、扩展方向、幻觉问题与三大关键技术
A Survey on Multimodal Large Language Models
LLM 会「读」不会「看」,视觉模型会「看」不会「想」——两者融合出的多模态大语言模型(MLLM)以 GPT-4V 为代表,能看图写故事、免 OCR 做数学推理;本文是第一篇系统梳理 MLLM 的综述,并配套持续更新的 GitHub 论文库。
arXiv:2306.13549 · 2023年6月23日(v1) · Shukang Yin, Chaoyou Fu, Sirui Zhao, Ke