CktGen:基于生成式人工智能(Generative AI)的模拟电路自动设计
CktGen: Automated Analog Circuit Design with Generative Artificial Intelligence
把「给定性能规格 → 生成能用的模拟电路」重新定义成生成任务:用一个变分自编码器把「规格」和「电路」映射进同一个潜空间,让一个规格可以对应多个合法电路,并能在不重新训练的情况下搜索满足新需求的电路。
arXiv:2410.00995 · 2024年10月1日(v1) · Yuxuan Hou, Hehe Fan, Jianrong Zhang, Yu
随机舍入:算法与硬件加速器
Stochastic Rounding: Algorithms and Hardware Accelerator
给神经形态芯片 SpiNNaker2 设计一个硬件加速器,用「随机舍入 + 饱和」代替软件模拟,让定点数运算更快、数值误差更小——随机舍入正在机器学习里越来越流行。
arXiv:2001.01501 · 2020年1月6日(v1) · Mantas Mikaitis(机构未在素材中标注)
模式引导的 FPGA 加速器设计空间探索
Pattern-Guided Design Space Exploration for FPGA Accelerator Design
把数值内核的「计算模式」(逐元素、归约、矩阵乘、模板更新)当作向导,把 HLS 的调度搜索从 140 个候选剪枝到 29 个,还能找回与穷举基线相同的最优延迟——用结构知识给昂贵的综合工具当「前置过滤器」。
arXiv:2607.15068 · 2026年7月16日(v1) · Jialiang Zhang, Weiman Yan, Yuelin Zou(机
迈向自主加速器设计:基于 SECDA 的 FPGA 加速器生成
Towards Autonomous Accelerator Design: FPGA Accelerator Generation with SECDA
让大语言模型当「架构师」:在 SECDA 软硬件协同设计生态里,用 RAG + 思维链 + 反馈回路自动探索加速器配置,并在 Zynq-7000 FPGA 真机上端到端跑通向量乘法、2D 卷积、矩阵转置三个加速器——实测时延 154 ms / 163 ms / 238 ms。
arXiv:2606.11117 · 2026年6月9日(v1) · Vinamra Sharma, Xingjian Fu, Jude Haris,
硬件木马检测的可解释性方法:系统比较
Explainability Methods for Hardware Trojan Detection: A Systematic Comparison
在 Trust-Hub 基准上系统比较三类可解释性——领域感知属性分析(31 个电路特征)、基于案例的推理(kNN)、模型无关特征归因(LIME/SHAP/梯度)——回答硬件安全工程师真正需要什么样的解释,并顺手把检测精度比 SVM 基线提升 4.25×。
arXiv:2601.18696 · 2026年1月26日(v1) · Paul Whitten, Francis Wolff, Chris Papac
AI 驱动的敏捷模拟电路设计与优化
AI-Powered Agile Analog Circuit Design and Optimization
两条 AI 辅助模拟设计路线——电路级:用多目标贝叶斯优化(MOBO)自动调晶体管尺寸;系统级:把模拟滤波器的传递函数嵌入神经网络训练循环,与关键词唤醒(KWS)分类器联合优化。
arXiv:2505.03750 · 2025年4月17日(v1) · Jinhai Hu, Wang Ling Goh, Yuan Gao(机构未在素
面向点云的高效 FPGA 加速器
An Efficient FPGA Accelerator for Point Cloud
针对子流形稀疏卷积网络(SSCN)「极端稀疏 + 复杂匹配」两大难点,提出去零策略、紧凑编码方案、稀疏数据匹配单元(SDMU)与计算核(CC)四位一体的 FPGA 加速器 ESCA,在 Xilinx ZCU102 上实现,性能比 GPU 提升约 1.88 倍、能效提升 51 倍。
arXiv:2210.07803 · 2022年10月14日(v1) · Zilun Wang, Wendong Mao, Peixiang Yang,
非易失存内计算(PiM)的错误校正研究
On Error Correction for Nonvolatile Processing-In-Memory
存内计算(PiM)继承存储器的错误,还会产生「计算引入的错误」——本文重访非易失 PiM 的纠错设计空间,同时考虑两类错误,提出基于汉明码的 ECiM 与基于三模冗余的 TRiM,在三种代表性非易失存储技术上都保证单比特纠错。
arXiv:2207.13261 · 2022年7月27日(v1) · Hüsrev Cılasun, Salonik Resch, Zamshed I
基于图神经网络(GNN)的硬件木马检测
Hardware Trojan Detection using Graph Neural Networks
不需要「黄金参考电路」,把 RTL 和门级网表都画成数据流图(DFG),用图神经网络学电路行为,97% 召回率、21.1ms 就能揪出没见过的硬件木马。
arXiv:2204.11431 · 2022年4月25日(v1) · Rozhin Yasaei, Luke Chen, Shih-Yuan Yu,
基于图学习的节点级硬件木马检测
Node-wise Hardware Trojan Detection Based on Graph Learning
把门级网表当成「节点=门、边=连线」的图,逐节点判断哪个门是木马——不用手工设计特征,检测准确率高达 0.998,还讲清楚了 GNN 到底学到了什么特征。
arXiv:2112.02213 · 2021年12月4日(v1) · Kento Hasegawa, Kazuki Yamashita, Seira
MultPIM:面向存内计算(PIM)的快速有状态乘法
MultPIM: Fast Stateful Multiplication for Processing-in-Memory
让「存数据的忆阻器阵列」顺便把乘法也算完——用进位保存加移位(CSAS)把乘法时间复杂度从 O(N²) 降到 O(N log N),32 位乘法比当时最先进的 RIME 再快 4.2 倍。
arXiv:2108.13378 · 2021年8月30日(v1) · Orian Leitersdorf, Ronny Ronen, Shahar K
存内计算(Processing in Memory)现代入门指南
A Modern Primer on Processing in Memory
这篇「现代入门指南」系统梳理了存内计算(PIM):把计算搬进/搬到数据所在的存储器里,消灭「搬数据」的巨大开销;并对比两条技术路线——用存储器计算(PUM)与近存储器计算(PNM),指出最大的采用障碍是「从处理器中心到内存中心」的思维范式转变。
arXiv:2012.03112 · 2020年12月5日(v1) · Onur Mutlu, Saugata Ghose, Juan Gómez-Lu
基于 Dyna 风格强化学习的模拟电路设计
Analog Circuit Design with Dyna-Style Reinforcement Learning
模拟电路设计靠工程师手工调参、仿真验证,慢且贵。本文提出 DynaOpt:用神经网络奖励模型替代昂贵的电路仿真、用随机策略生成器探索多样化可行解空间,两件套拼成 Dyna 式优化框架——在两级运算放大器基准上,只用 500 次仿真就超过了无模型方法用 20,000 次仿真才能达到的性能。
arXiv:2011.07665 · 2020年11月16日(v1) · Wook Lee, Frans A. Oliehoek(机构未在素材中标注)
同态量子纠错:云量子计算中加密与纠错的兼容性判据
Homomorphic Quantum Error Correction
回答了「加密后的量子数据还能不能直接做纠错」——给出稳定子码在块 Pauli 掩码下保持码空间的充要条件。
arXiv:2605.25692 · 2026年5月25日(v1) · Kornikar Sen, Miguel A. Martin-Delgado(机
改进的近似计算模板:基于参数化乘积共享的近似逻辑综合
An Improved Template for Approximate Computing
把 XPAT 的「朴素乘积和模板」升级为「参数化乘积共享模板」——模板参数与综合后面积强相关,相同误差下找到更小的加法器、乘法器电路。
arXiv:2509.06162 · 2025年9月7日(v1) · Morteza Rezaalipour, Francesco Costa, Ma
基于深度学习的 SRAM 设计布局前寄生电容预测
Deep-Learning-Based Pre-Layout Parasitic Capacitance Prediction on SRAM Designs
版图还没画,先用「GNN 分类器 + MLP 回归器」两阶段模型把 SRAM 的寄生电容预测出来——误差最多降 19 倍,仿真提速最高 598 倍。
arXiv:2507.06549 · 2025年7月9日(v1) · Shan Shen, Dingcheng Yang, Yuyang Xie, C
TransAxx:面向高效 Transformer 的近似计算
TransAxx: Efficient Transformers with Approximate Computing
Vision Transformer(ViT)很准但算力需求巨大,低功耗设备跑不动。本文提出 TransAxx:一个基于 PyTorch 的近似乘法器仿真框架,配合蒙特卡洛树搜索(MCTS)自动为每一层挑选最优近似配置并做近似感知微调,在 ImageNet 上实现了精度与功耗的大幅权衡收益。
arXiv:2402.07545 · 2024年2月12日(v1) · Dimitrios Danopoulos, Georgios Zervakis,
基于磁电FET的 SRAM 设计实现常关原位计算
Enabling Normally-off In-Situ Computing with a Magneto-Electric FET-based SRAM Design
物联网边缘设备待机漏电耗电快,但 SRAM 一断电数据就没了。本文首次提出基于磁电FET(MEFET)的非易失 SRAM「ME-SRAM」:空闲时快速备份后断电(常关),需要时恢复;还把布尔运算直接做进存储阵列(存内计算),跑二值卷积神经网络时能耗平均降低 5.3 倍。
arXiv:2312.05212 · 2023年12月8日(v1) · Deniz Najafi, Mehrdad Morsali, Ranyang Z
常数局部性下的分布式近似计算
Distributed Approximate Computing with Constant Locality
分布式系统里多个节点各自压缩数据、共同算一个函数,解码端还要「只读常数个压缩比特就能近似还原」。本文用分层编码(典型性编码 + 扩展图码)给出可达码率区域,并证明在源分布正则条件下最优——而且该区域通常严格小于无局部性约束的经典问题:想要更低的解码复杂度,就得付出更高的码率。
arXiv:2312.04141 · 2023年12月7日(v1) · Deheng Yuan, Tao Guo, Zhongyi Huang, Shi
非线性量子纠错(NLQEC:Nonlinear Quantum Error Correction)
Nonlinear quantum error correction
标准量子纠错要求编码态是码字的「任意线性组合」,但真实量子协议运行时只「路过」希尔伯特空间的一小部分状态——本文只针对这个状态子类(字母表态)设计纠错,得到更宽松的判据,并绕开了「高斯态无法有效纠错」的经典 no-go 定理。
arXiv:2112.01858 · 2021年12月3日(v1) · Maximilian Reichert, Louis W. Tessler, M
超表面可编程无线片上网络
Metasurface-Programmable Wireless Network-on-Chip
芯片内无线通信一直卡在「两难」里:信号要么太弱,要么反射太强导致码间干扰。本文把可编程超表面(RIS)装进芯片封装,让电磁环境「可编程」——把信道冲激响应整形为脉冲状,既保住信号强度,又把调制速度翻倍。
arXiv:2109.03284 · 2021年9月7日(v1) · Mohammadreza F. Imani, Sergi Abadal, Phi
基于自旋波的近似计算
Spin Wave Based Approximate Computing
摩尔定律快到尽头,自旋波(SW)电路靠「波的干涉」代替「电荷移动」实现超低能耗计算;本文再叠加近似计算范式——为多媒体、社交媒体这类容错应用设计的近似全加器 AFA 和 2 位输入乘法器 AMUL,比最先进的 CMOS 全加器省 33%~44% 能量、省至少 29% 芯片面积。
arXiv:2103.12869 · 2021年3月23日(v1) · Abdulqader Mahmoud, Frederic Vanderveken
Lupulus:面向神经网络的灵活硬件加速器
Lupulus: A Flexible Hardware Accelerator for Neural Networks
用「调度 + 映射」策略让同一个硬件加速器灵活适配不同神经网络,28nm FD-SOI 工艺实现 380 GOPS/GHz 峰值性能。
arXiv:2005.01016 · 2020年5月3日(v1) · Andreas Toftegaard Kristensen, Robert Gi