CktGen:基于生成式人工智能(Generative AI)的模拟电路自动设计
CktGen: Automated Analog Circuit Design with Generative Artificial Intelligence
把「给定性能规格 → 生成能用的模拟电路」重新定义成生成任务:用一个变分自编码器把「规格」和「电路」映射进同一个潜空间,让一个规格可以对应多个合法电路,并能在不重新训练的情况下搜索满足新需求的电路。
arXiv:2410.00995 · 2024年10月1日(v1) · 机构未标注
随机舍入:算法与硬件加速器
Stochastic Rounding: Algorithms and Hardware Accelerator
给神经形态芯片 SpiNNaker2 设计一个硬件加速器,用「随机舍入 + 饱和」代替软件模拟,让定点数运算更快、数值误差更小——随机舍入正在机器学习里越来越流行。
arXiv:2001.01501 · 2020年1月6日(v1) · 机构未标注
模式引导的 FPGA 加速器设计空间探索
Pattern-Guided Design Space Exploration for FPGA Accelerator Design
把数值内核的「计算模式」(逐元素、归约、矩阵乘、模板更新)当作向导,把 HLS 的调度搜索从 140 个候选剪枝到 29 个,还能找回与穷举基线相同的最优延迟——用结构知识给昂贵的综合工具当「前置过滤器」。
arXiv:2607.15068 · 2026年7月16日(v1) · 伊利诺伊大学厄巴纳-香槟分校、哥伦比亚大学
迈向自主加速器设计:基于 SECDA 的 FPGA 加速器生成
Towards Autonomous Accelerator Design: FPGA Accelerator Generation with SECDA
让大语言模型当「架构师」:在 SECDA 软硬件协同设计生态里,用 RAG + 思维链 + 反馈回路自动探索加速器配置,并在 Zynq-7000 FPGA 真机上端到端跑通向量乘法、2D 卷积、矩阵转置三个加速器——实测时延 154 ms / 163 ms / 238 ms。
arXiv:2606.11117 · 2026年6月9日(v1) · 格拉斯哥大学
硬件木马检测的可解释性方法:系统比较
Explainability Methods for Hardware Trojan Detection: A Systematic Comparison
在 Trust-Hub 基准上系统比较三类可解释性——领域感知属性分析(31 个电路特征)、基于案例的推理(kNN)、模型无关特征归因(LIME/SHAP/梯度)——回答硬件安全工程师真正需要什么样的解释,并顺手把检测精度比 SVM 基线提升 4.25×。
arXiv:2601.18696 · 2026年1月26日(v1) · 机构未标注
AI 驱动的敏捷模拟电路设计与优化
AI-Powered Agile Analog Circuit Design and Optimization
两条 AI 辅助模拟设计路线——电路级:用多目标贝叶斯优化(MOBO)自动调晶体管尺寸;系统级:把模拟滤波器的传递函数嵌入神经网络训练循环,与关键词唤醒(KWS)分类器联合优化。
arXiv:2505.03750 · 2025年4月17日(v1) · 机构未标注
面向点云的高效 FPGA 加速器
An Efficient FPGA Accelerator for Point Cloud
针对子流形稀疏卷积网络(SSCN)「极端稀疏 + 复杂匹配」两大难点,提出去零策略、紧凑编码方案、稀疏数据匹配单元(SDMU)与计算核(CC)四位一体的 FPGA 加速器 ESCA,在 Xilinx ZCU102 上实现,性能比 GPU 提升约 1.88 倍、能效提升 51 倍。
arXiv:2210.07803 · 2022年10月14日(v1) · 南京大学
非易失存内计算(PiM)的错误校正研究
On Error Correction for Nonvolatile Processing-In-Memory
存内计算(PiM)继承存储器的错误,还会产生「计算引入的错误」——本文重访非易失 PiM 的纠错设计空间,同时考虑两类错误,提出基于汉明码的 ECiM 与基于三模冗余的 TRiM,在三种代表性非易失存储技术上都保证单比特纠错。
arXiv:2207.13261 · 2022年7月27日(v1) · 明尼苏达大学
基于图神经网络(GNN)的硬件木马检测
Hardware Trojan Detection using Graph Neural Networks
不需要「黄金参考电路」,把 RTL 和门级网表都画成数据流图(DFG),用图神经网络学电路行为,97% 召回率、21.1ms 就能揪出没见过的硬件木马。
arXiv:2204.11431 · 2022年4月25日(v1) · 机构未标注
基于图学习的节点级硬件木马检测
Node-wise Hardware Trojan Detection Based on Graph Learning
把门级网表当成「节点=门、边=连线」的图,逐节点判断哪个门是木马——不用手工设计特征,检测准确率高达 0.998,还讲清楚了 GNN 到底学到了什么特征。
arXiv:2112.02213 · 2021年12月4日(v1) · 早稻田大学
MultPIM:面向存内计算(PIM)的快速有状态乘法
MultPIM: Fast Stateful Multiplication for Processing-in-Memory
让「存数据的忆阻器阵列」顺便把乘法也算完——用进位保存加移位(CSAS)把乘法时间复杂度从 O(N²) 降到 O(N log N),32 位乘法比当时最先进的 RIME 再快 4.2 倍。
arXiv:2108.13378 · 2021年8月30日(v1) · 以色列理工学院
存内计算(Processing in Memory)现代入门指南
A Modern Primer on Processing in Memory
这篇「现代入门指南」系统梳理了存内计算(PIM):把计算搬进/搬到数据所在的存储器里,消灭「搬数据」的巨大开销;并对比两条技术路线——用存储器计算(PUM)与近存储器计算(PNM),指出最大的采用障碍是「从处理器中心到内存中心」的思维范式转变。
arXiv:2012.03112 · 2020年12月5日(v1) · 苏黎世联邦理工学院、伊利诺伊大学厄巴纳-香槟分校
基于 Dyna 风格强化学习的模拟电路设计
Analog Circuit Design with Dyna-Style Reinforcement Learning
模拟电路设计靠工程师手工调参、仿真验证,慢且贵。本文提出 DynaOpt:用神经网络奖励模型替代昂贵的电路仿真、用随机策略生成器探索多样化可行解空间,两件套拼成 Dyna 式优化框架——在两级运算放大器基准上,只用 500 次仿真就超过了无模型方法用 20,000 次仿真才能达到的性能。
arXiv:2011.07665 · 2020年11月16日(v1) · 机构未标注
同态量子纠错:云量子计算中加密与纠错的兼容性判据
Homomorphic Quantum Error Correction
回答了「加密后的量子数据还能不能直接做纠错」——给出稳定子码在块 Pauli 掩码下保持码空间的充要条件。
arXiv:2605.25692 · 2026年5月25日(v1) · 机构未标注
改进的近似计算模板:基于参数化乘积共享的近似逻辑综合
An Improved Template for Approximate Computing
把 XPAT 的「朴素乘积和模板」升级为「参数化乘积共享模板」——模板参数与综合后面积强相关,相同误差下找到更小的加法器、乘法器电路。
arXiv:2509.06162 · 2025年9月7日(v1) · 帝国理工学院
基于深度学习的 SRAM 设计布局前寄生电容预测
Deep-Learning-Based Pre-Layout Parasitic Capacitance Prediction on SRAM Designs
版图还没画,先用「GNN 分类器 + MLP 回归器」两阶段模型把 SRAM 的寄生电容预测出来——误差最多降 19 倍,仿真提速最高 598 倍。
arXiv:2507.06549 · 2025年7月9日(v1) · 清华大学、香港中文大学
TransAxx:面向高效 Transformer 的近似计算
TransAxx: Efficient Transformers with Approximate Computing
Vision Transformer(ViT)很准但算力需求巨大,低功耗设备跑不动。本文提出 TransAxx:一个基于 PyTorch 的近似乘法器仿真框架,配合蒙特卡洛树搜索(MCTS)自动为每一层挑选最优近似配置并做近似感知微调,在 ImageNet 上实现了精度与功耗的大幅权衡收益。
arXiv:2402.07545 · 2024年2月12日(v1) · 雅典国立理工大学、帕特雷大学
基于磁电FET的 SRAM 设计实现常关原位计算
Enabling Normally-off In-Situ Computing with a Magneto-Electric FET-based SRAM Design
物联网边缘设备待机漏电耗电快,但 SRAM 一断电数据就没了。本文首次提出基于磁电FET(MEFET)的非易失 SRAM「ME-SRAM」:空闲时快速备份后断电(常关),需要时恢复;还把布尔运算直接做进存储阵列(存内计算),跑二值卷积神经网络时能耗平均降低 5.3 倍。
arXiv:2312.05212 · 2023年12月8日(v1) · 新泽西理工学院、内布拉斯加大学
常数局部性下的分布式近似计算
Distributed Approximate Computing with Constant Locality
分布式系统里多个节点各自压缩数据、共同算一个函数,解码端还要「只读常数个压缩比特就能近似还原」。本文用分层编码(典型性编码 + 扩展图码)给出可达码率区域,并证明在源分布正则条件下最优——而且该区域通常严格小于无局部性约束的经典问题:想要更低的解码复杂度,就得付出更高的码率。
arXiv:2312.04141 · 2023年12月7日(v1) · 清华大学、东南大学
非线性量子纠错(NLQEC:Nonlinear Quantum Error Correction)
Nonlinear quantum error correction
标准量子纠错要求编码态是码字的「任意线性组合」,但真实量子协议运行时只「路过」希尔伯特空间的一小部分状态——本文只针对这个状态子类(字母表态)设计纠错,得到更宽松的判据,并绕开了「高斯态无法有效纠错」的经典 no-go 定理。
arXiv:2112.01858 · 2021年12月3日(v1) · 华东师范大学
超表面可编程无线片上网络
Metasurface-Programmable Wireless Network-on-Chip
芯片内无线通信一直卡在「两难」里:信号要么太弱,要么反射太强导致码间干扰。本文把可编程超表面(RIS)装进芯片封装,让电磁环境「可编程」——把信道冲激响应整形为脉冲状,既保住信号强度,又把调制速度翻倍。
arXiv:2109.03284 · 2021年9月7日(v1) · 亚利桑那州立大学
基于自旋波的近似计算
Spin Wave Based Approximate Computing
摩尔定律快到尽头,自旋波(SW)电路靠「波的干涉」代替「电荷移动」实现超低能耗计算;本文再叠加近似计算范式——为多媒体、社交媒体这类容错应用设计的近似全加器 AFA 和 2 位输入乘法器 AMUL,比最先进的 CMOS 全加器省 33%~44% 能量、省至少 29% 芯片面积。
arXiv:2103.12869 · 2021年3月23日(v1) · 机构未标注
Lupulus:面向神经网络的灵活硬件加速器
Lupulus: A Flexible Hardware Accelerator for Neural Networks
用「调度 + 映射」策略让同一个硬件加速器灵活适配不同神经网络,28nm FD-SOI 工艺实现 380 GOPS/GHz 峰值性能。
arXiv:2005.01016 · 2020年5月3日(v1) · 机构未标注
基于受控电路老化的硬件木马检测
Hardware Trojan Detection Using Controlled Circuit Aging
不用等木马触发——让芯片在运行中自然「老化」,老化的时序延迟叠加超频产生位错误模式,机器学习一比对就知道芯片里有没有被植入木马。
arXiv:2004.02997 · 2020年4月6日(v1) · 机构未标注
基于机器学习的自补偿近似计算
Machine Learning-Based Self-Compensating Approximate Computing
给近似加速器内置一个「误差补偿模块」——用决策树学会「什么样的输入带来多大的误差」,在输出端把误差补回来,精度提升约 9% 而开销几乎为零。
arXiv:2001.03783 · 2020年1月11日(v1) · 机构未标注
面向卷积神经网络的柔性 FPGA 加速器
A flexible FPGA accelerator for convolutional neural networks
用「1 维 PE 阵列」的柔性核替代 2 维阵列:任意形状的卷积层分块都能线性化映射、免重配置,配合 TensorFlow 软件栈,在真实 VC709 板卡上逼近理论峰值性能。
arXiv:1912.07284 · 2019年12月16日(v1) · 机构未标注
面向深度神经网络的高性能可扩展 FPGA 加速器
High Performance Scalable FPGA Accelerator for Deep Neural Networks
用 FPGA 的逻辑单元(ALM)替代 DSP 做 INT-8-2(8 位激活 + 2 位权重)推理:Arria10 实测 5 AI-TOPS,Stratix10 预计 76 AI-TOPS @ 0.7 TOPS/W,超 CPU/GPU、迫近 TPU。
arXiv:1908.11809 · 2019年8月29日(v1) · 机构未标注
基于自动编译器的 CNN 训练 FPGA 加速器
Automatic Compiler Based FPGA Accelerator for CNN Training
用「RTL 编译器 + 参数化 Verilog 模块库」自动生成 CNN 训练加速器(16 位定点,含前向/反向/权重更新),在 Intel Stratix 10-GX 上训练 CIFAR-10 网络,吞吐最高 479 GOPS。
arXiv:1908.06724 · 2019年8月15日(v1) · 机构未标注
无线片上网络中的机会式波束成形
Opportunistic Beamforming in Wireless Network-on-Chip
不跟芯片内天线耦合“硬刚”,而是把现有全向天线临时拼成小阵列做机会式波束成形:全波仿真显示封装内阵列能获得中等增益、波束宽度低于 90°。
arXiv:1906.05361 · 2019年6月12日(v1) · 机构未标注
基于信息流安全验证的硬件木马检测
Hardware Trojan Detection through Information Flow Security Verification
无需白盒知识,用信息流安全(IFS)验证揪出第三方 IP 中隐藏的硬件木马,并在 18 个 trust-hub 基准上验证。
arXiv:1803.04102 · 2018年3月12日(v1) · 机构未标注
大规模 MU-MIMO 非参数均衡器(NOPE)的 VLSI 设计
VLSI Design of a Nonparametric Equalizer for Massive MU-MIMO
首个非参数均衡器 NOPE 的 VLSI 设计:免信号/噪声功率先验,28nm CMOS 综合,性能追平 L-MMSE。
arXiv:1711.10446 · 2017年11月28日(v1) · 机构未标注
近似计算导论
An introduction to approximate computing
系统介绍近似计算:以可控精度损失换取性能与能效,并提出贯穿整个系统栈的分类法。
arXiv:1711.06115 · 2017年11月12日(v1) · 机构未标注
硬件木马检测博弈:一种前景理论方法
Hardware Trojan Detection Game: A Prospect-Theoretic Approach
把「芯片制造商可能植入硬件木马、测试机构如何检测」的攻防对抗建模成非合作博弈,并用前景理论刻画双方的不理性决策。
arXiv:1703.07499 · 2017年3月22日(v1) · 机构未标注
基于近似计算的节能卷积神经网络(ConvNets)
Energy-Efficient ConvNets Through Approximate Computing
利用卷积神经网络的容错性做近似计算与量化,让专用加速器在不掉精度时省电 30 倍、99% 精度时省电超 100 倍。
arXiv:1603.06777 · 2016年3月22日(v1) · 机构未标注
改进基于片上网络(NoC)的 Turbo 译码器架构
Improving Network-on-Chip-based turbo decoder architectures
用自适应带宽缩减与位级/伪浮点外信息表示,让基于片上网络的 Turbo 译码器吞吐提升 60+ Mb/s、面积缩减 40% 以上。
arXiv:1105.1014 · 2011年5月5日(v1) · 机构未标注
保证服务质量(QoS)的片上网络设计算法
Algorithms for Network-on-Chip Design with Guaranteed QoS
给定拓扑、任务映射与流量需求,自动算出片上网络的互连宽度、静态路由与周期调度——不需要任何包头、控制消息与确认,也能保证每个数据包准时、不丢失地送达。
arXiv:1509.00249 · 2015年9月1日(v1) · 机构未标注
PIMSYN:面向存内计算(PIM)的 CNN 加速器自动综合
PIMSYN: Synthesizing Processing-in-memory CNN Accelerators
一条命令把 CNN 应用自动「综合」成存内计算加速器——把设计空间探索嵌进综合流程,功耗效率比现有工作提升数倍。
arXiv:2402.18114 · 2024年2月28日(v1) · 机构未标注
黄金码解码:一种 VLSI 设计
Decoding the Golden Code: a VLSI design
为 2×2 MIMO 黄金码量身设计的 VLSI 球面解码器——单周期只算一个度量、天然可流水,复杂度比并行结构降约 50%,还支持自适应调制。
arXiv:0711.2383 · 2007年11月15日(v1) · 机构未标注