7月26日至29日,第63届国际设计自动化会议(Design Automation Conference, DAC)在美国长滩举行。华中科技大学集成电路学院在本次会议上发表了3项存算一体和类脑计算领域的最新研究成果,向国际同行报告了学院师生团队在点云处理、Transformer加速、脉冲Transformer稀疏优化等前沿方向的进展。
DAC 由美国计算机协会(ACM)和电气与电子工程师协会(IEEE)联合主办,始于1964年,拥有超过60年的历史,是电子设计自动化领域历史最悠久、最具影响力的国际顶级学术会议之一,代表了集成电路设计自动化领域的国际前沿水平。
01
成果一:面向三维点云K近邻搜索的存算一体加速器
论文题目:“KCD-CAM: A K-Nearest-Neighbor Accelerator Based on Charge-Domain Content-Addressable-Memory for Point Cloud Processing”,集成电路学院博士生胡同为第一作者,通讯作者为李祎教授和陈佳副教授。
三维点云是自动驾驶、机器人、虚拟现实等应用采用的重要数据形式。与规则排列的二维图像不同,点云数据具有无序、离散和规模庞大等特点,需要通过K近邻(K-Nearest Neighbor,KNN)搜索建立点与点之间的局部几何关系。随着激光雷达的技术迭代,点云的生成规模迅速增加,这为后端数据处理带来了较高的时间与能耗开销。
针对这一问题,研究团队提出KCD-CAM,一种面向三维点云KNN搜索的存算一体加速器。该架构采用基于阻变存储器(ReRAM)的4T2R电荷域内容寻址存储器,将传统KNN搜索中繁琐的欧氏距离计算和全局排序转化为存储阵列内部的大规模并行范围比较,从而减少点云数据在存储器与计算单元之间的频繁搬运。围绕电路实现、搜索精度和并行效率,研究团队开展了三方面的协同设计。

图1 KCD-CAM系统架构
在电路层面,团队设计了4T2R电荷域内容寻址存储单元,可通过输入信号配置支持等于、大于等于和小于等于三种比较模式。阵列通过利用电荷重分配机制,将连续导通单元的长度转换为电压信号,最终由灵敏放大器直接判断数据的大小关系。这一设计使存储阵列能够同时比较大量参考点与查询边界,不再需要逐点读取坐标并交由数字计算单元处理,大幅提高了KNN搜索的效率。
在搜索算法层面,团队提出削角式Top-k搜索机制,在简化计算的同时提高近邻搜索准确度。传统的范围搜索方法会引入较多非真实近邻,影响搜索结果,而KCD-CAM使用多个可调的搜索区域组合形成边界,使其更加接近欧氏距离球面,并根据当前返回的邻居数量动态扩大或缩小搜索范围。实验表明,KCD-CAM在KITTI、Waymo、NCLT和MulRan四个真实激光雷达数据集上均表现出稳定的搜索准确率增益。
在并行搜索效率层面,由于真实点云的空间分布密度各异,高密度的区域容易聚集大量点,导致多个查询可能同时访问相同体素,造成访问冲突。为此,KCD-CAM采用了双粒度体素哈希机制,根据点云分布密度来设置体素大小。实验表明,双粒度体素哈希可将并行查询时的体素访问冲突率最多降低13%。
研究团队在28纳米工艺下完成了对KCD-CAM的验证和性能评估,在KNN搜索任务中,KCD-CAM实现了0.94 ms的平均搜索延迟和0.84 mJ的能耗。与其他前沿点云KNN专用加速器相比,KCD-CAM分别实现8.51倍的速度提升和4.76倍的能耗优势,为自动驾驶、机器人感知和边缘智能设备实现实时、低功耗的三维点云处理提供了新的硬件路径。
02
成果二:Transformer稀疏注意力混合存算加速器
论文题目:“HP-CIM: A Computing-in-Memory Transformer Accelerator with ReRAM-based Hash Predictor for Attention Sparsity Exploitation”,集成电路学院硕士生李彤、博士生周志威为共同第一作者。通讯作者为李祎教授和香港科技大学李健聪博士后。
Transformer已成为当前人工智能领域的核心模型,但注意力机制和大规模矩阵运算带来的高延时、高能耗,仍制约其在资源受限平台上的高效部署。混合ReRAM/SRAM存算一体架构能够利用ReRAM的高存储密度执行静态权重计算,并借助SRAM的高耐久性处理动态注意力,被视为加速Transformer的重要技术路径。然而,注意力矩阵中普遍存在大量低贡献Q-K对,约80%的Token对最终结果贡献有限。现有稀疏注意力方案虽然能够筛选关键Q-K对,但相关性预测本身往往需要大量计算和数据访问;后续Top-K选择还依赖模数转换、结果缓存和数字排序,容易抵消稀疏计算带来的收益。同时,直接舍弃未选中的Key会截断弱相关信息,进一步造成模型精度下降。

图2 (a)注意力的稀疏性;(b)注意力稀疏性搜索算法框架;(c)Q-K配对与注意力计算两个阶段的能耗和延时比较
针对上述难题,团队提出了HP-CIM,一种混合存算一体Transformer加速器,通过软硬件协同设计低成本利用动态注意力稀疏性。在硬件层面,团队设计了ReRAM哈希预测器(ReHP),利用ReRAM器件电导特性构造随机投影矩阵,将Q、K向量编码为低维二值哈希码;随后通过ReRAM内容可寻址存储器并行计算哈希码间的汉明距离,并结合支持Top-K选择的K-WTA电路,在模拟域直接完成高相关Q-K对匹配与Top-K筛选,从而减少高精度模数转换、数据缓存和外部数字排序开销。在算法层面,团队进一步提出优化偏置Softmax(OB-Softmax),为未选中的Key位置分配经过优化的可学习偏置,在保持注意力稀疏性的同时保留弱相关上下文信息,缓解传统稀疏化方法造成的信息截断和精度损失。
评估结果表明,HP-CIM在GPT-2、BERT和Gemma3等多类Transformer模型及多项自然语言处理任务上均表现出良好的硬件效率与计算鲁棒性。在考虑器件非理想性的情况下,相较当前先进的存算一体Transformer加速器,HP-CIM实现了9.05-310.04倍的能效提升和2.48-16.93倍的加速,为面向大规模人工智能模型的低成本动态稀疏预测与高效注意力计算提供了新的技术路径。
上述研究工作得到了国家科技创新2030重大研究项目、国家重点研发计划、国家高层次青年人才计划、湖北省自然科学基金杰出青年项目等资助,以及国家集成电路产教融合创新平台、先进存储器湖北省重点实验室的支持。
03
成果三:面向脉冲Transformer的自适应剪枝与层次化稀疏加速器
论文题目:“ADAPT: An Algorithm-Hardware Co-Design for Spiking Transformer with Training-Free Adaptive Token Pruning and Hierarchical Sparsity”,集成电路学院博士生江品锋、硕士生方艺龙为共同第一作者,通讯作者为王兴晟教授。
脉冲神经网络采用二值脉冲传递信息,具有事件驱动和激活稀疏等特点,是实现低功耗智能计算的重要技术方向。脉冲Transformer进一步结合了Transformer的建模能力与脉冲神经网络的能效优势,但较长的Token序列以及前馈网络中的大规模线性运算仍会产生较高的计算和访存开销。现有脉冲神经网络加速器主要利用非结构化的比特级稀疏性,难以同时挖掘Token级和块级冗余。

图3 自适应Token剪枝算法
针对上述问题,研究团队提出ADAPT,一种面向脉冲Transformer的算法—硬件协同加速方案。在算法层面,团队提出自适应Token剪枝算法,通过多样性评分和活跃度评分两条路径识别重要Token。多样性评分路径通过异或运算计算不同二值Token之间的汉明距离,评估其语义差异;活跃度评分路径对脉冲在时间和通道维度上进行累加,衡量各Token参与计算的程度。两类评分经过融合后,算法根据预设剪枝比例保留综合得分最高的Top-K Token。在硬件层面,团队设计了层次化稀疏加速架构ADAPT。Token剪枝单元使用异或门和计数器实现ATP;块稀疏压缩格式通过位图标记并紧密排列非零数据块,降低存储和数据传输开销;模式处理单元将非零数据块分解为4比特局部模式,通过缓存高频模式及其部分和结果,避免重复访存和计算。三类优化分别对应Token级、块级和比特级稀疏性,形成端到端的协同加速路径。
实验结果表明,ATP在SDT、QKformer、E-SpikeFormer等多个模型上均保持了稳定精度。在50%的Token剪枝比例下,模型平均精度仅下降1.64%。研究团队在28纳米工艺下完成了对ADAPT的验证和性能评估,与先进脉冲神经网络加速器相比,ADAPT实现3.1倍的加速效果和1.9倍的能耗优势,为脉冲Transformer在资源受限平台上的高效部署提供了新的技术路径。
本研究获得国家重点研发计划课题(2024YFB4405502), 国家自然科学基金重点支持项目及面上项目(U2341221, 62274070)资助。
学院将继续面向国际学术前沿和国家重大战略需求,致力于原创性突破和关键核心技术攻关,持续加强拔尖创新人才培养和高水平国际合作交流。