宋凌浩 — 研究者分析报告
分析模式:快速 | 分析时间:2026-03-16T00:46:11
评分:早期研究者(22.0/100)
基本指标
| 指标 | 数值 |
|---|---|
| 机构 | 未知 |
| h指数 | 2 |
| 总引用次数 | 33 |
| 近5年引用次数 | 22 |
| 总论文数 | 3 |
| 顶级会议论文数 | 0 |
| 发表时间 | 2020 - 2023 |
| Semantic Scholar | 2150597993 |
研究轨迹
宋凌浩是一位专注于计算机架构的研究者,其研究重点在于近/内存计算领域。2017年,他凭借GraphR这一ReRAM图处理加速器获得了最佳论文奖,从而在非易失性存储计算领域建立了早期声誉。2020–2022年间,他达到了研究巅峰期,系统性地构建了以稀疏线性代数加速(SpMV, SpMM, 共轭梯度求解器)和FPGA高级综合框架(TAPA)为核心的完整研究体系。2023年,他在ISCA顶级计算机架构会议上发表了NDSEARCH论文,将近数据处理范式应用于向量数据库和LLM检索增强生成场景,完成了从传统HPC到AI系统的关键转型。
其成长轨迹的一个关键特征是“工具+应用”的双重发展:TAPA/RapidStream-IR系列提供了FPGA编程基础设施,而Serpens/Sextans/NDSEARCH系列则是由该基础设施驱动的高影响力应用。这种自开发的工具链策略使其研究具有强可重复性及社区影响力。值得注意的是,2024年发表的两篇宇宙学/中微子论文(与Seesaw机制相关)与其他研究方向完全独立,可能属于同名但不同研究者所写,因此未纳入此轨迹分析。
突破性工作
1. GraphR:使用ReRAM加速图处理(2017)
描述:提出了首个基于ReRAM电阻存储的图处理加速器,将图邻接矩阵直接映射到ReRAM交叉阵列上,通过模拟电路执行大规模并行矩阵-向量乘法,从而绕过传统冯·诺依曼架构中的内存带宽瓶颈,实现极低能耗的图计算。
之前无法实现的原因:2015年前ReRAM技术尚未成熟,设备间差异大导致导电性控制困难。缺失的关键洞察是:以往研究者将ReRAM视为数字存储的替代品,而GraphR则系统证明了“图计算能容忍高精度,稀疏矩阵天然适合并行仿真领域”,使得模拟误差可接受。
影响:开启了“ReRAM作为计算基底”的研究方向。最佳论文奖使其成为近内存计算领域的里程碑式成果,直接引发了大量后续ReRAM加速器研究;其方法(将稀疏矩阵映射到模拟阵列)被广泛引用和扩展。
2. Refloat:利用ReRAM低成本浮点处理加速迭代线性求解器(2020)
描述:解决了ReRAM仿真计算中最关键的工程挑战——浮点支持问题。提出将浮点运算分解为可在ReRAM中以低成本执行的形式,并应用于科学计算中的迭代线性求解器(核心算子),该成果发表在超级计算顶级会议SC上。
之前无法实现的原因:浮点运算需要高精度(IEEE 754单精度需要23位 mantissa),而ReRAM仿真计算本身存在噪声。此前普遍认为“ReRAM仅适合低精度整数/固定点运算”。缺失的关键洞察是:科学计算中的迭代求解器具有自收敛特性,允许中间步骤使用混合精度;Refloat找到了精度误差与收敛速度之间的可控平衡,属于认知突破而非单纯工程改进。
影响:将ReRAM加速的适用领域从图/神经网络扩展到科学计算,为HPC+ReRAM开辟新研究空间;SC论文中的11次引用表明其性能稳定。
3. TAPA:现代FPGA的可扩展任务并行数据流编程框架,同时优化HLS与物理设计(2022)
描述:提出了TAPA端到端编译框架,允许用户使用C++任务并行数据流程序描述计算,并自动编译为高频FPGA加速器。关键创新在于同时优化高级综合(HLS)与物理布局,解决了大规模FPGA设计中频率崩溃问题。
之前无法实现的原因:主流工具如Xilinx Vitis HLS将HLS与物理实现视为独立阶段,导致布局和布线后频率显著下降。缺失的关键洞察是:任务并行粒度自然与FPGA的SLR(超级逻辑区域)物理分区一致;在HLS阶段识别物理约束可实现高生产力和性能。这需要深入理解FPGA架构与HLS内部机制,体现跨层抽象能力。
影响:成为学术FPGA加速器研究的重要基础工具;后续TAPA-CS进一步扩展至分布式多FPGA场景;降低了高性能FPGA加速器的开发门槛。
4. NDSEARCH:通过近数据处理加速基于图遍历的近似最近邻搜索(2023)
描述:提出了一种用于向量数据库中基于图遍历的近似最近邻搜索的近数据处理加速方案,该成果发表在ISCA顶级计算机架构会议上,直接针对LLM检索增强生成(RAG)的底层索引核心。
之前无法实现的原因:2022年前基于ANNS的图遍历算法主要被视为软件/算法问题;2022–2023年LLM+RAG的爆发式增长使ANNS成为数据中心的关键负载,引发对硬件加速的强烈需求。在计算层面,缺乏经验数据证明ANNS是内存带宽瓶颈而非计算瓶颈;NDSEARCH通过性能分析提供了关键证据,使得近数据处理方案具有吸引力。影响:22篇引用表明这是目前被最多引用的研究,与LLM基础设施的繁荣时期相吻合;这促使架构领域关注向量数据库,进而推动了大量后续ANNS加速器研究。
研究方向
- 近内存/缓存计算与硬件加速器设计(ReRAM、HBM、NDP)
- 稀疏线性代数与图计算加速(SpMV、SpMM、图遍历)
- FPGA高级综合与编程框架(TAPA、RapidStream)
- AI/LLM基础设施的系统加速(ANNS、向量数据库、RAG)
方法论演变
早期(2017–2019年)专注于模拟计算范式,利用ReRAM物理特性执行矩阵运算;核心方法是“精度与能效平衡”的权衡分析。从2020–2021年开始,转向数字稀疏加速器设计;方法论升级为“数据流分析+内存访问模式建模”,重点解决稀疏计算中的负载不平衡和随机内存访问问题。Pyxis数据集的发布也反映了对系统评估方法的重视。2022年引入了“跨层协同优化”方法论;TAPA涵盖编程模型、HLS编译器与物理设计,标志着从单一加速器向完整工具链的转变。2023年,方法论发展为“基于工作负载的架构设计”;NDSEARCH从真实的LLM应用场景出发,分析性能瓶颈,进而指导硬件架构决策,体现了以应用需求为基点的成熟系统研究范式。
总体来看,方法论演变路径为:模拟近内存计算→数字稀疏加速→编译器和硬件协同优化→由AI应用驱动的架构设计。始终关注内存带宽瓶颈问题,解决方案从模拟计算逐步发展到HBM利用,再至近数据处理。
领域影响
凌浩在计算机架构方面的贡献体现在两个层面:首先,方向性贡献。GraphR(2017年最佳论文)和NDSEARCH(ISCA 2023)分别在两个不同的时间点为研究带来指导——ReRAM图加速和向量数据库加速。前者激发了一代ReRAM加速器研究,后者与LLM基础设施的繁荣时期相吻合,引发了广泛后续研究。其次,基础设施方面的贡献:TAPA框架作为开源工具,降低了FPGA加速器研究的入门门槛,产生了放大效应。从引用分布来看,NDSEARCH的22篇引用集中在2023年发表后的两年内,表明其在AI系统与架构交叉领域具有强大的近期影响力,与当前LLM基础设施研究热点高度契合。
高被引论文(前20名)| # | 年份 | 引用数 | 标题 |
|—|——|——|——| | 1 | 2023 | 22 | NDSEARCH:通过近数据处理加速基于图遍历的近似最近邻搜索 | | 2 | 2020 | 11 | Refloat:利用ReRAM的低成本浮点运算加速迭代线性求解器 | | 3 | 2017 | 0 | GraphR:使用ReRAM加速图处理 | | 4 | 2017 | 0 | 具有单层精度突触的神经形态计算系统的分类精度提升 | | 5 | 2018 | 0 | DPatch:针对对象检测器的对抗性补丁攻击 | | 6 | 2019 | 0 | 结合能量和时间数据的中微子核相互作用事件的顶点重建深度学习应用 | | 7 | 2019 | 0 | HyPar:面向深度学习加速器阵列的混合并行化设计 | | 8 | 2020 | 0 | SparseTrain:利用数据流稀疏性实现高效的卷积神经网络训练 | | 9 | 2021 | 0 | Serpens:基于高带宽内存的通用稀疏矩阵-向量乘法加速器 | | 10 | 2021 | 0 | Pyxis:开源稀疏加速器性能数据集 | | 11 | 2021 | 0 | Sextans:用于通用稀疏矩阵-密集矩阵乘法的流式加速器 | | 12 | 2022 | 0 | Callipepla:以流为中心的指令集与混合精度技术,用于加速共轭梯度求解器 | | 13 | 2022 | 0 | TAPA:适用于现代FPGA的可扩展任务并行数据流编程框架,包含HLS和物理设计的协同优化 | | 14 | 2023 | 0 | 基于存储中的近数据处理加速基于图遍历的近似最近邻搜索 | | 15 | 2023 | 0 | TAPA-CS:在分布式HBM-FPGAs上实现可扩展加速器设计 | | 16 | 2024 | 0 | 中微子跷跷板机制的天体学特征 | | 17 | 2024 | 0 | 中微子跷跷板机制产生的天体学非高斯性 | | 18 | 2024 | 0 | RapidStream IR:FPGA高级物理综合基础设施 | |