把一段普通的 C 代码变成能跑在 FPGA 上的加速器,过去通常需要资深硬件工程师花上几个月。2026 年 8 月初,一个来自美国明尼苏达大学和芝加哥大学等机构的小组交出了一套新流程:他们让“会自己写硬件”的 AI 代理按人类专家的经验去试错、迭代、再训练——结果在标准基准上把自动化水平往前推了一大截。
这套被称作 HLSmith 的框架发表于本周的 arXiv 上(arXiv:2608.06791)。它的目标并不神秘:让大模型不再“随手生成一段 Verilog”,而是像一个真正写过几百个加速器的工程师那样,沿着固定的优化路径、把一段 C/C++ 函数反复打磨到能上板。
一、FPGA 加速器为什么难写
FPGA 是一种可以现场烧写内部电路的芯片。在 AI 推理、网络加速、信号处理这类任务里,它比通用 CPU 更快、比专用 ASIC 更灵活,因此从数据中心到通信基站都在用。但 FPGA 的开发语言是高层次综合(HLS),它把 C/C++ 翻译成底层电路。这一步看似自动化,实际非常依赖“硬件直觉”:哪些循环要展开、哪些数据要分块、哪些访存模式要重新组织——每一条都需要有经验的人来定。
过去大模型也曾试过直接端到端地输出 HLS 代码,但效果普遍一般。论文给出了一个很形象的解释:模型知道怎么写“程序”,却不知道哪段写法对应哪一类硬件瓶颈,于是给出的优化经常看上去合理、跑起来却慢。把这段工作交给一个一次性写完的智能体,相当于让一个“写软件的人”假装自己是一个“调电路的人”——偶尔蒙中,经常不中。
二、HLSmith 的三件套
为了解决这个错位,研究组搭了一个三段式的“专家指导”流程。
第一段是一本专家经验手册。手册里记录的是资深硬件工程师长年累月总结出来的“带条件”的改写规则:哪些循环在数据规模够大时才适合展开、哪些数组需要先分块再合并、哪些写法几乎肯定会拖慢综合。这部分经验原本散落在教科书、博客和公司内部 wiki 里,HLSmith 把它们整理成带前置条件和风险标记的结构化知识库,AI 代理在动手前要先查表。
第二段是一个多阶段、多反馈的调度流程。整个过程不再是“一次性输出 HLS 代码”,而是拆成合成-瓶颈分析-优化-再合成的循环:先让代理写一版可综合的结果,再用工具跑出真实性能报告,由代理自己读报告、定位瓶颈、选下一步要套的优化规则,然后再来一版。整条流水线严格按人类工程师的开发节奏走,但不需要人手。
第三段是把前两段积累的轨迹变成训练数据。每一轮代理的尝试都被记录下来,再让一个商用闭源大模型把“好的尝试”整理成问答样本,最后拿这些样本去微调开源的较小模型。论文的逻辑是:与其让模型从零学起,不如让代理先去模仿专家,等它做出足够多像样的优化之后,再用它自己的成功轨迹反过来增强自身——形成一条逐步摆脱闭源模型依赖的迁移链。
三、它意味着什么
在论文的基准测试里,这套流程相对此前最强的自动化方法拿到了不错的提升,并能在多个开源小模型上复用同样的效果。换句话说,过去那种“只有顶尖硬件团队才能在几个月里拿出一块定制加速器”的格局,被悄悄撕开了一道口子。
短期来看,最直接的受益者会是那些有大量 C/C++ 算子、但没有专职 FPGA 工程师的小团队——他们过去要外协的项目,如今可以内部先跑出一版原型,再决定要不要请专家深度优化。
中长期看,这件事更值得关注的是它指向的一个新职业分工:硬件优化的“专家规则”正在被结构化、变成可以被模型消费的知识。下一代 EDA 厂商的招聘广告里,“会写 HLS”可能不再是首选条件,而“会总结改写规则、会写反思提示词”的工程师会更抢手。
FPGA 不会因此变成“人人能写的玩具”,但门槛正在被一段段拆掉。这场从研究小组到工业工具链的迁移,可能比大多数芯片新闻报道得更安静,却影响得更久。
本站编辑整理,资料来源公开网络。如有错误欢迎指正。