• 周日. 9 月 13th, 2026

AI 读懂 mRNA 产量:0.94 的预测精度门

在透明微流控腔室中悬浮的发光 RNA 双螺旋结构

过去三十年,做 mRNA 的人卡在同一道关卡:想要高产出一管 RNA,先得把一段 DNA 模板放进试管里跑体外转录反应(IVT)——而「这段 DNA 序列到底能跑出多少 RNA」,从来都是靠经验、几组小批量实验和运气。

一、十万条序列,同时被读

2026 年 8 月,一项来自生物制药领域的预印本把这件事连根撬开了:研究团队并没有靠运气,他们先合成了一组覆盖 105 条随机寡核苷酸 的 DNA 库,每条都从启动子(DNA 上 RNA 聚合酶结合的位点)下游一段上下文里出发;然后用大规模并行二代测序(NGS) 去同时读 DNA 起始丰度和最终 RNA 产量丰度——一条测序反应里把十万条序列的产量都测出来。

这一步替代了过去「每次换十条序列、跑十次 IVT、跑十次 qPCR」的循环,把序列—产量的映射空间从「一年一百条」骤然扩到「一次十的量级」。

二、卷积网络读出了规则

库建好之后,剩下的事是教一个卷积神经网络(CNN,本质上是一只专门读局部与平移不变模式的模型)去看:哪些序列片段会让 RNA 聚合酶中途停下来,哪些会让它跑得欢。训练只用了 DNA 的 one-hot 编码——也就是把 A/C/G/T 翻译成 0/1 的向量,给模型自己找出规律。

在保留测试集上,模型对实测 RNA 产量的预测 Pearson 相关系数 0.94。这意味着工程师在动真反应之前,已经能比较准确地知道哪段模板会得到高产、哪段会「半路熄火」。

三、为什么这步真正动到了 mRNA 制药

mRNA 不是新事物。疫苗、蛋白替代疗法、癌症免疫疗法——都用它,但制药界长期在两件事之间走钢丝:一是序列设计好坏直接决定产量,二是产量直接决定单剂成本。过去十年,全行业一直靠「人工设计的 5′ UTR 骨架 + 几组试错突变」去卷,既不系统,也不便宜。

「如果模型能在设计上把上限先估出来,我们可以把实验室的湿迭代次数砍掉大半。」——这是该领域在过去一年里被反复说的同一句话。

这次研究的更大意义不在「模型多准」,而在 把序列空间正式测到了 105 量级。一旦数据扩展到 106,深度架构(CNN 之外,还有 Transformer 等能吃更长上下文的模型)就能开始学习「启动子—编码区—UTR 之间的远程协同」这种老办法看不见的规律。

它意味着什么

最直接的影响是 mRNA 疫苗工艺:未来一条新抗原的 mRNA,从序列设计到 IVT 上限预测,第一次有可能在几天内闭环完成,而不是几个月。延伸到蛋白替代疗法、个性化癌症疫苗、以及任何依赖 体外 制造 RNA 的下游应用,都会从这次「高通量筛选 + 深度学习」的合流中分到一杯羹。

当然,模型目前只在产量这一项上验证,下一站是翻译效率(同一条 mRNA 在细胞里最终合成多少蛋白)——而那才是真正决定疗效的指标。本周这个数字 0.94,更像是一扇门被推开,而不是终点。


本站编辑整理,资料来源公开网络。如有科学错误欢迎指正。

admin77

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注