生物数据成AI制药新焦点:GSK加码1.1亿美元合作

GSK与Relation Therapeutics达成最高1.1亿美元的研究合作,后者将生成大规模数据集,测量人类细胞对基因改变和药物干预的反应,用以训练AI模型,加速药物发现。此次合作折射出生物数据在AI制药中的核心价值,行业竞争正从算法比拼转向高质量数据基础设施的构建。

近日,葛兰素史克(GSK)与英国生物技术公司Relation Therapeutics共同宣布,双方将围绕AI辅助药物发现展开新一轮深度合作,合作总金额最高可达1.1亿美元。早在2022年,两家公司就已开始携手探索机器学习在药物靶点识别中的应用;此次合作进一步扩大范围,Relation将负责大规模生成人类细胞在基因扰动与药物干预下的反应数据,用于训练和优化AI模型,进而加速疾病机理研究和候选药物开发。

这项合作的核心,并非某一款药物或某个算法,而是“数据”——尤其是具有因果关系的高质量生物数据。Relation Therapeutics作为一家兼具实验与计算能力的企业,能够利用公司自主研发的高通量平台,在真实人类细胞环境中制造系统性扰动,并记录多维度的读数变化。这种“看得见脉络”的数据,远比过去零散的文献数据或静态组学数据更适合现代AI模型学习。

为什么生物数据成为AI制药的胜负手?

过去几年,AI制药行业经历了从“算法崇拜”到“数据焦虑”的转变。早期,大量初创公司强调自家模型有多强,但实验发现,无论深度学习架构多么精巧,如果训练数据不完整、不具代表性,模型的可靠性和可迁移性都会大打折扣。药物研发的对象是高度复杂的人类病理系统,AI要做的不是简单的图像识别或文字预测,而是推理因果、预测干预结果,这要求模型必须吸收足够密集的生物学证据。

GSK显然早已认识到这一点。与传统的外部CRO(合同研究组织)提供标准化数据不同,Relation提供的是一种“主动制造”的数据:通过大规模并行实验,系统性地改变人源细胞的基因表达,并施加候选药物,从而全面记录细胞如何应对“外部变化”。这种数据不仅可以训练出更精准的靶点发现模型,也有助于预测药物在人体中的真实反应,及时识别潜在的毒性或耐药机制。

“AI制药的瓶颈不在算力,也不在于算法,而在于能否获得真正反映疾病因果关系的生物数据集。”

从算法竞赛到数据基础设施竞赛

GSK此次大手笔投入,印证了行业竞争逻辑的转向。包括辉瑞、罗氏、诺华在内的大型药企,近年都在加紧布局数据型AI伙伴关系。一个明显的趋势是:制药巨头更愿意为“数据生成能力”买单,而不仅仅是拿到一份分析报告。因为数据是持续迭代的资产——模型会过时,但高质量、可复用的数据集可以不断释放价值。

类似地,Relation Therapeutics选择的路径也具有代表性:它并不试图替代生物学家,而是用工程化的方式,让细胞行为变得可观察、可量化、可建模。这也是“数据基础设施”的含义所在——让实验科学和计算科学真正打通,而不是各自为政。

编者按:数据的护城河,可能比算法更深

从行业角度看,这起合作释放了一个明确信号:在AI制药的下半场,掌握生物学数据生成能力的企业,将拥有更强的话语权。过去我们把AI视为“聪明的解剖刀”,但现在越来越清楚,这把刀需要一块扎实的“磨刀石”——成千上万条标注清晰、背景完整的生物学观测数据。GSK与Relation的合作,既是具体项目,也是行业走向数据驱动时代的注脚。对国内AI制药企业而言,这或许也是一次提醒:与其追逐模型层指标的微小提升,不如沉下心来构建具有自主知识产权的数据管线。

当然,1.1亿美元的合作是一个开始,最终能否带来临床阶段的候选药物,还需要时间和生物学验证来回答。但至少在目前,这起合作再次说明了一个朴素的道理:在药物研发这场复杂的因果推理游戏中,没有数据,AI寸步难行。

本文编译自AI News