衰老生物学专用大语言模型发布,性能优于通用商业模型

《细胞》杂志发表研究介绍了一套专为衰老生物学打造的AI系统,包含定制LLM、基准测试及代理接口。对比显示,该专业模型在多数衰老相关任务中表现优于OpenAI和DeepSeek等通用大模型,旨在解决衰老定义模糊带来的分析难题。

衰老研究进入 AI 时代:定制化大语言模型登场

人类对衰老机制的探索已有数千年历史,从追求永生的神话到现代寻找延长寿命药物的科学努力,这一课题至今未有定论。如今,这项研究开始与人工智能深度结合。

发表于《细胞》(Cell)杂志的一份报告介绍了一套专为衰老生物学打造的人工智能系统。该系统包含三个部分:一是在衰老生物学数据上训练的大型语言模型(LLM);二是由 17 项任务组成的基准测试,用于衡量此类及其他 LLM 在衰老相关课题中的表现;三是一个接口,将模型与衰老研究工具接入名为「代理」的 AI 助手,以辅助分析工作。

专业模型在多数衰老测试中优于通用大模型

研究团队用这套基准对比了自家专业模型与 OpenAI、DeepSeek 等公司开发的商业大模型——后者在规模更大、更多样化的数据集上训练,面向广泛任务。结果显示,在多数但并非全部测试中,专攻衰老研究的 LLM 表现更佳。

哈佛医学院计算机科学家 Marinka Zitnik 评价称,这项工作对长寿与衰老领域是重要的贡献,可为下一代 AI 模型的开发提供参考。

该研究还回应了领域内的核心难题:在科学界尚未对「衰老」本身给出统一定义的情况下,如何训练 AI 工具理解这一概念。Zitnik 指出,在癌症等疾病领域,AI 任务可以定义得非常清晰,而衰老是完全不同的情况——它很难被定义。

五花八门的「衰老时钟」

为刻画衰老这只「难以定义的野兽」,研究人员已耗费数十年收集数据,成果之一是大量用于测量生物衰老速度的「时钟」。这些时钟通过评估面部特征、蛋白质水平、基因活动和脑部扫描等指标,测算一个人的生物学年龄。

然而,即便时钟工具日趋精密,如何解读其结果仍是难题。上周有研究团队报告,一种针对肺部疾病的实验药物在一项小型临床试验中降低了受试者的生物学年龄。该结论基于六种不同的衰老时钟,但研究人员仍难以判断,药物是否真正逆转了衰老的根本进程。

这一问题并非孤例。剑桥大学表观遗传学家 Chira Herzog 提出了关键一问:衰老在哪里结束,疾病又从哪里开始?如何厘清两者关系,目前尚无明确答案。

参考文献

  1. Zhavoronkov, A. 等. Cell 189, 5980–5994.e8 (2026).
  2. Zhavoronkov, A. 等. Nature Biotechnology. https://doi.org/10.1038/s41587-026-03286-y (2026).

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读