一、昨晚,生命科学圈被一个大模型点燃了
8 月4 日,一家名叫津渡生科的公司刷屏了科技媒体:四个牛津归国学霸创办,自研多组学大模型 GeneLLM 接连登上《Nature Communications》与《Advanced Science》,被称为「中国生命科学版 DeepSeek」。
GeneLLM 的打法确实很「DeepSeek」:像大语言模型预测下一个 token 一样,把 RNA 序列中的碱基当作 token,直接从未经加工的组学原始数据中学习生命规律——不靠人工注释、不靠现成标签,百卡 A100 集群训练,完成了 15 亿参数、3.5 万亿碱基序列的预训练。

成果也是硬的:
- 泛癌检测 AUC 从传统方法的 0.91 提升至 0.96,胰腺癌数据集达到 0.99;
- 4 类癌症(结直肠、肺、肝、胃)分类平均准确率 0.83;
- 传统方法依赖 6Gb 深度测序,GeneLLM 在1Gb 极浅深度下仍保持 AUC>0.8,测序成本直降 83%。
如果说 AlphaFold 让 AI 看懂生命的「结构」,EVO2 让 AI 理解生命的「代码」,GeneLLM 则试图理解生命的整个「系统」。它填补了中国生命科学基础大模型的空白。
二、这台「生物 DeepSeek」,跑在华大智造的机器上
早在 2024 年 6 月 18 日,津渡生科就与华大智造在深圳华大时空中心揭牌成立了「华大智造-津渡生科医学大模型创新中心

> 双方基于华大智造 DNBSEQ-G99 平台,通过津渡生科超低测序量筛查算法,大幅扩充 G99 平台可检测的疾病门类,为未来人工智能算法集成至 G99 平台提供了开创性机遇。
结语
一次「中国版 DeepSeek」的诞生,表面上是模型的胜利,底层都是自主工具链的胜利。当 AI 开始读懂生命的语言,生产「语料」的机器,就是这条赛道里最硬的通货。
华大智造或许不是这个故事里声音最大的那一个,但它很可能是走得最稳的那一个
作者声明: 本文转载自第三方,旨在提供资讯参考,并非证券推荐或投资建议。作者对内容的真实性、准确性不承担保证责任。本文不构成任何投资建议或证券推荐。截至发文日,作者与文中提及的标的不存在持仓关系。