本文报道津渡生科发布全球首个基于原始测序数据预训练的多组学大模型 GeneLLM,并介绍其从基础模型到 BioFord 物理 AI 实验室基础设施的完整布局。
📝 详细摘要
文章以「中国版生物 DeepSeek」为切入点,报道津渡生科(4 位牛津归国学者创立)发布的多组学大模型 GeneLLM。该模型直接以 RNA 测序原始 reads 作为训练数据,通过 7-mer 滑动窗口切分为生命 Token,利用 Transformer 架构预测下一个碱基,已完成 15 亿参数 / 3.5 万亿碱基的预训练,XLarge 版本达 300 亿参数。模型在 1Gb 极浅测序深度下仍保持 AUC > 0.8,成本较传统 6Gb 深度测序缩减 83%。文章进一步介绍津渡的 BioFord Harness 物理 AI 基础设施与五大智能体(文献检索、实验设计、科学、实验调度、数据分析),强调其「最后一公里」定位——不做底座竞赛、不做端到端管线,专注于模型与实体实验系统之间的执行层。融资方面,公司一年内完成 4 轮融资,投资方包括红杉中国、高特佳等。文章将其与 Biomni、FutureHouse、晶泰、Lila Sciences、英矽智能等国际玩家对比,指出津渡的差异化在于轻量化物理 AI 路线与实验数据飞轮。
💡 主要观点
- GeneLLM 是全球首个直接基于原始测序数据预训练的多组学大模型。 区别于传统依赖基因注释和人工标签的方法,GeneLLM 以 RNA reads 为训练数据,通过 7-mer 滑动窗口切分为生命 Token,让模型自主从原始信号中发现疾病模式。
💬 文章金句
- AI for Science 真正的分水岭,不是模型回答得多像科学家,而是实验室能否开始像一个持续学习的系统。
- 在研发过程中,我们逐渐发现 AI for BioScience 不是简单地堆模型、堆数据。对做实验的人来说,要最终解决的仍然是算完不会做、做了又不对的困境。
- 生物学有多丰富,AI for Science 的前景就有多美。
📊 文章信息
AI 初评:72
来源:新智元
作者:新智元
分类:人工智能
语言:中文
阅读时间:21 分钟
字数:5074
标签: AI for Science, 多组学大模型, GeneLLM, 具身智能, AI 制药