中国版「生物DeepSeek」诞生!4个牛津学霸,让AI接管生命科学
创始人
2026-08-05 00:55:01
0

新智元报道

DeepSeek-V4-Flash正式版刚炸翻全球通用大模型圈,中国生命科学版Deepseek就紧随其后。

近日,津渡生科(由4个牛津大学归国学霸创办)自主研发的生命科学垂类GeneLLM多组学大模型,接连登上国际顶级学术期刊——《Nature Communications》与《Advanced Science》。

作为全球首个直接使用组学原始数据进行预训练的多组学大模型,GeneLLM是继谷歌AlphaFold和斯坦福大学的EVO 2之后的又一重磅模型,填补了中国生命科学基础大模型的空白,堪称中国生命科学版DeepseekAI开始理解生命的多个「语言」与整个「系统」。

左右图片

像预测下一个token一样,

预测下一条生命信息

ChatGPT、Claude、DeepSeek等大语言模型的核心,是下一个token预测。

GeneLLM思路类似,但它预测的不是文字,而是生命信息。

RNA序列中的四种碱基——腺嘌呤(A)、尿嘧啶(U)、鸟嘌呤(G)、胞嘧啶(C),成为GeneLLM理解生命语言的基本Token。

传统生物信息学分析通常依赖基因注释、序列比对和人工定义标签。这种方法虽然准确,但会提前限定模型的认知范围,也可能丢失大量隐藏在原始数据中的未知生物信号。

GeneLLM则另辟蹊径,直接从未经加工的原始测序数据中学习生命规律。

它以RNA组、蛋白质组、代谢组等多组学原始数据作为训练数据,让模型自主发现疾病相关模式。

目前,GeneLLM已完成15亿参数和3.5万亿碱基序列的模型预训练,XLarge版本实现300亿参数模型预训练,持续扩大技术壁垒。

作为全球首个基于原始测序数据预训练的多组学大模型,GeneLLM包括两大阶段:

(1)无监督预训练与原型挖掘

(2)患者级疾病微调(Disease Tuning)

GeneLLM首先需要解决一个问题:

如何把复杂的生命数据变成AI可以理解的语言?

在自然语言处理中,BPE算法会把句子切分成Token;而GeneLLM则将约150bp长度的RNA测序片段,通过7个碱基组成的滑动窗口(7-mer)切分为生命Token。

随后,模型利用Transformer架构,在没有基因注释和人工标签的情况下,直接预测下一个碱基。

这意味着AI不是先看人类整理好的「字典」,而是直接从生命原始信号中学习。

在训练过程中,GeneLLM处理了约数十万亿条RNA reads,在百卡集群 NVIDIA A100 GPU上训练。

至此,GeneLLM泛化等能力开始「涌现」。

作为生科领域的重大创新突破,GeneLLM这一国产生科模型可以应用于新药研发、精准医疗、合成生物、环境监测、微生物与生物农业、蛋白质与分子设计等多个领域,是全球范围内少有实现实际场景落地的大模型。

当我们审视完GeneLLM在「数据、架构、训练」等底层创新后,才能真正理解:为何它代表了中国的「生物版DeepSeek」。

硅谷以数万张H100堆砌万亿参数,DeepSeek则以算法创新提高算力效率,GeneLLM同样四两拨千斤,撬动亿万生命科学数据。

如果说AlphaFold让AI第一次看懂生命的「结构」,EVO2让AI开始理解生命的「代码」,那么GeneLLM试图进一步理解生命的「系统」。

更狠的是效率。传统方法依赖6Gb深度测序,成本高企,难以落地。GeneLLM 在1Gb极浅深度(成本缩减83%)下仍保持AUC > 0.8。

这意味真正有希望让普惠精准医疗成为现实。

一种新的科研范式开始浮现:让AI从生命数据中学习,让生命科学进入可预测、可计算、可规模化探索的新阶段。

不只是模型,还是「最后一公里」的智能基础设施

但津渡生科的布局不仅在基础模型。

以GeneLLM多组学大模型为生命认知底座,津渡生科进一步构建连接AI智能与物理世界的执行体系,通过Harness智能实验执行层与DBTL(Design-Build-Test-Learn)数据闭环,实现从生命规律理解、科学假设生成,到自动化实验验证和持续迭代优化的完整AI for Science闭环。

正如前OpenAI VP、后训练负责人Liam Fedus所说,当前LLM已经耗尽了互联网上有限的文本和代码,下一步的科学发现的重大进展必须依赖实验迭代。

也就是说,不能只靠读人类已写下的内容来发现新知识,AI 必须自己做实验。

可问题来了——

互联网服务天生有API,网络信息天生是数字化的,但科研设备来自不同厂商,协议各不相同,既复杂又昂贵,没有人能在几个月内推倒重建。

今天大多数实验室,是专为人类设计:仪器面板、移液动作、样本状态、临场判断,绝大多数没有变成机器可理解的信号。

AI进入实验室,当前不只是模型能力的问题,还需要一套新的基础设施。

因此,AI进入实验室,当前不只是模型能力问题,还需要物理Harness:把实验室变成一个可编译、可调度、可观测、可追溯的系统。

这,才是AI4S真正的最后一公里。

BioFord Harness,让实验室开始「自己动」

为此,津渡开发了一套名为BioFord Harness的系统。

这是一套把AI和物理实验室打通的基础设施。

他们不是让机械臂模仿人手,而是把实验室变成一个可编译、可调度、可观测、可追溯的系统。

这个过程中,物理Harness至少要完成三件事:

1.把科学意图或实验DSL,编译为不同设备能够执行的指令;

2.在多设备之间完成调度、资源与安全约束管理,并处理异常;

3.让实验结果、设备日志和环境参数回流,成为下一轮模型与实验设计的输入。

科学问题→AI理解→实验方案→设备调度→执行→数据回流→模型优化→下一轮。

一套科学实验数据的飞轮,就这样启动了。

五大智能体,把科研流程「卷」成流水线

BioFord Agent具身智能科研平台,则向下连接实验室物理层,向上承载科学家认知层,中间用物理AI打通推理与执行的断层。

在认知层,BioFord Agent有五大智能体组成协同网络,打通了生命科学研究全流程,可数倍提高科研效率。

文献检索智能体

实验设计智能体

科学智能体

实验调度智能体

数据分析智能体

举个例子,文献检索智能体可以快速帮你检索和阅读海量文献,完成文献综述并辅助提出假设。

实验设计智能体让科研团队把原本数月的实验设计周期缩短至一周。

而津渡生科推出的实验调度智能体,依托通用仪器抽象层(Universal Instrument Abstraction Layer),打破了多类异构设备之间的协议壁垒。

无论是PCR仪、酶标仪、流式细胞仪,还是自动化移液工作站,均可实现统一纳管与统一调度。系统内置动态调度算法,可自动批量排程、实时冲突规避,并全程记录实验参数,形成可追溯的审计链条。

这意味着,AI不再停留「出谋划策」的阶段,而是真正走进实验室,操纵设备、执行任务,成为一位可信赖的「科研助手」。

失败数据,也许比成功数据更珍贵

这套系统解决的更深层的价值在于:让每一次实验——无论成功还是失败——都变成系统可以消化的数据。

传统实验室里,一次失败的记录可能只是一行「结果不符合预期」,经验存在人的脑子里,人走了,经验也没了。

而在BioFord系统里,每一次失败都是宝贵的训练数据——参数选择的逻辑、环境条件的记录、错误路径的证明……全部沉淀下来,成为系统「经验」的一部分。

下一次,AI就知道:此路不通。

耐人寻味的是,在这个赛道,不是算力最强的赢,也不是模型最大的赢。

算力买得到,但科研数据买不到。

津渡生科创始人&CEO金泳成表示:「在研发过程中,我们逐渐发现AIfor BioScience 不是简单地堆模型、堆数据。对做实验的人来说,要最终解决的仍然是算完不会做、做了又不对的困境。

这,就是AI4S赛道最重要、也最难被复制的护城河。

四个牛津人,

其中还有罗福莉的同门师兄

2022年,金泳成在拿到牛津大学生物工程博士学位的那一刻,面临着一个选择。

他的导师是英国皇家学会会员、三代测序巨头英国上市公司Oxford Nanopore的创始人Hagan Bayley,实验室里「成果落地」的传统深厚。留在英国,是一条清晰的坦途。

但他选择了另一条路——把实验室里的一个「原型技术」装进行李箱,带回国。与他同行的,还有三位牛津校友:生物学博士邓司伟、计算机学院副研究员沙磊(北京大学计算机博士,小米大模型负责人罗福莉的同门师兄),以及擅长做产品落地的周天尧。四人具备生物工程、人工智能、计算生物学、商业运营等相关知识背景,缺一不可。他们曾组队开展联合科研项目,通过结合AI和转录组技术实现疾病预测检测。4个人像拼图一样恰好互补,可以完成高度交叉的学科研究。

公司名字「津渡生科」,「津」取自牛津,寓意他们从牛津的顶尖实验室等学术高地出发,「渡」意在渡人,那是他们认为AI for Science应该抵达的终点。

目前,津渡生科的 BioFord Agent 物理 AI 科研平台已在国内一些知名高校落地,成效显著,将科研周期从原本的数月缩短至一周。

起风了:1年4轮融资,资本「真香」现场

然而,走一条「前无古人」的路,必然伴随着孤独。

创业初期,困难重重。彼时AI创业如火如荼,但生物科学领域的「AI+」尝试寥寥无几。「懂AI的不一定懂生物科学,懂生物科学的大部分不懂AI。」

金泳成坦言:「投资方一度无法理解我们在做什么。」

团队选择了一条「最难的路」:从生物基础大模型切入,全球做此方向的公司屈指可数。

2025年,转机出现了。

当时,国务院印发《关于深入实施「人工智能+」行动的意见》,AI for Science位列其中,赛道起风了。

津渡生科创下「一年完成4轮融资」的战绩。公司的主要融资时间线堪称行业标杆。

天使+轮:获红杉中国种子基金领投;

Pre-A+轮:获创东方投资千万级领投;

Pre-A+轮:获南山战新投千万级投资;

A轮:获高特佳投资近亿元领投。

而金泳成的目标更远:「我们不满足于卖软件,要搭建生命科学领域的智能操作系统。就像英特尔定义了PC时代的算力,我们希望定义AI时代生命科学的研发新范式。」

从牛津实验室到深圳,从无人理解到获一线资本重注,四个牛津人的故事,不只是创业传奇,更是一场关于「我们能为人类做什么」的灵魂拷问。

当AI学会自己「通宵」科研,科学发现或许不再依赖天才的偶然灵感,而成为可预期的必然。这条路,他们才刚刚开始。

行业地图:津渡走出轻量化物理AI路线

在更大的AI for BioScience地图上,津渡并不孤单,但切入点截然不同。

第一类,是数字端的AI科学家。

斯坦福孵化的Biomni(已商业化为Phylo)拥有150多个专业工具,能自动执行文献回顾、假设生成和生物信息分析。

Eric Schmidt支持的FutureHouse,致力于构建能自主生成假设、撰写论文的AI科学家。

然而,它们虽然强大,却仍然局限在数字世界。

第二类,是全栈自主路线。

晶泰科技以「AI+机器人」在全球部署超300台工站。

Flagship Pioneering孵化的Lila Sciences,5.5亿美元融资,试图让AI完全接管实验的设计、执行与重新设计,目标是「科学超级智能」。

但这些,都太烧钱了。

第三类,是端到端管线路线。

英矽智能将AI直接推进自有创新药物管线,首款AI药物已进入III期临床,但他们是「造车人」而非「修路人」。

而津渡生科的选择是:专注构建物理Harness,做模型与实体实验系统之间「最后一公里」的基础设施。

不做底座竞赛,不做端到端管线,不做纯数字世界的AI科学家。只做那一公里,无疑是更加轻量化的打法。

金泳成把这个判断说得很清楚:「AIfor Science真正的分水岭,不是模型回答得多像科学家,而是实验室能否开始像一个持续学习的系统。」

而且,在全球AI for Science领域,津渡并非简单地「只做最后一公里」。

更准确地说,它以最后一公里为入口,争夺整条科研工作流的编排权。

相比纯数字AI科学家,它能够触碰物理世界;相比自建重资产科学工厂,它有机会接管客户已有实验室;相比端到端AI制药公司,它不必把命运押在某一条临床管线上。

它真正的护城河,将不是参数量,而是不断积累的实验轨迹、设备接口、失败经验和跨实验室执行网络。

正如金泳成所言,生物体内数以万计的信号通路和充满未知的反应机理令人着迷。「生物学有多丰富,AI for Science的前景就有多美。」

以AI的智能探索生命之谜,这群牛津学霸的星辰大海,才刚刚拉开序幕。

参考资料:

编辑:Aeneas KingHZ

秒追ASI

相关内容

热门资讯

铠侠与闪迪发布第十代332层Q... IT之家 8 月 4 日消息,铠侠株式会社今天宣布与闪迪公司共同推出下一代四层单元(QLC)3D 闪...
官方通报卫生巾疑现虫卵:对涉事... 8月4日晚,广西桂林市七星区市场监督管理局发布情况通报:4日,网络上关于“购买的卫生巾疑现虫卵”的信...
奖励一颗小行星命名!中国科学家... 中国科学家又有喜讯了。 综合中国气象报社、科技日报消息,当地时间8月3日,在意大利佛罗伦萨举办的第4...
全球最大通信卫星刚上天,休斯为... 卫星互联网商业模式观察 全球最大通信卫星刚上天, 休斯为什么还是被星链逼到破产? 作者 | 老谭 ...
中国版「生物DeepSeek」... 新智元报道 DeepSeek-V4-Flash正式版刚炸翻全球通用大模型圈,中国生命科学版Deep...
汽车回血,AI烧钱,特斯拉迎来... 文|高恒说 特斯拉开始把造车产线让给机器人。 2026年第二季度,特斯拉拆除了弗里蒙特工厂原有的M...
鸿蒙智行承认投诉“竹知了”视频... 针对“竹知了”玩具相关舆情,鸿蒙智行于8月4日晚发布企业声明,介绍了投诉“竹知了”视频相关情况,也表...
抢劫杀人犯死刑改死缓被害人家属... 澎湃新闻记者 熊强云南宣威市乐丰乡1999年“山村小卖部抢劫杀人案”被害人家属申诉迎来新进展:家属徐...
乘客投诉绕路遭出租车司机持铁棍... 8月4日晚,太原市公安局小店分局官方微博通报:7月20日凌晨2时许,我局接到群众报警,小店区体育路许...
中国登山者在巴基斯坦雪崩中遇难... 7月30日,一支10人国际登山队在攀登布洛阿特峰(Broad Peak)时遭遇雪崩失踪。据巴基斯坦高...