首页 > 资讯 > AI虚拟���胞行业白皮书:30亿美元资本涌入开启商业化元年,拆解规模化落地瓶颈与解法

AI虚拟���胞行业白皮书:30亿美元资本涌入开启商业化元年,拆解规模化落地瓶颈与解法

36氪文章 2026-09-30 09:54 4 阅读 查看原文

2026年被定义为AI虚拟细胞商业化元年。技术突破、政策加持、资本涌入与需求释放在同一时间窗口交汇,行业正式迈入产业化落地周期。在热度背后,产业各方对AI虚拟细胞的概念边界、技术路线、竞争格局和真实瓶颈仍缺乏统一认知。

本份白皮书希望回答三个问题:全球参与者形成了怎样的竞争格局,哪些路径更具长期生命力?从数据到模型再到应用落地,真正的瓶颈在哪里?产业界已经出现了哪些值得关注的创新解法?

为此,动脉智库梳理了全球AI虚拟细胞的技术演进与产业脉络,访谈了多家企业,盘点了数据供给、模型开发、商业落地各环节的参与者布局。我们发现,尽管行业热度高涨,但数据层的高价值数据缺失、模型层的预测能力未达产业预期、应用层的验证标准与闭环机制缺位,构成了关键制约。与此同时,一批企业正在数据生产、跨模态对齐、干湿闭环和真实场景交付上展开探索,为行业走向规模化落地提供了现实可行的突破口。

核心内容与观点:

以下为白皮书内容节选:

爆发增长,AI虚拟细胞开启生命科学新范式

1、定义与三层技术架构

虚拟细胞(Virtual Cell)是指利用数学方程、物理模拟和AI技术,在计算空间中构建细胞行为的数字化模型,使研究者在不依靠实体湿实验的条件下预测细胞对外部扰动(药物、基因编辑、环境变化等)的响应。

需要指出的是,虚拟细胞并非一个单一产品,而是一类技术体系的总称。根据建模方法的不同,目前主要存在两条技术路线。

数据驱动的AI建模路线,用大规模神经网络从数据中学习细胞行为的映射关系。规模化能力强、迭代速度快,但黑箱特性明显,缺乏因果性解释能力。2024年12月,斯坦福大学、基因泰克与陈-扎克伯格基金会在《Cell》上联合提出的AI虚拟细胞概念,是这一路线的代表性框架。

经典计算细胞生物学路线,基于数学物理方程,从已知的生化反应动力学出发构建模型。机制透明、可解释性强,但扩展性差��难以适配真实生物系统的高复杂度、动态化特征。

当前行业的前沿探索方向,是在数据驱动框架中融入生物机理约束,试图兼顾规模化能力与可解释性。

虚拟细胞技术路线

在讨论AI虚拟细胞时,有几个相近的概念有必要厘清边界。

AI虚拟细胞与相近概念内涵及关系

动脉智库从技术构建到产业落地的实际流程,将AI虚拟细胞技术划分为数据层、模型层、应用层三层架构,同时由闭环主动学习驱动持续进化。

AI虚拟细胞三层技术架构

(1)数据层:先验知识、静态架构、动态状态组成

先验知识整合已发表的生物医学文献、已知的分子表达规律和多尺度成像数据,明确细胞生命活动的基础规则。静态架构收录细胞形态结构、分子空间分布等固定信息,还原细胞固有物理特征。动态状态是构建具备真实推演能力模型的关键,聚焦细胞自然发育、衰老、药物干预、基因编辑等外部扰动下的状态变化,是支撑AI虚拟细胞实现动态仿真的核心数据底座。

(2)模型层:多类模型构成的能力矩阵

模型层基于数据层提供的信息,构建能够表征和预测细胞行为的数字化模型,产品形态大致分为以下几类。

细胞表征模型是当前数量最多的类型。扰动预测模型是目前核心竞争方向,在单细胞基础模型底座之上,针对性优化外部扰动响应建模能力,预判药物、基因编辑等干预行为对细胞状态的影响。多模态整合、跨尺度建模模型是长期演进方向,是贴合真实细胞生命活动规律、突破现有仿真精度瓶颈的必然发展趋势。

(3)应用层:面向生命科学全链条的价值落地

应用层将模型能力转化为实际应用场景中的解决方案,包括药物研发领域,可覆盖靶点发现与验证、候选药物虚拟筛选、药效评估、毒性预测、适应症拓展等,以及再生医学、合成生物学等领域。

(4)闭环主动学习:AI虚拟细胞的进化引擎

在数据层、模型层和应用层之间,存在一个关键的动态机制——闭环主动学习。

AI虚拟细胞在应用过程中自主识别模型认知缺口与预测不确定性区域,针对性设计基因编辑、小分子药物处理等新型湿实验方案,产出新数据,再将新增数据回流至数据层,驱动模型迭代优化。使AI虚拟细胞从静态的预测工具,变为一个能够持续逼近真实细胞行为的学习系统。

2、行业爆发窗口:技术、政策、资本、市场四维共振

技术拐点:AI建模与数据获取技术的双重突破。AI建模层面,AI大模型技术向生命科学领域渗透,行业摆脱人工预设生物规则的传统模式,形成数据驱动、自主学习、动态推演的全新建模逻辑。数据获取层面,单细胞测序、蛋白质组学、器官芯片等技术的逐步成熟,提供了不可或缺的燃料基础。

政策拐点:主要经济体同步加码AI for Science。2025年以来,美国、英国、欧盟、日本、中国等主要经济体密集出台AI for Science政策,普遍将其上升为国家级战略工程。

主要经济体AI for Science重点政策(2025—2026年)

资本拐点:全球资本加速入局,产业资金条件逐步成熟。截至2026年8月底,全球AI虚拟细胞领域融资总规模突破30亿美元,成为生命科学智能方向的重点投资赛道。国内市场后发加速,融资热潮集中于2026年,呈现出早期化特征。

全球AI虚拟细胞投融资事件盘点

需求拐点:传统研发体系承压,行业迎来刚性需求。AI虚拟细胞的爆发,离不开传统新药研发体系长期积累的弊端。下游需求已经从前沿技术探索转向实质性采购,这一变化由多重行业压力驱动。

四重压力驱动下的药企需求拐点

数据、模型、验证矛盾待解,规模化落地面临瓶颈

在产业热度之下,从数据生产、模型构建到场景验证的全链条中,仍存在多项深层次矛盾。动脉智库沿着数据、模型、应用三层产业链路,逐层拆解制约行业扩张的核心痛点,梳理现存约束。

1、数据层约束:高价值数据生产与标准化推高产业落地门槛

数据获取与加工痛点

(1)生产端:扰动、蛋白与阴性数据供给不足

扰动数据成本高,实验周期长,供给存在明显缺口。扰动数据需要通过定向干预实验产出,获取成本高、实验周期长,整体积累速度远慢于静态观测数据,难以支撑模型持续迭代。

蛋白质数据获取面临成本与技术瓶颈,供给严重不足。在细胞信息构成中,DNA仅承载约10%的静态信息,RNA反映约20%-30%的预备状态,蛋白质的功能修饰承载超过60%的信息权重。但质谱检测成本尚未出现指数级下降趋势,且蛋白覆盖率有限,使得蛋白组学数据获取的难度和成本都相对较高。

药物研发与阴性数据的缺乏,对AI虚拟细胞模型性能也有重要影响。药企内部的研发数据是模型学习真实药物作用机制的核心素材。特别是阴性数据,覆盖无效分子、毒性反应、失败扰动等边界场景,能够提升真实研发场景中的预测稳定性与可靠性。但药企内部研发数据通常不会对外共享,且行业惯例只留存阳性结果,大量失败实验数据被丢弃,公开数据清洗时也仅保留阳性结果,导致模型无法学习失败边界。

(2)加工端:标注与对齐两大梗阻制约数据可用性

即便数据被生产出来,进入模型前的加工环节仍面临双重梗阻。生物数据标注远比文本复杂,单个细胞状态需同时标注基因表达谱、蛋白丰度、表观遗传状态等多个维度,几乎缺乏自动化标注手段,高度依赖专家。

跨模态、跨尺度数据对齐同样困难。单细胞测序具有破坏性,测完一个组学后其他组学无法再测,天然难以实现模态对齐。跨数据源对齐整合需要大量批次效应校正和归一化处理,目前缺乏行业公认的统一流程。

数据层面的缺陷,会沿着模型能力、商业落地、规模效应形成负向传导。首先,模型能力固化,难以建立可靠的预测能力,其次,模型输出与商业需求错位,药企对描述性模型付费意愿有限,再次,Scaling Law局部失灵,单纯扩大模型参数量难以提升性能。

2、模型层瓶颈:通用架构与生物系统运行规律的结构性错配

模型层核心痛点

■ 困境一:先验缺失,通用架构缺乏生物拓扑的内建理解

结构性先验错配诱发通用AI架构核心功能失效。Transformer的自注意力机制假设序列中任意位置均可直接交互,但生物系统的相互作用具有严格的拓扑约束。通用架构未内建这些生物先验,只能依靠数据从零拟合。在样本有限的高维生物场景中,参数效率极低。

■ 困境二:表征割裂,组学模态与跨尺度动态难以统一

多组学数据格式不统一,跨模态整合停留在特征拼接层面。 这引���了三重问题:其一,不同模态的噪声相互干扰,高噪声模态会稀释低噪声模态的有效信号;其二,模型对模态完整性要求过高,缺失任一模态就会导致整条样本不可用,数据利用率明显下降;其三,不同模态的量纲与分布差异干扰梯度优化,导致训练不稳定。

时空尺度跨越多个数量级,现有模型难以同时实现分子到组织过程动态建模。

■ 困境三:解释性缺位,黑盒预测与高风险决策需求的错配

深度学习模型的黑盒特性在消费互联网场景中通常不构成主要问题,但在药物研发等高风险决策场景中会直接影响其可信度和实际采纳。当前模型仅能输出相关性层面的预测结果,无法提供因果层面的机制解释,导致预测结果无法转化为可执行的实验设计。

模型层架构与生物规律的错配,导致模型从核心决策依据退为辅助参考工具,商业化落地进度显著滞后于早期市场预期,尚未跨过大规模商业化应用的门槛。

3、应用层挑战:从技术验证到产业落地之间的断层

虚拟细胞应用层核心矛盾与结论

标准缺位,模型价值难以被客观量化。AI虚拟细胞领域至今缺乏类似CASP的行业级统一评估框架。现有评测任务多为预定义、有限范围的学术场景,无法覆盖药企实际面对的复杂决策情境。评估标准碎片化,导致不同模型之间难以横向比较,药企在技术选型时缺乏可靠参照。

接口错位,模型输出与药企研发流程难以嵌入对接。系统层面,多数药企数字化实验流程尚不完善。认知层面,模型输出多为计算原生格式,而研发团队习惯消费决策友好格式,跨界人才稀缺导致对接高度定制化。决策层面,大型药企技术引进决策权高度集中,早期合作往往依赖既有关系网络。三重错位叠加,使商业化落地难以脱离项目制模式。

闭环断裂,干湿循环未打通,制约模型进化。AI虚拟细胞的核心价值是以计算预测替代湿实验试错,但当前模型预测结果的可靠性本身仍需湿实验验证。类器官、器官芯片或动物实验等验证路径成本高、周期长,许多企业只能做到算完即弃,无法将验证结果结构化回流至模型进行迭代优化。干湿闭环的断裂,使模型丧失了通过预测、验证、反馈循环持续提升能力的关键机制。

竞争路径分化,数据与闭环能力决定长期竞争力

过去两年间,一批企业和机构在数据基建、模型搭建和商业应用上展开了探索,针对行业痛点形成了多元化的技术突破路径与落地解决方案。

本章基于行业发展现状,系统盘点市场参与主体类型、产品形态与整体发展进度,构建企业能力全景图谱,从数据、模型、应用三个层面梳理行业参与者的综合实力与发展差异。

1、参与类型多元,形成七大差异化发展路径

AI虚拟细胞行业格局全景图谱

目前行业参与者类型多元、覆盖维度广泛,不同背景的企业与科研机构依据自身资源禀赋,分别在产业数据层、模型层、应用层形成差异化布局,呈现出多点开花、协同发展的繁荣格局,尚未形成高度集中的竞争态势,各类主体仍处于能力搭建与赛道卡位阶段。

可以发现,业内企业虽处同一个赛道,选择的发展路径却差异显著,从上游数据供给到下游临床应用,从技术驱动到需求拉动,从商业公司到非营利机构,不同参与者基于初始资源禀赋、数据获取方式、技术切入逻辑与壁垒建设思路,形成了七条发展路径,不少企业随业务推进,会叠加多条发展路径。

■ 路径一、全栈平台型:资本驱动的全链条布局

该路径先投入重金建设数据基础设施和计算模型平台,形成从数据生成、模型训练到管线推进的全链条能力,再通过自研管线或对外合作实现长期价值回报,入场门槛极高,需要大规模的前期资本投入,且回报周期较长。

■ 路径二、服务验证型:以药企合作锚定技术价值

该路径用跨国药企的合作合同为自身技术定价,是当前行业认可度最高的技术验证路径之一。

■ 路径三、数据供给型:将数据资产作为核心产品

该路径打破数据作为实验副产品的传统定位,将生物数据打造为独立商业化产品,通过自主搭建实验体系规模化生产AI适配数据,供给模型研发企业。

■ 路径四、场景飞轮型:用临床场景驱动数据积累

该路径将真实临床场景作为数据入口,通过业务持续落地沉淀结构化数据,以数据迭代优化模型能力,再依托升级后的模型深化场景渗透,形成自我强化的正向循环,具备场景真实性强、数据维度贴合临床需求的特点。

■ 路径五、干湿闭环型:物理实验与计算模型互补

该路径通过器官芯片湿实验体系弥补纯算法建模的短板,构建AI预测、实验验证、数据回流、模型优化的闭环迭代体系,依托干湿结合的差异化路径形成独特竞争优势。

■ 路径六、公共基础设施型:搭建公共科研生态

该路径以非营利科研机构为主,通过搭建公共数据平台、建立行业评测标准、组织产业学术赛事等方式构建行业基础设施。

■ 路径七、临床牵引型:从临床痛点反向定义能力

该路径以临床痛点为导向,先明确临床诊疗、药物研发中的实际问题,再针对性定义AI虚拟细胞模型的能力需求,通过适配的数据采集、算法优化补齐技术短板,实现技术与场景的精准匹配。

七种发展路径对比

2、数据层:从公开数据集到私有资产壁垒的构建

仅依靠公开数据集,不足以支撑具备产业实用价值的模型,必须依托定向产出的私有实验数据完成训练与校准,这推动一批专业化数据生产商快速切入AI虚拟细胞赛道。

发展现状:专业化数据生产商快速崛起

AI虚拟细胞数据生产商布局

目前,数据供给端已经形成多元参与者矩阵。单细胞测序企业是重要数据来源,包括10x Genomics、寻因生物、墨卓生物、新格元等。类器官与器官芯片企业可产出贴近生理环境的细胞实验数据,代表有耀速科技、淇嘉科技等;蛋白质组学企业依托自研��谱平台,产出转录组难以覆盖的功能蛋白、翻译后修饰数据,包括嘉华药锐、西湖欧米等;部分生物医药企业也开始对外输出数据资产,例如神拓生物这类体内治疗技术企业,沉淀大量真实研发过程数据与失败边界信息。

数据层的核心竞争要点集中在数据集积累速度与客户迁移成本。一旦主体完成规模化、体系化的数据资产沉淀,后来参与者很难在短周期复刻同等体量与质量的数据资源。

单一模态数据很难完整还原细胞复杂运行逻辑,多组学融合的数据集合可以有效降低模型的认知偏差。业内数据生产商正积极通过跨主体合作补齐自身数据维度短板,淇嘉科技与赛陆医疗共建AI虚拟细胞数据训练平台,耀速科技联合珞米科技探索器官芯片叠加蛋白组学的数据体系,都是这一趋势下的实践案例。

与此同时,模型开发企业也意识到了数据底座的价值,数据生产商已经成为模型开发与迭代不可或缺的外部合作伙伴。2026年赛道诞生多起产业合作,例如衍因科技与神拓生物,百图生科与耀速科技,无界进化与墨卓生物,百曜科技与新格元,无尽方舟与寻因生物,英矽智能与墨卓生物,百图生科与华大智造,数据层与模型层的绑定日益紧密。

数据生产企业与模型开发企业合作案例

数据供给主体数量持续增长的背景之下,不可忽视的是,行业尚未建立统一的数据质量评判标尺,不同机构产出数据集的一致性、可复用性参差不齐。想要成为合格的AI虚拟细胞数据供给方,需要打造标准化的AI Ready数据体系,围绕模型训练诉求重构数据生产、整理与输出逻辑。

首先,企业需要优化数据整体分布结构。常规药物设计实验聚焦优质有效靶点与阳性化合物,数据样本高度集中于有效区间,会导致模型学习维度片面,难以掌握完整的细胞作用规律。合格的数据生产需要主动拓宽样本覆盖范围,均衡布局全维度实验空间,补齐无效、临界状态等薄弱数据区间,让模型实现对细胞调控与药物作用空间的全面认知。

其次,需要重构样本构建规则,重视全量实验数据与配套信息的留存。传统研发场景仅关注阳性有效样本,大量具备研究价值的阴性样本被舍弃,数据生产商需要合理优化正负样本比例与分布结构,留存实验批次、环境参数、操作条件等元数据,完善数据溯源体系,这是传统实验场景无需关注、却是AI模型训练不可或缺的内容。

同时,数据生产商需要建立数据与模型的协同思维,摆脱被动生产实验数据的模式。企业需要精准匹配模型迭代需求,了解模型训练的数据短板与优化方向,以低成本、高质量的定制化实验方案,补齐模型所需的关键数据,实现数据生产与模型开发的联动。

最后,需要具备多组学多模态数据的对齐与整合能力。AI虚拟细胞模型的高精度训练,依托于多维度生物数据的关联匹配。数据生产商需要针对性设计多类型扰动实验,统一多组学数据观测标准,梳理不同维度数据的内在关联,完成多模态数据的标准化对齐与结构化整理。

从传统实验数据生产到AI Ready数据体系的模式转变

但AI Ready数据体系的落地将显著推高实验与人力成本,对企业资源能力要求较高,多数中小企业难以承担,未来数据供给端大概率迎来一轮淘汰整合。

数据层创新方案:面向模型训练需求,补齐关键数据短板

面对AI虚拟细胞对特殊类型数据的迫切需求,产业端已经涌现多项创新解决方案,针对性缓解跨模态跨尺度数据难以对齐、扰动数据稀缺、大规模功能蛋白组获取困难、药物研发阴性数据不足等行业痛点。

(1)跨模态跨尺度数据对齐

多组学、多尺度数据的对齐融合是一大现实难题。百图生科是行业内少数已经落地跨尺度、跨模态数据对齐能力的企业,xTrimo生命科学基础大模型已覆盖DNA、RNA、蛋白质、小分子、细胞、多细胞及复杂生物系统等,公司通过三个层面构建多模态、多尺度数据的统一建模能力。

第一,通过中间模态建立跨模态关联。 在当前实验约束条件下,采用中间模态作为桥梁完成模态关联,借助同一套细胞样本下的视觉中间模态,分别建立视觉‑转录组、视觉‑蛋白组两组配对关系,间接实现转录组与蛋白组之间的数据对齐。

第二,将各类异构生物数据投射至统一的生物状态空间,不同来源、不同尺度的数据在同一个模型空间完成表征学习。即便部分样本缺少直接配对的实验测量,依然可以依靠共享的生物状态表征,在模型内部弥补物理实验层面的数据对齐短板。

第三,进一步引入生物机制知识辅助模态关联推理。通过构建基因调控网络,解析基因与蛋白之间的调控逻辑;依托蛋白质相互作用网络,还原分子层面的信号传递关系,以已知生物学机理约束不同模态之间的映射关系。

(2)扰动组学数据生产:高通量技术推动因果数据规模化

扰动数据是训练具备因果推断能力模型的关键素材,当前整体供给稀缺。Perturb-seq、CROP-seq等高通量技术的发展,能够同时对数千个基因进行功能性扰动,并在单细胞分辨率上读取转录组响应,为训练具有因果推断能力的模型提供数据基础。

海内外多家企业正在布局扰动数据集生产。10x Genomics凭借少量细胞、高通量3′端转录组测序技术,实现扰动数据的高效生成;Illumina推出Billion Cell Atlas项目,依托CRISPR技术在200余种疾病相关细胞环境中开关两万个人类基因,构建规模领先的全基因组遗传扰动数据集。

但多数企业并未对外披露扰动数据集实际规模,高通量扰动实验成本高、流程复杂,大规模、低成本、标准化的扰动数据生产体系尚未成熟,扰动数据的规模化产出会是后续行业重点观察方向。

(3)蛋白质组学:高灵敏度技术突破功能蛋白检测瓶颈

针对传统蛋白质组检测存在样本门槛高、检测通量有限、成本高昂,难以大规模产出训练数据的痛点,嘉华药锐微量蛋白平台,单一细胞可鉴定到超过3800种蛋白,并且依托自研SH2超级结合蛋白可捕获低丰度酪氨酸磷酸化信号,该能力在全球范围内尚无其他平台可实现。

酪氨酸磷酸化数据作为细胞信号通路的直接读出,能够在数据量有限的情况下高效反映细胞的功能状态变化,为AI虚拟细胞提供反映细胞动态功能状态的重要数据维度。

目前,嘉华药锐搭建起以功能蛋白组学为特色的多组学数据库,累计数据总量300TB,包含蛋白3900万条,肽段4.8亿条,磷酸化位点4000万条,为AI虚拟细胞提供高质量的训练素材。

(4)细胞与基因治疗:补齐药物研发数据的关键缺口

面对真实药物研发过程数据,以及研发失败案例这类阴性数据缺乏的问题,细胞与基因治疗企业深耕细胞生物学机理,拥有体内实验完整链路,具备天然的数据供给优势,其积累的体内药效数据、动物模型数据和阴性数据,可以完善数据层的研发场景拼图。

以神拓生物为代表,企业布局体内CAR‑T管线,积累了大量临床前研发、生产以及部分临床相关数据,同时产出专门适配AI虚拟细胞训练的多组学与影像数据,把药物研发实践中沉淀的认知转化为可复用的数据资产。

3、模型层:从状态表征走向扰动预测,多技术路线并行

当前AI虚拟细胞行业的模型开发主体呈现多元格局,包含AI科技企业、生物技术企业、高校与科研机构,同时部分创新药企也在开展模型自研,尚未出现绝对主导者,跨界合作与竞争并存是这一阶段的基本特征。

发展现状:规模扩张,进入扰动预测模型竞速阶段

海内外AI虚拟细胞模型

模型规模的快速扩张是近年来最直观的变化。AI虚拟细胞模型呈现参数量扩大、训练数据集规模持续提升的趋势。CellOS参数量达120亿,依托3.905亿条人类单细胞转录组训练;X-Cell参数量达49亿;Tahoe-x1参数量超过30亿,整合2.66亿单细胞转录组数据训练。但参数量和训练规模并非衡量模型实用价值的决定性指标,面向扰动任务的数据质量、评测设计与生物学机理约束,往往比单纯参数规模更能决定模型落地效果,行��也逐步摆脱一味追求大参数的思维,更加看重模型在真实研发任务上的实际表现。

研究重心正从描述性模型转向预测性、干预性模型。早期研究的核心任务是描述细胞状态,Geneformer、scGPT、scFoundation等基础模型均属于这一类型。2024年以后,研究重心转向预测,预测药物或基因扰动后细胞会发生怎样的变化,代表模型包括Tahoe-x1、xTrimoSCPerturb、State等。药企在实际药物研发过程中,不再仅需要知道细胞本身是什么状态,更希望获取药物、基因编辑等外界干预之后细胞会如何变化,可以说扰动预测能力决定AI虚拟细胞的产业价值,因此成为当前模型层竞争的关键板块。

从单模态向多模态、跨尺度模型演进是另一条重要主线。早期模型多以单细胞转录组单一模态为输入,随着多组学技术的成熟,越来越多的模型开始整合转录组、蛋白质组、空间组学、表观基因组等多维度数据。xTrimoSCPerturb融入蛋白质模型嵌入作为扰动条件,SToFM整合空间信息,CellProteo则以功能蛋白组学数据为核心输入。多尺度建模也成为重要方向:从分子层面到细胞层面再到组织层面,构建多层次的细胞行为模拟能力,State的基因-细胞-群体三层架构就是典型代表。

另外值得关注的是世界模型架构的兴起。2026年以来,将世界模型理念引入AI虚拟细胞建模成为重要趋势。当世界模型应用于细胞建模时,AI虚拟细胞不再仅仅是一个预测工具,而是一个能够模拟细胞在任意扰动下所有可能状态的生成式系统。AIDO Cell和CellOS都是基于世界模型架构。

AI虚拟细胞模型核心变化

模型层创新方案:面向扰动预测、多模态融合的优化

动脉智库注意到,模型层已经涌现出多个创新解决方案,从不同角度回应了行业在预测精度、多模态融合和跨尺度建模方面的痛点。

■ State:多尺度架构实现扰动预测的跨越式提升

State由Arc Institute团队开发,最核心的创新在于多尺度三层架构设计:基因水平为每个基因学习嵌入向量,捕捉基因功能关系;细胞水平采用State Embedding(SE)模型,基于双向Transformer在1.67亿细胞上预训练,用于压缩细胞转录组状态并过滤技术噪声;群体水平的State Transition(ST)模型是最具突破性的部分,在超过1亿个细胞的扰动数据上训练,不单独观察一个细胞,而是同时分析一组相同条件下的细胞,通过捕捉细胞间的差异和共性,精确分离真正的扰动效应和背景噪声。

State在性能表现上实现了显著提升。在化学药物扰动数据集(Tahoe-100M)上,State 区分不同扰动效应的能力提升了66%,预测基因表达变化的皮尔逊相关系数提升了91%。在细胞因子信号扰动数据集(Parse-PBMC)上,State区分能力提升了29%,相关性提升了48%。在基因编辑扰动数据集(Replogle-Nadig)上,State区分能力提升了10%,相关性提升了10%。

■ xTrimoSCPerturb:首届虚拟细胞挑战赛冠军

xTrimoSCPerturb由百图生科研发,是基于单细胞预训练构建的扰动预测模型。在Arc Institute发起的全球首届虚拟细胞挑战赛中,xTrimoSCPerturb从114个国家、1200余支队伍中脱颖而出,夺得冠军。

xTrimoSCPerturb的技术特点体现在工程优化的深度上。模型依托xTrimo单细胞基础大模型底座,将xTrimo蛋白质模型的嵌入信息作为扰动条件引入建模流程,同时采用多重混合损失策略,提升扰动状态模拟与差异表达基因的预测精度。特别的是,团队对模型架构与训练策略进行了双重升级,通过算法优化解决了传统模型因测序深度不足导致的低表达基因预测难题,并提升了基因调控关系的AI化解析能力。

■ CellProteo:功能蛋白组学增强的差异化路线

CellProteo由嘉华药锐研发,定位为功能蛋白质组学增强型虚拟细胞平台。其差异化优势在于以功能蛋白质组学数据为基石,整合多组学信息,从数据维度上构建了独特的竞争壁垒。

模型直接在多细胞尺度进行数据收集和建模,避免了单细胞模型数据采集不足,可解释性差的缺陷,另外,采用分层设计的混合架构,一方面利用Transformer框架处理分子序列信息,另一方面借助图神经网络(GCN)对细胞内部信号网络进行建模,动态模拟采用Neural ODE,兼顾预测效果与通路层面的可解释性,还原更加贴近真实生理环境的细胞响应,面向创新药研发、精准医学提供计算决策支撑。

4、应用与验证层:商业化处于早期,干湿闭环构筑长期进化壁垒

AI虚拟细胞模型应用落地案例

AI虚拟细胞行业商业化落地路径可分为四类。药企付费合作是目前行业收入的主要来源,能够快速实现技术商业价值兑现;平台订阅与软件授权可复用性强、边际成本低,是中长期被普遍看好的方向,但对模型可信度和标准化程度要求极高。

AI虚拟细胞商业模式对比

从应用场景来看,当前落地场景高度集中于药物研发领域,其中靶点发现、药物扰动效果预测是落地最扎实、产业认可度最高的两大细分方向,两者都有明确的付费方和可量化的交付标准。

一个值得关注的新兴方向是细胞与基因治疗场景。AI虚拟细胞在细胞与基因治疗领域的落地相对空白。与小分子药物不同,细胞与基因治疗的干预对象就是细胞本身,基因编辑、载体递送、细胞重编程等操作的效果依赖对细胞状态的精确理解,这与AI虚拟细胞模型能力高度匹配。细胞与基因治疗有望成为继靶点发现和扰动预测之后,下一个具备规模化落地条件的场景。

商业模式的可持续运转,依赖于一个底层能力:干湿闭环。干湿闭环的意义不止是验证模型精度,更是驱动模型持续进化的核心引擎。

随着行业的发展,干湿闭环的内涵也在深化,从简单的“AI预测-湿实验验证-数据回流-模型优化”,演进为更精细的多层闭环体系,包括模型迭代闭环与场景应用闭环。

模型迭代闭环,核心特征是模型主动指导数据生产方向。模型可自主识别自身预测短板与数据缺口,主动规划湿实验的扰动条件、观测维度与实验范围,定向采集对模型性能提升增益最大的高价值数据,精准提升模型迭代效率。

场景应用闭环则聚焦产业落地全链路,将模型嵌入药物研发、工业生物制造等真实业务流程,从实际应用场景中收集反馈数据、挖掘技术短板,反向驱动模型迭代优化。

干湿闭环体系的目标是实现三重效率的提升。目前处于提高数据效率阶段,通过干湿闭环提高数据生产的效率。接下来,从数据效率切换到模型效率。行业不再单一追求实验数据产出通量与数据规模,重点关注数据对模型能力提升的边际增益。之后,从模型效率切换到生物状态空间覆盖效率。跳出单一模型指标优化的局限,以完善全维度生物状态空间认知为长期目标,全面提升模型各类下游任务的泛化能力。

AI虚拟细胞干湿闭环体系与三重效率迭代

当前行业能够搭建有效干湿闭环的企业仍属少数,纯算法企业只有干端推演能力,传统生物企业只有湿端实验能力。目前干湿闭环布局者分为两类,一类是湿实验企业向上延伸,以器官芯片、高通量实验能力为基础,叠加AI建模能力构建闭环。另一类是AI模型企业从计算端出发向下延伸构建闭环。

应用与验证层创新方案:交付部署与干湿闭环的产业实践

动脉智库注意到,已有企业在应用落地和干湿闭环构建上形成了值得关注的创新实践。

(1)Noetik:与GSK达成首个合作里程碑

2026年8月,Noetik宣布达成与GSK合作的第一个里程碑——完成OCTO-VC模型推理与微调能力在GSK侧的交付部署并通过测试标准,证明了AI虚拟细胞模型具备跨平台部署的能力,仅需少量GSK自有专属数据进行微调,就能生成高准确度、高特异性的预测结果。对于整个行业而言,Noetik的里程碑完成意味着AI虚拟细胞模型不再只是一个科研工具,而是能够通过药企严格测试标准的商业化产品,将直接影响其他药企对类似合作的评估标准。

(2)百图生科:小闭环起步,构建跨模态跨尺度的干湿闭环体系

百图生科在干湿闭环上的实践具有代表性。其策略是把模型能力和实验验证相结合,借助干湿闭环进行持续迭代和升级。具体路径是用大模型做扰动预测,然后通过自有细胞实验室进行高通量实验验证,把结果反馈回模型进行迭代优化。公司已形成了单细胞领域的干湿闭环能力,正在逐步扩展到跨尺度、跨模态的干湿结合闭环。

在产业落地层面,百图生科依托生命科学基础大模型、虚拟细胞建模与干湿闭环验证体系,与天津药物研究院合作,启动面向工业菌株研发场景的虚拟细胞干湿闭环合作项目,围绕工业菌株建模、靶点筛选、代谢网络预测与实验验证等关键环节,构建可预测、可设计、可验证、可迭代的工业菌株AI研发体系。

本文来自微信公众号“动脉网”(ID:vcbeat),作者:焦艳丽、周梦亚,36氪经授权发布。