首页 > 资讯 > AI模型渴求生物学数据,OpenAI掏钱自己造

AI模型渴求生物学数据,OpenAI掏钱自己造

赢政天下 2026-09-15 21:24 2 阅读 查看原文
AI模型渴求生物学数据,OpenAI掏钱自己造

编者按:当大语言模型在文本世界里飞速迭代时,生物学领域的AI却卡在了一个更朴素的问题上——没有足够的数据可训。而据MIT Technology Review报道,OpenAI正在掏钱,试图亲手制造这些数据。

生物AI的隐形天花板

过去两年,AI在蛋白质结构预测、分子生成、药物筛选等方向不断取得突破,但业内越来越清楚地意识到,制约模型能力的往往不是算法,而是数据。互联网上的文本可以以万亿token计,生物学领域的高质量数据却分散在实验室笔记本、企业内部系统和监管文件里,规模有限、格式混乱、获取门槛极高。

更麻烦的是,生物数据中价值最高的部分,恰恰是最不公开的部分。临床试验的失败结果、药物的安全性数据、生产工艺参数,这些内容要么因为商业机密被锁进保险柜,要么因为「失败不值得发表」而从未进入公共视野。结果是,AI模型反复学习少数成功案例,却对绝大多数失败经验一无所知。

破产公司里的「数据金矿」

临床试验政策分析师Ruxandra Teslo曾提出一个颇具想象力的思路:去失败的生物技术公司里找数据。她的逻辑是,当一家生物技术公司走向破产,其资产会被清算拍卖,而竞标者有机会接触到详细的监管申报文件、生产策略和安全数据——这些信息在正常经营期间通常被当作核心商业秘密严加保管。

「通过参与破产程序竞标,或许可以获得详细的监管申报、生产策略与安全数据——这些通常作为商业秘密被隐藏的信息。」

这个提议之所以引人关注,是因为它指向了一个被长期忽视的事实:失败的数据同样有价值,甚至对AI训练而言价值更高。一个模型如果只见过成功的分子,就学不会识别何为危险;只有把大量失败案例纳入训练,它才可能真正理解生物系统的复杂性。

OpenAI为什么愿意自己出钱

据MIT Technology Review报道,OpenAI正投入资金,推动新的生物学数据集的生产。这一动作的潜台词是:公开数据已经不够用了。与其等待学术界慢慢发表论文、等待药企开放内部记录,不如直接出钱资助数据的采集与生成,把「数据生产」变成一项可以采购的服务。

这与OpenAI此前在数学、代码、多模态等领域的策略一脉相承——当互联网上的现成语料耗尽,前沿实验室就开始为特定领域定制数据。在生物学场景里,这意味着资助湿实验、购买专有数据集、与机构合作建立新的标注体系。它的成本高昂,但一旦形成规模,就可能成为后来者难以复制的壁垒。

数据护城河与商业秘密的拉扯

不过,「向破产公司买数据」这条路并不平坦。监管申报文件、生产记录往往涉及患者隐私、知识产权和商业竞争,清算拍卖中的数据转让可能引发法律争议。此外,即便拿到数据,如何标准化、去标识化、确保合规使用,也是巨大挑战。对AI公司而言,更现实的路径可能是与实验室、医院、药企建立合作,直接资助数据的产生与共享。

与此同时,生物技术行业内部也在权衡:把数据交给AI公司,究竟是在换取资金与效率,还是在培养未来的竞争对手?这种张力,将长期决定生物数据市场的开放程度。

谁掌握数据,谁就掌握生物AI

从更宏观的视角看,OpenAI的这笔投入反映的是整个行业的转向:AI竞争正在从「拼模型」走向「拼数据」。在通用文本领域,数据红利逐渐见顶;而在生物学、材料科学、医疗等垂直领域,谁能够率先建立起高质量、独家的数据管道,谁就可能建立真正的护城河。

这也意味着,未来几年我们会看到更多「AI公司出钱做实验」的场景——不是为了发论文,而是为了喂模型。生物技术行业积累了几十年的「暗数据」,或许正迎来被重新定价的时刻。

本文编译自MIT Technology Review