首页 > 资讯 > 生物逆龄竞赛开赛,LLM 推理再遭质疑

生物逆龄竞赛开赛,LLM 推理再遭质疑

赢政天下 2026-10-02 21:23 6 阅读 查看原文
生物逆龄竞赛开赛,LLM 推理再遭质疑

编者按:麻省理工科技评论(MIT Technology Review)的每日通讯《The Download》近日同时抛出两个耐人寻味的话题:一边是有人把“生物年龄”变成了一场竞赛的赛道,另一边是研究者再次追问——大语言模型到底会不会推理。前者关乎人类如何延展生命,后者关乎机器如何被定义。本期我们把它拆开来看。

一场以“青春”为赌注的竞赛

本周,MIT Technology Review 记者 Jessica Hamzelou 做了一件不太寻常的事——她正式报名参加了一场竞赛。这场比赛比拼的不是速度,也不是耐力,而是谁能让自己的“生物年龄”下降得更快。换句话说,这是一场逆龄比赛。

要理解它为什么成立,得先理解“生物年龄”这个概念。过去十年,衰老研究逐渐从边缘走向主流,核心工具之一是表观遗传时钟(epigenetic clock)。研究者通过检测 DNA 甲基化模式,结合代谢、炎症、肌肉功能等一系列生物标志物,可以估算出一个人的身体究竟“老化”到什么程度——这常常和身份证上的数字并不一致。

资本早已闻风而动。Altos Labs 在 2022 年以约 30 亿美元起步,Calico 背靠 Alphabet,Retro Biosciences 拿到了 Sam Altman 的投资。它们追逐的方向包括“部分重编程”(partial reprogramming),也就是用 Yamanaka 因子等手段,让细胞短暂回到更年轻的状态,再观察机体整体是否受益。

“本周,我正式报名参加了一场不同寻常的竞赛——它奖励的是那些在生物青春上跑得更快的人。”——Jessica Hamzelou

这类竞赛的价值未必在奖金,而在标准化。衰老领域长期缺乏公认的评估终点:有人看端粒长度,有人看炎症因子,有人看表观遗传年龄。指标不统一,研究之间就难以比较。如果一场比赛能推动大家坐下来统一度量方式,那本身就是一次进步。当然,风险也在——把复杂的生物学简化成一个排行榜,容易催生营销式的“逆龄”叙事。

LLM 的“推理”,是思考还是模仿?

《The Download》同日关注的另一个话题,是那句被反复引用的论断:大语言模型不会推理。它并非空穴来风。过去两年,大量研究从不同角度测试模型的推理能力,结论往往指向同一处:题目稍作改动,表现就会大幅波动。

苹果在 2024 年发表的 GSM-Symbolic 研究颇具代表性。研究者把标准数学题中的人名和数字替换掉,再插入无关的干扰信息,模型的准确率便明显下滑。这暗示模型很可能是在匹配训练数据里的模式,而不是像人那样,从题目中抽象出稳定的运算规则。

这并不等于说模型没用。在翻译、摘要、写代码这类任务上,它们表现相当出色。争论的真正焦点在于:我们把“能给出正确答案”和“理解为什么这个答案正确”混为一谈了。

模式匹配可以在大量场景下产生正确输出,但它无法保证在分布之外的世界里依然可靠。

为什么这两件事值得放在一起看

逆龄竞赛和 LLM 推理看似风马牛不相及,却共享同一个底层难题:如何定义并测量一个模糊的概念。生物年龄需要一套可信的指标体系,模型推理能力同样需要一个不轻易被“题目换皮”击穿的评测框架。

对普通读者而言,这意味着两件事。第一,看到“逆龄 XX 岁”的宣称时,先问它用的是哪套指标、样本有多少、是否经过同行评审。第二,在使用大模型处理关键任务时,把它当作一位博学但偶尔自信过头的助手,而不是一位可以全权托付的专家。

技术的前沿,往往不是某个突破性答案,而是我们对问题本身重新提问的方式。

本文编译自 MIT Technology Review。