首页 > 资讯 > AI早就比医生会看病了?漏读数据不吭声,这才是最可怕的

AI早就比医生会看病了?漏读数据不吭声,这才是最可怕的

36氪文章 2026-10-10 19:06 5 阅读 查看原文

多年来,布兰迪・扎卡里博士一直在把复杂的病史、化验结果、症状、用药和多年治疗经过,整理成连贯的临床方案。一个复杂病例,往往要花她三个小时研究,才敢确定什么重要、下一步怎么做。

后来,生成式AI出现了,能消化海量信息,调取医学知识的速度远超人脑,几秒钟就能看出一份病例里各项信息之间的关联。她以为,只要给大语言模型套个界面、加几道安全防护,就大功告成了。

实际上,他们花了一年左右、约100万美元,带着软件工程师和一支10人临床团队,系统却至今没建完。

她用的AI,和别人不一样

原因不是AI不够聪明,而是“聪明”恰恰是最容易的部分。

做临床软件之前她就发现:同一个AI工具,自己和旁边的人用,结果天差地别。因为她不是简单提问、拿走答案,而是在跟AI争辩、质疑假设、补上漏掉的背景、纠正错误、换角度再追问。

技术上用的是同一个工具,效果上却不是同一个东西。

写广告时这只是效率问题,换成病人就完全不同。她和7万多名执业医生打过交道:有人临床非常出色,却完全不会从AI系统里问出有用的信息。

医疗行业的主流答案,似乎是让医生去学“提示词工程”。她不认为这是正经方案:如果临床AI要靠医生先修炼成提示词工程师才可靠,那它根本没造完。

研究已经告诉我们一些不愿面对的事实

2024年一项随机临床试验让50名医生做高难度诊断:用GPT-4的医生得76分,用传统资料的74分,差距不显著GPT-4单独作答时,比传统资料高出16个百分点。

2026年巴基斯坦的试验中,接受过AI素养培训、能用GPT-4o的医生诊断推理得分71.4%,用传统资料的只有42.6%,GPT-4o单独作答则是82.9%。

2026年英国的重复杂研究也类似:医生在AI辅助下虽有进步,仍比单独工作的大模型低21个百分点以上。

坦白说:在某些认知任务上,AI已经胜过单个医生。没有医生读过全部论文,也没人能及时想起每一种罕见病和药物禁忌,而AI能处理海量信息,不疲惫、不受时间限制。真正的错误,是以为放一个聊天机器人在医生面前,问题就解决了。

问题出在那个空白的提示框

想象一位医生上传一份含150项指标的化验报告:回答很快回来,整理得赏心悦目,但系统并没有可靠提取全部150项指标。通用大模型不是确定性的临床文档解析器,处理表格和密集的医学报告尤其困难。

最吓人的是:它不会告诉你“我漏掉了50个数值”,可能直接给出答案。若漏掉的某个数值恰需紧急评估呢?

这是她绝不愿绕过的缺陷,团队不得不另造一套提取技术,先准确、可复现地处理化验报告,临床推理才能启动。

一个会告诉你“我不知道”的AI,只是有点麻烦;不知道自己漏掉了什么的AI,才是危险的。

为什么要在AI之外再建一层

临床工作硬性要求一种通用生成式AI天生给不了的东西:可复现性。必须对输入输出都有掌控——可靠的数据提取、结构化的知识、确定性的逻辑、安全防护,以及能跨病史评估指标关联的系统。

临床推理不是一堆条件句,有时信号藏在几个指标的关系里;五个单独看平平无奇的结果,合起来却至关重要。人体生物学满是例外和相互竞争的解释。答案从来不是“用AI还是不用AI”,而是弄清每项工作该交给谁。

使用得当,AI能扩展医生的记忆、加速研究、提出不常见的可能性,在海量信息中识别模式。这越来越不像取代医生,而像打造一位“仿生医生”。

医疗中的人际互动,不是机器干完脑力活后加的温情装饰,而是临床数据的另一个来源。最好的临床系统,两者都需要。

别再问AI会不会取代医生

未来不一定属于聊天机器人最机灵、模型最聪明的公司,重要创新正发生在模型周围:信息如何被捕获核实、系统拥有什么知识、被允许推断什么、哪些环节由人参与。

我们不该要求每位医生都变成业余AI开发者,复杂性应该活在技术内部,而不是医生的提示词里。

未来的医生不会在记忆力上战胜AI,那场比赛已失去意义。

相反,我们应该把机器的记忆、算力和模式识别交给医生。同时保留他们对整体情况的把握、判断力、怀疑精神,以及与患者的人性连接,我们称之为“仿生医生”。

本文由雷科技编译自Unite.AI

原文链接:AI已经比你的医生更聪明了,但这还不是最吓人的部分

本文来自“雷科技”,36氪经授权发布。