AI让科研假设变廉价后,MIT与谷歌为何盯上实验瓶颈?
假设不再稀缺,稀缺的是能验证假设的实验室
MIT与谷歌联合发布的一份报告在科研圈引发讨论:AI正在把提出科学假设这件事变得极其廉价。过去一个博士生花半年才能打磨出的候选方向,现在用大模型跑一遍文献和数据库,几分钟就能列出几十条。报告的核心判断很直接——假设生成的成本已经趋近于零,但验证假设所需的实验资源完全没有跟上。
这意味着科研流程的瓶颈发生了位移。以前最耗时间的是“想不出来”,现在最耗时间的是“排不上队”。一台冷冻电镜的机时可能要等三个月,一批动物实验的周期以月计,哪怕是相对自动化的高通量筛选,一轮湿实验走完也要数周。AI把前端加速了十倍,后端却还是原来的节奏,整体产出并不会等比例提升。
对做计算的研究者来说,这反而是个提醒:算力堆出来的候选列表再长,如果实验室接不住,价值就停在纸面上。我一般会先问合作方一句话——你们一周能跑多少个样本?这个数字往往比模型参数量更能决定项目节奏。
谷歌与MIT的报告里,哪些环节被AI真正改变了
报告梳理了AI在科研各环节的渗透程度,差异非常明显。文献综述和假设生成这两步,AI的介入已经相当深入,谷歌自家的Gemini等模型被用于跨学科知识关联,能从材料学论文里找出生物学可借鉴的思路。分子筛选和性质预测也进展很快,报告提到AI筛选候选分子的效率比传统方法高出一个数量级。
但到了实验设计和执行,AI能做的仍然有限。报告列举了几个卡点:
- 实验方案需要依赖隐性经验,很多操作细节没有写在论文里,模型学不到。
- 实验室设备接口不统一,自动化程度参差不齐,AI很难直接调度。
- 阴性结果极少被发表,导致训练数据存在系统性偏差。
这几个问题叠加,使得AI生成的假设在进入实验阶段后,淘汰率往往高于人类专家提出的假设。报告没有回避这一点,反而把它当作下一步要解决的重点。
值得留意的是,MIT方面在报告里强调,AI的价值不在于替代科学家做判断,而在于把人力从重复筛选中解放出来。一个研究者原本要读三百篇论文才能锁定一个方向,现在可以把这个时间压缩到几小时,省下来的精力应该投向实验设计和结果解读。
实验环节为什么成了最难啃的骨头
实验自动化的推进速度远慢于软件。一家实验室要上马自动化平台,涉及设备采购、接口改造、流程重写,周期通常以年计。而AI模型的迭代周期是几个月。两者节奏不匹配,导致每次模型升级,实验端都来不及响应。
数据问题同样棘手。AI要学习实验设计,需要大量带标注的操作记录和失败案例。但多数实验室的记录方式还是纸质或零散的电子表格,格式不统一,难以直接用于训练。谷歌在报告里提到,构建可用的实验数据集,工作量不亚于重新做一遍实验。
另一个容易被忽略的点是评价标准。假设生成阶段可以用准确率、召回率来衡量,但实验阶段的成功与否,往往要等几个月甚至几年才能判断。反馈周期太长,模型很难从中快速学习。这就形成了一个循环:AI生成假设快,实验验证慢,慢的反馈又拖累了AI的进一步优化。
按我的经验,团队如果打算把AI引入科研流程,先别急着上大模型。把实验记录数字化、把设备接口理清楚,这两件事做完,AI能发挥的作用才会显现出来。否则模型再强,也只是在空中楼阁上盖房子。
当假设变得廉价,科研组织方式也要跟着变
报告结尾提出了一个值得思考的方向:如果假设不再稀缺,科研团队的构成和评价体系可能需要调整。过去一个课题组的核心竞争力在于谁有好想法,未来可能更看重谁能快速验证想法。实验平台的建设、跨机构设备共享、实验数据的标准化,这些基础设施的重要性会上升。
谷歌和MIT在报告里没有给出具体的时间表,但释放的信号很清楚:AI在科研中的角色正从辅助工具转向流程重构的推手。对高校和科研机构来说,与其争论AI会不会取代研究者,不如先解决实验通量的问题。一个能每周稳定跑完数百个样本的自动化平台,配上AI生成的候选列表,产出效率可能超过十个各自为战的课题组。
当然,这并不意味着小型团队没有机会。聚焦在特定实验技术上做深做透,把某一类实验的通量和数据质量做到极致,同样能在AI驱动的科研链条里找到位置。关键在于认清自己的瓶颈是在假设端还是验证端,然后把资源压到更紧的那一头。