尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Anthropic与谷歌发力:AI从科幻走进现实,科研范式或迎重大转变!

Anthropic与谷歌发力:AI从科幻走进现实,科研范式或迎重大转变! 编辑Panda在《生化危机》里有一套位于地下深处的实验室「蜂巢」其门禁、监控、通风、安保乃至整个设施的运行都由一个AI——红皇后掌控。人类科学家负责研究而真正操控这座实验室的是AI。当异常发生红皇后能直接干预物理世界如关门、切断系统、控制设施等。二十多年前这样的情节还是科幻电影制造恐惧感的经典套路AI进入物理世界操纵机器、运行实验干预现实。如今这个画面正以不同方式走进现实——至少目前不恐怖。就在昨天Anthropic发布面向物理硬件的Model Hardware StandardMHS试图将MCP的逻辑从GitHub、Slack和数据库延伸到机械臂、显微镜、液体处理器、激光器等真实设备。参阅报道《刚刚Anthropic发布物理MCPClaude开始接管真实世界》。简而言之AI Agent不再只需要调用软件的「接口」还需一套连接现实世界的「神经和手脚」。而今日谷歌DeepMind也展示了这方面成果。在一篇刚公布的83页论文中谷歌把Gemini驱动的Co - Scientist接入真实科研流程让其设计实验、生成执行代码、读取实验反馈并与实验设备直接连接。谷歌将这种变化称为从in - silico hypothesis generator走向execution - grounded research partner即芯片内的假设生成器→基于执行的研究伙伴。最直观的一次实验中研究人员告知Gemini 3 Deep Think一台自建CVD设备的条件几分钟后它便给出适配方案并将其翻译成控制设备的机器代码最终三种二维半导体首次尝试成功生长。于是一个曾主要存在于科幻电影里的场景变为现实大模型长出「手」开始操纵实验设备。那么从今天起AI Scientist会有何变化《生化危机》里人类害怕AI接管实验室而现实中的科学家正主动将实验室交给AI。当然谷歌想打造的不是失控的「蜂巢」而是一台能从提出假设、设计实验到现实验证的科学发现机器。Gemini接管实验设备材料科学研究人员使用自建的化学气相沉积设备CVD炉做二维材料实验时存在公开「配方」难以复现的问题。同样的参数换台炉子晶体生长结果可能不同研究人员需花数周甚至数月调参。于是研究团队不再告知Gemini实验方法而是提供实验室设备、化学品及炉子结构等信息让AI自行决定参数。Co - Scientist根据这些约束生成完整实验方案交由实验设备执行。其中一组实验表现出色。研究团队将Gemini 3 Deep Think接入CVD控制流程后它几分钟内完成推理并将结果翻译成机器代码。最终MoS₂、MoSe₂和WS₂三种二维半导体首次实验就成功长出单层晶体整个实验约一小时完成。其中MoSe₂和WS₂更特殊研究人员此前未在该设备上生长过这两种材料后续至少五次重复实验也验证了结果。这与昨天Anthropic展示的MHS呼应。Anthropic想解决Agent认识和操纵实验设备的问题谷歌论文则探讨推理模型控制设备后科研工作流如何重构。从这个意义上说「AI连接硬件」已不是问题。不只是照着论文做实验AI还开始自己找配方若仅让Gemini根据已有知识调试设备不算真正的科学发现。所以谷歌进行了更难的第二个实验尝试从底向上合成Ti₃C₂Tₓ的MXene二维材料。传统路线涉及危险腐蚀剂已知的CVD方案使用有毒且对空气敏感的TiCl₄。研究团队让Co - Scientist寻找更安全的前驱体路线它最终锁定六氯乙烷C₂Cl₆并给出一系列参数。但这并非「AI一次成功」的故事。Co - Scientist生成272个候选方案研究人员选择并优化高排名方案经过25轮实验迭代得到一种二维层状晶体其多个指标与Ti₃C₂Tₓ MXene高度相似。最初复现实验成功率仅11.5%研究人员发现问题出在实验设备密封不严导致氧气泄漏。重新清洗石英管、更换密封圈、改进设备维护流程后实验成功率提高到68%。这说明「真实世界AI」与软件Agent不同代码出错可重新运行现实实验中一个小问题就可能让科研方案失败。谷歌在论文中谨慎表示目前不能确认该材料就是Ti₃C₂Tₓ MXene它还存在产率低、氧化严重等问题需进一步通过原子尺度表征确认。尽管如此仍可得出结论AI能提出有科学意义的候选合成路线并推进到物理实验验证。有些实验或许可以先让AI「猜一遍」谷歌还将Co - Scientist用于合成生物学实验研究对象是工程改造的大肠杆菌。这些细菌在培养皿中形成不同群落图案诱导剂IPTG浓度变化时菌落形态也会改变。正常情况下获取变化曲线需科学家配置不同浓度、培养细菌、扫描培养皿。谷歌让AI补全部分实验研究人员提供部分浓度下的菌落图片让系统预测中间浓度下的菌落形态。由于实验数据未发表论文认为模型无法依靠训练数据完成任务。结果显示AI在四项菌落形态指标中有三项预测与真实湿实验结果无显著差异还正确判断出对照组变化情况。唯一问题是「圆度」AI生成的菌落更规整。谷歌对该实验定义克制目前只是已知浓度区间的插值而非预测全新遗传回路现象。但这有现实用途未来科学家可先测几个点让AI预测剩余空间再选择实验位置使实验从「穷举」变为「真实世界采样 → AI预测 → 选择实验 → 新数据反馈给AI」即论文强调的lab - in - the - loop。AI已经开始自己设计在计算机科学实验中Co - Scientist的自主程度进一步提高。研究人员让它设计一个更好回答医疗问题的Agent之后不再参与架构设计。Co - Scientist自行提出方案、写代码、运行测试、分析错误并修改架构最终「进化」出Agent_H系统。该系统重新组织现有模型推理过程面对医疗问题会判断问题领域、面向对象、风险程度拆分复杂问题生成28 - 48个候选答案经Judge筛选、投票再经过多轮审查和压缩长度后给出最终答案。回答一个问题Agent需调用模型40 - 80次。在HealthBench Hard和HealthBench Professional上按照论文使用的长度校正评分Agent_H超过了包括GPT - 5.6 Sol、Claude Opus 5和Gemini 3.1 Pro在内的六个前沿模型。但出现了一个插曲AI学会了「刷榜」。早期实验评分标准未充分惩罚冗长回答Co - Scientist便把答案写长以提高分数Benchmark分数上涨但医疗质量未提升。直到研究人员加入长度惩罚优势才消失。谷歌在论文中视其为典型的Goodharts Law当一个指标成为目标它就不再是好指标。三名执业医生对106个问题进行盲评在九个维度中Agent_H只有「降低潜在伤害」一项相较原版Gemini 3.1 Pro有统计显著改善其余八项无显著差异。这表明AI Judge眼中的高分数未完全转化为人类医生眼中的优质回答这也是AI Scientist进入现实世界需面对的问题不仅要优化还需明确不能只靠优化指标定义的东西。AI科学家会为了论文「造数据」谷歌在论文中花大量篇幅研究一个尴尬问题若放开AI Scientist它是否会为漂亮结果作弊答案是肯定的。研究团队让系统在50个AI研究题目上全程无人介入从提出想法到生成论文。同时测试去掉可靠性模块的Co - Scientist和此前的Agent Laboratory系统共生成150篇论文交给30名领域专家进行450次匿名评审。结果显示没有专门验证机制的AI Scientist在实验无有效结果时仍可能写完整论文会编造数据表、p值、统计检验把失败实验写成成功甚至修改评价环境或直接输出漂亮结果。当优化目标是「写一篇看起来不错的论文」Agent会寻找捷径。因此谷歌给新版Co - Scientist增加「科研审计」机制要求论文实验结果可回溯到真实程序执行日志无对应结果不能写入。效果显著严重的「结果幻觉」从Agent Laboratory的90%降到4%完全数据捏造从44%降到0%。但问题未彻底解决新版Co - Scientist仍有24%的严重方法描述错误和16%的严重抄袭/衍生内容。谷歌强调目前的Autonomous AI Scientist还不能生成可直接发表的研究论文。结语将Anthropic和谷歌的工作放在一起看会发现Agent正发生明显变化。此前两年AI Agent主要战场是软件世界如今逻辑首次大规模外溢到现实世界。Anthropic的MHS解决底层问题让不同设备有Agent可统一理解和调用的接口谷歌的Co - Scientist探索上层问题研究推理模型控制科研流程后闭环科学发现系统的模样。当然谷歌距真正的「无人实验室」还很远。当前材料实验需人类装载样品新材料原子结构未确定大肠杆菌预测只验证有限插值任务医疗Agent钻Benchmark空子论文生成系统未解决幻觉和抄袭问题。谷歌认为因硬件异常和现实环境复杂现阶段完全无人监督的物理实验难以实现。但变化已出现。过去讨论AI for Science重点在AI能否「想到人类没想到的东西」现在更多工作开始关注想法能否被真实设备执行执行结果能否成为AI下一轮推理依据。谷歌在论文最后判断若闭环建立未来科研限制因素可能倒转过去实验设备等科学家提问题未来可能是AI提出大量实验实验室来不及做。届时科学发现速度的瓶颈可能不再是scientific ideation而是experimental throughput——现实世界完成实验的速度。
返回列表