科研基础设施

Anthropic预览MHS,Agent接入物理设备

MHS仍是研究预览,但把Claude控制真实设备的接口公开给首批伙伴。

2026年8月28日 · 周五深度报告高置信重要度 5/5

本文要点

  • Claude从软件工具调用推进到实验室和制造设备控制。
  • MHS把设备描述、发现和控制统一到模型可读取接口。
  • 早期伙伴给出量子、显微、药物实验和qPCR案例。

阅读辅助

先看数字、证据和来源,再读正文。

数小时或数分钟集成时间目标
6个早期伙伴案例
4 条 Claim Audit

MHS目前是研究预览,不是已经开源的完整标准。

4 个时间点

2024-11-25 · Anthropic开源MCP,把AI应用连接外部数据源和工具作为标准化问题。

6 个来源5 个非 X 来源

Anthropic在2026年8月27日开放Model Hardware Standard,也就是MHS的研究预览。这次更新把Claude的工具接口从软件插件推进到真实物理设备,让AI agent用一套共享规格去发现、读取和操作实验室及先进制造设备。

这次预览先把三件事摆上台面。MHS目前是research preview,只给首批科学研究实验室和先进制造伙伴使用;Anthropic称它可让显微镜、移液工作站、机械臂等多类设备并行协作,把通常需要数周或数月的硬件集成压到数小时或数分钟;该标准被设计为model-agnostic,可通过MCP、命令行接口和代码文件或API被不同agent harness调用。Anthropic同时写明ahead of making the standard open source,开源仍在后续。

物理世界让这套标准必须带着刹车上路。早期案例和数字主要来自Anthropic官方与伙伴披露,外部复现实验还没有形成公开样本。官方也承认,LLM通过文本和图像学习物理世界,空间与物理推理仍有局限,需要专家监督。MHS今天的新闻价值在于标准化方向和研究预览启动,而不是证明“无人实验室”已经成熟。

对读者最直接的影响,是agent工作流的边界被推到物理层。软件开发者要理解的不再只是tool calling,而是设备发现、驱动封装、权限审批、故障恢复和审计日志。科研机构与自动化厂商要评估的是:如果AI能稳定控制硬件,实验设计、夜间无人运行和多设备协作的成本结构会怎样改变。

从MCP到MHS:接口对象换成了设备

MHS的语境离不开MCP。Anthropic在2024年11月25日发布Model Context Protocol时,把MCP定义为连接AI应用与外部数据源、工具和工作流的开放标准。MCP官方文档后来用“USB-C port for AI applications”解释它的角色:应用只要接入一个标准协议,就能连接文件、数据库、搜索、日历、Figma、Blender等外部系统。

MHS沿着这条路线前进,但对象从软件系统变成了物理设备。物理世界的复杂度更高:设备有厂商私有接口,有不同通信协议,有安全上下限,有校准状态,有样本损坏、机械碰撞和激光功率等不可撤销风险。一个数据库查询失败可以重试,一次移液或激光调参失败可能直接破坏样本或设备。

Anthropic给出的机制是“标准化driver”。MHS driver在操作系统和硬件设备之间做翻译,使用一组简单primitives,例如read用于“读取温度”,write用于“设置温度”。设备还会提供reference file,描述它能测量什么、能调整什么、会执行哪些安全限制。agent拿到这些信息后,才知道设备存在、设备能力和可操作边界。

控制层则有三条路径:MCP、CLI,以及代码文件或API。Anthropic称这些机制可以协同,让多个设备通过一行代码被编排。这个表述需要保留边界:它说明MHS希望降低编排复杂度,不代表任意设备即插即用,也不代表任意agent都能在没有专家约束的情况下接管实验室。

层级Anthropic披露的做法对应风险
设备接入MHS driver把设备接口翻译成统一primitives厂商协议差异和驱动质量会影响稳定性
设备发现reference file说明测量项、可调参数和安全限制描述不完整会误导agent决策
控制路径MCP、CLI、代码文件或API共同支持编排权限、日志和审批需要细化
适用范围当前最适合实验室和制造设备板卡、相机和更泛化机器人仍是后续扩展
发布状态research preview ahead of open source标准治理和兼容测试尚未公开

六个案例说明了价值,也暴露了边界

Anthropic列出6个早期伙伴案例:Genentech、University of Washington Baker and Pinglay labs、Carnegie Mellon University、HHMI Janelia Research Campus、QuEra Computing和Tetsuwan Scientific。它们共同指向一个问题:实验室自动化并不是缺一个大模型就能解决,瓶颈经常在设备之间的互操作、实时状态读取和异常处理。

Genentech案例是蛋白浓度测定的BCA protein assay proof of concept。官方描述里,MHS让agent协调液体处理器、机械臂和读板仪。值得注意的是错误处理部分:当混合时出现气泡导致runtime errors,Claude的调试需要研究人员引导它认识到这是物理失败,不是软件bug,只能通过正确实验步骤缓解。这是MHS的典型价值,也是它的安全警告。

University of Washington的Baker和Pinglay实验室案例更接近高通量生物实验工作流。官方称,研究者用MHS搭了远程监控仪器的dashboard,并让AI agent监督qPCR流程。另一个细节是,实验室使用基于LeRobot的开源机械臂,经MHS instrumented后协调多个仪器之间的样本装载。这里的关键不是某一次交接,而是把“人必须守在bench旁边”的连续操作拆成可被agent监督的步骤。

Carnegie Mellon University给出的数字更明确:研究者用MHS运行serial dilution dose-response实验,速度约为此前的3倍。该系统同时编排液体处理器、读板仪、机械臂和监控摄像头,设备分布在3台电脑上,接口彼此不兼容。CMU案例后续还写到,希望把MHS扩展到qPCR和显微镜,并集成MCP-based agents with the MHS fleet。这里“hope to reduce the integration time per instrument”只能写成计划和愿望,不能写成已经实现。

HHMI Janelia的重点是显微系统。Anthropic披露,Janelia研究者用MHS加速一组显微相关项目,其中一个场景涉及由7个不同厂商程序控制的系统,包括激光、motorized focusers和专用相机。MHS的作用,是让agent根据用户目标选择成像参数和分析流程,同时通过设备级安全限制避免例如过高激光功率导致荧光分子漂白。这个案例说明,MHS不只是“能控制设备”,还要把设备安全边界显式写给agent。

QuEra案例最有量化信息。QuEra做中性原子量子计算,激光锁定状态会影响原子控制。Anthropic和QuEra描述称,团队把“写一个独立Python脚本重新锁定激光”的目标和接口定义交给Claude。后续盲测在700次随机诱发扰动中恢复正确lock 695次,成功率为99.3%。最困难扰动用时10到14秒,而人类在bench旁处理通常需要5到10分钟。QuEra还称,在363次实验和16个无人值守小时里,Claude把残余误差从15.7mV调到1.55mV,约为此前十分之一。

这些数字很强,但不应外推过头。它们说明MHS在特定设备、特定专家定义和特定任务下可以把agent能力转成物理操作收益。它们不能证明MHS已经适用于所有实验室设备,更不能说明语言模型已经拥有完整物理直觉。Anthropic自己在文章中写得很清楚:these early results are encouraging, but we have more work to do on the standard before we open-source it。

英文状态词要逐句保留

这篇公告最容易写错的不是数字,而是状态。Anthropic用了很多未来时、预览期和范围限定词。中文稿需要把这些词保留下来,否则会把一个正在验证的标准写成已经成熟的产品。

英文原文口径中文表述不能写成
research preview研究预览正式发布或全面开放
ahead of making the standard open source在开源该标准之前已经开源
will support MHS through Strands RobotsAWS将通过Strands Robots支持MHSAWS已经全面集成
will use the research preview将利用研究预览构建安全评估已完成安全评估
hope to expand the standard希望扩展标准覆盖范围已扩展到全部设备
currently best covers lab and manufacturing equipment当前最适合实验室和制造设备已覆盖所有硬件

AWS、Hugging Face和Raspberry Pi这些伙伴也要按原文时态处理。Anthropic说AWS will support MHS through Strands Robots,并会在研究预览期间向参与者提供private, pre-release版本的Strands Robots package。Hugging Face是adding MHS support in LeRobot,Raspberry Pi是enabling MHS integration across a number of products following successful tests。它们是伙伴计划和早期适配,不是已经面向所有开发者稳定发布的生产能力。

MCP工具规范提供了另一层背景。规范说,MCP tools are model-controlled,模型可基于上下文自动发现和调用工具;同时安全建议是始终应该有人能拒绝工具调用,应用应清楚展示哪些工具暴露给AI、调用时有视觉提示,并对操作提供确认提示。把这套原则迁移到MHS,要求会更高,因为工具调用的对象从软件API变成了液体、激光、机械臂、相机和样本。

为什么这条新闻排在今天前列

过去一年,agent叙事大多停在浏览器、IDE、文档、代码仓库和SaaS后台。MCP把数据源和工具接入标准化之后,软件世界的agent生态迅速扩张。MHS把同一套逻辑推向硬件,意味着模型公司开始处理更难的一层接口:可编程设备如何向agent声明能力,如何让agent知道限制,如何记录和约束每次动作。

科研自动化本来就是一个长期存在的需求。实验室里大量时间消耗在样本准备、仪器切换、参数调整、异常排查和夜间无人运行上。自动化设备并不新,问题在于它们常常各自为政。Anthropic文章里反复出现“bespoke integrations”和“no standardized way”,说明MHS瞄准的不是单个设备能力,而是设备之间没有统一语言。

先进制造也有类似结构。生产设备和检测设备可以被软件控制,但每个产线都有定制系统、权限边界和安全要求。若MHS只是一套demo协议,它很快会被厂商私有接口吞没。若它能形成稳定驱动、测试套件、设备描述格式和审计规范,它才可能成为AI agent进入真实工业环境的通用入口。

这也解释了为什么Anthropic先做research preview,而不是直接把MHS开源。物理世界的失败成本更高,安全评估不只是prompt注入或越权访问,还包括设备损坏、样本污染、实验误判、人员安全和合规责任。Anthropic说会develop a physical safety roadmap,以加强safeguards policy and enforcement coverage against the risk of misuse。这句话应该被读成“路线图仍在开发中”,不是“安全问题已经解决”。

早报观点

早报判断是,MHS最重要的信号在于Anthropic正在把agent能力产品化到“可审计的物理动作”。软件agent的核心接口是文件、数据库和网页;物理agent的核心接口则是设备状态、动作权限和安全边界。谁能把这三件事标准化,谁就能影响实验室自动化和先进制造里的AI采用路径。

这条路线对Anthropic也很顺手。MCP已经让它在软件工具调用生态里拿到标准话语权,MHS则把同样的策略延伸到硬件层。它不要求所有设备都为Claude定制接口,而是希望设备以agent能理解的方式描述自己。这样一来,模型能力、协议生态、硬件厂商和安全策略会被绑在一起,形成比单个应用更难替代的基础设施位置。

但这条路的风险也比普通agent更硬。模型可以在代码里犯错再回滚,物理设备的错误不一定可逆。MHS能否成立,取决于它是否把“人类可拒绝、设备可限幅、动作可追溯、失败可停机”做成标准本身,而不是放在每个实验室自己的手册里。Anthropic现在把开源放在研究预览和安全评估之后,是一个必要的顺序。

对科研机构而言,MHS值得试,但不应该被当作采购口号。真正要问的是:现有设备是否有可编程接口,厂商是否愿意维护驱动,实验记录能否进入审计系统,高风险步骤是否需要人工确认。回答这些问题之前,MHS是一个有方向感的标准预览;回答之后,它才可能变成能改变实验室日常的基础设施。

接下来要看什么

规格公开是第一道门槛。Anthropic需要说明MHS的设备reference file长什么样,read和write primitives如何扩展,安全限制由谁定义,设备能力如何被agent发现,版本兼容和认证测试怎么做。没有这些细节,外部开发者很难判断它是开放标准,还是Anthropic生态里的集成方案。

安全评估要覆盖真实设备的失败方式。MHS至少需要处理权限授予、动作确认、异常停止、日志审计、设备不可达、传感器误读和危险参数写入。MCP工具规范已经强调human in the loop和工具暴露透明度;MHS需要把这些原则转成物理设备可执行的策略。

伙伴实现会决定它是否超出Anthropic公告。AWS的Strands Robots、Hugging Face的LeRobot和Raspberry Pi产品如果能给出公开驱动、示例和测试结果,MHS就会从单家公司倡议变成多方生态。尤其是LeRobot这类硬件无关、Python-native的机器人库,天然适合作为社区验证层。

复现实验则负责校准收益。QuEra的99.3%、CMU的约3倍、HHMI的7个厂商程序整合,都是很好的早期样本。下一步需要看其他实验室能否在不同设备、不同模型和不同安全策略下复现同类收益。MHS今天已经给出清晰方向;它能否成为标准,要靠接下来几个月的开放程度、故障记录和第三方实现来证明。