AI 第一次自己做完物理实验:40 项量子测量,人类只插手 4 次
OpenAI 与 MIT EQuS 联合案例研究:GPT-5.6 Sol 装在 Codex 自主框架上打通实验室硬件,在一块从未测过的 6 比特超导芯片上跑完全套校准测量,40 项目标测量里人类只干预了 4 次。

综述
OpenAI 与 MIT 工程量子系统组(EQuS)联合发布了一份案例研究,名字起得很朴素:《超导量子比特的智能体校准》。但里面描述的事情不太朴素——AI 智能体端到端地自主跑完了一台量子计算机的测量与校准。
具体的人是 MIT 的博士研究生 Beatriz Yankelevich。她把 GPT-5.6 Sol 搭载在 Codex 的自主智能体框架上,干了一件此前没人在公开记录里干成的事:直接打通模型的 API 与实验室的硬件控制系统。经过几个月的迭代,研究团队把「实验上下文」喂给了它——实验装置细节、芯片设计图纸、特定测量技能包(模板代码、常见物理失效原因、成功与失败的图表样例),一样不少。
然后人类放开了手。测试对象是一块从未被测量过的 6 比特超导芯片,4 个固定频率量子比特、2 个可调频率量子比特,参数完全未知。从硬件控制软件到微波信号源再到数据采集卡,全部向 AI 开放。它自己要规划首轮脉冲的频率、功率和宽度;自己调用控制软件,向稀释制冷机深处发射微波序列;自己接收微弱的量子态反射信号,做数字化清洗、拟合与傅里叶变换;然后根据结果决定——是提取频率存档,还是当场调整测量边界、开启下一轮试错。
从识别量子比特的跃迁频率、标定控制与读取脉冲,到测定量子信息能留存多久的相干时间,全套标准测量流程由它自主跑通。在 40 项针对固定频率量子比特的目标测量中,人类研究员只干预了 4 次。

专业分析
一、这不是"自动化脚本",而是带物理直觉的闭环决策
必须先排除一个误读:这不是预先写死的自动化宏。传统实验自动化是把人已经想清楚的步骤固化成程序,遇到异常就停下来等人。而这次的智能体是在理解物理含义的基础上做分支决策。
报告里放出了一段思维链:面对一条有波动的阻尼正弦曲线,模型在内部盘算——「当前拟合残差偏大,可能是解调相位的参考基准漂移导致 I/Q 分量混合……我需要先执行相位解缠绕;如果残差仍未降到阈值以下,就把微波失谐量增加 5 MHz 重新扫描。」
这句话的分量在于:它先给出一个物理归因,再据此选择一个操作,而不是拿参数做盲搜。它完成的四件事构成了一个完整回路——自主推断参数、底层硬件调度、数据反刍与降噪、决策自适应迭代。信号漂亮就提频率入库当基准,数据不对劲就改测量边界重来。这种「理解—决策—执行—复盘」的闭环,恰恰是过去的脚本程序够不到的地方。
二、它撞上的是物理世界最脆的一层
要理解这件事为什么难,得看清量子比特校准为什么是实验物理的地狱难度。
超导量子比特被称为「人造原子」,靠超导约瑟夫森结构造出非线性离散能级。想让它们听话,得用精确到纳秒甚至皮秒的微波脉冲在能级间翻转量子态。但这群「人造原子」极其神经质:空间里微弱的电磁杂散信号、稀释制冷机几毫开尔文的温度漂移,都足以让它退相干,辛苦准备的量子信息瞬间塌成噪音。更麻烦的是参数漂移——芯片昨天测出的共振频率,今天可能已经走了。
然后是环环相扣的依赖链:先找到共振频率,才能校准拉比振荡定脉冲幅度;定了幅度,才谈得上用拉姆齐条纹修相位;修完相位,才轮到测能量弛豫时间和相位退相干时间。上一步的数据是下一步的绝对前置条件,前序有微小系统误差,后面全部报废。
而这一切都发生在一个人类碰不到的地方:芯片封装后沉进稀释制冷机的圆筒,温度降到毫开尔文级,比外太空还冷。人只能坐在室温的电脑前,把脉冲从同轴电缆打进去,再从反射信号里把答案抠出来。一次完整的芯片特性表征,过去往往需要一个训练有素的物理系研究生连续几天几夜守在仪器旁,做上千次手工测量与调整——量子物理学家把七成以上的时间耗在这种「调参螺丝钉」式的重复劳动上,这是圈内公开的秘密。
而这次,AI 是在这样一个环境里,自己把活干完了。
三、边界很清楚:信号一弱,它就笨了
官方报告没有回避失败面,这点反而值得尊重。当信号变得微弱、背景噪声压过来时,GPT-5.6 Sol 开始显得笨拙:在低信噪比边缘区域,它需要反复试探参数,耗时呈指数级上升;遇到芯片表现出的不可预知反常现象,它会陷入误判、无法准确定位原因,最终仍然要靠经验丰富的研究者手动介入。
OpenAI 自己写得很直白:当前的智能体能极其稳定地跑完定义明确的标准工作流,但在解读高度模糊、充满物理反常的结果时,顶级科学家的直觉依然无可替代。
这句话划出了这次突破的真实边界。它是「把科学家从例行公事里赎买出来」,而不是「让科学家失业」。前者已经足够改变一个实验室的生产关系,后者还早。

关联信息与影响
同一周里,OpenAI 还宣称在千禧年难题「纳维–斯托克斯方程」上取得突破,说他们证明了存在某些流体在有限时间内达到无限速度;据称为此调用了一万个智能体、跑了 88 小时、消耗 1300 亿 token。这条消息随即引来数学家 Tristan Buckmaster 的质疑,公开指责 OpenAI 抢发并试图把 Anthropic 研究员的署名排除在外;奥特曼的回应也算坦白:「我们尝试这个方向,是因为上周网上传 Anthropic 的模型解决了一个千禧年问题,我们好奇自己的模型能不能做到。」
把两条新闻放在一起看,图景很有意思:数学是纯虚拟世界的战场,AI 在那里的推进再快,也只是在符号空间里跑;而量子芯片校准是同时压着硬件、噪声、温度、时间和物理定律的真实战场——这里没有撤销键,信号不会因为你聪明就变干净。AI 这次跨过去的,正是这道「虚拟与物理世界之间的结界」。
这也解释了为什么两条新闻里,看起来更「不起眼」的这条可能更值钱:数学突破可以争论归属,物理实验跑通了就是跑通了。
未来展望
这项工作的意义可以分三层看。
短期,它会把一种新的实验组织形态带进实验室:人类专注顶层设计(方案、机制、全局规划),底层调参剥离给智能体;理论上还可以按岗位切分多个智能体——理论、测控、仿真各管一摊,并行作业。科研迭代的周期会从「周」被压到「小时」甚至「分钟」。
中期,「理论推演 → 仿真设计 → 物理硬件控制 → 数据拟合 → 迭代优化」这条超级闭环一旦在更多实验室复现,会催生真正的无人实验室:白天人类定方向,夜里 AI 值班跑测量——它不需要睡眠,也不会在第 800 次测量时手抖。
长期,前沿科学的核心壁垒可能会换一种形式:从「谁有更好的头脑和更多的手」变成「谁有更强的 AI 加上更完整的自动化实验平台」。这个转变对基础物理的意义,不亚于当年计算工具对理论物理的意义。
需要泼的冷水同样明确:这次是一块 6 比特芯片、一套标准测量流程、几十项测量任务。真正的科研突破往往发生在没人知道该测什么的时刻,而那种时刻目前还得靠人。
信号强度
- 实验物理研究者:最有价值的不是「AI 会不会取代我」,而是把自己手里那条最耗时、最标准化的测量链路整理出来——这类工作最容易被交接出去。
- 量子计算公司:芯片表征一直是量产路上的隐形成本,自动化校准的成熟度会直接决定比特数上量后的现金流压力。
- AI 实验室与 Agent 开发者:这次的关键工程不是模型本身,而是「把实验上下文和技能包喂进去」的那套 harness——真正的壁垒在领域知识的接口设计上。
- 在读研究生:短期内最直接的变化是,那些需要几天几夜守仪器的活儿可能不再属于你;留给人的部分会更挑剔,也更像科学。
GPT-5.6 Sol 打通实验室硬件控制链路,自主完成参数推断、微波脉冲调度、数据降噪拟合到自适应迭代的全流程,40 项测量人类仅插手 4 次;低信噪比区仍需人类直觉兜底,官方报告自己写明了边界。
本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。
原始报道:https://openai.com/index/codex-quantum-computing-experiments(新智元)


