仿真会暂停等模型回复,这样的机器人成绩还能代表什么(出现仿真错误的原因) ypxx.net

可以代表模型在排除当前延迟后的控制能力上界,不能直接代表今天的在线系统能够实时运行。

Anthropic 在 Em 的部分直接控制与代码控制仿真中,让物理时钟在模型生成动作时暂停。原因很实际:机器人低层控制循环远快于 API 调用。Go2 约需 83 Hz,意味着每个控制周期约 12 毫秒;研究中的无推理模型调用约 0.2 至 0.4 Hz,通常数秒才返回一次,差距接近两个数量级。

如果仿真不停,模型会因为来不及发下一条命令而倒下。那种结果主要测网络与推理速度,难以判断模型给出的动作是否合理。暂停则把时间因素暂时拿掉,观察“假设未来推理更快,它有没有控制逻辑”。

两种测试回答不同问题

暂停时钟的能力测试,适合比较动作质量、控制器代码、策略选择和模型代际变化。它把模型响应视为瞬时,不承诺现实延迟。

持续时钟的系统测试,才包含 API 往返、排队、图像上传、推理、动作解析和设备执行。它回答当前部署能否在截止时间内形成闭环。

两种成绩应并列:

第三种容易被混淆。模型编写 Python 控制器后,代码可以在本地高频运行,不必每个物理周期调用模型。成绩较好,说明程序化接口适合该任务,不等于 API 延迟问题已经解决。

延迟表要按动作截止时间来写

官方没有进行正式延迟研究,但附录提供了运行日志范围:无推理的纯文本回合大约 2 至 8 秒,带一两张图通常 5 至 15 秒;Opus 4.6、4.7 高推理常见 15 至 60 秒,长尾达到 60 至 180 秒,超高推理平均约再翻倍。

这些数字受提供方、负载、图像和预算影响,不能当 SLA。它们足以说明,低层平衡环路不适合等待远程语言模型。架构应按截止时间分工:

  • 关节与平衡:毫秒级,本地确定性控制器
  • 速度和短轨迹:设备或边缘预训练策略
  • 目标选择与重规划:秒级语言模型
  • 离线分析与策略生成:可接受更长推理

每个动作都要带生成时间和过期时间。旧动作晚到后直接丢弃,不能排队补发到已经改变的机器人状态。

从仿真到现场要补四组试验

第一组是延迟阶梯。保持模型输出不变,人为加入不同响应时间,观察哪个点开始失稳。这样能找到当前控制器的截止时间,而不是只记平均 API 延迟。

第二组是抖动与长尾。固定平均延迟,却让少数请求明显变慢。物理系统可能对偶发长尾比对稳定慢速更敏感。记录最长无更新时间、恢复动作和是否触发安全状态。

第三组是断网与过期。中断模型服务,确认低层策略继续维持安全姿态、停止或降落。服务恢复后要重新读取当前状态,不能从断网前的计划继续。

第四组是仿真现实差。相同控制器进入真实设备后,比较传感器频率、执行误差、摩擦、反射和通信。官方真实 Go2 试验出现将玻璃门倒影当目标、办公室绕圈全部失败等情况,说明现实会带回仿真中没有充分覆盖的视觉与空间问题。

第五组是负载并发。单台机器人空闲时的调用延迟,可能与多设备同时上传图像时完全不同。让一台、五台和计划峰值数量分别运行,观察排队、超时和降级。控制服务要为实时性较高的任务保留资源,不能让一条离线长推理占满所有执行请求。

第六组是时钟漂移。图像、机器人状态和模型动作若来自不同机器,时间戳偏差会让系统把旧画面配给新状态。测试中主动制造小幅时钟偏移,确认对齐层能拒绝过期组合。否则,平均网络延迟达标,动作仍可能基于错误时刻。

现场还要区分冷启动与稳态。模型连接首次建立、容器扩容、策略加载和摄像头预热会产生额外延迟。如果机器人在任务开始后立即等待第一条动作,冷启动长尾可能比稳态均值更危险。测试应覆盖首次任务、空闲一段时间后的唤醒,以及故障切换到备用服务。

对允许缓存的高层计划,要注明缓存失效条件。路线可以在短时间复用,抓取动作却可能因物体被移动而立刻过期。缓存不能按接口统一设置固定分钟数,应由状态变化触发。否则降低调用延迟的优化,会把旧世界状态带入新动作。

报告延迟时,还应把失败请求计入分布。若只统计成功返回,超时和断线会被排除,P95 看起来很漂亮,机器人却频繁进入等待。将超时按截止时间上限或单独比例展示,并记录降级是否成功,才能对应现场可用性。

动作解析时间也不应遗漏。模型返回一段文本,系统还要校验格式、转换坐标、做约束检查并发送给设备。若解析失败后自动重问模型,总时延会翻倍。分别统计首答可执行率和重试耗时,比只看 API 返回更接近控制链。

另外要测计划取消。操作者改变目标或按下停止后,队列中的模型回复、缓存路线和策略动作都应作废。取消消息与普通动作若走同一拥堵队列,急停可能被延迟;安全停止应走独立通道。

测试记录可写成:

  • 任务控制频率与动作截止时间
  • 模型响应 P50 / P95 / 最大值
  • 图像采集、编码、网络、推理、解析各段耗时
  • 超时动作的丢弃或降级规则
  • 最长断网、机器人安全状态与恢复步骤
  • 仿真暂停成绩、实时仿真成绩、真机成绩

只有总延迟,没有分段,就无法判断优化网络、减少图像、降低推理预算或更换本地控制器哪个更有效。

什么时候暂停设置仍然有研究价值

如果目标是比较模型是否会写控制器、能否根据观察纠错,暂停能防止所有模型因同一个现实速度限制同时得零分。它相当于一个上界实验,也适合观察未来推理加速后可能出现的能力。

但发布结果时要把条件放在主表或首段,不能藏在附录。尤其不能将暂停仿真中的直接控制,与本地预训练策略的实时控制混在一个综合分里,再说某模型已可实时驾驶。

机械臂与四足也不能套同一判断。官方指出,固定底座机械臂没有移动机器人那样严格的实时平衡约束,因此机械臂操作时没有同样暂停仿真。任务的物理时限决定架构,不能因为都叫机器人就统一处理。

暂停等待模型回复,不会让实验失效。它只是把研究问题从“当前系统能否实时跑”改成“排除延迟后,模型决策是否有用”。将这个上界与实时、断网和真机试验并列,读者才能知道能力卡在模型判断、控制接口,还是时间预算。

官方来源:Anthropic,《Claude plays robotics》,2026 年 7 月 9 日。