为了让这一机制生效,团队还设计了混合Transformer架构,将语义推理、视觉生成与动作预测模块既解耦又协同,并通过自动化流程将原始数据转化为带有推理标签的训练资料。VLA-Perf的开源,为学术界和产业界…...