当所有模态在模型底层真正打通之后,模型在面对复杂图文融合、多主体一致性、连续分镜叙事等复杂任务时,内部要做的跨模态对齐工作量就小了很多,因为它在一个坐标系里就能把事办了。 这也恰好是世界模型所需要的基础能力…...