Fly0这篇论文自己也无意中验证了这个悖论:当它把模型的职责压缩到只剩"语义定位"这一件事时,测试结果显示GPT-5、Gemini3 Pro、Claude 3.7 Sonnet、Qwen2.5-VL-32...