美团上线LongCat-2.5-Preview:1.6万亿参数押注长程任务与多模态能力(美团上线堂食周末活动) ypxx.net

美团把LongCat系列的最新版本推到台前,这次上线的是LongCat-2.5-Preview,参数规模标到1.6万亿。官方给出的定位很明确,主攻长程任务与多模态能力。对一家以外卖、到店与即时零售为核心业务的平台来说,把模型做到这个体量本身就是一个信号:它要的不只是聊天或写代码,而是能够连续处理一长串动作、中途不丢上下文的智能体底座。

1.6万亿参数听上去惊人,但真正值得注意的是它放在哪里用。长程任务指的是模型需要在较长的时间跨度内保持目标一致,先理解需求、再拆解步骤、调用工具、检查中间结果,最后交付。这类任务对记忆与规划的要求远高于单轮问答,参数规模带来的收益也更直接。多模态则是另一个维度,图像、语音与文本的同时理解,让模型可以直接处理现实业务中大量非结构化信息。

从业务角度看,美团的算盘并不难理解。外卖与本地生活的服务链条极长,一个用户请求背后涉及商家、配送、库存、路线与售后,任何一个环节都需要判断。如果模型只能做单轮回答,就很难真正嵌入流程,只有把任务拆解与工具调用做扎实,才能让智能体在真实场景里替代一部分人工协调工作。这也是为什么长程能力被放在宣传的第一位。

当然,参数规模从来不是免费的。1.6万亿参数的模型在推理时要占用大量显存,服务成本远高于中小模型。对平台而言,是否划算取决于它能否在高价值环节替代人力,或者带来额外的转化。这也意味着短期内部署范围很可能是有限的,先在少数场景跑通再逐步扩大,是更现实的路线。预览版的发布节奏本身也说明了这一点。

多模态能力的加入,则打开了另一种可能。本地生活平台每天产生海量的图片、语音与视频数据,从菜品照片到客服录音,过去这些内容的处理高度依赖人工规则或小模型。统一的多模态底座可以把这些流程收敛到一套系统里,减少维护成本。不过多模态同样带来对齐与幻觉方面的挑战,在涉及交易与评价的场景里,错误的代价会被放大。

把这件事放在行业背景下看,国内大厂近两年在模型上的投入已经从参数竞赛转向效率与场景。长程任务之所以被反复强调,是因为它是智能体能否真正落地的关键门槛。模型可以写一首诗,但能否连续完成二十步操作并在中途自我纠错,才是企业客户真正关心的能力。美团把这一项写进定位,等于承认了自己的主战场在流程而非内容创作。

对观察者来说,更有价值的判断标准是后续的实际调用数据,而不是发布时的参数。预览版意味着能力仍在快速迭代,也意味着官方还需要真实反馈来校准方向。接下来的问题在于,这套模型能否在成本可控的前提下稳定跑完长链条任务。如果答案成立,本地生活行业的服务组织方式很可能会被重新设计一遍。