2026 年主流 AI Agent 怎么选?我把国内外 20 多款工具分成了 4 类(2026年AI的发明) ypxx.net

这篇文章最早的标题,是“国内外 12 款 AI Agent 怎么选”。

名单整理到一半,我把“12 款”删了。

不是因为产品不够,而是因为产品太多:如果坚持一个整齐的数字,就得把腾讯 QClaw、Marvis、飞书 aily、刚加强自动化能力的 Grok,以及整合了多个旧入口的千问办公排除在外。

标题整齐了,地图却少了几条重要的路。

所以,最终变成了“20 多款”。

标题要服从事实,不能让事实服从标题。

这也是 2026 年选择 AI Agent 最让人头疼的地方:产品越出越多,能力越来越像,名字还一直变。你可能听过 Codex、TRAE SOLO、MiniMax Agent、QoderWork、ClawdBot,却不知道它们现在是什么;也可能把腾讯 Marvis 和 MiniMax Mavis 当成同一款工具。

本文不做“谁绝对最强”的总榜,也不冒充把所有产品放在统一条件下亲测过。它是一份截至 2026 年 8 月 4 日的资料调研和选型地图:把国内外 20 多款代表产品或产品入口分成四类,帮第一次接触 Agent 的人找到自己的试用顺序。

别急着看产品,先判断它是不是 Agent

会聊天,不等于 Agent。

能联网搜索、写长文、生成一份 PPT,也未必是完整 Agent。

我更愿意用一条朴素的标准判断:它能不能接住一个目标,自己拆解步骤,调用工具,连续执行,遇到问题时调整,最后交付一个可以验收的结果。

结果可能是一份 Word、Excel、PPT、一个网页、一段经过测试的代码,也可能是完成一次浏览器操作、跨应用流程或定时任务。

普通聊天助手更像顾问,告诉你“应该怎么做”;Agent 更像执行同事,在授权范围内真的动手。

现实中的产品当然没有这么泾渭分明。有些工具只是某一部分能力 Agent 化,有些已经能完成长任务,却不能碰本地文件。所以下面的分类不是给产品贴死标签,而是按照它当前最主要的入口和价值,把复杂市场先画成四条路线。

第一类:桌面与本地办公型

如果资料已经在电脑里,你希望 AI 直接整理文件、使用浏览器、生成可编辑的办公成果,先看这一类。

WorkBuddy:从真实工作成果出发

WorkBuddy 是腾讯面向职场任务的一站式桌面智能体工作台。按照官方文档,它可以在授权范围内处理本地目录,制作或修改办公产物,通过连接器访问外部服务,并用 Skills 和自动化扩展工作流。

它覆盖报告整理、表格分析、PPT、网页、代码、资料检索和跨工具协作。对中国大陆普通职场用户,它的优势不在于宣称每个单项都第一,而在于网络、中文、本地文件、办公交付和连接器之间的综合摩擦相对较低。

但能碰本地文件,也意味着权限边界更重要。不要一上来开放整个硬盘,只给它完成当前任务所需的测试目录。

QClaw:本地助手与 OpenClaw 生态

QClaw 是腾讯产品矩阵里的本地 AI 助手,基于 OpenClaw 生态,并强调微信等远程入口。

它更像是在本地放一个可扩展助手,再通过熟悉的入口远程叫它干活。适合愿意研究本地能力、远程调用和生态扩展的人。

QClaw 和 WorkBuddy 同属腾讯体系,但不是同一产品:WorkBuddy 更偏职场成果交付和一站式工作台,QClaw 更偏本地助手与 OpenClaw 生态。

Marvis(马维斯):系统级个人助手

Marvis 的中文公开名称是“马维斯”。它走的是操作系统层级个人助手路线,重点在文件、系统、应用、浏览器和跨端控制。

如果说 WorkBuddy 更像一张智能办公桌,Marvis 更像试图成为电脑里的系统级管家。

这里必须单独提醒:腾讯 Marvis 和 MiniMax Mavis 是两款不同产品,也不是改名前后关系。两者英文只差一个字母 r,中文读音接近,特别容易被新手混淆。

ChatGPT Work、Codex 与 Claude Cowork

OpenAI 已在新的 ChatGPT 桌面应用中整合 Chat、Work 和 Codex。ChatGPT Work 面向长任务、浏览器、本地文件、插件和计划任务;Codex 仍然偏软件开发。

Codex 不是 GPT 的旧名,也不是 ChatGPT Work 的旧名。准确关系是:GPT 是模型家族,ChatGPT 是产品;Codex 最初是编程 Agent,后来其独立桌面应用并入新的 ChatGPT 桌面应用,但 Codex 作为开发视图继续存在。

Anthropic 的 Claude Cowork 则面向本地文件和知识工作,强调文件夹、浏览器、Skills、连接器以及执行中的审批。

这两条海外路线都值得研究,但对中国大陆用户,产品能力之外还有一层现实门槛:官方支持地区、账号、支付方式、身份验证和公司数据合规。技术上很强,不等于你能稳定、合规地使用。

TRAE Work、MiniMax Code 与有道龙虾

TRAE Work 的旧称是 TRAE SOLO。公开发布资料显示,它在 2026 年 6 月升级为 TRAE Work,并区分 Work 与 Code 模式,正在从编程环境扩展到更广的电脑任务。

MiniMax Code 是为 MiniMax M3 设计的独立 Agent 产品,偏软件开发、计算机操作和长程工程任务。MiniMax Code、MiniMax Mavis、M3 分别是产品、产品和模型,不要混成同一层。

LobsterAI 的中文名是“有道龙虾”。它是网易有道推出的开源桌面级 Agent,强调本地文件、浏览器、定时任务和即时通信远程入口。它也不是 OpenClaw 原项目,而是另一款独立产品。

桌面型 Agent 的共同优势,是离真实工作文件近;共同风险,也是离真实文件太近。

第二类:云端自主生产型

这类产品不一定深入接管你的电脑,但擅长在云端完成研究、分析、编码、网页、PPT或媒体内容等长任务。

Kimi Agent:云端研究与成品交付

Kimi Agent 提供浏览器、文件、终端和代码等工具,可用于研究、PPT、网站和数据分析,并交付多种文件或网页。

它适合希望低门槛获得成品,又暂时不需要 AI 深度控制本地系统的用户。需要注意的是,Kimi Agent 与后续产品入口应按官方最新说明区分,套餐和额度也要以使用当日页面为准。

MiniMax Mavis:原 MiniMax Agent

MiniMax Agent 升级后正式命名为 Mavis,名字来自“MiniMax as a Jarvis”。它强调 Agent Teams、长任务、记忆、技能和持续协作。

它更像在云端组织一支 AI 小队,让不同角色协同完成研究、制作、代码和复杂任务。

再次强调:MiniMax Mavis 不是腾讯 Marvis,也不是 MiniMax Code。

Manus、Genspark、Perplexity Computer

Manus 是通用云端 Agent 的代表,强调从任务规划到成品交付。

Genspark 同样走云端自主生产路线,在研究、网页和媒体类成果上有较强存在感。

Perplexity Computer 则从搜索和研究向可执行任务延伸,更适合高度依赖检索、引用和信息整合的用户。

这几款产品的信用点、套餐、价格和开放范围变化很快。试用时不要只看演示视频,还要记录:完成一次真实任务消耗多少额度,失败是否计费,最后能不能导出可继续编辑的成果。

腾讯元宝 Agent、百度搭子与 Grok Automations

腾讯元宝已经提供 Agent 化的文件交付入口,可以生成 PPT、Word、Excel、PDF 和 HTML。它的优势是入口低、在对话中就能产出文件,但不能因此把它直接等同于完整的桌面系统 Agent。

百度 DuMate 的中文名是“百度搭子”。公开资料显示,它把搜索、编码、研究、数据分析和应用创建放进统一入口。只记得中文名的用户,搜索时可以同时使用“百度搭子”和“DuMate”。

Grok 是需要谨慎描述的新变化。截至核验日,官方可直接确认的是 Grok Automations:可以安排定时工作、响应事件并发送通知。这说明 Grok 正从聊天助手向持续自动化 Agent 演进,但当前不宜把它宣传为已经成熟的全桌面办公 Agent。

第三类:生活服务与设备操作型

这一类的目标不是替你写一份更长的报告,而是直接完成手机、浏览器、购物、出行或设备上的动作。

千问 App:阿里生活服务入口

千问 App 的强项是阿里生态内的生活服务执行,包括外卖、购物、支付、旅行和本地生活。

如果你的目标是“帮我把事情办了”,而事情主要发生在阿里服务体系,千问 App 的路径通常比通用桌面 Agent 更短。

但千问 App 和千问办公不是同一入口:一个偏生活服务,一个偏办公生产力。

豆包任务模式与豆包手机助手

豆包的任务模式或专业版覆盖办公、多模态、浏览器、文件与自动化;豆包手机助手则进一步尝试在合作硬件上执行手机任务。

选择手机 Agent 时,模型聪不聪明只是一部分。更现实的问题是:你的手机是否支持,目标 App 能否可靠操作,付款、下单和账号设置有没有清晰的人工确认。

AutoGLM 与 AutoClaw(澳龙)

智谱 AutoGLM 走的是云手机、云电脑操作路线,核心是让 Agent 理解图形界面并执行步骤。

AutoClaw(澳龙)则是后续出现的本地 OpenClaw 封装产品。二者不是简单的改名关系,实际能力和开放范围仍在快速变化。

Marvis、QClaw 也会跨入设备和远程操作场景。分类的目的不是争论它们究竟属于哪一格,而是先确认你的任务入口:核心目标是系统控制和远程执行,就优先看这条路线;核心目标是 Word、Excel、PPT 等成果交付,就回到第一类比较。

第四类:企业协作与业务生态型

个人 Agent 解决“我怎么把一件事做完”;企业 Agent 还要回答:谁能看,谁能改,数据从哪里来,结果写回哪里,出了问题谁负责。

飞书 aily 与多维表格智能体

不能笼统地说“飞书就是一款 Agent”。更准确的说法是,飞书已经形成一套 Agent 体系。

飞书 aily 是智能体平台,体系中包括智能伙伴、aily 工作助手、Agent 团队、企业系统连接和企业安全底座。

飞书多维表格智能体则更贴近真实业务数据:它可以基于多维表格工作,继承高级权限,由记录新增、修改、删除、评论或定时任务触发,并共享给人员或群组。销售推进、项目巡检、经营分析、工单处理和合规预审,都是更典型的使用场景。

它的前提也很现实:企业已经把数据、权限和业务口径整理好。如果底层表格混乱,Agent 只会更快地放大混乱。

千问办公(QwenWork)

千问办公是阿里的一站式办公 Agent 平台。官方资料明确,它整合了 QoderWork、MuleRun 和悟空的核心能力。

所以,如果你以前听过这些名字,不要误以为它们与千问办公毫无关系。但“整合”也不等于所有旧入口会在同一天消失,实际使用仍应以官方最新说明为准。

Microsoft 365 Copilot

Microsoft 365 Copilot 深入 Word、Excel、PowerPoint、Outlook、Teams 和企业数据图谱。

对已经重度使用 Microsoft 365,并拥有管理员与合规体系的组织,它的价值不只是“会写一段文案”,而是在既有身份、权限、会议、邮件和文档体系里工作。

Gemini Spark

Gemini Spark 是 Google Workspace 方向的持续在线个人 Agent,适合 Gmail、Drive、Docs、Calendar 等 Google 生态用户,但首发开放范围较窄。

Gemini 普通应用能使用,不等于 Spark 一定开放。选择前要分别核对功能、地区、套餐和组织权限。

WorkBuddy 与企业连接器

WorkBuddy 也会跨入企业协作路线,因为连接器、Skills 和自动化决定了它不只处理本地文件,也能进入外部工作流。

它与飞书 aily、Microsoft 365 Copilot 的差异主要在入口:飞书和微软更像从既有组织生态向内生长,WorkBuddy 更像从个人工作台向外连接多个工具。哪种更合适,取决于你的公司数据主要沉淀在哪里。

这张“产品户口本”,建议先收藏

2026 年选 Agent,名称沿革本身就是选型信息。最容易混淆的是下面这些:

• ChatGPT Work ≠ Codex ≠ GPT。 GPT 是模型家族,ChatGPT 是产品,Work 是长任务 Agent,Codex 偏编程。Codex 应用并入新 ChatGPT 桌面应用,不等于 GPT 曾叫 Codex。

• 腾讯 Marvis(马维斯)≠ MiniMax Mavis。 两款不同产品,只是拼写和读音相近。

• MiniMax Mavis = 原 MiniMax Agent。 MiniMax Code 是另一款偏开发的 Agent,M3 是模型。

• TRAE Work = 原 TRAE SOLO。 当前包含 Work 与 Code 路线。

• 千问办公整合 QoderWork、MuleRun、悟空的核心能力。 千问 App 则是偏生活服务的另一个入口。

• 飞书 aily、智能伙伴、aily 工作助手、多维表格智能体是同一飞书 Agent 体系中的平台、入口和业务智能体,不是一次简单改名。

• 百度 DuMate = 百度搭子。 中英文名指向同一产品。

• LobsterAI = 有道龙虾。 它不是 OpenClaw 原项目。

• OpenClaw 是开源 Agent 生态底座,历史上曾使用 ClawdBot、MoltBot 等名称。厂商推出的“龙虾”产品不能自动等同于原项目。

• QClaw、WorkBuddy、Marvis、腾讯元宝 Agent都来自腾讯体系,但分别偏本地助手、职场工作台、系统级助手和对话内文件交付。

为什么这些关系值得花篇幅解释?

因为你搜索旧教程、判断一篇测评是否过时、寻找正确下载和付费入口时,名字会直接决定你找没找对产品。

真正选型,问这 10 个问题

1. 你要建议,还是最终交付?

只想问思路,聊天助手已经够用。要 Word、Excel、PPT、网页、代码或实际操作结果,再重点看 Agent 的交付能力。

2. 任务发生在哪里?

本地文件多,看桌面办公型;研究和内容生产多,看云端生产型;购物、出行和手机操作多,看生活设备型;业务数据在飞书或 Microsoft 365,看企业生态型。

3. 能不能稳定访问和注册?

对中国大陆用户,网络环境、官方支持地区、账号风控和身份验证不是附加项,而是产品能力的一部分。

4. 能不能顺利付费?

除了标价,还要看人民币或国际支付、企业采购、发票、信用点,以及失败任务是否计费。

5. 能不能接触你的真实资料?

只会在对话框里工作,和能读取测试目录、浏览器、邮箱、知识库、业务表格,是完全不同的能力半径。

6. 结果能不能继续编辑?

图片式 PPT 和结构可编辑的 PPT,不是同一种交付。表格有没有公式、网页能不能运行、代码有没有测试,都需要实际验收。

7. 过程能不能看见和打断?

可靠的 Agent 应该告诉你它准备做什么、正在做什么,并在删除、发送、发布、付款等高风险动作前停下来。

8. 出错后会不会调整?

长任务一定会遇到网页变化、权限不足、文件格式异常和工具失败。只会机械重复同一步,不算可靠执行。

9. 成本能不能预测?

不要只看月费。还要记录一次任务用了多少额度、重试几次、人工返工多久。

10. 数据和权限是否符合你的边界?

个人资料、公司机密、客户数据和财务数据的规则不同。企业选型尤其要看身份、权限继承、审计和管理员控制。

别凭感觉试,用同一个 30 分钟任务

第一次用 Agent,不要让它“帮我运营一家公司”。

选一个 30 分钟内能验收的小任务。例如:

把一份会议纪要和一张数据表整理成三页汇报材料,输出可编辑 PPT,并列出数据异常和待确认事项。

然后用同一个任务试两款产品,只记录五件事:

1. 任务是否完成;

2. 成果能否直接使用;

3. 人工返工用了多久;

4. 消耗多少额度或信用点;

5. 是否出现需要你阻止的风险动作。

涉及本地文件时,先复制到测试目录;连接邮箱、网盘、飞书或企业系统时,只给完成当前任务所需的最小权限。

这比看十场演示更接近真实选择。

如果国内外各推荐一款,我会这样选

前面讲了很多产品,但推荐不能只停在“各有优点”。如果让我分别给出一个起点,我的选择是:

国内优先试 WorkBuddy;海外优先试 ChatGPT 桌面应用。

国内:为什么从 WorkBuddy 开始

这不是说 WorkBuddy 所有单项能力都世界第一。我的判断是:对中国大陆普通职场用户,它很适合作为国内第一站。

一是试用摩擦相对低。网络、中文界面和本地使用路径更贴近中国大陆用户。

二是工作面比较完整。本地文件、办公产物、网页、代码、连接器、Skills 和自动化可以放在一个工作台里理解,不用一开始就拼装多个工具。

三是容易用真实小任务验收。拿测试目录中的一份文档或表格开始,看它能否交付可编辑成果,而不是只判断回答“像不像懂了”。

四是保留了扩展空间。等你知道自己真正需要的是生活服务、飞书业务流程、本地 OpenClaw 扩展还是手机操作,再转向对应路线,选择会更准确。

国外:为什么推荐 ChatGPT,也要把 Codex 说出来

海外产品里,我更建议把 ChatGPT 桌面应用作为第一站。新的桌面应用把 Chat、Work 和 Codex 放进同一个入口:Work 负责综合长任务,Codex 继续负责大家更熟悉的软件开发和编程 Agent 场景。

很多人先认识的是 Codex。现在看到“ChatGPT 桌面应用”或“ChatGPT Work”,可能反而不知道自己熟悉的 Codex 已经整合进来了。所以这篇文章必须把两个名字并列写清:如果你以前用过或听过 Codex,现在仍然可以从 ChatGPT 桌面应用进入 Codex;它没有变成 GPT 的旧名,也没有消失,只是与 Chat、Work 整合到了同一个桌面应用中。

我推荐它的原因,是同一个入口同时覆盖对话、综合知识工作和编程任务,海外生态与工具扩展也更完整。对同时写作、研究、处理文件和开发的人,切换成本更低。

但这项推荐有明确前提:你的所在地区、账号、支付方式和组织数据规则符合 OpenAI 官方要求。对中国大陆用户,这些门槛必须先核对;本文不提供绕过方法。

这两项推荐都不是唯一答案。数据和协作都在飞书,飞书 aily 与多维表格智能体可能更顺;公司重度使用 Microsoft 365,Copilot 的组织生态更强;偏爱长知识工作,可以比较 Claude Cowork;主要需求是阿里生活服务,千问 App 的路径更短;愿意折腾本地开源生态,可以看 QClaw、有道龙虾或 OpenClaw 路线。

所以,我的最终结论是:国内看综合使用摩擦,先试 WorkBuddy;海外看综合能力与成熟入口,先试整合了 Work 和 Codex 的 ChatGPT 桌面应用。

Agent 扩大执行半径,也会扩大错误半径

当 AI 只能聊天时,错误通常停在一段文字里。

当 Agent 能读文件、改表格、发消息、操作浏览器和调用业务系统时,一个错误可能变成覆盖文件、误发内容、错误下单、权限泄露或连续扣费。

无论使用哪一款,都建议守住几条底线:

• 本地文件先复制,再让 Agent 操作;

• 第一次只授权测试目录;

• 邮箱、网盘、飞书和业务系统使用最小权限;

• 删除、发送、发布、付款、转账、下单和账号设置必须人工确认;

• 网页、邮件和文档里可能藏有针对 Agent 的提示注入,不要让外部内容自动获得更高权限;

• 价格、库存、政策、新闻和财务数据必须回到原始来源复核;

• 重要成果由人做最后验收。

回到开头那个问题。

为什么不做一张整齐的“12 款总榜”?

因为普通人真正需要的,不是一个好看的数字,而是一张不会为了版面整齐故意删路的地图。

第一款 Agent 的价值,也不是让你见识最炫的演示。

而是让你完成第一个可验收、可复查、可继续使用的任务。

从一个测试目录、一份会议纪要、一张表格开始。先试 WorkBuddy,再选一款同类产品,用同一个任务比较。

最后只问一句:哪一款用更少的返工,交付了更可用的结果?

这就是你的答案。

我是张渔歌,1999年生,国企辞职青年,AI Agent 探索者。这里不吹概念,只记录一个普通人如何从零理解、使用并真正驾驭 AI Agent。

本文信息核验截至 2026 年 8 月 4 日,主要参考 WorkBuddy、OpenAI、Anthropic、MiniMax、阿里巴巴、飞书、Kimi、Microsoft、Google、腾讯元宝、有道龙虾和 Grok 等官方产品页、帮助文档及公开发布资料。产品名称、Beta 范围、官方支持地区、套餐、免费额度、信用点、连接器和硬件兼容变化很快,请以使用当日官方页面为准。 本文是资料调研与选型指南,不是所有产品在统一条件下的第一手亲测排名,也不提供绕过官方地区或网络限制的方法。