Artificial Intelligence September 17, 2026 1 min

IDC 首发Xwork通用Agent 实测:常规任务基本能打,复杂任务仍需谨慎

2026年,通用Agent成为AI市场最受关注的方向之一。OpenClaw成为现象级产品,海外有Anthropic Cowork、ChatGPT Work等,国内则有WorkBuddy、豆包工作、百度搭子、千问办公等产品,头部厂商纷纷整合产品线,把资源集中到通用Agent上,市场群雄逐鹿。

热度背后是AI应用范式的变革。与去年以Workflow为主的智能体相比,基于Harness架构的通用Agent使用门槛更低、处理复杂任务能力更强,也更容易被普通用户采用。

但市场上的通用Agent究竟能完成多少任务、不同产品各有什么优势、企业又该如何选型,目前还缺少基于统一任务、统一模型和统一测试条件的公开横向实测。

IDC今年启动系统研究,综合企业问卷、用户访谈、产品实测和厂商交流,对主流产品进行深度评测,帮助企业解决选型难题,也为厂商提供市场视角。

一、IDC如何定义“通用Agent”?

IDC将可独立提供服务的智能体分为通用Agent和垂直Agent两类:

  • 通用Agent不限定特定场景或固定任务,目前主要用于企业办公,包括信息检索与研究、文档生成与处理、数据处理与分析、网页与应用生成、沟通协作和日常事务管理,还可加载Skill、通过工具连接企业业务系统完成更多场景更专业的任务;
  • 垂直Agent则预设应用场景,多选择垂直专有模型或接入专业知识库,并配套专用工具和模板,完成专业任务。

Agent Harness是当前这类产品的核心框架,其负责组织上下文、调度工具与Skill、管理任务状态、控制执行环境,完成任务循环。不同产品执行同一任务,其步骤规则、循环处理的差别很大。在同一模型的统一评测下,产品差异很大程度上来自Harness工程能力。

二、企业级应用现状:普遍关注,但当前尚未规模应用

IDC对中国企业用户调研(n=200)显示,早在今年4月,已有合计48.5%的企业开始评估、试点或使用通用Agent。

从分行业看,互联网企业比例最高(83.3%),金融63.3%,电信、能源和媒体分别为55.0%、50.0%和50.0%。IDC在Q3的用户访谈显示,企业目前主要在日常办公场景试用,业务应用仍在建设;虽然尚未规模化落地,但几乎所有受访企业都高度关注,并将其视为未来企业级智能体建设的重要方向。

企业对通用Agent的要求可概括为“好不好用、好不好管”。

  • “好不好用”: 看任务完成效果、执行效率和交互体验,对应任务表现、成本效率、交互体验、多智能体编排、记忆与工作空间等评估维度;
  • “好不好管”: 看能否接入企业系统、安全可控、运行可追踪,对应可观测、安全可控、工具与技能、生态与开放性四个维度。

IDC的调研数据与框架基本一致:53.6%的企业把跨系统完成端到端任务列为评估通过Agent的首要驱动因素。其余为复杂任务自动化、数字员工、统一入口等能力;另一个问题中,52.0%的企业认为Agent规模落地的关键在于ROI的量化问题,使成本治理和效果观测成为选型重点。

在使用场景上,96.9%的企业用于办公自动化,流程自动化、智能客服(均80.8%)、知识管理与企业搜索(77.7%)、数据分析与商业智能(75.6%)紧随其后。

IDC据此设计近百道测试任务的Benchmark,覆盖邮件、日程、会议纪要、企业知识检索、财报分析、表格清洗、文档与PPT生成、视频生成、CRM与审批等真实场景,按复杂度分为常规任务(58.1%)和复杂任务(41.9%)。

三、好不好用:常规任务基本能打,复杂任务仍需谨慎

(以下内容仅展示部分实测评估情况,更多评估请查阅完整报告)

参评产品在统一模型(DeepSeek-v4 Pro)、统一测试环境(产品开箱状态)、统一工具接口和数据基线(统一仿真MCP Server)下完成近百道非公开测试任务。

(注:产品模型均统一配置为Deepseek-V4 Pro,TeleAgent因无法配置模型默认使用旗舰模式)

  • 常规任务:整体表现不错。常规任务目标明确、执行路径确定,主要包括基础文档输出与改写、邮件与日程安排、会议纪要总结和基础数据处理。多数产品能准确理解相对时间、识别联系人、定位信息,并把结果正确写回日历、待办、CRM等系统,一次交付即可使用的任务占比相对较高。
  • 复杂任务:能交付,但还不能直接可用。复杂任务涉及长上下文、长链路和多步骤循环(复杂PPT、复杂表格、浏览器操作、财报抓取与分析、视频生成等),大部分产品能花数十分钟至数小时交付,但结果通常不能直接用。问题集中在:结构与版式不到位;处理要求遗漏,链路越长漏得越多;长上下文内容常被压缩改写;数据错位与识别异常;并且整体执行代价偏高。例如某浏览器操作类任务平均消耗约473.5万Token,复杂的11页PPT生成平均消耗约353.7万(最高超1,000万)。

从“能交付”到“直接用”之间的差距,就是企业级智能体落地的最后一公里。

四、好不好管:管得住,企业才敢大规模应用

而在企业级场景落地智能体,除了Agent完成任务能力之外,企业更关注的是安全机制、权限控制、操作审计、执行稳定性、企业系统连接能力等企业级能力,这也是通用Agent是否能够真正进入企业级场景的前提。

安全可控与权限:当前大部分产品已能识别提示词注入,按风险等级自动放行、请求确认或阻断,高风险操作前二次确认,代码和浏览器在独立沙箱运行;企业级产品还需为Agent建立独立身份和权限体系,配置临时凭证和单独设定的操作范围。

运维与数据看板:企业主要关注三个维度,一是智能体使用普及率;二是成本观测、归因与治理(能否按任务、用户、部门、Agent统计用量并设置预算配额);三是运行失败、停滞或异常调用时能否及时告警并给出处理建议。

数据与知识治理:Agent读写的是企业自己的文档、知识库和业务数据,哪些内容可进上下文、哪些只能内网处理、产物存哪里、保留多久都要提前确定,并建立智能体相关资产的创建、审核、授权和版本管理能力。

五、当前市场产品平均得分

当前业界普遍能力雷达:好用与好管维度仍需补齐

六、IDC的建议

给厂商的建议

  • 持续提高复杂任务完成能力。常规与复杂任务差距来自规划、长链路执行和多工具协同,都需Harness支撑;相同模型下产品得分仍有明显差异,说明Harness工程能力直接影响任务表现,是下一阶段竞争重点。
  • 把企业级能力覆盖到任务执行全过程。工作空间协同、身份权限、成本统计与预算管控、运行观测和审计留痕需同步建设,接入系统越多,企业对权限、证据和追溯的要求越高。
  • 建立场景交付和合作伙伴生态。厂商难独立完成垂直场景建设,应尽早建立合作伙伴网络;已跑通的任务应主动帮企业构建为Skill,既可在组织内扩散,也减少重复规划的Token消耗。
  • 提供更符合智能体的任务交互方式。复杂任务时长可达数小时,用户需同时发起多个任务或调度多个Agent,传统“一次会话对应一个任务”的交互难以集中管理,应支持并发任务状态监控、异常提醒和随时人工接管。

给企业的建议

  • 观望期也是窗口期。产品快速迭代,观望期同样是积累经验的窗口,企业可优先选择适合的日常办公场景试点,积累能力与组织经验后再深入业务流。
  • 按任务复杂度设计场景。规则明确、重复度高、结果易检查的任务交给Agent或Workflow;边界不清晰、链路较长的复杂任务交给通用Agent,同时安排专业人员检查并最终审核。
  • 建立覆盖任务全过程的治理机制。Agent接入的系统和工具越多,越要统一管理智能体身份权限,并与现有运维、安全和审计体系衔接。
  • 让组织能力跟上Agent能力。Agent会重新划分员工、管理者和系统的责任,企业需同步提升员工AI技能、管理层对能力边界的理解,并调整流程、协作方式和考核机制。企业对AI认知的上限,基本决定了Agent价值的上限。

更多内容请关注IDC报告:

IDC《中国企业级通用Agent产品技术评估,2026 Q3》(Doc# CHC54893926,2026年9月)

如果您希望了解人工智能相关的研究或开展进一步交流,欢迎点击 联系我们

Zhenya Sun

Zhenya Sun - Research Manager

Zhenya Sun is a research manager for the IDC team focused on exploring the application of technology and industrial development of AI and AI agents. He is also responsible for providing clients with consulting services on technologies, products, and markets…

Subscribe to our blog