Artificial Intelligence September 9, 2026 1 min

IDC:GPT-6 Astra计算机操作能力首次跨越可用分界线,网络安全能力达到最高级

本文作者:IDC中国研究总监王军民、研究经理程荫、研究经理孙振亚 

2026年9月3日,OpenAI发布新一代旗舰大模型GPT-6 Astra,并同步公开系统卡与安全评估结果。官方将其定义为目前智能水平与对齐能力最高的模型,最大突破是原生强化的计算机操作(Computer Use)智能体能力,可自主操作桌面与网页软件,完成填写表单、维护CRM、数据分析绘图、网站开发、工程设计与软件故障排查,独立走完多步骤业务流程。与此同时,其网络安全能力首次达到OpenAI Preparedness Framework的最高级–Critical(关键级)。

IDC核心观点

在IDC看来,GPT-6 Astra让当前模型的计算机操作(Computer Use)能力首次跨过了可用不可用的分界线,这意味着智能体的任务执行无需等待系统接口改造或软件开放,Agent可以通过直接的Computer use能力执行相关任务,为大量因系统封闭而长期无法自动化的长尾场景提供了新的解法。

但硬币的另一面同样不容忽视,Astra在网络攻击、漏洞挖掘等安全基准上的表现同步触及OpenAI定义的Critical阈值,能力越强,被恶意利用时的破坏力也越大。对于计划推进智能体试点的企业而言,这既是一个机会窗口,也是一次对治理体系的压力测试。

以下,IDC从执行能力、成本结构、安全能力三个维度,拆解此次升级对企业落地的真实影响。

核心判断一:Computer Use准确率突破90%实用线,接口不再是智能体落地的首要瓶颈

技术层面,此次变化主要体现在定位准确率提升,单任务耗时和Token消耗下降。界面元素定位准确率从前代GPT-5.6 Sol的76.9%升至92.7%,真实软件任务、终端任务与业务自动化基准的得分均有提升,特定专业任务的耗时和输出Token消耗也有所下降。模型的上下文窗口达到105万Token,最大输出达到12.8万Token,推理档位扩展至五档。Codex通过跨上下文窗口保留笔记,减少反复压缩摘要,早期窗口中的内容仍可检索;接近百万Token长度时,多目标检索准确率仍达96.3%。这套机制可以缓解我们在先前实测中经常遇到的任务因上下文压缩而无法接续执行的问题。

这一变化为以往难以接入自动化系统的场景提供了一条不依赖接口改造的可选路径,当前智能体落地案例中,企业若要让智能体执行某个业务环节,通常需要先定义流程,再对接API、封装工具或搭建MCP服务并交由智能体处理,接口缺失系统通常需要多次调试才能构建GUI操作路径。随着模型Computer use定位准确率超过九成,单任务成本和耗时同时下降,智能体可以像人一样操作软件,处理难以预先定义的动态场景。

这将大大降低企业落地智能体的门槛,长尾场景可以直接用Computer use执行操作而无需任何复杂配置,部分稳定且高频的业务流则可以保留接口调用或MCP服务,或直接基于Computer use过程沉淀为可复用的Skill。

但需要注意的时,虽然模型定位准确率已具备较高的可用度,但Agent的任务级完成效果仍然依赖意图理解、任务规划、上下文处理、工具调用、任务执行等各个环节的表现,在长链路多步骤复杂任务场景下,仍需要Harness层的工程优化来充分发挥模型的能力,这也是当前应用层厂商的差异化竞争的空间。

核心判断二:旗舰模型单价随能力上涨,企业Token成本治理已从“建议”变为“必须”

模型定价层面,能力提升的同时单价也在上调。Astra的API价格为输入每百万Token 10美元、输出50美元、缓存输入1美元,前代GPT-5.6 Sol的标准价为输入5美元、输出30美元,按标准价对比分别为前代的2倍与1.67倍(按当前Sol促销价计算两者均为2.5倍)。

OpenAI公布的评测显示,Astra完成特定场景专业任务时,相比其他旗舰模型的耗时与输出Token消耗有所降低,例如在OSWorld 2.0离线评测的延迟模拟中,单任务耗时比Sol下降约47%;Agents’ Last Exam中,输出Token消耗比Opus 5减少约65%。长链路任务的综合成本因此可能下降,但短链路任务与高频调用则随着Token单价的提升可能会变的更贵;企业的实际支出更多取决于推理档位选择、缓存复用与路由策略,以及智能体场景的工程优化与Skill建设水平。旗舰模型单价随能力代际上移已在形成趋势,Token成本治理也因此成为企业的必要能力。

核心判断三:网络安全能力:攻与防双线同时抬高能力证据方面充分确凿:

  • Astra在ExploitBench公开基准取得满分;
  • 但因公开基准存在污染风险,OpenAI以”Daybreak Blue”权限配置另行加测,结果在内部20个新披露高危漏洞测试中,Astra执行率更高;
  • 评估过程中自主挖出2个零日漏洞,还把他们形成利用链;
  • 专家实测确认:Astra利用零日漏洞,仅打开一个HTML文件即可触发沙箱逃逸并执行主机命令,且可由普通权限一路提权至root。

防护层面表现出色,Astra较前代GPT-5.6 Sol更稳健。网络攻击类越狱请求拒绝率由59%升至91.5%;蜜罐测试中,前代56%样本触碰周边设施,Astra为0次;面对auto-review拒绝,Astra从未尝试绕过。

市场影响及IDC观点

GPT-6 Astra进一步提高了计算机操作的准确性和执行效率,增强了智能体处理复杂任务的能力,也为智能体进入更多接口受限的长尾场景创造了条件。

对企业落地的影响:

  • 接口限制得到缓解。当前企业智能体执行业务任务的主要障碍集中在数据、权限、场景建设和系统接口等方面。借助Computer Use,企业可让智能体直接操作软件处理业务,无需等待系统改造全部完成
  • 数据、权限和ROI仍是企业自己的功课。 模型执行能力增强后,数据治理、权限管理与ROI评估仍需持续推进。模型能力增强后,企业仍需提升数据就绪度、完善权限体系,并持续验证评估应用效果。IDC判断,应用范围将先在集成要求较低、效果容易验证的环节扩大。
  • 混合架构是未来十二个月的主流选择。IDC预计,未来十二个月,国内企业在智能体任务执行中更可能采用混合架构:Computer Use覆盖接口缺失的长尾环节,稳定、高频流程继续依托API或MCP服务。GUI路径能否大规模用于生产环境,仍取决于其执行稳定性和可控性。

对国内厂商格局的影响

  • 基座模型厂商:需要同步提升工具调用、长流程规划和环境交互能力,持续增强模型执行复杂任务的能力。
  • 中小模型团队:机会更多集中在行业智能体应用和专业垂直模型,行业经验与具体业务场景的积累和适配将更加重要。
  • 应用层厂商:具备智能体编排、Harness工程、系统集成与行业理解能力,并能持续帮助企业建设积累可复用Skill的厂商,更容易进入企业实际项目。

规模化部署的关键条件

  • 智能体身份与权限: 企业应为智能体建立专属身份,按任务需要配置访问和操作权限,明确授权边界与责任归属,并落实最小权限控制和全程操作留痕。
  • 运行环境: 企业需在国产操作系统、旧有客户端和云桌面等实际环境中验证模型适配性,并将云桌面或虚拟机的资源开销计入成本,评估其对规模化部署的影响。

IDC行动建议

基于以上判断,IDC建议企业在推进智能体试点时优先落实以下五项工作:

  • 新梳理业务流程,优先选择标准化、高重复、电脑端操作类场景,尤其是那些长期因缺接口而无法自动化的环节,并区分AI自主执行与辅助的边界。
  • 把验收标准换成任务级指标:一次通过率、人工介入比例、单任务耗时与成本,试点阶段先把基线立起来;成本测算以完整业务任务而非Token单价为口径,同时管好上下文预算与缓存复用。
  • 打通内部系统接口、规整数据与知识,落实最小权限授予与全程操作留痕审计;严控资金与重大决策权限,防范自主操作引发的数据篡改与误操作,并为安全检查的误拦截预设处置流程。
  • 建立人机协同的组织制度,推动员工从事务执行转为任务监督与校验,配套权责规范、人工复核与异常告警机制。
  • 构建AI原生的主动安全防御体系,不仅要建设“识别威胁”的AI,更要建设能“击败威胁”的AI。

进一步交流

如您对本次GPT-6 Astra发布的企业级影响、智能体落地策略或相关技术评估有进一步兴趣,欢迎与IDC中国研究团队联系。请点击此处与我们联系。

Zhenya Sun

Zhenya Sun - Research Manager

Zhenya Sun is a research manager for the IDC team focused on exploring the application of technology and industrial development of AI and AI agents. He is also responsible for providing clients with consulting services on technologies, products, and markets…

Subscribe to our blog