资讯 · 高影响返回资讯

OpenAI 发布 GPT-6 Astra:1.05M 上下文切入自主系统操控,攻防能力首触 Critical 红线

OpenAI 于 2026 年 9 月 3 日正式发布新一代旗舰模型 GPT-6 Astra。新模型标配 1,050,000(1.05M)Token 上下文窗口与 128,000(128K)Token 单次输出能力,研发重心转向端到端计算机操作与自主任务接管;在 ExploitBench 取得 100% 成绩,成为首个触发 Critical 网络安全风险等级的前沿系统,并引入了受限防御准入与阻断式对齐监控。

核心参数与基准表现

OpenAI 于 2026 年 9 月 3 日正式发布 GPT-6 Astra。新模型开启分阶段推送,覆盖 ChatGPT Plus、Pro、Business、Enterprise 用户,并同步上线 API 以及 Azure 与 AWS Bedrock。Astra 将研发重心全面推向计算机操作员(Computer Operator)方向,主打跨浏览器、桌面应用与终端环境的长程自主调度。

评测维度与工程指标GPT-6 Astra 表现前代基准与工程说明
上下文与输出限制1,050,000 Token 上下文单次最大输出 128,000 Token,支撑长程代码分析
API 标准资费方案输入 $10.00 / M,输出 $50.00 / M命中缓存输入为 $1.00 / M,支持批量计费
FrontierMath (Tier 4)97.6% 求解成功率突破前沿专业数学推导上限,较前沿水平大幅跃升
ARC-AGI-399.9% 抽象推理得分在少样本抽象归纳与全新规则推理任务中接近满分
ExploitBench100% 漏洞验证率具备自主发现漏洞并生成 PoC 载荷的能力
OSWorld 2.0 系统操作59.3% 至 72.6% 成功率较 GPT-5.6 Sol 显著提升,支持跨软件键鼠连续调度

自主系统操控:从单轮对话走向任务接管

Astra 的技术突破体现在长程任务的自驱闭环。模型不再局限于单次代码生成或被动问答,而是能够直接调度系统级 API 与无头浏览器。在 跨标签页数据检索与复杂表格整理 中,模型可以独立执行几十步连续操作,主动处理页面结构变更与弹窗阻碍。

在 OSWorld 2.0 测试中,Astra 展现了对图形界面的动态辨识与容错恢复能力。面对运行报错或加载超时,模型不再直接中断退出,而是在 1,050,000 Token 上下文 中记录错误堆栈并尝试备用路径。配合单次最大 128,000 Token 的输出空间,开发团队可以一次性传递完整的工程项目与构建日志,减少了分段拼接的人工干预。

首触 Critical 安全红线:自主攻防与思维链黑盒化

伴随能力突破,OpenAI 在最新系统卡中确认,Astra 是其安全准备度框架下首个达到 Critical 网络安全风险阈值 的前沿模型。该模型在 ExploitBench 拿到 100% 的满分成绩,意味着它具备在无人类指引下自主挖掘复杂 0-day 漏洞并组装可执行攻击载荷的能力。

为此 OpenAI 部署了分级准入机制,将高危攻防能力限制在受信任的安全审查计划内。同时工程团队接入了 全轨迹阻断式对齐监控,在后台持续校验 Agent 的外部操作。系统卡同时指出,随着推导步数成倍增加,模型内部思维链的可监控性出现了明显下滑,这使得防范未授权越权动作成为当前部署的核心挑战。

工程师落地账本:调用成本与工作模式分流

在商业接入层面,官方 API 标定输入每百万 Token 10.00 美元,输出每百万 Token 50.00 美元。虽然单次代码合成的 Token 效率有所优化,但运行包含截图分析与多轮编译反馈的自主 Agent 时,50.00 美元的输出单价 依然会快速积累开销。在未设置严密轮数熔断的场景下,单次长程重构任务的真实成本显著高于传统对话模型。

目前 ChatGPT 已在网页端推出专门的工作模式来承接长时间占用算力的高阶任务。企业客户与云端开发者则可在 Azure AI Studio 与 AWS Bedrock 中按需挂载 gpt-6-astra 节点,通过调整推导步数预算在交互时延与任务完成率之间权衡取舍。

下一步

继续追踪 GPT-6 Astra

沿着同一主题继续阅读。

打开实体档案