核心参数与基准表现
OpenAI 于 2026 年 9 月 3 日正式发布 GPT-6 Astra。新模型开启分阶段推送,覆盖 ChatGPT Plus、Pro、Business、Enterprise 用户,并同步上线 API 以及 Azure 与 AWS Bedrock。Astra 将研发重心全面推向计算机操作员(Computer Operator)方向,主打跨浏览器、桌面应用与终端环境的长程自主调度。
| 评测维度与工程指标 | GPT-6 Astra 表现 | 前代基准与工程说明 |
|---|---|---|
| 上下文与输出限制 | 1,050,000 Token 上下文 | 单次最大输出 128,000 Token,支撑长程代码分析 |
| API 标准资费方案 | 输入 $10.00 / M,输出 $50.00 / M | 命中缓存输入为 $1.00 / M,支持批量计费 |
| FrontierMath (Tier 4) | 97.6% 求解成功率 | 突破前沿专业数学推导上限,较前沿水平大幅跃升 |
| ARC-AGI-3 | 99.9% 抽象推理得分 | 在少样本抽象归纳与全新规则推理任务中接近满分 |
| ExploitBench | 100% 漏洞验证率 | 具备自主发现漏洞并生成 PoC 载荷的能力 |
| OSWorld 2.0 系统操作 | 59.3% 至 72.6% 成功率 | 较 GPT-5.6 Sol 显著提升,支持跨软件键鼠连续调度 |
自主系统操控:从单轮对话走向任务接管
Astra 的技术突破体现在长程任务的自驱闭环。模型不再局限于单次代码生成或被动问答,而是能够直接调度系统级 API 与无头浏览器。在 跨标签页数据检索与复杂表格整理 中,模型可以独立执行几十步连续操作,主动处理页面结构变更与弹窗阻碍。
在 OSWorld 2.0 测试中,Astra 展现了对图形界面的动态辨识与容错恢复能力。面对运行报错或加载超时,模型不再直接中断退出,而是在 1,050,000 Token 上下文 中记录错误堆栈并尝试备用路径。配合单次最大 128,000 Token 的输出空间,开发团队可以一次性传递完整的工程项目与构建日志,减少了分段拼接的人工干预。
首触 Critical 安全红线:自主攻防与思维链黑盒化
伴随能力突破,OpenAI 在最新系统卡中确认,Astra 是其安全准备度框架下首个达到 Critical 网络安全风险阈值 的前沿模型。该模型在 ExploitBench 拿到 100% 的满分成绩,意味着它具备在无人类指引下自主挖掘复杂 0-day 漏洞并组装可执行攻击载荷的能力。
为此 OpenAI 部署了分级准入机制,将高危攻防能力限制在受信任的安全审查计划内。同时工程团队接入了 全轨迹阻断式对齐监控,在后台持续校验 Agent 的外部操作。系统卡同时指出,随着推导步数成倍增加,模型内部思维链的可监控性出现了明显下滑,这使得防范未授权越权动作成为当前部署的核心挑战。
工程师落地账本:调用成本与工作模式分流
在商业接入层面,官方 API 标定输入每百万 Token 10.00 美元,输出每百万 Token 50.00 美元。虽然单次代码合成的 Token 效率有所优化,但运行包含截图分析与多轮编译反馈的自主 Agent 时,50.00 美元的输出单价 依然会快速积累开销。在未设置严密轮数熔断的场景下,单次长程重构任务的真实成本显著高于传统对话模型。
目前 ChatGPT 已在网页端推出专门的工作模式来承接长时间占用算力的高阶任务。企业客户与云端开发者则可在 Azure AI Studio 与 AWS Bedrock 中按需挂载 gpt-6-astra 节点,通过调整推导步数预算在交互时延与任务完成率之间权衡取舍。