跳到正文

GPT-6 Astra 评测解读

本文综合 OpenAI 官方资料与 Artificial Analysis 独立评测。引用数据均注明来源;目前不作为 NovaModelHub 独立实测结论。

发布于 2026-09-16 · 资料核验于 2026-09-16

先看结论

Astra 更适合复杂编程、长链路工具调用和高价值专业任务。单 Token 价格高于 Sol,但独立评测显示其 Token 效率能够抵消部分成本;简单、批量任务仍应比较 Terra 或 Luna。

官方规格与价格

1.05M上下文窗口
128K最大输出
$10输入 / 1M Token
$50输出 / 1M Token

模型 ID 为 gpt-6-astra,支持 Responses API、Chat Completions、Computer Use、Web Search、MCP 与工具调用。查看 OpenAI 官方模型页 ↗

独立评测怎么说

以下数字来自 Artificial Analysis 于 2026 年 9 月 9 日发布的独立分析。该机构把模型放进相同的评测体系,并同时观察能力、Token 使用和单任务成本。

Artificial Analysis GPT-6 Astra 长程任务评测图表
来源:Artificial Analysis,AA-Briefcase 等长程知识工作评测。
Artificial Analysis GPT-6 Astra AutomationBench 评测图表
来源:Artificial Analysis,AutomationBench-AA 与相关指标。

报告结果:Astra 在 Intelligence Index 得分 53,与 Claude Fable 5.1 并列;Coding Agent Index 得分 62,高于 Sol 的 55;Terminal-Bench v4.0 为 Astra 59%、Sol 40%。

指标GPT-6 AstraGPT-5.6 Sol解读
Intelligence Index53未列入此处同口径对比与 Claude Fable 5.1 并列
Coding Agent Index6255Astra 得分更高
Terminal-Bench v4.059%40%终端软件工程任务领先
AutomationBench-AA69%60%工作流自动化任务领先
Coding Agent 单任务成本$7.09约低 15%Astra 单价更高,但 Token 效率更好

这些结果不能合并为一个“总分”。报告也记录了反例:GDPval-AA v2 中 Astra 比 Sol 低约 45 Elo,说明表达质量和职业任务并非全面领先。查看原始报告与完整图表 ↗

联系支持

扫码添加微信,备注「进群」,我拉你进用户交流群。

微信用户交流群二维码