2026 年 9 月 19 日 星期六
  • 登录
  • 注册
周天财经
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
周天财经
没有结果
查看所有结果
首页 商业

AGI 来没来不好说,但 GPT-6 真把 Token 省下来了

2026 年 9 月 7 日
在 商业
阅读时间: 2 mins read
阅读:816
A A

Related articles

姚星丞之后,AI人才的中间层开始掉价

姚星丞之后,AI 人才的中间层开始掉价

2026 年 9 月 19 日
Gemini 4 Pro疑似泄露,「AI减速」又成空话

Gemini 4 Pro 疑似泄露,「AI 减速」 又成空话

2026 年 9 月 19 日


文|光锥智能,作者 | 魏琳华 ,编辑|刘俊宏 

多年以后,人类或许会想起 AGI 时代的到来,是在一个平平无奇的夜晚。

9 月 3 日,整个 AI 圈可能都没睡好。先是晚间全球 AI 大宕机,就当所有人准备洗洗睡的时候,9 月 4 日凌晨三点半,GPT-6 Astra 亮相了。

虽然发布会上 OpenAI 宣布还只对部分企业用户开放,不过好在它没让我们等太久。9 月 5 日,OpenAI 全量推送了 GPT-6 Astra,让付费用户们及时体验上了新模型。

「欢迎来到 AGI 时代。」 在介绍 GPT-6 Astra 时,OpenAI 总裁 Greg Brockman 说。

和前几代大模型相比,OpenAI 交出的新模型成绩上确实相当耀眼,正如模型的名字 「星辰」,它在多个关键基准上跑出了 「饱和」 的成绩,把编程、长程任务的能力往上拔了一截。

但 「会刷题」 算不得什么,能干活才真有用。

实际干活时,GPT-6 Astra 能做到 「又快又省」——交付质量更高的同时,它单次任务的 Token 消耗和任务耗时都明显低于上一代。Perplexity 在自家 AI 研究智能体评估框架中甚至测出,Astra 的单次任务花销低于 Fable 5.1。

发布不到一周,Anthropic 的新模型 Fable 5.1 就被 GPT-6 Astra 抢去了风头。

现场演示和网友实测里,各种复杂的活儿都被丢给了它:操作电脑、填表单、建网站,甚至把电子原理图排成可投产的 PCB、在 Blender 里建好房间模型,再转进虚幻引擎,让用户可以在建模场景中走动查看房屋细节。

支撑这一跃迁的,是又一次 「大力出奇迹」:据外媒报道,GPT-6 Astra 的训练动用了 10 万 GPU 的集群,是 OpenAI 迄今最大规模的一次训练。

那么,这一代模型到底变了什么?所谓 AGI 时刻到底是真的,还是只是又一次宣言?

性能 「饱和」 的 GPT-6 Astra,成色几何?

这次 GPT-6 Astra 没有 「见光死」,实际体验和演示效果差距不大。

昨天,GPT-6 Astra 已经正式全量向所有订阅用户开放使用。早上晒出的一众测评案例中,有人惊叹它干活的交付质量,有人提到它跑任务更省 Token、成本低。

具体到能力表现层面,GPT-6 Astra 在一些特定领域跑出了接近满分的极限分数。人类的考卷已经快 「考不下」 了。

比如,它在研究级数学基准 FrontierMath Tier 4 跑到 98,官方形容为 「饱和」,也就是它的分数已经达到了测试的上限;在强调陌生环境中学习与抽象推理的 ARC-AGI-3 上,GPT-6 Astra 从上一代 GPT-5.6 Sol 的 7.8% 直接跳到 99.9%。可以说是直接实现了 「从 0 到 100」 的突破;漏洞利用测试 ExploitBench 则直接满分 100%,GPT-5.6 Sol 为 78.5%。

最夸张的是 ARC-AGI-3,它相当于把大模型扔进一个陌生环境,不给规则说明,看它能不能自己摸索规则并做出正确决策。这个测试对人类来说并不难,100 分轻轻松松,但 AI 之前一直搞不定,徘徊在不及格的区间。

然后,GPT-6 Astra 就满分了。三个月时间,AI 就进化成人类了?

用 ARC Prize Foundation 的 Greg Kamradt 的话来说:「在 96% 的测试层级上,Astra 超越了我们的人类行为效率基线,实际上达到了人类水平。」

OpenAI 是怎么做到的?还是用了一点 「手段」 的——将模型和 Harness 打配合。

这个 99.9% 的高分的前提是,它跑在 OpenAI 为自家模型适配的 Harness 上,所以效果会更突出。但这并不意味着去掉 Harness 就立刻 「拉胯」。根据 X 上 ARC Prize 发布的测评结果是 62.7%,这已经是第二名 Claude Opus 5 的两倍。

但这种成绩还是容易令人质疑。自家模型+自家特调测出来的分,这不是忽悠人么?

厂商自报分数用自家框架,确实是常规操作:DeepSeek 上月底发布的 DeepSeek V4 Flash,官方在注释里写明基于自家 DeepSeek Harness 测得,它还同步把 Harness 作为独立产品推向市场。所以这并不是问题。

不过,GPT-6 Astra 的提升也有些许 「偏科」。从 OpenAI 给出的成绩来看,它在部分任务上出现了 「倒退」 的情况。

以测评模型 Agent 能力的指标之一——人类终极测试 (Humanity』s Last Exam) 上,GPT-6 Astra 的成绩为 57.2%,反而低于 GPT-5.6 Sol 与 Fable 5.1。

这样的偏科成绩,也让测评机构给出了不一样的评估分数。

比如按照 Artificial Analysis 的通用智能指数,Astra 为 61.2,与 Sol 的 60.9 基本持平,导致新模型也被不少网友戏称是 「更贵版本的 Sol」。但实际上,AA 测评的指标更多集中在知识、推理等能力上,GPT-6 Astra 的强项,多数不在它的测评范围内。

说完上面这些 「虚的」 测试,我们来看看 GPT-6 Astra 在商业化已经被验证领域的表现。

在 Coding 场景上,GPT-6 Astra 显然是冲着最强目标冲击的。它在 Terminal-Bench 4.0(测评智能体在复杂终端任务上的表现) 为 57.9%,超过了 Fable 5.1 的 55.8%,而 GPT-5.6 Sol 在这个基准上只有 37.3%。

得益于编程能力的提升,现在人们拿 GPT-6 Astra 已经能做出媲美真实游戏的作品。不少网友已经晒出了他们拿新模型做出的射击游戏、开放世界冒险游戏等等。从建模和实际体验来看,已经可以算得上成品级别。

智能体维度,相较于上一代,GPT-6 Astra 在长程任务的处理能力上了一个台阶。

单看智能体维度的跑分,其中,GPT-6 Astra 在 Agents' Last Exam(真实软件中完成金融建模、工程设计、媒体制作等专业任务) 拿到 59.3%,略高于上代 Sol 的 53.6%;OSWorld 2.0(真实桌面环境里看屏幕、点鼠标、敲键盘完成操作)72.6%;在跨系统业务流程的 AutomationBench 一项上,GPT-6 Astra 的得分从 GPT-5.6 Sol 的 18.1% 大幅提升至 41.4%。

那么,强大能力的代价是什么?

训练出这样的模型,OpenAI 靠的是又一次 「大力出奇迹」。据外媒报道,GPT-6 Astra 的训练动用了 10 万 GPU 的集群,这是 OpenAI 迄今为止最大的训练规模。不得不感慨,Scaling Law 的强度还是立竿见影。

但 AI 圈还有一个共识:高分不一定就 「高能」,模型到底好不好用,还得干活层面见真章。

响应更快、Token 消耗更少,GPT-6 更擅长 「干活」

比起跑分,本次大家讨论的一个共识是,GPT-6 Astra 充分展示了它 「干活能力」 的跃升——操作电脑、长任务、端到端交付等能力,它的演示效果都让打工人心动不已。

X 上展示的测评也高度一致地落在干活测评上。多数测评图中,GPT-6 Astra 在 「干的快、干的好」 这两项上遥遥领先:Perplexity 在自家面向 AI 研究智能体的评估框架中测试,GPT-6 Astra 不仅分数最高,它花的钱也比 Fable 5.1 更便宜。

是什么让用户纷纷 「爽歪歪」?主要是两个关键体验:一是降低成本,二是压缩任务的处理时长。GPT-6 Astra 讨人喜欢就在于这两点。

通过有效降低任务输出 Token,GPT-6 Astra 实现了降低成本的效果。不仅输出冗余大幅精简,比如在考察复杂专业任务的 Agents' Last Exam 最高分设置下,相比 Claude Opus 5 少用了约 65% 的输出 Token;面向终端任务的 Terminal-Bench 4.0 中,Astra 的预估 API 成本比自家上一代 Sol 缩减约 9%,对比 Fable 5.1 的降幅更是高达 63%。

作为 OpenAI 的客户,Higgsfield AI CEO Alex Mashrabov 表示,Astra 比他们测过的其他模型少用了高达 20% 的 Token。

时间消耗上,和上一代模型相比,GPT-6 Astra 将部分任务的时间压缩掉近一半。OSWorld 2.0 上,Astra 完成一个计算机使用任务的平均耗时约 40 分钟,比上一代 Sol 的 75 分钟少了 47%;Mind2Web 基准上,Codex 任务完成速度做到上一代的 1.9 倍。

这些改变,不仅和模型各项能力提升相关,可能和 OpenAI 采用的模型新架构有关。

据 The Information 报道,OpenAI 在 GPT-6 Astra 采用了一种叫 「循环深度」(recurrent depth) 的架构技术,它通过复用同一组网络层进行多次内部循环计算,中间推理在隐藏状态中完成,不会全部转化为输出文本。

简单来说,就是原来 OpenAI o 系列的思考模型基本上会把中间推理步骤以自然语言写出来,变成一条人类可读的思维链。这种 「想什么都写出来」 的方式,好处是透明,坏处是啰嗦:一个复杂任务可能输出几千个 Token 的推理过程。

新的架构,让模型内部思考更多,但它输出的 Token 却减少了,这让它能在办事时做到 「又快又省」。

从 OpenAI 的分享中,另一个可以确认的事实是通过对 Harness 能力优化,是它办事能力提升的关键。

先从 Computer Use(计算机使用) 说起,也就是让大模型自主操作电脑浏览、干活的种种能力。对此,OpenAI 直接称它 「世界上最好的 Computer Use 模型」:GPT-6 Astra 把软件当作 「人的工具」 来用——让 AI 填网页表单、更新 CRM 记录、整理日程,分析数据出图、搭好网站再自己跑一遍前端 QA。

OpenAI 现场还展示了在 KiCad 里把电子原理图排成可投产的 PCB、在 Blender 建模后转进虚幻引擎 5,让设计师和客户在 3D 场景中 「看」 到实际效果。根据平面图,GPT-6 Astra 能从零搭建出完整的房屋 3D 模型,包括墙体、门窗、楼层结构等建筑元素。X 上有用户分享的实测效果对比中,也能看到 GPT-6 Astra 的细节做得已经相当完善。

第二处升级在 Codex 的 「记忆」 机制,新增的跨上下文管理机制起到了作用。

Astra 可以跨上下文窗口保存 「工作笔记」,同时让更早的完整上下文保持可搜索,之前的消息和工具输出都能找回。重点内容主动记下来,漏记的细节还能回头翻,避免因上下文压缩导致细节丢失。

此外,Codex 同步推出的 「异步提问」 机制做了一个产品细节上的优化:有开发者在 X 上贴出自己让 Codex 连跑数小时的记录:模型在中途遇到歧义时不再卡死等人工确认,而是先把能独立推进的部分做完,同时攒好问题等用户回答。

这层优化简直救了程序员的命。之前还得守在电脑前一步步确认需求,现在 AI 终于能清净一会,可以多 「摸会鱼」 了。

总而言之,GPT-6 Astra 确实是一次重磅升级,无论是能力还是实际应用层面。但 AGI 时代有没有到来?很显然,现在还不该回答这个问题。参考电力时代的经验,AI 迟早会走到那一天——

当大模型解决复杂工作变得更快速、更便宜时,AI 本身的讨论会逐渐退居幕后,取而代之的是各种 AI 原生的产品。到那时候,「用不用 AI」 的讨论就该翻篇了,就像现在早已没人会讨论 「要不要用电」。

广告

相关 文章

姚星丞之后,AI人才的中间层开始掉价

姚星丞之后,AI 人才的中间层开始掉价

来自 周天财经
2026 年 9 月 19 日
0

文 | 奇帆商业姚星丞的价格还在涨。今年...

Gemini 4 Pro疑似泄露,「AI减速」又成空话

Gemini 4 Pro 疑似泄露,「AI 减速」 又成空话

来自 周天财经
2026 年 9 月 19 日
0

文 | 字母 AI 前几个月,OpenAI 和...

珀莱雅投资毕生之研;ALO官宣中国市场七城八店零售布局;星巴克中国新一代旗舰店亮相北京SKP;NikeSKIMS品牌正式进入中国|消研所周报

珀莱雅投资毕生之研;ALO 官宣中国市场七城八店零售布局;星巴克中国新一代旗舰店亮相北京 SKP;NikeSKIMS 品牌正式进入中国|消研所周报

来自 周天财经
2026 年 9 月 19 日
0

消费动态珀莱雅投资毕生之研近日,珀莱雅旗...

月之暗面递表之后,Kimi 的成色要被验算三遍

月之暗面递表之后,Kimi 的成色要被验算三遍

来自 周天财经
2026 年 9 月 19 日
0

文 | 舒泽品牌手记 9 月 17 日,月之暗面...

外卖「御三家」:狂热开始,理性收敛

外卖 「御三家」:狂热开始,理性收敛

来自 周天财经
2026 年 9 月 18 日
0

文 | 表外表里 ,作者 | 陈梓洁 陈...

加载更多
广告
  • 热门
  • 评论
  • 最新
「我们也深陷残酷价格战」,德资巨头中国区高管警告

「我们也深陷残酷价格战」,德资巨头中国区高管警告

2025 年 8 月 4 日
一周产业基金|上海市人工智能CVC基金发布;湖北百亿人形机器人母基金来了

一周产业基金|上海市人工智能 CVC 基金发布;湖北百亿人形机器人母基金来了

2025 年 8 月 4 日
「硬科技」指数携手上涨,半导体设备ETF易方达(159558)、芯片ETF易方达(516350)等产品助力布局板块龙头

基民懵了!这个火爆的板块年内涨超 37%,主力却借道 ETF 狂抛逾 400 亿元

2025 年 9 月 20 日
pt999铂金回收价格今日多少钱一克(2025年06月27日)

期货在什么情况下会被强行平仓

2025 年 8 月 4 日
Lesson 1: Basics Of Photography With Natural Lighting

The Single Most Important Thing You Need To Know About Success

4
Lesson 1: Basics Of Photography With Natural Lighting

Lesson 1: Basics Of Photography With Natural Lighting

3
Lesson 1: Basics Of Photography With Natural Lighting

5 Ways Animals Will Help You Get More Business

2
Lesson 1: Basics Of Photography With Natural Lighting

New Cryptocurrency That Will Kill Of Bitcoin

2

科创芯片设计指数涨超 4%,科创芯片设计 ETF 易方达 (589030) 近一月净流入领跑同标的产品

2026 年 9 月 19 日

今日兰州菜百黄金价格查询 (2026 年 9 月 9 日)

2026 年 9 月 19 日

住建部释放多重利好 房地产板块集体拉升 多只个股涨停

2026 年 9 月 19 日
SpaceX可能会颠覆电力股

AI 猎头魔幻一年:一单佣金 300 万,数百人围猎一个岗位

2026 年 9 月 19 日
  • 隐私政策
  • 联系我们
  • 关于周天
  • 登录
  • 注册
投诉建议:+86 13326565461

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

欢迎回来!

在下面登录您的帐户

忘记密码? 注册

创建新帐户!

填写以下表格进行注册

所有项目需要填写。 登录

重置您的密码

请输入您的用户名或电子邮件地址以重置密码。

登录

用户登录

还没有账号?立即注册

用户注册

已有账号?立即登录