2026 年 7 月 23 日 星期四
  • 登录
  • 注册
周天财经
广告
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金
没有结果
查看所有结果
周天财经
没有结果
查看所有结果
首页 商业

Gemini 3.5 Pro 难产,谷歌先交了两张草稿纸

2026 年 7 月 22 日
在 商业
阅读时间: 3 mins read
阅读:859
A A


(本文作者为 字母 AI,钛媒体经授权发布)

Related articles

不靠海,不沿边,郑州靠什么造出一座汽车城?

泡沫猎手:马斯克的三次完美逃顶

2026 年 7 月 23 日
上市公司TOP5济安评估(7月13日至7月19日)|上市公司观察

上市公司 TOP5 济安评估 (7 月 13 日至 7 月 19 日)|上市公司观察

2026 年 7 月 23 日

文 | 字母 AI

7 月 21 日,谷歌突然上线了两个新模型:

广告

Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite。

没有一点点防备,也没有一丝顾虑,它俩就这样出现在了 Google AI Studio 和 Gemini 的模型选择器里。

这两个模型,一个主打更强的代码和 Agent 能力,一个主打更低成本的大规模调用。

而作为旗舰模型的 Gemini 3.5Pro,千呼万唤依然…… 出不来。

按照此前的计划,3.5 Pro 本应在 6 月份上线,现在 7 月都过一大半了,这款被寄予厚望的模型仍然没有正式亮相。

代表旗舰实力的答卷迟迟不交,谷歌先拿出两张“ 草稿纸”,是个什么意思?

3.6 Flash:比上一代便宜,不比上一代聪明

谷歌表示,相比上一代 Flash 模型,Gemini 3.6 Flash 进一步提升了编码、推理和工具调用表现,同时通过减少输出 token 降低运行成本。

Gemini 3.6 Flash 的定位是一个面向真实生产环境的高效模型,或者更直白一点,为 Agent 服务。

在 Agent 时代,一次任务可能需要几十轮模型调用,这意味着模型不仅要聪明,还必须足够快、足够便宜。

Google 此前已经在 Gemini 3.5 Flash 上强化了这条路线。根据官方 API 文档,Gemini 3.5 Flash 支持 100 万 token 的长上下文,可以一次处理大量信息,同时支持代码执行、调用外部工具、搜索文件等能力,能够完成更复杂、更长时间的任务。

Gemini 3.6 Flash 延续了这条路线,它追求的并不是单次回答的质量,是一个“ 能够承担得起每日真实工作” 的位置。

Gemini 3.6 Flash 的定价如下:

  • 输入:1.50 美元/百万 token
  • 输出:7.50 美元/百万 token

相比此前 Gemini 3.5 Flash 每百万 token 输入 1.5 美元、输出 9 美元的价格,输入成本没有变化,但输出成本进一步下降。

对于需要大量调用 AI 的企业来说,这种成本变化可能比 benchmark 上的几个百分点提升更加重要。

另外,谷歌展示的一项内部测试显示,在完成同一任务时,Gemini 3.6 Flash 相比 3.5 Flash 减少了 55.8% 的 token 消耗,同时将任务评分从 85 分提升到了 100 分。

当然,这只是谷歌自己的测试结果,只能说明 Google 希望展示的方向:

新模型不仅更省,而且能够用更少的计算完成同样甚至更好的任务。

在那些被公开的 benchmark 里,谷歌主要强调的是代码能力和 Agent 能力。

在 DeepSWE 代码评测中,Gemini 3.6 Flash 得分 49%,高于上一代的 37%。谷歌表示,新模型能够减少无效代码修改和重复执行过程。

在测试 AI 操作电脑能力的 OSWorld-Verified 评测中,Gemini 3.6 Flash 得分 83%,超过 3.5 Flash 的 78.4%。

而在面向机器学习任务的 MLE Bench 中,Gemini 3.6 Flash 得分 63.9%,相比上一代的 49.7% 也有明显提升。

不过,上述数据更多说明 Gemini 3.6 Flash 相比上一代有所进步。

如果放到当前大模型竞争中横向比较,Google 选择的对手是 GPT-5.6 Luna、Grok 4.5 和 Claude Sonnet 5(这里也可以看出这个产品的定位)。

从结果来看,Gemini 3.6 Flash 并没有全面领先,GPT 和 Claude 的模型在复杂软件工程和知识工作任务上仍然保持优势。

但这其实也是 Flash 系列存在的意义:

它不一定要成为最强模型,只需要在明显低于旗舰模型成本的情况下,提供够用的能力。

官方测评之外,根据 Artificial Analysis 的发布前测试,Gemini 3.6 Flash 在 Intelligence Index 上拿到了 50 分,与 Gemini 3.5 Flash 持平。

这意味着,如果只看模型综合“ 智力”,Gemini 3.6 Flash 并没有什么升级。

但是呢,它的速度又很好地弥补了这一点。

Artificial Analysis 还统计了模型完成 Intelligence Index 任务所需的平均时间。结果显示,Gemini 3.6 Flash 每项任务平均耗时约 1.3 分钟,相比上一代 3.5 Flash 的约 2.7 分钟,减少了一半。

与此同时,Gemini 3.5 Flash-Lite 的任务完成时间也从上一代 3.1 Flash-Lite 的约 1.6 分钟,下降到约 0.6 分钟。

总的来说,Gemini 3.6 Flash 的升级方向其实是效率—— 更少的 token 消耗,更低的运行成本,以及更适合长期运行的 Agent 能力。

对于习惯使用 Gemini 3.5 Flash 的用户来说,确实是非常不错的升级。

3.5 Flash-Lite:更快,但没有上一代便宜

然后再来看另一个模型 Gemini 3.5 Flash-Lite。

顾名思义,Flash-Lite 是 Flash 系列中更轻量的版本,相比 Flash,它牺牲了一部分能力上限,换取了更低的成本和更快的速度。

就像前面提到的那样,Gemini 3.5 Flash-Lite 的任务完成时间从上一代 3.1 Flash-Lite 的约 1.6 分钟,下降到了约 0.6 分钟。

3.5 Flash-Lite 也是 3.5 系列中速度最快的型号,根据 Artificial Analysis 测试数据,其生成速度达到约 350 token/秒,已经属于当前主流大模型中的高速水平。

Gemini 3.5 Flash-Lite 的定价如下:

输入:0.30 美元/百万 token

输出:2.50 美元/百万 token

相比 Gemini 3.6 Flash,输入价格约为 1/5,输出价格约为 1/3。不过,与上一代 Gemini 3.1 Flash-Lite 相比,新模型并没有进一步降价。

虽然 Gemini 3.5 Flash-Lite 由于能力提升,可以通过减少输出量降低部分成本,但综合起来,还是很难抵消单价上的成本增加。

根据官方文档,相比上一代 Gemini 3.1 Flash-Lite,新模型在不同思考等级 (thinking levels) 下都有明显提升。开发者可以根据任务需求调整模型的思考深度。

此外,Gemini 3.5 Flash-Lite 还内置了 Computer Use 能力,可以帮助 Agent 更可靠地操作电脑环境,完成跨应用任务。

在具体测试中,Gemini 3.5 Flash-Lite 相比上一代模型也有明显提升:在 Terminal-Bench 2.1 编程 Agent 测试中,成绩从 31% 提升到 54%;在测试长上下文理解能力的 GDM-MRCR v2 中,从 60.1% 提升到 72.2%;在更贴近真实工作场景的 GDPval-AA v2 任务执行测试中,从 642 提升到 1140。

值得注意的是,在一些 Agent 和代码相关测试中,Gemini 3.5 Flash-Lite 甚至超过了上一代更高定位的 Gemini 3 Flash 模型。

例如,在 SWE-Bench Pro 软件工程测试中,Gemini 3.5 Flash-Lite 得分 54.2%,高于 Gemini 3 Flash 的 49.6%;在测试 AI 操作电脑能力的 OSWorld-Verified 中,Gemini 3.5 Flash-Lite 也以 74.0% 的成绩超过 Gemini 3 Flash 的 65.1%。

这意味着,随着模型能力不断提升,过去需要更大模型才能完成的部分 Agent 任务,正在逐渐下沉到更便宜、更快速的模型。

顺便一提,除了前两个面向普通用户的通用模型,谷歌还推出了 Gemini 3.5 Flash Cyber。

它主要针对网络安全场景。根据官方文档,在 CodeMender 系统中,多个 Gemini 3.5 Flash Cyber Agent 可以协同工作,分别完成不同分析任务,并最终汇总成一份完整报告。在网络安全基准测试 CyberGym 中,Flash Cyber 也达到了接近前沿模型的表现。

该模型目前不会公开提供,仅通过 CodeMender 平台向政府和可信合作伙伴开放。

3.5 Pro:谷歌迟迟交不出的旗舰答卷

如果说 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 还可以看作是谷歌对 AI 规模化应用的判断,那么 Gemini 3.5 Pro 则代表着谷歌的模型上限。

但问题在于:这份答卷,到现在还没有交出来。

5 月 I/O 的时候,谷歌表示 Gemini 3.5 Pro 将在“ 接下来一个月左右” 推出,也就是预计在今年 6 月上线。现在 7 月都过了一大半了。

据彭博社 7 月 16 日报道,Gemini 3.5 Pro 的发布时间已经落后原计划数月。谷歌正在继续优化模型能力,尤其是编码表现,希望达到内部设定的目标。

路透社最新的报道则显示,截至目前,谷歌仍未公布具体上线时间,只表示该模型正在与合作伙伴测试,并将“ 很快” 推出;另有新闻稿透露,Gemini 4 的训练工作已经开始了。

而我们都知道,“ 很快” 就是不确定的意思。

Gemini 1.0 发布时就曾因演示争议受到质疑;Gemini 1.5 Pro 凭借百万 token 上下文短暂扳回局面,但随后 Claude 和 GPT 系列快速追赶;直到 Gemini 3 系列发布,谷歌才重新获得“ 回到前沿竞争” 的评价。

如今 Gemini 3.5 Pro 再次延期,市场关注的已经不只是一个模型什么时候上线,还有谷歌到底能否保持旗舰模型的竞争节奏问题。

何况谷歌透露出的编码表现不及预期,并不是什么容易解决的小问题。

随着 Agent 开始进入企业工作流,代码能力的重要性迅速提升。一个模型能否理解复杂项目、修改真实代码、完成多步骤开发任务,已经成为衡量它是否具备实际生产价值的重要指标。

路透社指出,华尔街正在等待 Gemini 3.5 Pro,因为它将成为判断 Google DeepMind 是否能够跟上 OpenAI 和 Anthropic 的重要指标。

当然,谷歌并不是没有动作,这次推出的几个模型,恰说明谷歌正在强化另一条路线:让 AI 变得更便宜、更容易规模化。

谷歌 CEO Sundar Pichai 近期也多次强调成本优势,并表示企业如果将大部分 AI 工作负载迁移到 Gemini 模型,可以每年节省超过 10 亿美元。

但问题在于,市场在期待一份证明谷歌模型实力的“ 答卷”,谷歌交出的却是两张关于效率和成本的“ 草稿纸”—— 很难不让人觉得,谷歌在用 Flash 系列填补 Pro 延迟留下的空档。

有意思的是,在 Gemini 3.5 Pro 延期的同时,AI 竞争格局正在发生变化。

过去,人们讨论 AI 领先者,主要关注海外“ 御三家”:OpenAI、Anthropic 和 Google DeepMind。

但最近,GLM-5.2、Kimi K3 等国产模型也开始进入前沿竞争,并引发了大量讨论。

前沿模型的追赶速度正在加快,也让谷歌的问题变得更加紧迫,它当然可以继续大力推出 Flash 模型,但前提是它的旗舰模型足够给力—— 只要硬实力足够,自有大儒为他辩经。

如果谷歌最终推出一个真正领先的旗舰模型,那么 Flash 路线会成为完整体系的一部分:Pro 负责突破能力上限;Flash 负责规模化应用。

但如果 Gemini 3.5 Pro 持续落后,市场很可能会继续追问:谷歌拥有最强 AI 研究资源,为什么却无法稳定跑赢竞争对手?

在 Alphabet 本周举行第二季度财报电话会议时,人们很可能会进一步询问有关 Gemini 3.5 Pro 的更多细节。

更多精彩内容,关注钛媒体微信号 (ID:taimeiti),或者下载钛媒体 App

相关 文章

不靠海,不沿边,郑州靠什么造出一座汽车城?

泡沫猎手:马斯克的三次完美逃顶

来自 周天财经
2026 年 7 月 23 日
0

(本文作者为 锦缎,钛媒体经授权发布) 文...

上市公司TOP5济安评估(7月13日至7月19日)|上市公司观察

上市公司 TOP5 济安评估 (7 月 13 日至 7 月 19 日)|上市公司观察

来自 周天财经
2026 年 7 月 23 日
0

本周机构调研热度较上周基本持平,但头部热...

端侧觉醒:当AI长出" 身体",热闹之后拼什么?| WAIC2026

端侧觉醒:当 AI 长出" 身体",热闹之后拼什么?| WAIC2026

来自 周天财经
2026 年 7 月 23 日
0

7 月 17 日至 20 日,上海世博展览馆的人潮...

五洲医疗跨界半导体:上市三年营收利润「双杀」,一份「留白」预案撬动20cm涨停丨并购一线

五洲医疗跨界半导体:上市三年营收利润 「双杀」,一份 「留白」 预案撬动 20cm 涨停丨并购一线

来自 周天财经
2026 年 7 月 22 日
0

7 月 22 日开市,五洲医疗 (301234....

暑期遭遇定档难

暑期遭遇定档难

来自 周天财经
2026 年 7 月 22 日
0

(本文作者为 犀牛娱乐,钛媒体经授权发布...

加载更多
广告
  • 热门
  • 评论
  • 最新
神马经典投研: 集资讯、策略、研报一站式期货投研工具

神马经典投研: 集资讯、策略、研报一站式期货投研工具

2025 年 11 月 7 日
「我们也深陷残酷价格战」,德资巨头中国区高管警告

「我们也深陷残酷价格战」,德资巨头中国区高管警告

2025 年 8 月 4 日
一周产业基金|上海市人工智能CVC基金发布;湖北百亿人形机器人母基金来了

一周产业基金|上海市人工智能 CVC 基金发布;湖北百亿人形机器人母基金来了

2025 年 8 月 4 日
「硬科技」指数携手上涨,半导体设备ETF易方达(159558)、芯片ETF易方达(516350)等产品助力布局板块龙头

基民懵了!这个火爆的板块年内涨超 37%,主力却借道 ETF 狂抛逾 400 亿元

2025 年 9 月 20 日
Lesson 1: Basics Of Photography With Natural Lighting

The Single Most Important Thing You Need To Know About Success

4
Lesson 1: Basics Of Photography With Natural Lighting

Lesson 1: Basics Of Photography With Natural Lighting

3
Lesson 1: Basics Of Photography With Natural Lighting

5 Ways Animals Will Help You Get More Business

2
Lesson 1: Basics Of Photography With Natural Lighting

New Cryptocurrency That Will Kill Of Bitcoin

2

周末利好频出,A 股今天为何盘中震荡,尾盘才拉升?

2026 年 7 月 23 日

电力板块逆势活跃,绿色电力 ETF 易方达 (562960) 连续 2 日 「吸金」 累计近 1 亿元

2026 年 7 月 23 日

香港黄金价格今天多少一克 (2026 年 7 月 17 日)

2026 年 7 月 23 日
冯骥评《梁文锋四小时投资人会议实录》:荡气回肠,这就是中国故事

冯骥评 《梁文锋四小时投资人会议实录》:荡气回肠,这就是中国故事

2026 年 7 月 23 日
  • 隐私政策
  • 联系我们
  • 关于周天
  • 登录
  • 注册
投诉建议:+86 13326565461

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

没有结果
查看所有结果
  • 首页
  • 24 小时
  • 世界
  • 商业
  • 基金
  • 期货
  • 股票
  • 行业新闻
  • 黄金

© 2025 广州小舟天传媒有限公司 by 周天财经 - 粤 ICP 备 2025452169 号-1

欢迎回来!

在下面登录您的帐户

忘记密码? 注册

创建新帐户!

填写以下表格进行注册

所有项目需要填写。 登录

重置您的密码

请输入您的用户名或电子邮件地址以重置密码。

登录

用户登录

还没有账号?立即注册

用户注册

已有账号?立即登录