• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

谷歌六周内第三次迭代,Gemini 3.8 Flash的“推理换性能”逻辑

谷歌六周内第三次迭代,Gemini 3.8 Flash的“推理换性能”逻辑
AI TOP100
56分钟前

距离Gemini 3.7 Flash发布仅过去三周,谷歌于9月2日又推出了Gemini 3.8系列两款模型——Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber (真让人大开眼界)。这已是谷歌在六周之内发布的第三款Flash模型了(不按套路出牌)。

模型地址:谷歌Gemini官网 (海外网站需要科学上网)

Gemini 3.8 Flash的

一、核心机制:“更努力地工作”

Gemini 3.8 Flash并非架构层面的重构——它基于Gemini 3.7 Flash,在模型架构、训练数据集、硬件和软件层面均延续了前代的技术栈。性能提升的核心逻辑来自产品设计层面的选择:3.8 Flash在面对复杂任务时会“更努力地工作”——执行更多推理步骤、反复调用工具、在过程中自我检查和迭代 。

这套“长时间运行的代理循环”(long-running agentic loops)机制,通过递归评估和优化模型输出来提升任务完成质量。代价是显而易见的:模型可能比3.7 Flash消耗更多token。据Artificial Analysis的测试,3.8 Flash的单任务成本较3.7 Flash上升约40%。

为平衡算力约束,谷歌保留了可调节的 推理强度档位 (effort levels),开发者可根据任务需求在质量、成本和延迟之间做出取舍。效率优先的用例可继续使用3.7 Flash。

二、基准测试:逼近Opus 5,局部超越

从官方公布的基准数据来看,Gemini 3.8 Flash在多个维度上已逼近甚至局部超越Claude Opus 5:

基准测试 Gemini 3.8 Flash Gemini 3.7 Flash Claude Opus 5
DeepSWE v1.1(长周期软件工程) 73.7% 65.3% 74.0%
Terminal-Bench 2.1(命令行Agent) 89.4% 85.8% 89.1%
Vals Finance Agent v2(金融分析) 61.4% 59.0% 58.6%
Harvey's Legal Agent Benchmark(法律) 10.0% 8.8% 6.7%
HLE-Verified(多学科专家推理) 54.9% 53.6% 54.4%
CharXiv Reasoning(复杂图表理解) 86.2% 84.5% 83.7%
LVBench(长视频理解,Agent模式) 87.8% 85.4% 75.4%

在DeepSWE v1.1上,3.8 Flash较3.7 Flash提升了8.4个百分点,距Opus 5仅差0.3个百分点。在金融、法律等垂直专业领域,3.8 Flash对Opus 5的优势更为明显。14组基准评测中拿下8个第一 。

⚠️ 不过需要指出的是,基准测试成绩与实际使用体验之间仍存在差距 。

有评测指出,3.8 Flash能在两三分钟内生成可运行的3D场景代码,但结果却是“能跑但不对”——直升机模型的部件关系和运动方式粗糙。

Gemini 3.8 Flash的

三、定价策略:单价不变,单任务成本上升

Gemini 3.8 Flash的API定价与3.7 Flash完全一致:输入 $0.75/百万token ,输出 $3.75/百万token 。缓存读取价格为$0.075/百万token。

但这一价格 仅为限时优惠 ,有效期至2026年12月31日。2027年1月1日起将恢复常规价格:输入$1.50/百万token,输出$7.50/百万token。即便如此,恢复后的单价仍远低于Claude Opus 5(输入$5/百万token,输出$25/百万token)和GPT-5.6 Sol(输入$4/百万token,输出$20/百万token)。

但如前所述,由于3.8 Flash在复杂任务中消耗更多token,单任务实际成本上升约40% ——“单价未变,完成一件事更贵了”。知识截止日期为2026年3月,部分领域信息可能更晚,部分则仍停留在2025年1月。

Gemini 3.8 Flash的Gemini 3.8 Flash的

四、Gemini 3.8 Flash Cyber:网络安全专用衍生版

与通用模型同期发布的还有 Gemini 3.8 Flash Cyber ,一款面向防御性网络安全的专用模型。两者共享同一基础智能内核。

核心性能

在漏洞挖掘基准CyberGym上展现前沿级自主漏洞发现能力;CWE-Bench测试中Pass@1达 47.2% ,紧追顶尖前沿模型的47.8%,成本显著更低。在谷歌内部覆盖20种编程语言的真实漏洞测试中,漏洞挖掘成功率突破70%。

落地案例

  • Chrome安全团队评估发现,3.8 Flash Cyber生成的有效修复补丁数量达到顶尖商业模型的 2.6倍
  • 安全机构Wiz内部基准测试显示召回率提升7.5%-9.7%,成本降至前沿模型的1/5.2至1/2.3
  • 谷歌云漏洞研究团队借助该模型耗时不到2小时便挖出一处严重底层架构漏洞,此前同类排查通常需要数月

分发渠道

通过 Fairwind Program 向首批受信任的政府机构和安全防御团队开放。相比基础模型,Cyber版本适度放宽了网络安全领域的策略拦截限制,因此仅面向需要完备网络攻防能力的合规团队。

五、趋势观察

第一,“推理换性能”成为模型迭代的新路径。 Gemini 3.8 Flash证明了在不改变架构的前提下,通过强化推理深度即可实现性能跃迁。这标志着大模型竞争正从“模型有多大”转向“模型有多努力”。

第二,六周三迭代的节奏值得关注。 从3.6到3.7再到3.8,谷歌以近乎“下饺子”的速度推进Flash系列迭代。这种高频迭代在维持市场声量的同时,也让人对版本号的剩余空间产生好奇。

第三,垂直专用模型与通用模型并行推进。 Cyber版本的推出表明,基础模型的能力正在向网络安全等高价值垂直场景溢出和定制化,通用与专用并行的产品矩阵正成为头部玩家的标准配置。


AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。

想了解AITOP100平台其它版块的内容,请点击下方超链接查看

AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说

AITOP100平台官方交流社群二维码:

AITOP100平台官方交流社群二维码AITOP100平台官方交流社群二维码

0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关AI工具
  • 谷歌Gemini
相关资讯
  • 谷歌六周内第三次迭代,Gemini 3.8 Flash的“推理换性能”逻辑

  • 李飞飞的Atlas:当AI终于决定睁开眼看世界

  • World Labs发布Atlas:首个多模态世界模型,用像素级相机控制生成3D一致世界

  • 谷歌AI修图工具Pics:不用模板不学设计,Workspace里“一句话”搞定海报配图

  • Anthropic发布Claude Fable 5.1与Mythos 5:世界上最先进的编码和知识工作模型

热点资讯

每日AI资讯-2026年8月25日

8天前
每日AI资讯-2026年8月25日

腾讯混元发布Hy4 Preview:770B MoE开源旗舰,1M上下文,聚焦真实生产力

5天前
腾讯混元发布Hy4 Preview:770B MoE开源旗舰,1M上下文,聚焦真实生产力

每日AI资讯-2026年9月02日

21小时前
每日AI资讯-2026年9月02日

每日AI资讯-2026年8月31日

2天前
每日AI资讯-2026年8月31日

每日AI资讯-2026年8月28日

5天前
每日AI资讯-2026年8月28日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有