距离Gemini 3.7 Flash发布仅过去三周,谷歌于9月2日又推出了Gemini 3.8系列两款模型——Gemini 3.8 Flash 与 Gemini 3.8 Flash Cyber (真让人大开眼界)。这已是谷歌在六周之内发布的第三款Flash模型了(不按套路出牌)。
模型地址:谷歌Gemini官网 (海外网站需要科学上网)

一、核心机制:“更努力地工作”
Gemini 3.8 Flash并非架构层面的重构——它基于Gemini 3.7 Flash,在模型架构、训练数据集、硬件和软件层面均延续了前代的技术栈。性能提升的核心逻辑来自产品设计层面的选择:3.8 Flash在面对复杂任务时会“更努力地工作”——执行更多推理步骤、反复调用工具、在过程中自我检查和迭代 。
这套“长时间运行的代理循环”(long-running agentic loops)机制,通过递归评估和优化模型输出来提升任务完成质量。代价是显而易见的:模型可能比3.7 Flash消耗更多token。据Artificial Analysis的测试,3.8 Flash的单任务成本较3.7 Flash上升约40%。
为平衡算力约束,谷歌保留了可调节的 推理强度档位 (effort levels),开发者可根据任务需求在质量、成本和延迟之间做出取舍。效率优先的用例可继续使用3.7 Flash。
二、基准测试:逼近Opus 5,局部超越
从官方公布的基准数据来看,Gemini 3.8 Flash在多个维度上已逼近甚至局部超越Claude Opus 5:
| 基准测试 | Gemini 3.8 Flash | Gemini 3.7 Flash | Claude Opus 5 |
|---|---|---|---|
| DeepSWE v1.1(长周期软件工程) | 73.7% | 65.3% | 74.0% |
| Terminal-Bench 2.1(命令行Agent) | 89.4% | 85.8% | 89.1% |
| Vals Finance Agent v2(金融分析) | 61.4% | 59.0% | 58.6% |
| Harvey's Legal Agent Benchmark(法律) | 10.0% | 8.8% | 6.7% |
| HLE-Verified(多学科专家推理) | 54.9% | 53.6% | 54.4% |
| CharXiv Reasoning(复杂图表理解) | 86.2% | 84.5% | 83.7% |
| LVBench(长视频理解,Agent模式) | 87.8% | 85.4% | 75.4% |
在DeepSWE v1.1上,3.8 Flash较3.7 Flash提升了8.4个百分点,距Opus 5仅差0.3个百分点。在金融、法律等垂直专业领域,3.8 Flash对Opus 5的优势更为明显。14组基准评测中拿下8个第一 。
⚠️ 不过需要指出的是,基准测试成绩与实际使用体验之间仍存在差距 。
有评测指出,3.8 Flash能在两三分钟内生成可运行的3D场景代码,但结果却是“能跑但不对”——直升机模型的部件关系和运动方式粗糙。

三、定价策略:单价不变,单任务成本上升
Gemini 3.8 Flash的API定价与3.7 Flash完全一致:输入 $0.75/百万token ,输出 $3.75/百万token 。缓存读取价格为$0.075/百万token。
但这一价格 仅为限时优惠 ,有效期至2026年12月31日。2027年1月1日起将恢复常规价格:输入$1.50/百万token,输出$7.50/百万token。即便如此,恢复后的单价仍远低于Claude Opus 5(输入$5/百万token,输出$25/百万token)和GPT-5.6 Sol(输入$4/百万token,输出$20/百万token)。
但如前所述,由于3.8 Flash在复杂任务中消耗更多token,单任务实际成本上升约40% ——“单价未变,完成一件事更贵了”。知识截止日期为2026年3月,部分领域信息可能更晚,部分则仍停留在2025年1月。


四、Gemini 3.8 Flash Cyber:网络安全专用衍生版
与通用模型同期发布的还有 Gemini 3.8 Flash Cyber ,一款面向防御性网络安全的专用模型。两者共享同一基础智能内核。
核心性能
在漏洞挖掘基准CyberGym上展现前沿级自主漏洞发现能力;CWE-Bench测试中Pass@1达 47.2% ,紧追顶尖前沿模型的47.8%,成本显著更低。在谷歌内部覆盖20种编程语言的真实漏洞测试中,漏洞挖掘成功率突破70%。
落地案例
- Chrome安全团队评估发现,3.8 Flash Cyber生成的有效修复补丁数量达到顶尖商业模型的 2.6倍
- 安全机构Wiz内部基准测试显示召回率提升7.5%-9.7%,成本降至前沿模型的1/5.2至1/2.3
- 谷歌云漏洞研究团队借助该模型耗时不到2小时便挖出一处严重底层架构漏洞,此前同类排查通常需要数月
分发渠道
通过 Fairwind Program 向首批受信任的政府机构和安全防御团队开放。相比基础模型,Cyber版本适度放宽了网络安全领域的策略拦截限制,因此仅面向需要完备网络攻防能力的合规团队。
五、趋势观察
第一,“推理换性能”成为模型迭代的新路径。 Gemini 3.8 Flash证明了在不改变架构的前提下,通过强化推理深度即可实现性能跃迁。这标志着大模型竞争正从“模型有多大”转向“模型有多努力”。
第二,六周三迭代的节奏值得关注。 从3.6到3.7再到3.8,谷歌以近乎“下饺子”的速度推进Flash系列迭代。这种高频迭代在维持市场声量的同时,也让人对版本号的剩余空间产生好奇。
第三,垂直专用模型与通用模型并行推进。 Cyber版本的推出表明,基础模型的能力正在向网络安全等高价值垂直场景溢出和定制化,通用与专用并行的产品矩阵正成为头部玩家的标准配置。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










