• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

智谱AI发布GLM-5.3-Flash:性能比肩顶尖模型,成本降至1/40,国产芯片首次承载大规模流量

智谱AI发布GLM-5.3-Flash:性能比肩顶尖模型,成本降至1/40,国产芯片首次承载大规模流量
AI TOP100
1小时前

智谱AI发布GLM-5.3-Flash


发布时间 :2026年8月26日

模型亮点 :GLM-5系列首个原生多模态模型,性能比肩Claude Opus 4.8,成本仅为其1/40,所有测试流量均由国产芯片集群承载。

工具地址:智谱AI官网

智谱AI发布GLM-5.3-Flash1️⃣ 模型概述:

GLM-5.3-Flash是智谱AI于2026年8月26日正式发布并开源的原生多模态大模型。

项目 参数/说明
总参数量 320B
架构设计 创新的 MoE(混合专家)架构
推理激活参数 仅18B
多模态支持 文本、图像、视频输入
上下文窗口 高达 100万 Token
模型定位 旗舰效率型 —— 以极致成本提供前沿能力
💡 “大基座+小激活” 的设计使其在保持顶尖能力的同时,实现了极高的推理效率。

2️⃣ 核心特性与技术创新

🔹 2.1 原生多模态与视觉编码能力

GLM-5.3-Flash将视觉能力原生集成进模型,能够自主判断何时需要“观察”,并利用视觉反馈指导下一步行动。

在视觉编码领域表现尤为突出:

  • 🎨 前端开发 :根据设计图直接生成前端代码,并在浏览器预览效果,实现“边写、边看、边改”的闭环工作流
  • 🎮 3D建模与游戏开发 :支持从文本描述生成3D场景,可导出Blender、Unity格式。甚至有案例显示,其自主运行16小时,搭建了一套约400㎡的专业主厨自宅与测试厨房
  • 📄 自我验证与优化 :能检查并优化自身输出的PPTX、PDF、DOCX等文档,具备更强的审美判断能力

🔹 2.2 混合注意力架构与效率革命

GLM-5.3-Flash是全球首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,这是实现高效低成本的关键:

创新点 具体表现
动态切换注意力模式 关键信息使用稀疏注意力保证精度;非关键上下文使用线性注意力提升速度
极致压缩内存与计算 通过IndexPool技术将索引器缓存向量从4个压成1个
计算量与缓存优化 注意力计算量降低 3.01倍,KV缓存大小降低 4.44倍
长上下文成本优势 长上下文服务成本降至GLM-5.3的约 1/3
推理速度提升 处理10万字法律文档时,推理速度比GLM-5.3快 2.8倍

🔹 2.3 国产芯片全栈适配

GLM-5.3-Flash的发布标志着国产AI芯片在大模型应用领域的重要突破:

  • 🇨🇳 首次大规模承载流量 :发布前以匿名模型"Ox-Alpha"在OpenCode和OpenRouter测试期间,所有请求流量均由国产芯片集群(昇腾910B、寒武纪思元590等)提供算力支持
  • ⚙️ 软硬协同优化 :智谱在SGLang基础上构建专用推理引擎,通过“模型优化系统,系统承载模型”的正向循环(由GLM-5.3驱动的Infra Agent辅助开发),将端到端服务性能提升 3倍
  • 📊 接近英伟达GPU效率 :在国产芯片集群上实现了接近NVIDIA GPU的推理效率,单Token成本已达到与主流英伟达GPU相当的水平

3️⃣ 性能表现:跻身全球第一梯队

GLM-5.3-Flash在多项权威基准测试中展现了顶尖能力:

评估维度 表现摘要 对比参考
综合智能 AA智能指数得分 57 与Claude Opus 4.8持平,进入全球前沿模型区间
编程能力 Z.ai Code Bench体感评估中表现与Claude Opus 4.8相当 超过GLM-5.2
Agent与复杂任务 Terminal Bench 2.1、Agents’ Last Exam、AutomationBench等基准表现优异 明显优于GLM-5.2,接近Claude Opus 4.8
匿名测试验证 以"Ox-Alpha"身份在OpenRouter,6天处理超20万亿Token 创调用量新高,成为当周最受欢迎模型

智谱AI发布GLM-5.3-Flash

在 https://Z.ai 代码基准测试中,该测试衡量真实世界的编码性能,GLM-5.3-Flash 在每个努力水平上明显优于 GLM-5.2,并且与 Claude Opus 4.8 表现相当。

智谱AI发布GLM-5.3-Flash

架构增强与优化的预训练语料库相结合,使 GLM-5.3-Flash 能够在更少的计算资源下提供更高的智能水平。

智谱AI发布GLM-5.3-Flash

4️⃣ 成本优势:性价比高

GLM-5.3-Flash的定价策略是其最具冲击力的亮点,旨在推动AI普惠:

定价维度 GLM-5.3-Flash(限时折扣) GLM-5.3 Claude Opus 4.8
输入价格 ($/M Tokens) 0.075 1.40 ~3.00
输出价格 ($/M Tokens) 0.25 4.40 ~10.00
缓存命中输入 ($/M Tokens) 0.015 0.26 ~0.60
相对价格比 基准 (1x) 18.7x ~40x
💡 限时折扣期间,GLM-5.3-Flash的价格约为GLM-5.3的 1/20,Claude Opus 4.8的 1/40。

开发者能以极低的成本获得此前只有顶尖闭源模型才能提供的能力,大幅降低了个人开发者、中小企业和学术研究机构使用世界级AI模型的门槛。

5️⃣ 国产算力:10 万张国产芯片首次大规模集体出海

GLM-5.3-Flash 最引人注目的特点之一,是其全部线上流量由超过 10 万张国产芯片承载 。这是国产算力芯片首次大规模直接服务全球真实负载 。

据智谱披露,这批芯片通过自研高带宽互联网络连接,采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、Prompt 预填充和逐 Token 解码拆分为可独立调度的工作池。与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 Token 成本已达到与主流英伟达 GPU 相当的水平 。据《晚点 LatePost》了解,这批芯片的供应商或来自华为、摩尔线程与海光。


AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。

想了解AITOP100平台其它版块的内容,请点击下方超链接查看

AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说

AITOP100平台官方交流社群二维码:

AITOP100平台官方交流社群二维码AITOP100平台官方交流社群二维码

0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关AI工具
  • 智谱清言
相关资讯
  • 千问办公接入企业微信:阿里Agent集齐国内三大协同办公平台

  • Seedance 2.5的1秒的成本是$3.60,Wan3.0一秒的成本$1.20,成本直降2/3!!

  • 豆包工作上线:AI办公从“帮你写”进化到“替你干”,飞书生态是最大底牌

  • 千问APP打通阿里云Token Plan:你的API Key终于能当“月卡”用了

  • AITOP100「AI画布工作流」来了,创作效率直接拉满!

热点资讯

每日AI资讯-2026年8月25日

1天前
每日AI资讯-2026年8月25日

每日AI资讯-2026年8月24日

2天前
每日AI资讯-2026年8月24日

每日AI资讯-2026年8月20日

6天前
每日AI资讯-2026年8月20日

每日AI资讯-2026年8月19日

7天前
每日AI资讯-2026年8月19日

陵水海归小镇x妙呀 品牌IP设计大赛:万元现金+创业支持

7天前
陵水海归小镇x妙呀 品牌IP设计大赛:万元现金+创业支持
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有