• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

智谱AI发布GLM-5.3-Flash:性能比肩顶尖模型,成本降至1/40,国产芯片首次承载大规模流量

智谱AI发布GLM-5.3-Flash:性能比肩顶尖模型,成本降至1/40,国产芯片首次承载大规模流量
AI TOP100
13天前
AI摘要
2026年8月26日智谱AI发布GLM-5系列首个原生多模态开源模型GLM-5.3-Flash,总参320B、推理激活仅18B,支持百万Token上下文,性能比肩Claude Opus 4.8,成本仅为其1/40。该模型全部流量由十万张级国产芯片集群承载,是国产算力首次大规模服务全球真实负载,大幅降低顶尖AI使用门槛。

使用AI智能大模型技术生成

智谱AI发布GLM-5.3-Flash


发布时间 :2026年8月26日

模型亮点 :GLM-5系列首个原生多模态模型,性能比肩Claude Opus 4.8,成本仅为其1/40,所有测试流量均由国产芯片集群承载。

工具地址:智谱AI官网

智谱AI发布GLM-5.3-Flash1️⃣ 模型概述:

GLM-5.3-Flash是智谱AI于2026年8月26日正式发布并开源的原生多模态大模型。

项目参数/说明
总参数量320B
架构设计创新的 MoE(混合专家)架构
推理激活参数仅18B
多模态支持文本、图像、视频输入
上下文窗口高达 100万 Token
模型定位旗舰效率型 —— 以极致成本提供前沿能力

💡 “大基座+小激活” 的设计使其在保持顶尖能力的同时,实现了极高的推理效率。

2️⃣ 核心特性与技术创新

🔹 2.1 原生多模态与视觉编码能力

GLM-5.3-Flash将视觉能力原生集成进模型,能够自主判断何时需要“观察”,并利用视觉反馈指导下一步行动。

在视觉编码领域表现尤为突出:

  • 🎨 前端开发 :根据设计图直接生成前端代码,并在浏览器预览效果,实现“边写、边看、边改”的闭环工作流
  • 🎮 3D建模与游戏开发 :支持从文本描述生成3D场景,可导出Blender、Unity格式。甚至有案例显示,其自主运行16小时,搭建了一套约400㎡的专业主厨自宅与测试厨房
  • 📄 自我验证与优化 :能检查并优化自身输出的PPTX、PDF、DOCX等文档,具备更强的审美判断能力

🔹 2.2 混合注意力架构与效率革命

GLM-5.3-Flash是全球首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,这是实现高效低成本的关键:

创新点具体表现
动态切换注意力模式关键信息使用稀疏注意力保证精度;非关键上下文使用线性注意力提升速度
极致压缩内存与计算通过IndexPool技术将索引器缓存向量从4个压成1个
计算量与缓存优化注意力计算量降低 3.01倍,KV缓存大小降低 4.44倍
长上下文成本优势长上下文服务成本降至GLM-5.3的约 1/3
推理速度提升处理10万字法律文档时,推理速度比GLM-5.3快 2.8倍

🔹 2.3 国产芯片全栈适配

GLM-5.3-Flash的发布标志着国产AI芯片在大模型应用领域的重要突破:

  • 🇨🇳 首次大规模承载流量 :发布前以匿名模型"Ox-Alpha"在OpenCode和OpenRouter测试期间,所有请求流量均由国产芯片集群(昇腾910B、寒武纪思元590等)提供算力支持
  • ⚙️ 软硬协同优化 :智谱在SGLang基础上构建专用推理引擎,通过“模型优化系统,系统承载模型”的正向循环(由GLM-5.3驱动的Infra Agent辅助开发),将端到端服务性能提升 3倍
  • 📊 接近英伟达GPU效率 :在国产芯片集群上实现了接近NVIDIA GPU的推理效率,单Token成本已达到与主流英伟达GPU相当的水平

3️⃣ 性能表现:跻身全球第一梯队

GLM-5.3-Flash在多项权威基准测试中展现了顶尖能力:

评估维度表现摘要对比参考
综合智能AA智能指数得分 57与Claude Opus 4.8持平,进入全球前沿模型区间
编程能力Z.ai Code Bench体感评估中表现与Claude Opus 4.8相当超过GLM-5.2
Agent与复杂任务Terminal Bench 2.1、Agents’ Last Exam、AutomationBench等基准表现优异明显优于GLM-5.2,接近Claude Opus 4.8
匿名测试验证以"Ox-Alpha"身份在OpenRouter,6天处理超20万亿Token创调用量新高,成为当周最受欢迎模型

智谱AI发布GLM-5.3-Flash

在 https://Z.ai 代码基准测试中,该测试衡量真实世界的编码性能,GLM-5.3-Flash 在每个努力水平上明显优于 GLM-5.2,并且与 Claude Opus 4.8 表现相当。

智谱AI发布GLM-5.3-Flash

架构增强与优化的预训练语料库相结合,使 GLM-5.3-Flash 能够在更少的计算资源下提供更高的智能水平。

智谱AI发布GLM-5.3-Flash

4️⃣ 成本优势:性价比高

GLM-5.3-Flash的定价策略是其最具冲击力的亮点,旨在推动AI普惠:

定价维度GLM-5.3-Flash(限时折扣)GLM-5.3Claude Opus 4.8
输入价格 ($/M Tokens)0.0751.40~3.00
输出价格 ($/M Tokens)0.254.40~10.00
缓存命中输入 ($/M Tokens)0.0150.26~0.60
相对价格比基准 (1x)18.7x~40x

💡 限时折扣期间,GLM-5.3-Flash的价格约为GLM-5.3的 1/20,Claude Opus 4.8的 1/40。

开发者能以极低的成本获得此前只有顶尖闭源模型才能提供的能力,大幅降低了个人开发者、中小企业和学术研究机构使用世界级AI模型的门槛。

5️⃣ 国产算力:10 万张国产芯片首次大规模集体出海

GLM-5.3-Flash 最引人注目的特点之一,是其全部线上流量由超过 10 万张国产芯片承载 。这是国产算力芯片首次大规模直接服务全球真实负载 。

据智谱披露,这批芯片通过自研高带宽互联网络连接,采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、Prompt 预填充和逐 Token 解码拆分为可独立调度的工作池。与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 Token 成本已达到与主流英伟达 GPU 相当的水平 。据《晚点 LatePost》了解,这批芯片的供应商或来自华为、摩尔线程与海光。


AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。

想了解AITOP100平台其它版块的内容,请点击下方超链接查看

AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说

AITOP100平台官方交流社群二维码:

AITOP100平台官方交流社群二维码AITOP100平台官方交流社群二维码

0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关AI工具
  • 智谱清言
相关资讯
  • 99克、4英寸、全语音操控:联通×魅族“小魔方”把AI手机做成“随身助手”

  • AI帮你建3D模型:GPT-6 Astra + Blender全流程实操教程

  • 微信开源WeMM-Embedding:把日调用10亿次的“找图”底座交了出来

  • DeepSeek罕见放出150个HC:Harness团队急招后端,规模暴涨倒逼系统重写

  • 火山引擎内测AI版权平台,Seedance这次不防侵权了,转向IP商业化搞钱

热点资讯

每日AI资讯-2026年9月04日

5天前
每日AI资讯-2026年9月04日

每日AI资讯-2026年8月31日

9天前
每日AI资讯-2026年8月31日

每日AI资讯-2026年9月01日

8天前
每日AI资讯-2026年9月01日

AITOP100-AI画布「分享优质工作流」激励计划上线,3万积分等你来拿!🚀

2天前
AITOP100-AI画布「分享优质工作流」激励计划上线,3万积分等你来拿!🚀

每日AI资讯-2026年9月02日

7天前
每日AI资讯-2026年9月02日
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有