• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

智谱AI发布GLM-5.3-Flash:性能比肩顶尖模型,成本降至1/40,国产芯片首次承载大规模流量

智谱AI发布GLM-5.3-Flash:性能比肩顶尖模型,成本降至1/40,国产芯片首次承载大规模流量
AI TOP100
2026-08-27 11:35:10
AI摘要
2026年8月26日智谱AI发布GLM-5系列首个原生多模态开源模型GLM-5.3-Flash,总参320B、推理激活仅18B,支持百万Token上下文,性能比肩Claude Opus 4.8,成本仅为其1/40。该模型全部流量由十万张级国产芯片集群承载,是国产算力首次大规模服务全球真实负载,大幅降低顶尖AI使用门槛。

使用AI智能大模型技术生成

智谱AI发布GLM-5.3-Flash


发布时间 :2026年8月26日

模型亮点 :GLM-5系列首个原生多模态模型,性能比肩Claude Opus 4.8,成本仅为其1/40,所有测试流量均由国产芯片集群承载。

工具地址:智谱AI官网

智谱AI发布GLM-5.3-Flash1️⃣ 模型概述:

GLM-5.3-Flash是智谱AI于2026年8月26日正式发布并开源的原生多模态大模型。

项目参数/说明
总参数量320B
架构设计创新的 MoE(混合专家)架构
推理激活参数仅18B
多模态支持文本、图像、视频输入
上下文窗口高达 100万 Token
模型定位旗舰效率型 —— 以极致成本提供前沿能力

💡 “大基座+小激活” 的设计使其在保持顶尖能力的同时,实现了极高的推理效率。

2️⃣ 核心特性与技术创新

🔹 2.1 原生多模态与视觉编码能力

GLM-5.3-Flash将视觉能力原生集成进模型,能够自主判断何时需要“观察”,并利用视觉反馈指导下一步行动。

在视觉编码领域表现尤为突出:

  • 🎨 前端开发 :根据设计图直接生成前端代码,并在浏览器预览效果,实现“边写、边看、边改”的闭环工作流
  • 🎮 3D建模与游戏开发 :支持从文本描述生成3D场景,可导出Blender、Unity格式。甚至有案例显示,其自主运行16小时,搭建了一套约400㎡的专业主厨自宅与测试厨房
  • 📄 自我验证与优化 :能检查并优化自身输出的PPTX、PDF、DOCX等文档,具备更强的审美判断能力

🔹 2.2 混合注意力架构与效率革命

GLM-5.3-Flash是全球首个采用稀疏注意力与线性注意力混合架构的开源前沿模型,这是实现高效低成本的关键:

创新点具体表现
动态切换注意力模式关键信息使用稀疏注意力保证精度;非关键上下文使用线性注意力提升速度
极致压缩内存与计算通过IndexPool技术将索引器缓存向量从4个压成1个
计算量与缓存优化注意力计算量降低 3.01倍,KV缓存大小降低 4.44倍
长上下文成本优势长上下文服务成本降至GLM-5.3的约 1/3
推理速度提升处理10万字法律文档时,推理速度比GLM-5.3快 2.8倍

🔹 2.3 国产芯片全栈适配

GLM-5.3-Flash的发布标志着国产AI芯片在大模型应用领域的重要突破:

  • 🇨🇳 首次大规模承载流量 :发布前以匿名模型"Ox-Alpha"在OpenCode和OpenRouter测试期间,所有请求流量均由国产芯片集群(昇腾910B、寒武纪思元590等)提供算力支持
  • ⚙️ 软硬协同优化 :智谱在SGLang基础上构建专用推理引擎,通过“模型优化系统,系统承载模型”的正向循环(由GLM-5.3驱动的Infra Agent辅助开发),将端到端服务性能提升 3倍
  • 📊 接近英伟达GPU效率 :在国产芯片集群上实现了接近NVIDIA GPU的推理效率,单Token成本已达到与主流英伟达GPU相当的水平

3️⃣ 性能表现:跻身全球第一梯队

GLM-5.3-Flash在多项权威基准测试中展现了顶尖能力:

评估维度表现摘要对比参考
综合智能AA智能指数得分 57与Claude Opus 4.8持平,进入全球前沿模型区间
编程能力Z.ai Code Bench体感评估中表现与Claude Opus 4.8相当超过GLM-5.2
Agent与复杂任务Terminal Bench 2.1、Agents’ Last Exam、AutomationBench等基准表现优异明显优于GLM-5.2,接近Claude Opus 4.8
匿名测试验证以"Ox-Alpha"身份在OpenRouter,6天处理超20万亿Token创调用量新高,成为当周最受欢迎模型

智谱AI发布GLM-5.3-Flash

在 https://Z.ai 代码基准测试中,该测试衡量真实世界的编码性能,GLM-5.3-Flash 在每个努力水平上明显优于 GLM-5.2,并且与 Claude Opus 4.8 表现相当。

智谱AI发布GLM-5.3-Flash

架构增强与优化的预训练语料库相结合,使 GLM-5.3-Flash 能够在更少的计算资源下提供更高的智能水平。

智谱AI发布GLM-5.3-Flash

4️⃣ 成本优势:性价比高

GLM-5.3-Flash的定价策略是其最具冲击力的亮点,旨在推动AI普惠:

定价维度GLM-5.3-Flash(限时折扣)GLM-5.3Claude Opus 4.8
输入价格 ($/M Tokens)0.0751.40~3.00
输出价格 ($/M Tokens)0.254.40~10.00
缓存命中输入 ($/M Tokens)0.0150.26~0.60
相对价格比基准 (1x)18.7x~40x

💡 限时折扣期间,GLM-5.3-Flash的价格约为GLM-5.3的 1/20,Claude Opus 4.8的 1/40。

开发者能以极低的成本获得此前只有顶尖闭源模型才能提供的能力,大幅降低了个人开发者、中小企业和学术研究机构使用世界级AI模型的门槛。

5️⃣ 国产算力:10 万张国产芯片首次大规模集体出海

GLM-5.3-Flash 最引人注目的特点之一,是其全部线上流量由超过 10 万张国产芯片承载 。这是国产算力芯片首次大规模直接服务全球真实负载 。

据智谱披露,这批芯片通过自研高带宽互联网络连接,采用生产级 Encode–Prefill–Decode(EPD)分离式架构,将多模态编码、Prompt 预填充和逐 Token 解码拆分为可独立调度的工作池。与同一硬件上的初始基线相比,端到端服务性能提升了 3 倍,硬件效率和单 Token 成本已达到与主流英伟达 GPU 相当的水平 。据《晚点 LatePost》了解,这批芯片的供应商或来自华为、摩尔线程与海光。


AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。

想了解AITOP100平台其它版块的内容,请点击下方超链接查看

AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说

AITOP100平台官方交流社群二维码:

AITOP100平台官方交流社群二维码AITOP100平台官方交流社群二维码

0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关AI工具
  • 智谱清言
相关资讯
  • 单剧最高20万激励!快手短剧8月头部版权方分账破2000万,全面转向IP系列化精品时代

  • 声动有形,帧随意动:AI跨媒介影像创作的实验感悟

  • Vidu Q4 Preview发布:每秒0.014美元把旗舰视频模型拉进“试错自由”时代

  • AI视频教程|水墨国风写实二次元角色技能演示提示词拆解,一键生成30秒高级感动作短片

  • 可灵Kling 4.0发布:30秒原生视频直出,AI视频从“素材生成”走向“叙事创作”

热点资讯

每日AI资讯-2026年10月09日

2天前
每日AI资讯-2026年10月09日

每日AI资讯-2026年10月08日

3天前
每日AI资讯-2026年10月08日

每日AI资讯-2026年10月10日

1天前
每日AI资讯-2026年10月10日

灵光·新帧青年AI影像季|200万现金+300万算力积分,全国青年AI短剧作品征集开启

1天前
灵光·新帧青年AI影像季|200万现金+300万算力积分,全国青年AI短剧作品征集开启

2026腾讯SSV“科技向善”AI视频大赛:13万元奖金+1000万积分,用AI讲述公益故事

3天前
2026腾讯SSV“科技向善”AI视频大赛:13万元奖金+1000万积分,用AI讲述公益故事
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有