• 首页
  • AI工具集
  • AI资讯
  • AI活动
  • AI社区
  • AI短剧
  • AI创作大赛
  • AI小说
  • AI绘画
    AI视频
    AI对口型
  • AI画布AI画布AI画布
AI 对话

云知声发布 U2-Flash:266B 参数只激活 10B,却要「干主力模型的活」

云知声发布 U2-Flash:266B 参数只激活 10B,却要「干主力模型的活」
小峰
3小时前


一句话看懂这件事:Flash 不再是「阉割版」的代名词。云知声用 266B 总参数、单次只激活 10B 的架构,硬是把编程、Agent 这些主力能力塞进了「高频调用」的成本区间里。


9 月 15 日,云知声(09678.HK)发布自愿性公告,正式推出新一代高密度智能模型 U2-Flash。


它是基于今年 6 月发布的 U2 通用基座模型,做强化后训练得到的。官方定位说得很直接:面向真实任务的新一代高性能主力模型——不是「轻量版」,而是「主力版」。

参数大,激活少,这是关键

U2-Flash 采用稀疏混合专家(MoE)架构,几个数字值得先记住:


  • 总参数约 266B(2660 亿)
  • 单次推理只激活约 10B
  • 激活比例不到总参数的 4%
  • 首字响应时间平均 3 秒以内
  • 峰值输出吞吐最高 300 Tokens/s


这组数字背后的逻辑,是云知声一直讲的「高智能密度」:用更少的激活资源,承载更强能力。


打个比方,这像一座大型工厂,里面有很多专业车间,但每次接到订单,只启动和这次订单相关的几条生产线。写代码时调度编程能力,处理复杂任务时再调用规划推理模块。既保住了「大模型」的能力上限,又压住了每次推理的实际计算负担。

编程能力,翻倍了

这次 U2-Flash 最硬核的亮点,是编程和 Agent 能力。


几个官方披露的评测成绩:


  • DeepSWE v1.1:64.6 分,较前代 U2 的 32 分翻倍,超过 GLM5.3-Flash 和 DeepSeek-V4-Pro-0813;
  • SWE-Bench Pro:61.6 分,较前代提升 10.5 分;
  • TerminalBench 3.0:24.3 分,超过 K3 等万亿参数级别模型。


这些榜单看的不是「模型能不能写出一段看起来对的代码」,而是「能不能在接近真实开发的环境里,把理解需求、改代码、跑测试、修问题连成一条完整链路」。所以 U2-Flash 的价值,在于它不只是「会写」,而是「能写完、跑通、修好」。

更快,不只是首字快

很多人看模型速度,第一反应是「首字响应」。但 Agent 任务里,真正重要的指标,是一项任务从开始到结束,要走多少轮、花多久。


U2-Flash 交出的数据是:


  • Agent 任务迭代步数减少 20%–30%;
  • 任务执行周期缩短 35%;
  • Token 消耗减少 20%–30%。


翻译一下:它能更快找到有效路径,少走弯路,少做无效探索。对每天要跑大量 Agent 任务的企业来说,这种「总耗时」的下降,比单纯的响应速度提升更有价值。

两个值得留意的技术点

一个是「隐式思考」+「连续状态推理」。 它不会把所有中间思考过程都直接吐给用户,而是在模型内部完成规划和状态维护,再输出结果。推理强度被封装成四档可控接口,高强度档位能输出完整可读的推理链条,保证过程可核查、可追溯。


另一个是「模型参与自身训练」的闭环。 这是云知声在「递归自我改进」(RSI)方向的第一步实践:模型参与任务生成、轨迹分析、纠错重采,自主构建了近 10 万的高质量 SWE 任务集。官方披露,有效训练轨迹数提升了约 60%,训练步数减少了约 55%。


注意,这「自我改进」不是无边界进化——所有调整都在人工设定的沙盒环境和验证标准内进行,保留完整、可回滚的记录。

国产算力适配,是另一个信号

用户问题里点到的「完成主流国产算力平台适配」,其实是个容易被忽略、但很关键的点。


大模型部署,不是把模型文件复制到另一种芯片上就完事。不同硬件在算力结构、显存、通信带宽、编程框架上都有差异,MoE 模型的专家调度和通信尤其麻烦。理论上的稀疏优势,如果软硬件不协同优化,根本转化不成实际吞吐。


云知声这次是「从架构到调度的全栈适配」,覆盖核心算子、推理框架、集群调度、显存利用、通信效率。软硬件协同调优后,国产平台的吞吐、时延、并发和集群扩展能力持续提升,部分场景已接近主流 GPU。


这对政企、制造、能源这类对数据安全、算力自主有要求的客户,现实意义不小——不用把模型运行完全绑定在单一硬件上。

结语

放到行业大背景里看,U2-Flash 和谷歌的 Gemini Flash、智谱的 GLM 5.3 Flash、DeepSeek 的 V4.1 Flash,其实走的是同一条路:把「主力能力」装进「高频调用的成本区间」里。


背后的逻辑也不复杂。当 Agent 深度嵌入业务流程,Token 消耗不是「对话量」的线性增长,而是「任务复杂度 × 执行时长」的指数级攀升。一个典型项目,Token 消耗能到百万级,比普通对话高了三个数量级。


所以谁能把「用得起、用得频」这件事解决,谁就能吃到规模化落地的红利。


U2-Flash 的发布,是云知声在这条路上的一次关键卡位。至于它的 Token 业务能不能延续上半年的陡峭增长,还得看真实场景里的表现——但方向,已经写得很清楚了。




0
0
文章来源:AI TOP100
免责声明:本文不代表本平台立场,且不构成投资建议,请谨慎对待。
全部评论
暂无评论
相关资讯
  • 每日AI资讯-2026年9月16日

  • 每日AI资讯-2026年9月15日

  • 每日AI资讯-2026年9月14日

  • 阿里云"万有无界"开启公测:一个让"人和 Agent 一起干活"的企业协作平台

  • 每日AI资讯-2026年9月11日

热点资讯

每日AI资讯-2026年9月14日

2天前
每日AI资讯-2026年9月14日

每日AI资讯-2026年9月15日

1天前
每日AI资讯-2026年9月15日

AITOP100-AI画布「分享优质工作流」激励计划上线,3万积分等你来拿!🚀

9天前
AITOP100-AI画布「分享优质工作流」激励计划上线,3万积分等你来拿!🚀

2026北京动画周48小时AIGC原创动画挑战赛开启战队招募

2天前
2026北京动画周48小时AIGC原创动画挑战赛开启战队招募

AI生成30秒顶级仙侠空战!真人高速对冲打斗成片教程(附带提示词)

1天前
AI生成30秒顶级仙侠空战!真人高速对冲打斗成片教程(附带提示词)
分享
0
0

欢迎来到AI Top100!我们聚合全球500+款AI智能软件,提供最新资讯、热门课程和活动。我们致力于打造最专业的信息平台,让您轻松了解全球AI领域动态,并为您提供优质服务。

合作伙伴
联系我们
加入AITOP100社群
加入社群
AITOP100商务微信
商务微信
相关链接
服务及隐私政策
网站地图
关于我们
粤ICP备2022124843号-2粤公网安备44030002004505广播电视节目制作经营许可证:(粤)字第00712号Copyright © 华强方特(深圳)动漫有限公司 版权所有