一句话看懂这件事:Flash 不再是「阉割版」的代名词。云知声用 266B 总参数、单次只激活 10B 的架构,硬是把编程、Agent 这些主力能力塞进了「高频调用」的成本区间里。
9 月 15 日,云知声(09678.HK)发布自愿性公告,正式推出新一代高密度智能模型 U2-Flash。
它是基于今年 6 月发布的 U2 通用基座模型,做强化后训练得到的。官方定位说得很直接:面向真实任务的新一代高性能主力模型——不是「轻量版」,而是「主力版」。
参数大,激活少,这是关键
U2-Flash 采用稀疏混合专家(MoE)架构,几个数字值得先记住:
- 总参数约 266B(2660 亿)
- 单次推理只激活约 10B
- 激活比例不到总参数的 4%
- 首字响应时间平均 3 秒以内
- 峰值输出吞吐最高 300 Tokens/s
这组数字背后的逻辑,是云知声一直讲的「高智能密度」:用更少的激活资源,承载更强能力。
打个比方,这像一座大型工厂,里面有很多专业车间,但每次接到订单,只启动和这次订单相关的几条生产线。写代码时调度编程能力,处理复杂任务时再调用规划推理模块。既保住了「大模型」的能力上限,又压住了每次推理的实际计算负担。
编程能力,翻倍了
这次 U2-Flash 最硬核的亮点,是编程和 Agent 能力。
几个官方披露的评测成绩:
- DeepSWE v1.1:64.6 分,较前代 U2 的 32 分翻倍,超过 GLM5.3-Flash 和 DeepSeek-V4-Pro-0813;
- SWE-Bench Pro:61.6 分,较前代提升 10.5 分;
- TerminalBench 3.0:24.3 分,超过 K3 等万亿参数级别模型。
这些榜单看的不是「模型能不能写出一段看起来对的代码」,而是「能不能在接近真实开发的环境里,把理解需求、改代码、跑测试、修问题连成一条完整链路」。所以 U2-Flash 的价值,在于它不只是「会写」,而是「能写完、跑通、修好」。
更快,不只是首字快
很多人看模型速度,第一反应是「首字响应」。但 Agent 任务里,真正重要的指标,是一项任务从开始到结束,要走多少轮、花多久。
U2-Flash 交出的数据是:
- Agent 任务迭代步数减少 20%–30%;
- 任务执行周期缩短 35%;
- Token 消耗减少 20%–30%。
翻译一下:它能更快找到有效路径,少走弯路,少做无效探索。对每天要跑大量 Agent 任务的企业来说,这种「总耗时」的下降,比单纯的响应速度提升更有价值。
两个值得留意的技术点
一个是「隐式思考」+「连续状态推理」。 它不会把所有中间思考过程都直接吐给用户,而是在模型内部完成规划和状态维护,再输出结果。推理强度被封装成四档可控接口,高强度档位能输出完整可读的推理链条,保证过程可核查、可追溯。
另一个是「模型参与自身训练」的闭环。 这是云知声在「递归自我改进」(RSI)方向的第一步实践:模型参与任务生成、轨迹分析、纠错重采,自主构建了近 10 万的高质量 SWE 任务集。官方披露,有效训练轨迹数提升了约 60%,训练步数减少了约 55%。
注意,这「自我改进」不是无边界进化——所有调整都在人工设定的沙盒环境和验证标准内进行,保留完整、可回滚的记录。
国产算力适配,是另一个信号
用户问题里点到的「完成主流国产算力平台适配」,其实是个容易被忽略、但很关键的点。
大模型部署,不是把模型文件复制到另一种芯片上就完事。不同硬件在算力结构、显存、通信带宽、编程框架上都有差异,MoE 模型的专家调度和通信尤其麻烦。理论上的稀疏优势,如果软硬件不协同优化,根本转化不成实际吞吐。
云知声这次是「从架构到调度的全栈适配」,覆盖核心算子、推理框架、集群调度、显存利用、通信效率。软硬件协同调优后,国产平台的吞吐、时延、并发和集群扩展能力持续提升,部分场景已接近主流 GPU。
这对政企、制造、能源这类对数据安全、算力自主有要求的客户,现实意义不小——不用把模型运行完全绑定在单一硬件上。
结语
放到行业大背景里看,U2-Flash 和谷歌的 Gemini Flash、智谱的 GLM 5.3 Flash、DeepSeek 的 V4.1 Flash,其实走的是同一条路:把「主力能力」装进「高频调用的成本区间」里。
背后的逻辑也不复杂。当 Agent 深度嵌入业务流程,Token 消耗不是「对话量」的线性增长,而是「任务复杂度 × 执行时长」的指数级攀升。一个典型项目,Token 消耗能到百万级,比普通对话高了三个数量级。
所以谁能把「用得起、用得频」这件事解决,谁就能吃到规模化落地的红利。
U2-Flash 的发布,是云知声在这条路上的一次关键卡位。至于它的 Token 业务能不能延续上半年的陡峭增长,还得看真实场景里的表现——但方向,已经写得很清楚了。








