据千问AI平台近日发布的公告,DeepSeek-V4.1-Flash已正式上线 ,API服务与Token Plan同步开放。这次不是简单的模型上架,而是把一套“大参数、小激活、强缓存”的组合拳直接塞进了千问生态里。对于正在死磕长上下文Agent、代码生成或者多模态审单的中小团队来说,这可能是今年下半年最值得试水的一次基础设施更新。
工具地址:千问AI平台官网

架构揭秘:552B的MoE,输入只激活8B
先说硬指标。据平台技术文档显示,DeepSeek-V4.1-Flash总参数量达到552B ,采用MoE(混合专家)架构,但它的结构设计有点意思——用的是Causal-Encoder-Decoder非对称结构 。
这意味着什么?
简单讲,就是输入和输出的激活参数不对称:输入端仅激活约8B参数,输出端激活约16B 。这种设计的好处是,在处理长文档理解、知识库检索这类“重输入、轻输出”的任务时,推理开销被大幅压缩,同时保留了足够的生成能力。
另外,该模型原生支持文本与图像理解 ,最长上下文窗口拉到100万token ,平台实际最大输出可达393K 。在多项Agent与代码基准测试中,官方称其较同系前代有明显提升,且以更低的激活参数换取了更高的吞吐量和更低的延迟。
成本账本:KV Cache压缩至1/4,闲时输入1元/百万Token
这次上架最狠的一刀,砍在成本上。
据千问平台页面公示的价格,DeepSeek-V4.1-Flash实行分时计价:
- 闲时 :输入1元/百万token ,输出4元/百万token
- 忙时 :输入2元/百万token,输出8元/百万token
这个定价背后是新一代缓存压缩技术的支撑。据技术文档披露,优化后的KV Cache对HBM显存需求降至上一代的1/4 ,对SSD存储需求降至1/8 。换句话说,跑同样的长上下文或多轮工具调用任务,硬件资源消耗断崖式下降,这部分节省的成本直接反映在了API定价上。
速率限制方面,RPM 15K、TPM 1M ,功能覆盖前缀补全、函数调用、上下文缓存、结构化输出、批量任务与联网搜索。对于需要高频调用Agent工作流的业务来说,这个配额基本够用。
落地场景:谁该第一时间接入?
阿里云百炼联合vLLM开源社区已完成适配,中国站与国际站均可调用,覆盖北京、新加坡及Global美国、德国、日本、香港等地域。
从功能特性看,这几类场景建议优先测试:
- 长文档解析与客服知识库 :100万token上下文+低输入成本,适合把整本产品手册、合同库喂进去做问答;
- 代码仓库级理解 :393K输出上限+函数调用能力,可以支撑跨文件代码审查、自动生成单元测试等任务;
- 多模态审单与票据处理 :原生图文理解+结构化输出,能把图片信息直接转成JSON格式,省去后处理环节;
- 批量原型验证 :闲时低价+Token Plan订阅模式,适合中小团队在非高峰时段跑大规模评测或数据标注。
业内普遍认为,V4.1-Flash的核心价值不在于刷榜,而在于把“够用且便宜”的长上下文Agent能力变成了可规模化调用的基础设施。对于预算有限但又想验证AI工作流可行性的团队,闲时1元/百万token的输入价格加上Token Plan的灵活订阅,确实降低了试错门槛。
不过也要提醒一句,模型选型最终还是要回归业务实测。建议拿自己的真实数据跑一轮benchmark,看看在特定任务上的表现是否匹配预期,别光看参数和价格就all in。毕竟,能稳定跑在生产环境里的模型,才是好模型。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:










