
AITOP100平台获悉,2026年10月7日,生数科技正式发布下一代旗舰 AI 视频模型 Vidu Q4 Preview 的首个公开预览版。这款模型以“表现力”(expressive audio and video)为核心卖点,首发定价压至每秒 0.014 美元起,将旗舰级视频生成的价格门槛拉到了此前行业未曾触及的区间。
并且在 Artificial Analysis 的图生视频排行榜(AA-Video-I2V v1.0)上,Vidu Q4 Preview 以 1,179 的 Elo 分数首次登场即位列第三,相比前代最佳成绩 Vidu Q3 Pro 的 1,056 分(第19名)跃升 123 分。
工具地址:Vidu AI官网
一、从“表演”出发:Q4 的三层升级逻辑
Vidu Q4 Preview 的升级叙事并非围绕参数规模或分辨率数字展开,而是从三个相互关联的维度重构视频生成的“表现力”。
第一层是表演协调
生数科技将面部表情、情绪传达、肢体动作与声音四个维度进行联合建模,而非分层叠加。这意味着角色的眼神、语调与身体姿态在生成过程中是同步协调的,而非各自独立生成后再拼合。一位参与测试的创作者反馈:“即使在没有台词的停顿里,角色的眼神与表情也足以传递情绪。”
第二层是镜头控制
在追逐、打斗等高速运动场景中,Q4 的镜头被设计为更连贯地跟随动作,剪辑点与画面动作的配合更利落。生数科技的发布资料将其描述为“镜头运动、剪辑与画面动作之间的协调”,在快速动作序列中实现更流畅的镜头切换与动态运镜。
第三层是特效融合。
Q4 在处理爆炸、烟火、粒子等视觉特效时,强调特效“位于场景之内,而非浮贴于其上”。测试者描述其效果为“火焰的光会照亮周围建筑,烟尘随坍塌结构扩散,成片观感接近实拍”。创作者特别提到,Q4 在帧内中文文字渲染方面表现突出,“已经接近人工后期合成的效果”。

二、规格与参考体系:从“抽卡”到“钉死”
在硬指标层面,Vidu Q4 Preview 提供了完整的输出阶梯:540p、720p、1080p、2K、4K,其中 2K 和 4K 支持 10-bit 色彩深度,可进入专业后期工作流。单次生成时长最长 16 秒,图生视频为 3 至 16 秒,参考生视频为 1 至 16 秒。
真正指向生产效率的是参考体系的扩展。Q4 Preview 支持最多 15 张参考图像(用于定义角色、服装、道具、产品与环境)以及最多 3 段参考音频(用于锁定角色的音色与情感表达方式)。这意味着创作者可以在一套参考配置下连续生产多支镜头——主角的脸不变、衣服不变、声音不变,跨镜头的一致性由参考输入兜底,而非依赖提示词反复描述和多次抽卡。
一位测试者对这种工作流的改变给出了直观描述:“过去要打一段很长的提示词,写清楚角色的脸、衣服、声音,然后祈祷这次抽卡能中。现在把这些参考素材一次性喂进去,后面只需要描述镜头和动作。”
三、定价逻辑:把“多试一条”的自由还给创作者
Vidu Q4 Preview 的定价是此次发布中最具冲击力的部分。首发价格为 每秒 0.014 美元起步,随分辨率上行至 4K 档每秒 0.39 美元。图生视频与参考生视频在 11 月 30 日前享受七折优惠。
| 分辨率 | 促销价(美元/秒) | 标准价(美元/秒) |
|---|---|---|
| 540p | 0.0315 | 0.045 |
| 720p | 0.0665 | 0.095 |
| 1080p | 0.084 | 0.12 |
| 2K | 0.133 | 0.19 |
| 4K | 0.273 | 0.39 |
数据来源:fal.ai Vidu Q4 定价页面
生数科技联合创始人兼 CEO 骆怡航在发布说明中解释了这一定价背后的产品逻辑:“一个能用的镜头往往要尝试不止一次。调整表情、比较机位、测试开场,都是成本。高级视频模型应该在精选演示之外证明自己,效率上的每一次提升,最终都应该转化为创作者多试一条、多拍一版的自由。”
官方还提出了一个效率对比主张:在可比输出规格与计费条件下,Q4 Preview 能在相同预算下带来最高五倍的输出量。需要指出的是,这是一项效率声明而非质量声明,且“可比输出规格与计费条件”这一限定语在实际复现中承担了关键作用,目前尚无第三方独立验证。
四、竞品对比:AA榜单上的位置
在 Artificial Analysis 的图生视频排行榜上,Vidu Q4 Preview 与主要竞品的对比如下:
| 模型 | AA I2V 排名 | Elo 分数 | 每分钟价格 |
|---|---|---|---|
| Vidu Q4 Preview | 第 3 名 | 1,179 | $7.20 |
| Google Veo 3.1 | 第 12 名 | 1,082 | $24.00 |
| Google Veo 3.1 Lite | 第 15 名 | 1,071 | $4.80 |
| Google Veo 3.1 Fast | 第 18 名 | 1,066 | $9.00 |
| Kling 3.0 1080p (Pro) | 第 20 名 | 1,055 | $20.16 |
| Kling 3.0 720p (Standard) | 第 21 名 | 1,051 | $15.60 |
数据来源:Artificial Analysis,2026年10月8日
从榜单数据可以读出两个关键信息。其一,Q4 Preview 在 Elo 分数上领先最佳 Kling 3 变体 124 分,这一差距比 Kling 3 四个变体之间的内部跨度(19 分)大出六倍以上。其二,Q4 Preview 的每分钟价格($7.20)仅为 Veo 3.1($24.00)的 30%,而其 Elo 分数高出 Veo 3.1 近 100 分。
不过,一个值得注意的事实是:Vidu Q4 Preview 在 AA 文生视频排行榜(AA-Video-T2V v2.0)上完全缺席。该模型目前仅支持图生视频与参考生视频两种模式,不支持文生视频。这意味着 Q4 Preview 的定位并非“全能的视频生成模型”,而是聚焦于需要角色一致性和表演可控性的专业制作场景。

五、技术底盘:U-ViT 架构与生数科技的积累
Vidu 系列的技术底座源自生数科技创始团队在清华大学提出的U-ViT 架构(Diffusion 与 Transformer 融合),该架构于 2022 年 9 月发表,比 OpenAI 的 DiT 架构早三个月。2024 年 4 月,生数科技发布中国首个全面对标 Sora 的视频大模型 Vidu,此后连续迭代 Q1、Q2、Q3 版本。
2026 年,生数科技在资本层面动作密集。2 月完成超 6 亿元人民币 A+ 轮融资,由中关村科学城公司和星连资本领投;7 月完成新一轮 5 亿美元融资,为国内通用世界模型领域最大单笔融资。公司当前正从视频生成向通用世界模型方向延伸,Vidu Q 系列已渗透漫剧、短剧、广告、电商、动画和影视等内容生产体系。
六、预览版的边界
作为“Preview”版本,Q4 Preview 的发布方式本身也传递了明确信号。生数科技明确表示,这是完整 Q4 模型发布前的首次公开预览,邀请创作者在最终版本仍在打磨期间将其用于真实项目。官方随文发布的但书也指出:最终定价、支持的解析度、功能可用性与使用条款可能因方案与地区而异。
从首批测试反馈来看,Q4 在广告类内容中的完成度提升较为明显——产品特写、口播开场、促销字幕等过去需要反复抽卡的镜头,一次通过率有显著改善。但对以量取胜的电商与信息流团队而言,单位成片成本的实际下降幅度仍需在规模化使用中验证。
Vidu Q4 Preview 的发布,将视频模型竞争的一个核心变量从“每分钟多少美元”推向了“每秒几分钱”。当旗舰级模型的价格降至每秒 0.014 美元起,创作者的决策逻辑正在从“这条值不值得试”转向“多试几条也无妨”。这种试错自由度的质变,或许比单纯的画质提升更能改变 AI 视频在生产流程中的实际渗透率。
AITOP100-AI资讯频道将持续关注AI行业新闻资讯消息,带来最新AI内容讯息。
想了解AITOP100平台其它版块的内容,请点击下方超链接查看
AI创作大赛 | AI活动 | AI工具集 | AI资讯专区 | AI小说
AITOP100平台官方交流社群二维码:











