阿里云国际模型服务平台Qwen Cloud近日上线Wan3.0-Video模型页面。根据页面公布的信息,新模型支持文本、图片、音频和视频输入,可以处理多模态参考素材,最长生成30秒视频,并提供480P、720P和1080P三种输出规格。
Wan3.0-Video还将参考生成、视频编辑、内容复刻和角色或动作驱动等能力整合进统一模型。对于AI短剧、广告、音乐MV和数字人视频创作者来说,这意味着不同视频任务有望在同一个模型入口中完成。
Wan 3.0在线体验地址:
需要说明的是,截至本文发布时,Wan3.0-Video已经在Qwen Cloud模型市场提供API信息和价格说明,但Wan官方GitHub、ModelScope及Hugging Face尚未同步完整技术报告和开源权重。因此,目前更准确的说法是“Wan3.0-Video上线Qwen Cloud”,是否开源仍需等待Wan官方后续公告。
Wan 3.0效果演示视频
视频整体时长达到了30S,稳定性强,运镜流畅
打斗方面稳定性强,没有出现明显的崩坏情况
Wan3.0-Video是什么
Wan3.0-Video是Wan视频生成模型系列的新版本,目前通过Qwen Cloud模型市场提供体验和API调用。
在中文用户的搜索习惯中,Wan系列也常被称为“通义万相视频模型”或“千问Wan视频模型”。Qwen Cloud则是阿里云面向国际开发者提供的模型、API和云服务平台。
与只处理文本生成视频或图片生成视频的单一模型相比,Wan3.0-Video强调多种创作能力的统一,包括:
- 文本生成视频;
- 图片参考生成视频;
- 音频参考视频生成;
- 视频参考与视频编辑;
- 角色、人物或动作驱动;
- 参考视频风格及内容复刻;
- 多模态素材理解;
- 视听内容同步生成。
根据Qwen Cloud模型页介绍,Wan3.0-Video能够解析文件、网页和复杂图片,并利用相关内容辅助视频生成。不过,具体支持的文件类型、网页解析范围及各项输入限制,仍需等待更完整的API文档。
Wan 3.0有哪些新功能
最长生成30秒视频
Qwen Cloud页面显示,Wan3.0-Video最长可以生成30秒视频。
相比常见的5秒或10秒AI视频,30秒能够容纳更完整的动作、镜头和情节,更适合剧情短片、广告片段、音乐MV和社交媒体内容。
需要注意的是,视频时长越长,人物一致性、动作连贯性和镜头稳定性通常越难保持,实际效果仍需通过样片测试判断。
支持音频、图片、文字和视频输入
Wan3.0-Video的输入类型包括:
- Audio:音频;
- Image:图片;
- Text:文字;
- Video:视频。
这意味着用户不仅可以通过提示词生成视频,也可以上传人物图片、场景参考、动作视频或音乐素材,给模型提供更明确的创作依据。
全模态参考生成
Qwen Cloud将Wan3.0-Video描述为支持“omni-modal reference”,即全模态参考。
在实际创作中,全模态参考可能用于:
- 使用图片控制人物和场景;
- 使用视频参考镜头或动作;
- 使用音频控制节奏和声音;
- 使用文字补充剧情与画面要求;
- 综合多种素材生成统一视频。
具体可以同时上传多少份素材、支持多长的参考视频以及音频如何参与生成,目前页面尚未公布完整限制。
参考、编辑、复刻和驱动能力统一
Wan3.0-Video模型页列出的主要创作方向包括reference、editing、replication和driving,可对应理解为:
- 参考生成:根据人物、场景或风格素材制作视频;
- 视频编辑:对已有视频进行修改或重构;
- 内容复刻:参考授权视频的结构、风格或镜头表现;
- 角色驱动:根据动作、音频或其他条件驱动人物表现。
使用“复刻”功能时,应确保参考视频、人物形象、音乐和品牌素材已获得合法授权,避免直接复制受版权保护的作品。
角色一致性与音画表现
Qwen Cloud页面重点提到Wan3.0-Video的角色一致性、真实视觉效果和声音表现。
这表明新模型不仅关注单个画面的清晰度,也试图改善人物在连续镜头中的外观稳定性,并提供更完整的视听体验。
不过,官方暂未公布统一评测结果和完整技术报告,因此“生产级一致性”的实际表现仍需要通过多镜头、多人和复杂动作测试验证。
支持1080P视频
Wan3.0-Video目前提供三种视频生成规格:
| 输出规格 | 官方API价格 |
|---|---|
| 480P | 0.05美元/秒 |
| 720P | 0.10美元/秒 |
| 1080P | 0.20美元/秒 |
按照当前页面价格计算,生成一段30秒视频的参考成本为:
| 输出规格 | 30秒参考成本 |
| 480P | 1.5美元 |
| 720P | 3美元 |
| 1080P | 6美元 |
以上为模型页面显示的基础API价格,不包含汇率变化、税费、订阅优惠或平台赠送额度。实际费用以Qwen Cloud账号结算页面为准。
Wan 3.0 API开放情况
Wan3.0-Video已经在Qwen Cloud页面提供DashScope API调用示例,模型名称为:
wan3.0-video
官方示例使用异步视频生成接口,可以设置:
- 视频提示词;
- 输出分辨率;
- 视频比例;
- 生成时长。
目前页面公开的调用限制为:
| 项目 | 限制 |
| 并发任务 | 2个 |
| 异步排队任务 | 50个 |
| 每分钟请求数 | 30次 |
这些限制可能根据账号等级和平台政策调整,开发者应以控制台实时信息为准。
Wan 3.0怎么体验
方法一:在线体验
打开Wan3.0-Video模型页面:
注册或登录Qwen Cloud账号后,查看模型当前状态。如果页面显示可以试用,可输入提示词并上传相应参考素材。
建议首次测试时:
- 先选择480P和5秒时长;
- 使用单人、单场景和简单动作;
- 检查角色、动作和镜头稳定性;
- 再逐步增加时长、人物和参考素材;
- 确认效果后再生成720P或1080P版本。
这样可以减少因提示词或参考素材不合适而产生的费用。
方法二:调用API
开发者可以在Qwen Cloud申请API Key,并通过DashScope国际接口调用wan3.0-video模型。
API更适合:
- 批量生成AI视频;
- 搭建企业视频生产流程;
- 开发AI短剧或广告应用;
- 将视频生成接入Agent;
- 自动处理大量图片和视频素材。
正式接入前,应先测试任务失败、超时、排队、内容审核和费用统计等情况。
Wan 3.0与Wan 2.2有什么区别
| 对比维度 | Wan3.0-Video | Wan 2.2公开模型 |
| 当前开放方式 | Qwen Cloud API及模型市场 | 开源权重及社区部署 |
| 输入类型 | 文本、图片、音频、视频 | 主要为文本和图片 |
| 最长视频 | 官方页面标注最长30秒 | 根据模型及工作流而定 |
| 输出规格 | 480P、720P、1080P | 公开模型主要支持480P和720P |
| 视频编辑 | 模型页明确列出 | 需要具体模型或工作流 |
| 角色与动作驱动 | 模型页明确列出 | 依赖相应模型及社区方案 |
| 音画能力 | 强调视听一体化体验 | 以视频画面生成为主 |
| 开源状态 | 暂未公布开源权重 | 已提供公开代码和权重 |
| 价格 | 按生成秒数计费 | 本地部署产生硬件和算力成本 |
Wan3.0-Video当前更偏向云端统一视频生成服务,而Wan 2.2仍然更适合需要本地部署、模型研究和自定义工作流的开发者。
Wan 3.0适合哪些场景
AI短剧与漫剧
最长30秒视频和多模态参考能力,可以用于生成短剧分镜、剧情片段、角色对白和漫剧素材。
制作多集内容时,仍需要建立统一的人物、服装、场景和提示词规范。
产品广告与电商视频
用户可以上传商品图、品牌视觉和参考视频,生成产品展示、场景演示及社交媒体广告素材。
涉及商品功能、价格和广告承诺时,应进行人工核实。
音乐MV
音频输入和视听生成能力可用于制作音乐节奏、舞蹈、表演和氛围类视频。
音乐和歌手形象必须获得合法使用授权。
数字人与角色驱动
用户可以使用人物图片、动作或音频作为参考,测试数字人、虚拟角色和口播内容。
涉及真人肖像或声音克隆时,应取得本人授权。
影视预演和动态分镜
导演、编剧和制作团队可以使用Wan3.0-Video制作概念样片、动态分镜和镜头预演,用于沟通视觉方向。
AI预演不能完全替代正式拍摄、动画制作和后期流程。
Wan 3.0目前还有哪些信息没有公布
截至2026年8月7日,以下信息尚未在官方模型页完整披露:
- 模型参数规模;
- 具体技术架构;
- 训练数据说明;
- 统一视频生成评测;
- 支持的详细视频比例;
- 不同时长的完整参数限制;
- 音频生成及控制方式;
- 参考文件数量及大小限制;
- 是否会发布开源权重;
- 是否登陆国内阿里云模型服务;
- 商业使用授权细则。
因此,现阶段不建议引用网络传言中的模型参数、榜单成绩或开源日期。应等待Wan官方GitHub、ModelScope、Hugging Face或阿里云正式技术报告。
Wan 3.0常见问题
Wan 3.0正式发布了吗?
Wan3.0-Video已经出现在Qwen Cloud模型市场,并提供价格、API示例和调用限制。但Wan官方暂未同步完整发布公告、技术报告和开源权重。
Wan 3.0可以免费体验吗?
Qwen Cloud表示多数模型可能提供免费API额度,但Wan3.0-Video是否有独立免费额度,应以登录后账号页面为准。超出免费额度后按照视频分辨率和生成秒数计费。
Wan 3.0最长可以生成多长的视频?
Qwen Cloud模型页显示,Wan3.0-Video最长可以生成30秒视频。
Wan 3.0支持1080P吗?
支持。当前页面列出了480P、720P和1080P三种API计费规格。
Wan 3.0支持声音吗?
模型页面将音频列为输入类型,并强调真实的视觉和声音表现。不过,声音生成方式、语言支持和音频控制参数仍需等待详细文档。
Wan 3.0支持图生视频吗?
支持图片输入。用户可以上传人物、商品、场景或风格参考图辅助视频生成。
Wan 3.0可以编辑已有视频吗?
官方模型页面将视频编辑列为主要能力之一,并支持视频输入。具体可以修改哪些内容、支持多长的输入视频,需要以API文档为准。
Wan 3.0开源了吗?
截至本文发布时,Wan官方GitHub、ModelScope和Hugging Face尚未提供Wan 3.0开源权重。Wan 2.1和Wan 2.2仍是目前主要的公开模型。
Wan 3.0生成的视频可以商用吗?
能否商用需要同时检查Qwen Cloud服务协议、具体模型规则、输入素材版权、人物肖像权及音乐授权,不能仅凭“AI生成”判断。
Wan 3.0和通义万相是什么关系?
Wan是阿里视频生成模型系列的英文名称,中文用户通常将其称为通义万相视频模型。Wan3.0-Video目前通过Qwen Cloud模型市场提供服务。
Wan 3.0体验入口
模型页面:
https://www.qwencloud.com/models/wan3.0-video
Wan官方GitHub:https://github.com/Wan-Video
Qwen Cloud:https://www.qwencloud.com/
最后更新时间:2026年8月7日









