阿里 Wan3.0 公测:一次生成 30 秒视频,把 PPT、表格直接变成片子

想象一个工作流:把一份产品介绍 PPT 丢进对话框,几分钟后收到一条 30 秒的成片——运镜、转场、配音齐全,不用写一帧提示词。8 月 6 日,阿里云宣布 Wan3.0 进入公开测试,这个工作流从演示变成了可申请的能力。

这是阿里视频生成模型的一次代际更新。上一代 Wan 2.7 的官方文档里,单次生成时长上限是 15 秒;Wan3.0 把这个数字直接翻倍——原生支持 30 秒视频的单次生成。

背景:视频生成卡在"时长"上已经太久了

先把行业背景说清楚。AI 视频生成发展了两年多,最尴尬的瓶颈始终是时长。主流模型单次生成普遍在 5—15 秒,想得到一条像样的短视频,必须多次生成再剪辑拼接——“提示词写十分钟,剪片子剪一小时"是常态。

时长为什么难突破?视频生成是自回归地"一帧帧往后推”,每推一帧都要重新审视全局一致性,序列越长,人物、场景、光影的漂移风险越大。30 秒意味着数百帧的连贯叙事,对模型的长期一致性是硬考验。阿里云 Model Studio 官方文档显示,上一代 wan2.7-t2v 的单次时长范围是 2—15 秒,30fps、MP4(H.264 编码),支持带音频的多镜头叙事。Wan3.0 把原生时长做到 30 秒,等于把"拼接"这个环节从工作流里删掉了一部分。

核心:三个关键词与一组定价

Wan3.0 的官方卖点可以拆成三个词(阿里云官方 X 账号发布信息):原生 30 秒视频生成Reality-Grade 渲染(官方对画质与真实感的表述)、Omni-Reference 全模态参考

最值得展开的是 Omni-Reference。此前视频模型的输入基本是"文字 + 图片 + 可选音频",Wan3.0 把输入扩展到了文档类:除了文本、图像、音频、视频,还支持文档、表格、幻灯片、网页(官方 X 账号表述;独立科技媒体 AlphaSignal 的报道列出了更细的清单:.doc、.xls、.ppt、.pdf、.txt、.key、.pages、.numbers)。换句话说,你不必把一份 PPT 的内容"翻译"成提示词,直接把文件扔进去。

质量与一致性上,QwenCloud 模型页的描述是"生产级角色一致性"与"逼真的视听效果"——视频带声音,角色跨镜头保持一致。公开测试期间的 API 定价(官方 X 账号与 QwenCloud 模型页一致):

分辨率 价格(美元/秒)
480P $0.05
720P $0.10
1080P $0.20

换算一下更直观(按 1 美元兑 7.2 元人民币估算):一条 10 秒的 720P 视频约 1 美元,合人民币 7 元左右;一条 30 秒的 1080P 成片约 6 美元,合 43 元左右。入口在阿里云 Model Studio 与 Qwen Cloud,公测采用申请制,官方称完整 API 访问将很快全面放开。

开发者视角的参数同样值得记录(QwenCloud 模型页):异步任务接口(dashscope-intl 的 video-synthesis 服务,模型名 wan3.0-video),调用参数包含分辨率、画幅比例(adaptive 自适应)与时长;模型页还列出了函数调用、上下文缓存、结构化输出、批量任务、联网搜索、微调等配套能力——说明它接的不是一个"玩具接口",而是一套完整的 API 生态。当前公测限制:并发数 2、异步队列上限 50、每分钟请求数 30——典型的"先限量再放量"节奏。官方账号在公告之后连发两条演示视频(阿里云官方 X 账号回复),展示 30 秒成片的实际效果——申请入口与演示物料都已就位,想感受"原生 30 秒"的观感,可以直接去看官方演示。

深度分析一:30 秒 + 文档输入,改的是"生产流程"

30 秒这个数字,放在内容生产语境里比放在技术语境里更有分量。一条完整的电视广告是 30 秒,一条抖音/快手的标准短视频是 15—60 秒。单次生成 30 秒,意味着"广告片一次成型"从概念变成了可申请的能力;对批量做口播、产品演示、电商素材的团队来说,剪辑拼接不再是必经步骤。

Omni-Reference 的意义更靠前一步:它把"素材整理"这个环节也交给了模型。过去的工作流是"素材 → 人写提示词 → 模型生成";现在可以是"素材直接进模型"。AlphaSignal 的评论点出了关键:当输入从"创意描述"扩展到"原始材料",视频生成就从"创意工具"变成了"生产工具"——前者需要你会表达,后者只需要你有素材。这对短视频供给侧的产能影响,可能比画质提升更大。

把视野再拉开一点:Wan 在阿里云 Model Studio 里并不是孤零零一个文生视频模型。官方文档显示,同一套 Wan 体系还覆盖数字人唇形同步、图生动作、视频换脸、舞蹈替换、视频重绘、通用视频编辑等垂直场景。Wan3.0 是这套体系的新底座——30 秒原生时长与文档输入,会同步抬高所有下游场景的天花板。这也是大厂做视频模型与创业公司的差别:一次升级,整条产品线受益。

文档里还有一个容易被忽略的细节:Wan 的通用视频编辑能力包含视频扩展(官方示例:把 1 秒的片段扩展到 5 秒)与画幅转换(横屏转竖屏)。这意味着 30 秒原生生成只是入口,素材的二次加工同样在模型能力范围内——“一次生成"与"按需修改"合起来,才是完整的生产闭环。对做短视频矩阵的团队来说,横屏素材一键转竖屏这类需求,以前要人工重剪,现在是一条 API 的事。

深度分析二:价格战从文本烧到了视频

定价同样值得咂摸。按秒计价是视频生成行业的通行做法,Wan3.0 的 0.05 美元/秒(480P)处在第一梯队的中低位。结合阿里云近期的动作看,节奏很清晰:8 月 5 日 Qwen-Image-3.0 上线,文字渲染精度推到 10px 字号,单张定价 0.03 美元起;8 月 6 日 Qwen3.8-Max 宣布低谷时段五折;同一天 Wan3.0 公测。文本、图像、视频三条线同时降价放量——2026 年夏天从 Kimi K3 引发的大模型价格战(本站 8 月 5 日有专文),正在从文本模型蔓延到多模态生成。

这背后是算力与规模的红利,也是竞争的白热化:视频生成是公认的下一块高价值市场,国内外厂商都在密集迭代。先发者用价格换规模、用规模摊薄成本。对使用者而言,这意味着"试试看"的门槛在快速降低——几条视频的成本只相当于几杯咖啡。

按秒计价的逻辑其实很朴素:视频生成的计算成本与时长大致线性相关,按秒收费对供需双方都直观。当"每秒多少钱"成为行业通用语言,视频生成的商品化进程就完成了关键一步——它正在变成像云存储一样按量计费的基础服务。

局限也要说清。其一,公测期并发 2、队列 50、RPM 30 的限制意味着它暂时还撑不起大规模生产流水线;其二,“生产级角色一致性"是官方宣称,真实水平需要实测——长视频的人物漂移是行业通病,30 秒是更大的考验;其三,30 秒是单次生成上限,长片、剧情片依然需要剪辑与多段拼接;其四,公测申请制与"完整 API 即将放开"的表述,说明服务能力还在爬坡。

落地:两件现在就能做的事

  1. 内容团队去申请公测,用 30 秒原生时长重跑一条生产流程:拿一个真实需求(产品演示、口播、电商素材)测三件事——单次 30 秒的质量、文档输入(PPT/表格)的可用度、带声音视频的完成度。成本极低:一条 1080P 的 30 秒成片约 6 美元。
  2. 开发者先读 API 文档再排期:接口是异步任务制(video-synthesis),当前并发只有 2、RPM 30——接入前先确认你的批量场景能接受排队;想自己试的,QwenCloud 模型页有现成的 curl 示例,模型名 wan3.0-video。

结尾

从 15 秒到 30 秒,从提示词到文档直投,Wan3.0 的每一步都踩在同一个方向上:把视频生产里"人要做的事"再拿走一块。当一条广告片的成本降到几十元、一条短视频的产出从"剪"变成"等”,内容供给的底层逻辑正在被改写。工具的门槛在降低,但选择用工具做什么——这个判断力,依然是人的事。

(信息来源:阿里云官方 X 账号 Wan3.0 公测公告(2026-08-06)、QwenCloud Wan3.0-Video 模型页(定价与 API 参数)、阿里云 Model Studio 视频生成官方文档、AlphaSignal 报道(2026-08-06))

0%