30:00:00

免费注册 · 领欢迎积分 · 上线即享年度福利

查看年付套餐
文章

Wan 3.0 视频生成重磅公测:从读懂 PPT 到原生 30 秒长镜头,通义万相这次进化有多猛?

W

AI 视频生成与工作室工作流指南。

16 分钟
Wan 3.0 视频生成重磅公测:从读懂 PPT 到原生 30 秒长镜头,通义万相这次进化有多猛?

关注 AI 视频创作的朋友们,最近这段时间估计感受特别明显。进入 2026 年 8 月,AI 视频模型领域可以说是神仙打架,社区里到处都在讨论 MiniMax H3、Seedance、Flux…

关注 AI 视频创作的朋友们,最近这段时间估计感受特别明显。进入 2026 年 8 月,AI 视频模型领域可以说是神仙打架,社区里到处都在讨论 MiniMax H3、Seedance、Flux 等一众新老玩家的最新动态。而就在这个节点,阿里通义实验室视觉生成品牌——通义万相(Wan),官方 X 账号 @Alibaba_Wan 以及微信公众号等渠道同步官宣:Wan 3.0 正式开启公测(Introducing Wan3.0 — now in Public Beta)![^1][^2]

老实说,在 Wan 3.0 出来之前,大家用 AI 做视频多多少少都有点“痛点”:要么镜头生成出来只有三五秒,稍微想展示个连贯动作就得频繁拼接;要么人物一转头就变脸,道具走着走着直接变样;再不然就是想要生成一个符合企业产品的视频,得费尽心思把几千字的文档手动拆解成一句句繁琐的提示词。

而这一次 Wan 3.0 给人的最直观感受是——AI 视频生成正在从“画画面”走向真正“懂意图”。[^2]

今天我们就抛开那些高深晦涩的技术公文腔,用咱们创作者能听懂的大白话,深度盘一盘 Wan 3.0 的演进历史、公测核心亮点、代际差异、落地场景以及大家最关心的价格与上手入口。


认识一下万相家族:从画一张图到“读懂真实世界”

要理解 Wan 3.0 为什么能在社区引发这么大的讨论,咱们得先回头看看通义万相(Wan)这个家族的发展脉络。

通义万相(官方网站为 wan.video 及通义万相平台)最初是从图像生成起步的,随后全面切入视频生成赛道。[^11] 回顾它的版本迭代,简直就是一部 AI 视觉生成技术的演进史:

  • Wan 2.1(约 2025 年 2 月):这是开源 AI 视频界的一个重要里程碑。当时 Wan 2.1 采用了主流的 DiT 架构配合 Wan-VAE,推出了支持文生视频(T2V)与图生视频(I2V)的 1.3B 和 14B 参数版本,并以 Apache 2.0 协议开源。[^4][^5] 其中 1.3B 版本对消费级显卡非常友好,14B 版本则提供了极高的画质,在当时的 VBench 等测评基准上表现抢眼。权重一出,立刻在 Hugging Face、ModelScope 以及 ComfyUI 生态中引发了爆火式的二次开发热潮。[^6][^13]
  • Wan 2.2(约 2025 年 7 月):万相家族引入了开源 MoE(混合专家)视频模型架构,推出了 T2V-A14B、I2V-A14B 以及 TI2V-5B 等型号,进一步强化了运镜控制与电影级质感。[^7][^12]
  • Wan 2.5(约 2025 年 9 月):主攻原生音画同步方向,开始具备约 10 秒级 1080P 的音画一体生成能力。[^8]
  • Wan 2.6 与 Wan 2.7:到了 Wan 2.6,模型开始具备多镜头叙事、角色参考出演新场景以及更强的音画协同能力;[^9] 而 Wan 2.7 则成为了公测前的主力旗舰,全面覆盖文生、图生、参考生成与视频编辑,输出时长提升到约 15 秒 1080P 的水平。[^10]

官方用极其精炼的九个字概括了这个家族的叙事成长线:Wan1 学会画 → Wan2 学会拍 → Wan3 学会懂。[^2]

值得一提的是它的开源与云端策略演进:早期 Wan 2.1 和 2.2 通过开放权重极大带动了开源社区生态;[^4][^7] 而到了后续的旗舰版本,模型复杂度与算力需求大幅提升,更多转向了云端 API 和平台化服务。本次 Wan 3.0 的公测也是以托管云端与平台体验为主,公开信息中暂未提及随公测同步开源权重。[^1][^3]


Wan 3.0 公测亮点深拆:AI 视频的“懂行”时刻

这次 Wan 3.0 带来的公测更新,绝对不是小打小闹的修修补补。如果把以前的模型比作“摄影新手”,那 Wan 3.0 更像是一个开始懂得听懂导演讲戏、甚至能自己看懂剧本的“老辣摄影师”。

1. 原生 30 秒生成:告别“碎片剪辑”,挑战一镜到底

过去做 AI 短视频,单次输出大多卡在 3 秒到 10 秒之间。要凑满半分钟,创作者不得不生成好几段镜头再去软件里强行倒腾,接缝处往往充满违和感。

Wan 3.0 直接打破了这个瓶颈,实现了原生单次 30 秒视频生成(Native 30-Second Video Generation)。[^1][^2]

  • 一镜到底与连续运镜:它支持极具张力的连续运镜和一镜到底走位,镜头推进、推拉摇移都更加流畅自然。[^2]
  • 智能时长与视频延长:如果你拿不准一段脚本需要多久,系统内置的“智能时长”会根据提示词自动推算最合适的生成长度;如果 30 秒还没讲完故事,还可以配合“视频延长”功能顺着上文的上下文与画面逻辑自然向下续写。[^2]

2. Omni-Reference 全能参考:把 PPT 和文档直接变成视频

这绝对是 Wan 3.0 最出圈的新能力。以往我们给 AI 传参考资料,无非是“文字 Prompt + 1 张参考图 + 1 段配音”。

Wan 3.0 推出了全新的 Omni-Reference(全能参考) 体系。不仅支持文本、图像、音频、视频,还打破常规地直接支持输入 doc、xls、ppt、pdf、md 等结构化文档格式,以及网页链接等资源(官方要求单个文件或链接≤100MB、≤50页)。[^1][^2]

这意味着什么?举个很现实的商业例子: 假设你想为一家新开张的咖啡馆做一段品牌形象宣传片。以前你需要自己把咖啡馆的背景、装修风格、主打产品提炼成复杂的英文字符串。现在,你只需要把咖啡馆现有的介绍文档(Word 或 PPT)直接喂给模型,Wan 3.0 就能自己“读懂”里面的逻辑重点,提炼出咖啡豆的质感、光影氛围以及门店调性,快速帮你生成一段有模有样的宣传片![^2]

3. 千人千面与全维度一致性

AI 视频最让人头疼的就是“穿帮”——主角走着走着换了张脸,或者手里的道具突然变了材质。

Wan 3.0 在真实感渲染(Reality-Grade Rendering) 和连贯性上做了全面升级:[^1]

  • 千人千面与复杂群像:对于人像处理更加敏锐,不仅能精准刻画微表情与肢体动作的联动,甚至在多人在场的复杂群像场景里,也能让不同角色呈现出各不相同的细腻情绪,不再出现僵硬的“换脸傀儡感”。[^2]
  • 全维度一致性:实现了角色一致性、道具一致性、声音一致性、空间一致性、风格一致性的全面调优。不管镜头怎么旋转,角色的服装发型、道具上的 Logo 与材质、场景的空间方位,都能保持高度统一。[^2]

4. 数字化图表质感与深度后期可修改

对于做知识科普或商业汇报的创作者来说,视频里的图表、UI 界面往往很难用 AI 做好。Wan 3.0 提升了数字化图表与界面的渲染质感,文字与排版更加规整。[^2]

同时,它进一步强化了视频编辑能力。如果你对生成出来的片段局部不满意,或者想调整中间的台词、剧情走势乃至局部画面,可以直接针对性地进行修改,不用动不动就“抽卡重来”。[^2]


代际对比:Wan 3.0 相比前代到底提升了什么?

为了让大家更直观地看清迭代幅度,咱们把 Wan 3.0 和 2.x 及更早期版本做个对比:[^1][^2][^8][^9][^10]

维度早期版本 (Wan 1.x / 2.1)旗舰前代 (Wan 2.5 / 2.6 / 2.7)最新公测 (Wan 3.0)
单次生成时长几秒级片段约 10–15 秒级原生单次约 30 秒(支持智能时长与延长)
参考输入形态单一文本 / 画面图片多模态参考(图/音/视)Omni-Reference 全能参考(新增 doc/xls/ppt/pdf/md/网页等)
画面一致性表现容易出现主体飘移、变脸角色与风格一致性逐步增强角色/道具/声音/空间/风格全维度一致,Logo 与材质更稳定
渲染与叙事能力侧重单镜头画质表现引入多镜头与音画协同真实感渲染、千人千面微表情联动、群像情绪与一镜到底
核心使用定位“出一段动态画面”“拍几组镜头”“读懂复杂材料,直接讲完整故事/做成片”

落地实战:Wan 3.0 适合哪些创作场景?

有了这些硬核能力,Wan 3.0 在实际的生产力场景里到底能怎么用?咱们整理了几个非常接地气的落地方向:[^2]

  1. 品牌宣传与企业门店介绍

以前企业做宣传片要找外包团队折腾好几周。现在把现成的企划案 Word、品牌手册 PDF 或介绍 PPT 直接导入,AI 结合提示词就能快速转化出氛围感十足的品牌形象片。

  1. 产品卖点与规格演示

做电商或者硬件产品推广时,只需上传产品的规格参数表(XLS)或卖点文档,AI 便能理解产品的核心功能,生成带有数字图表质感与材质演示的产品介绍短视频。

  1. 讲义与知识科普转换

很多自媒体创作者手头有大量的 Markdown(MD)笔记、教程讲义。利用 Wan 3.0 的文档理解能力,可以直接将干瘪的文字课件一键转化为带声画同步的讲解短片。

  1. 短剧与自媒体连贯叙事

对于短剧创作者来说,30 秒的长镜头加上极其稳定的角色、道具一致性,意味着可以轻松拍摄长镜头对白、室内群戏或者连续的动作镜头,大幅降低后期剪辑的成本。


价格、入口与社区反响

说到这,大家最关心的肯定是:去哪里能用上?价格贵不贵?

需要说明的是,根据官方帖及媒体转述公开信息,由于平台与地区不同,具体的入口与定价存在一定差异:

1. 公测体验入口

  • 国内官方生态:根据阿里官方微信公布的信息,Wan 3.0 已在阿里云百炼、万镜一刻、万相官网、千问创作 PC 端、IF STUDIO、堆友等平台开启公测,千问 App 端也在灰度开放中;官方 API 接口将在近期全量开放。[^2]
  • 国际侧与云端通道:官方 X 贴文显示,国际侧可在 Model Studio、Qwen Cloud 等平台关注,wan.video 成员也即将可用。[^3][^11]

2. 公开定价参考(请以各平台实时界面为准)

  • 国际公开价(官方帖标示):[^3]
  • 480p:$0.05 / 秒
  • 720p:$0.10 / 秒
  • 1080p:$0.20 / 秒
  • 中文媒体/社区转述人民币 API 价(如智东西等报道):[^15]
  • 480P:约 ¥0.3 / 秒
  • 720P:约 ¥0.6 / 秒
  • 1080P:约 ¥1.2 / 秒
  • 粗略算一笔账:生成一段 30 秒的 1080P 高清视频,API 成本大约在 ¥36 左右。

3. 创作者与行业反响

在归藏等著名创作者及各大 AI 社区的反馈中,Wan 3.0 的原生 30 秒和 Omni-Reference 被普遍认为“对 Agent 工作流极其友好”。大家普遍反映文字渲染和动态效果有了肉眼可见的进步。不过,面对 1080P 约 ¥1.2/秒 的定价,社区里关于“效果与算力成本如何平衡”的讨论也非常热烈。[^14][^15]


边界与理性预期:它还有什么局限?

虽然 Wan 3.0 展现出了惊人的进化,但在实际商业交付或日常创作中,咱们还是得保持理性的预期:

  • 客观技术局限:在目前的公测体验和官方说明中,声音质感与文字准确度仍有进步空间。如果你的画面需要渲染极其复杂的生僻汉字,或者对配音的播音级情感有极高要求,AI 生成的结果可能偶尔还是会出现瑕疵。[^2]
  • 生成随机性:AI 生成视频天然带有一定的概率性,一致性再好也不意味着“绝对不翻车”或“保证一次过审”。
  • 成本把控:由于是按分辨率和时长按秒计费,如果频繁盲目生成高码率的 1080P 长镜头,成本会积累得比较快。建议先用低分辨率试错提示词和镜头语言,满意后再导出高清版本。[^3][^15]

如何快速上手体验?

如果你迫不及待想体验一下 Wan 3.0 的生成效果,除了各大云端平台之外,也可以去 WAN 3.0 Video 进行上手尝鲜。

WAN 3.0 Video 站内,你可以很直观地感受新一代 AI 视频的创作流程:

  • 文生 / 图生视频模式:输入一段灵感文字,或者上传一张设定好的主角图片,快速验证镜头动效;
  • 多画幅自定义:无论是做站外横屏(16:9)还是短视频竖屏(9:16),都可以灵活调整输出画幅;
  • 体验约 30 秒带声短片:亲自感受一下原生长镜头与音画同步的连贯表达,看看它到底能不能读懂你的创作意图。

总结来说,从 Wan 2.1 的开源爆火,到 Wan 3.0 带来读懂文档的 Omni-Reference 和原生 30 秒长镜头,通义万相正在把 AI 视频创作从“玩梗抽卡”推向真正的“生产力工具”。[^1][^4]

如果你手头刚好有一份写好的企划案或者想拍的脑洞脚本,不妨现在就去 WAN 3.0 Video 试试手,看看 AI 到底能帮你把创意还原出几分惊喜!


参考来源

[^1]: Wan (@Alibaba_Wan), “Introducing Wan3.0 — now in Public Beta,” X, 2026-08-06. https://x.com/Alibaba_Wan/status/2085339761284104529

[^2]: 阿里巴巴, 《更懂真实世界,Wan3.0开启公测》, 微信公众号. https://mp.weixin.qq.com/s/MQeQm2xOiNc3_zIK9WZqLA

[^3]: Wan (@Alibaba_Wan), Wan3.0 public beta access & API pricing (USD), X, 2026-08-06. https://x.com/Alibaba_Wan/status/2085339765860364601

[^4]: Alibaba Group, “Alibaba Cloud Open Sources its AI Models for Video Generation,” 2025-02-26. https://www.alibabagroup.com/en-US/document-1831486012178563072

[^5]: Wan Team, Alibaba Group, “Wan: Open and Advanced Large-Scale Video Generative Models,” arXiv:2503.20314, 2025. https://arxiv.org/abs/2503.20314

[^6]: Alibaba Group, “Alibaba Unveils its Latest Open-Source Video Generation Model,” 2025-04-18. https://www.alibabagroup.com/en-US/document-1851424828087599104

[^7]: Alibaba Cloud, “Alibaba Releases Wan2.2 to Uplift Cinematic Video Production,” 2025-07-29. https://www.alibabacloud.com/en/press-room/alibaba-releases-wan-2-2-to-uplift-cinematic

[^8]: Wan (@Alibaba_Wan), “Today, we're officially launching Wan2.5-Preview!” X, 2025-09-24. https://x.com/Alibaba_Wan/status/1970697244740591917

[^9]: Wan (@Alibaba_Wan), “Introducing Wan2.6,” X, 2025-12-16. https://x.com/Alibaba_Wan/status/2000930078037827972

[^10]: Alibaba Cloud Model Studio, “Wan2.7 - Text-to-Video API Reference.” https://www.alibabacloud.com/help/en/model-studio/text-to-video-api-reference

[^11]: Wan AI 官网. https://wan.video/

[^12]: Wan-Video on GitHub. https://github.com/Wan-Video

[^13]: Wan-AI on Hugging Face. https://huggingface.co/Wan-AI

[^14]: 歸藏 (@op7418), 关于 Wan 3.0 公测能力与社区反馈, X, 2026-08-06. https://x.com/op7418/status/2085370072332452212

[^15]: 智东西 (@Chinazhidx), “Alibaba Wan3.0 AI video generation model is now open for public beta,” X, 2026-08-06. https://x.com/Chinazhidx/status/2085360869089939487

相关文章