> 本文基于公开可验证信息撰写,数据来源包括阿里云官方公告、arXiv 技术论文、PixelDojo 早期测试页面及第三方平台实测数据。截至 2026 年 8 月初,阿里官方可用最新版本为 Wan 2.7,文中关于 "WAN 3.0" 的信息主要来自平台早期测试泄露,标注有明确来源。
一、引言:AI 视频生成迈入"30秒完整叙事"新阶段

2026 年 7 月 31 日,AI 工具平台 PixelDojo 在官方 X 账号上发布了一条引发行业震动的消息:他们获得了 WAN 3.0 视频模型的早期访问权限,并展示了多段单次生成的完整 30 秒视频 demo。[^1]
这些 demo 中,有两位厨师在厨房里进行四句对话的完整场景,有信件从邮筒到门廊的 30 秒单镜头跟踪,还有自动适配竖屏广告和方形产品循环的自适应画幅演示。最引人注目的是——所有视频的对话、音效、环境音和音乐都是与画面同步生成的,而非后期叠加。
这意味着什么?AI 视频生成正在从"生成几秒钟的视觉片段"进化为"单次输出完整的带声短片"。对于内容创作者、广告从业者和技术开发者而言,这是一个质变时刻。
但需要先厘清一个重要的背景:截至 2026 年 8 月 3 日,阿里云官方平台(wan.video 和阿里云 Model Studio)公开可用的最新版本仍是 Wan 2.7,最高支持约 15 秒、1080P 视频生成。[^2] "WAN 3.0" 这个名称目前尚未出现在任何阿里官方文档或 API 中。[^3] 本文所引用的 3.0 能力信息,主要来自 PixelDojo 等平台的早期测试展示,其正式名称、参数和发布时间仍待阿里官方确认。
二、WAN 视频模型发展来龙去脉

要理解 WAN 3.0 的意义,必须先了解整个 Wan 系列的发展脉络。这是国内最重要的开源视频模型家族之一,其演进路径清晰地体现了"先开源打基础→快速迭代提能力→向生产级迈进"的策略。
2.1 起源:从图像生成到视频转型(2023-2024)
通义万相(Tongyi Wanxiang)最初是阿里巴巴通义实验室的视觉生成品牌,2023 年 7 月上线时主要聚焦 AI 图像生成,接入钉钉等办公场景。2024 年 9 月的云栖大会上,通义万相首次加入视频生成能力,支持插画、涂鸦、短片等场景化应用,标志着从静态图像向动态视频的转型正式开始。
2.2 破局时刻:Wan 2.1 全面开源(2025年2月)
2025 年 2 月 26 日,阿里云宣布开源 Wan 2.1 系列的四个模型,包括 T2V-14B、T2V-1.3B、I2V-14B-720P 和 I2V-14B-480P。[^4] 这一举动在行业内引发了巨大反响,被不少从业者称为"视频生成领域的 DeepSeek 时刻"。
Wan 2.1 的核心技术基于 Diffusion Transformer(DiT)架构,配合阿里自研的时空变分自编码器(Wan-VAE)和流匹配训练框架。[^5] 其技术论文《Wan: Open and Advanced Large-Scale Video Generative Models》(arXiv:2503.20314)详细披露了架构细节:Wan-VAE 实现了时间维度 4 倍、空间维度 8×8 倍的压缩率,将视频高效编码到潜在空间中;文本编码器采用 Qwen LLM 替代传统的 CLIP 或 T5,支持长达 512 token 的中英文复杂提示词。[^5]
Wan 2.1 的关键突破:
- 双版本策略:14B 版本面向专业生产环境,1.3B 版本仅需 8.19 GB 显存即可在消费级 GPU(如 RTX 4090)上运行[^5]
- 基准登顶:在 VBench 综合评测中以 86.22% 的总分排名第一,超越当时多个闭源模型[^4]
- 视觉文字生成:首个支持中英文双语视频内文字生成的模型[^4]
- 完全开源:Apache 2.0 许可,源代码、模型权重、训练代码全部开放[^4]
截至 2025 年 4 月,Wan 2.1 系列在 Hugging Face 和 ModelScope 上的下载量已超过 220 万次。[^6] 社区围绕 ComfyUI、LoRA 微调等生态迅速爆发,让高质量视频生成的门槛大幅降低。
2.3 快速迭代:从 2.2 到 2.7(2025年中-2026年初)
Wan 系列的迭代速度在国内大模型中堪称最快。以下是关键版本节点:
Wan 2.2(2025年7月29日) —— 行业首个开源 MoE 视频模型[^7]
阿里云发布了 Wan 2.2 系列,最大的亮点是引入了 Mixture-of-Experts(MoE)架构。该系列包含三个模型:Wan2.2-T2V-A14B(文生视频)、Wan2.2-I2V-A14B(图生视频)和 Wan2.2-TI2V-5B(文图混合生视频)。
MoE 架构的设计非常巧妙:两个专家模型分别处理高噪声和低噪声阶段——高噪声专家负责整体场景布局和运动规划,低噪声专家专注于细节纹理和一致性精修。虽然总参数量达到 270 亿,但每步推理只激活 140 亿参数,计算消耗降低了约 50%。[^7]
数据方面,Wan 2.2 的训练数据相比 2.1 有大幅扩充——图像数据增加 65.6%,视频数据增加 83.2%。[^7] 在运动表现上,复杂面部表情、动态手势和体育运动等高难度场景的质量显著提升。
Wan 2.5(约2025年9月) —— 首次实现原生音画同步
从多个来源交叉验证,Wan 2.5 是系列中首个引入原生音频生成能力的版本,支持人声、音效和背景音乐的同步生成,时长延伸至 10 秒级 1080P。这一能力后来在 2.7 中得到进一步完善。
Wan 2.6(约2025年12月) —— 强化参考生视频(R2V)
Wan 2.6 系列进一步强化了参考生视频能力,支持角色带声音出演新场景、多镜头叙事。在 Artifical Analysis Video Arena 等评测平台上表现优异。
HappyHorse 1.0(2026年4月) —— 匿名登顶 Arena
2026 年 4 月 7 日,一个名为 "HappyHorse 1.0" 的匿名模型出现在 Video Arena,文生视频 Elo 评分达到 1384,图生视频达到 1416,两项均创下 Arena 历史最高分。[^8] 随后该模型被确认属于 Wan 系列(Wan 2.7),展现了阿里在视频生成领域的技术实力。
Wan 2.7(2026年3-4月至今) —— 当前官方正式可用最高版本
Wan 2.7 是目前阿里云 Model Studio 和 wan.video 官方平台提供的最新版本。[^2] 它统一了图像与视频生成,支持文生视频、图生视频(首帧/首尾帧/视频续写)、参考生视频和视频编辑等多种模式。关键能力包括:
- 最高约 15 秒 1080P 视频生成
- 原生音频同步(对话+音效+环境音)
- 多镜头叙事(支持自然语言描述分镜)
- 首尾帧控制与视频续写
- 多语言视觉文字生成
阿里云 DashScope API 目前提供 wan2.7-t2v-2026-06-12(文生视频)、wan2.7-i2v-2026-04-25(图生视频)和 wan2.7-videoedit(视频编辑)三个端点。[^2][^9]
2.4 核心演进逻辑
纵观整个 Wan 系列,有三条清晰的技术主线:
| 维度 | 2.1(2025.2) | 2.2(2025.7) | 2.7(2026.4) | 3.0(2026.7 测试) |
|---|---|---|---|---|
| 时长 | 5 秒 | 5 秒 | 约 15 秒 | 2-30 秒 |
| 架构 | Dense DiT | MoE DiT | 统一多任务 | 待确认 |
| 音频 | 无 | 无 | 原生同步 | 原生同步 |
| 参考输入 | 有限 | 有限 | 图片+首尾帧 | 图+视频+音频混合 |
| 分辨率 | 720P | 720P | 1080P | 1080P(演示) |
策略上,阿里采取了"早期大力开源建立生态,后期用 API 和闭源测试版推向生产可用"的混合路线。Wan 2.1/2.2 完全开源(Apache 2.0)带来了巨大的社区生态红利,而 2.5 之后的部分能力开始通过闭源 API 提供。这种策略与 Meta 的 LLaMA 系列有相似之处——用开放换取生态,用闭源保持商业化竞争力。
三、WAN 3.0 核心能力详解(基于早期测试)
以下信息主要来自 PixelDojo 2026 年 7 月 31 日至 8 月 2 日的早期访问预览页面和公开 demo 演示。[^1] PixelDojo 明确表示该模型"仍在测试中,尚未正式上线工具列表"。第三方营销站点(wan30.co、wan3pro.com 等)声称的部分规格(如原生 4K、60fps、60 秒、神经物理引擎等)与官方文档及实际测试平台不符,本文以 PixelDojo 等可靠测试平台的信息为准。
3.1 时长突破:单次 30 秒完整生成

这是 WAN 3.0 最大的突破点。PixelDojo 展示了单次生成 2-30 秒完整视频的能力,无需拼接或后处理。[^1] 更值得注意的是"智能时长"功能——将时长设置为 -1 时,模型会根据提示词自动决定视频长度。在 PixelDojo 的测试中,描述"纸船沿水沟漂流"后,模型自主生成了 20 秒的视频,长度完全由模型决定。
这意味着视频生成正在从"用户精确控制每一帧"转向"用户描述意图,模型自主编排"。
3.2 原生音频一体化

WAN 3.0 的音频不是后期叠加的,而是在扩散过程中同步生成的。[^1] 对话、音乐、房间混响(room tone)和拟音(foley)都直接内嵌在输出的 MP4 文件中。PixelDojo 特别指出,"开启或关闭音频的费用完全相同",说明音频生成是架构原生的,而非可选的后处理步骤。
在 demo 中,30 秒的厨师对话场景展示了四句自然对话的同步生成,声音与嘴型动作基本匹配;雨滴打在画布上的场景中,雷声、雨声和远处的火光音效都与画面精准对齐。
3.3 多模态参考系统

WAN 3.0 支持在单次请求中输入最多约 10 张图片、5 段视频和 5 段音频作为参考。[^1] 用户可以从一张图中提取角色外观,从另一张图中提取场景环境,从音频中提取声音特征,再用文字描述如何组合它们。
PixelDojo 的 demo 展示了这种能力:输入一张人物静态照片,输出该人物在特定环境中的动态视频,角色外观保持一致。
3.4 像素级一致性
在多个 demo 中,WAN 3.0 展现了跨整段视频的角色和场景一致性。[^1] 30 秒的救援场景中,两个角色的服装、面部特征和空间关系在全程保持稳定,没有出现明显的漂移或变形。这对于叙事性内容至关重要——观众不会因为角色突然"变脸"而出戏。
3.5 自适应画幅

WAN 3.0 支持将宽高比设置为"自适应"模式,模型会根据提示词内容自动选择最合适的画幅。[^1] PixelDojo 测试中,提示"竖屏广告"时返回了 720×1280,提示"方形产品循环"时返回了 960×960——两次请求中都没有指定任何尺寸参数。
3.6 首尾帧控制
用户可以指定视频的第一帧和最后一帧(均为静态图片),模型自动生成两者之间的运动过渡。[^1] 这一功能对于需要精确控制起止状态的场景(如产品展示、动作过渡)非常实用。
四、横向对比:WAN 3.0 vs 主流视频模型

2026 年中期的 AI 视频生成赛道竞争激烈,头部玩家各有所长。以下是基于可验证信息的横向对比。
4.1 对比对象简介
- Seedance 2.5(字节跳动):2026 年 7 月 API 正式上线,目前功能最激进的商用模型[^10]
- Kling 3.0(快手):2026 年 2 月正式发布,最成熟的商业闭源模型[^11]
- Gemini Omni Flash(Google DeepMind):2026 年 5 月发布,独特的对话式编辑能力[^8]
4.2 核心规格对比
| 维度 | WAN 3.0(早期测试) | Seedance 2.5 | Kling 3.0 | 优势方 |
|---|---|---|---|---|
| 单次最大时长 | 30 秒 | 30 秒 | 15 秒 | WAN/Seedance 并列 |
| 分辨率 | 1080P(演示) | 原生 4K(10bit 色彩) | 原生 4K / 1080P / 60fps | Seedance/Kling |
| 原生音频 | 有(对话+音效+环境音) | 有(同潜空间联合生成) | 有(多语言唇形同步+方言) | 三者均支持 |
| 多模态参考 | ~10图+5视频+5音频 | 最多 50 个参考输入 | 多图+元素参考 | Seedance 明显领先 |
| 多镜头叙事 | 支持连贯场景 | 支持多镜头+区域编辑 | 最多 6 镜头(AI 导演) | Kling 分镜最精细 |
| 角色一致性 | 像素级(测试表现优秀) | 优秀(大量参考支撑) | 优秀(Element Reference) | 三者接近 |
| 可用性 | 早期测试,正式待定 | API 已开放,逐步铺开 | 全面开放(官网+API) | Kling 最成熟 |
| 开源 | 系列传统上较开放 | 闭源 | 闭源 | WAN 潜在优势 |
4.3 逐项分析
时长与叙事完整性: WAN 3.0 和 Seedance 2.5 都实现了单次 30 秒生成,这对广告和短剧场景意义重大——一个完整的"起承转合"可以在单次生成中完成。Kling 3.0 限制在 15 秒,但通过最多 6 个智能分镜把信息密度做高,适合节奏更快的社媒内容。[^10][^11]
参考控制能力: Seedance 2.5 在这方面遥遥领先——单次最多 50 个多模态参考(图+视频+音频+3D 白模),还支持局部区域编辑(画框修复)和 3D 摄影机预演。[^10] WAN 3.0 的参考能力在早期测试中已经很强,但与 Seedance 的 50 参考仍有差距。Kling 3.0 的优势则在角色元素绑定和多镜头自定义的精细度上。
音频与多语言: 三者都支持原生音画同步。Kling 3.0 在多语言支持上最全面(中英日韩西 + 方言口音、多角色混说)。[^11] Seedance 2.5 强调同潜空间联合生成带来的更高同步精度。WAN 3.0 的音频自然度在 demo 中表现不错,但多语言细节尚未公开。
画面质量: Seedance 2.5 和 Kling 3.0 的原生 4K 能力已得到广泛验证。WAN 3.0 当前演示停留在 1080P,物理感和细节表现(如蜂蜜倾倒、雨景画布、界面文字渲染)不错,但尚未看到大规模 4K 实证。
性价比: Kling 3.0 的 API 定价最低(标准模式约 0.075 美元/秒),是日常高频使用的首选。[^8] Seedance 2.5 的 720P 标准档约 0.30 美元/秒,4K 档约 0.68 美元/秒,成本较高。WAN 3.0 的正式定价尚未公布。
4.4 使用场景建议
- 需要最长完整叙事(30秒单镜头) → WAN 3.0 或 Seedance 2.5
- 需要极多参考素材 + 精细控制(专业制作) → Seedance 2.5
- 需要成熟稳定、多语言对话、精细分镜、立即出片 → Kling 3.0
- 预算敏感 / 高性价比日常使用 → Kling 3.0 或后续 WAN 正式版
- 需要本地部署 / 自托管 / 模型微调 → WAN 系列(开源基因)
五、技术推测与分析
基于 Wan 系列公开的技术论文[^5]和已有版本的架构演进,结合早期测试表现,我们可以对 WAN 3.0 的技术方向做一些合理推测。
5.1 30 秒生成的架构挑战
从 15 秒到 30 秒不是简单的"加倍"——长视频生成面临的核心挑战是时序一致性(temporal coherence)的指数级衰减。早期的 DiT 模型在超过 10 秒后容易出现物体漂移、风格突变和空间关系错乱。
推测 WAN 3.0 在以下一个或多个方面做了突破:
- 时空注意力机制优化:可能引入了多尺度时间注意力(multi-scale temporal attention),在不同时间分辨率上并行处理,兼顾长程一致性和短程运动细节
- VAE 压缩率提升:Wan-VAE 的时间压缩比可能从 4 倍提升到更高,降低长序列的计算量
- 流匹配机制改进:可能借鉴了 Wan-Streamer 论文中的"世界模型 + 事件流"分解思路,将长视频拆分为语义事件序列
5.2 音频-视觉联合生成
WAN 3.0 的原生音频不是后期叠加,而是在生成过程中同步产出。[^1] 推测其采用了音视频联合扩散(joint audio-video diffusion)架构,在同一潜在空间中同时建模视觉和音频信号。这与 Seedance 2.5 的技术路线类似,但具体实现细节可能不同。
这种架构的优势在于:音画同步精度更高(无需后期对齐),且可以学习到更深层的"声音-动作"关联(如脚步声与行走节奏的自然匹配)。
5.3 多参考与身份锁定
从 Wan 2.7 的有限参考输入,到 WAN 3.0 的"10图+5视频+5音频"混合参考,能力跨度很大。推测引入了更强的 cross-attention 机制或专用的身份锁定(identity locking)模块,在交叉注意力层中将多个参考源的特征融合注入生成过程。
5.4 关于"神经物理引擎"的可信度
部分第三方站点声称 WAN 3.0 具备"神经物理引擎"(Neural Physics Engine),支持液体、布料、头发的精确物理模拟。[^12] 从 PixelDojo 的 demo 看,物理感确实有提升(蜂蜜倾倒、纸船漂流等),但这更可能是训练数据质量提升和时序建模改进带来的副作用,而非独立的物理引擎模块。在当前的扩散模型架构中,"真正的物理引擎集成"仍是未解决的研究课题。
六、应用场景与创作者意义


6.1 内容创作的范式转变
30 秒 + 原生音频意味着什么?意味着 AI 视频生成从"素材供应商"变成了"短片制作人"。过去,创作者需要用 AI 生成 5-10 秒的片段,再手动拼接、配音、剪辑。现在,一个完整的广告场景、一段对话短剧、一个产品展示可以直接从提示词一步到位。
具体应用场景:
- 短视频/社媒内容:30 秒刚好覆盖抖音、Instagram Reels 等平台的单条视频时长
- 广告创意:完整的 15-30 秒广告片可通过单次生成完成初版
- 短剧/叙事内容:有开头、发展、结尾的完整故事弧线
- 产品展示:带音效的产品特写、360 度展示
- 教育/培训:带旁白的操作演示、概念讲解
6.2 多模型混用成为常态
在实际创作工作流中,单一模型很难满足所有需求。许多创作者已经在混合使用多个模型:
- 用 Seedance 2.5 做高参考控制的品牌视觉内容(需要大量参考素材 + 精确编辑)
- 用 Kling 3.0 做多语言对话场景和社媒短片(需要成熟稳定的多镜头 + 唇形同步)
- 等 WAN 3.0 正式版补上"30 秒长叙事"的缺口(需要单次完整生成 + 可能的低成本/开源方案)
这种"工具箱"思维将是未来 AI 内容创作的常态——没有万能模型,但多个互补模型可以覆盖几乎所有场景。
6.3 对行业的深层影响
如果 WAN 3.0 正式发布后保持 Wan 系列的开源传统,将对行业产生深远影响:
- 降低准入门槛:中小创作者和独立开发者可以获得接近商业级的视频生成能力
- 推动本地化部署:对于有隐私需求或成本敏感的场景,自托管方案是刚需
- 加速生态创新:ComfyUI 工作流、LoRA 风格微调、定制化推理管线等社区创新将继续爆发
七、未来展望与风险
7.1 发布时间线推测
基于 Wan 系列的历史节奏(2.1 到 2.7 在约一年内迭代了 6 个大版本)和多平台已获早期访问的事实,推测 WAN 3.0 的正式发布时间线可能是:
- 2026 年 8-9 月:阿里云 Model Studio API 开放 3.0 版本(闭源 API)
- 2026 年 Q3-Q4:部分轻量版(如 1.3B)开源
- 2026 年 Q4 或更晚:完整版本开源(如果延续传统)
但需要注意,Wan 2.5/2.6 曾出现过"承诺开源但未完全兑现"的情况,社区对 3.0 的开源策略需要保持谨慎乐观。
7.2 计算成本挑战
30 秒视频的生成成本将显著高于 15 秒。参考 Kling 3.0 和 Seedance 2.5 的定价,30 秒 1080P 视频的 API 调用成本可能在 2-10 美元区间。对于高频使用的创作者,这是一个需要考虑的因素。
7.3 竞争格局展望
2026 年下半年的 AI 视频赛道将更加白热化:
- 字节跳动(Seedance):功能最激进,但闭源且成本较高
- 快手(Kling):最成熟稳定,性价比最优,持续迭代
- 阿里(WAN):开源基因 + 长时长优势,需要在画质和 4K 上追赶
- Google(Gemini Omni):独特的对话式编辑范式,生态最广
- OpenAI(Sora):技术前沿但商业化保守
WAN 系列最大的差异化竞争力在于开源基因 + 中文场景优化 + 持续快速迭代。如果 3.0 能延续这一传统,它将成为开发者和中小创作者最具性价比的选择。
7.4 需要关注的风险
- 营销夸大:第三方站点(wan30.co、wan3pro.com 等)声称的"原生 4K、60fps、60 秒、神经物理引擎"等规格与官方文档及实际测试平台不符,可能存在夸大。[^3] 建议以 PixelDojo 等实际可测试平台和阿里官方文档为准
- 版权与伦理:参考素材的使用边界、生成内容的商用版权归属等问题仍需行业共识
- 技术局限:复杂高速运动、极端物理交互、超长视频(超过 30 秒)的质量衰减等问题仍待验证
八、结语
> 想边读边试:可在 wan3video.art 的浏览器创作台体验文生视频 / 图生视频(积分制;生成参数以接入的生产 API 为准)。
WAN 3.0 的早期测试信息显示,它是一次实用性导向的重大升级——重点解决"能生成完整可用短片"的问题(时长 + 音频 + 一致性),而不是单纯堆分辨率或参数量。从 PixelDojo 的实际 demo 看,质量已经具备商业可用性。
但我们也需要保持理性:目前关于 WAN 3.0 的信息碎片化程度很高,既有可靠的早期测试数据,也有第三方站点的夸大宣传。在阿里官方正式公布之前,建议以实际可测试的 demo 效果为判断依据。
对于开发者和技术团队,WAN 系列的开源传统意味着更低的试错成本和更大的定制空间。对于内容创作者,30 秒 + 原生音频的能力将显著缩短从创意到成片的距离。无论你属于哪个群体,持续关注 PixelDojo 预览页、阿里云 Model Studio 官方文档和 Wan-AI 的 GitHub/Hugging Face 主页,是获取最新动态的最佳途径。
在这个多模型混用的时代,没有单一的"最佳模型",只有最适合你场景的选择。WAN 3.0 正在补上"长叙事"这一关键拼图,整个行业也将因此加速向"单次生成完整带声叙事"的方向演进。
参考来源
[^1]: PixelDojo, "WAN 3.0 makes 30 second videos," 2026年7月31日. https://pixeldojo.ai/wan-3-0-preview
[^2]: 阿里云 Model Studio, "Wan2.7 - text-to-video API reference," 更新于2026年7月22日. https://help.aliyun.com/en/model-studio/text-to-video-api-reference
[^3]: Imagera.ai, "Is Wan 3.0 Real? What Alibaba Has Actually Shipped in 2026," 2026年7月29日. https://imagera.ai/blog/is-wan-3-0-real-what-alibaba-shipped-2026
[^4]: Alibaba Group, "Alibaba Cloud Open Sources its AI Models for Video Generation," 2025年2月26日. https://www.alibabagroup.com/en-US/document-1831486012178563072
[^5]: Wan Team, Alibaba Group, "Wan: Open and Advanced Large-Scale Video Generative Models," arXiv:2503.20314, 2025年3月. https://arxiv.org/abs/2503.20314
[^6]: Alibaba Group, "Alibaba Unveils its Latest Open-Source Video Generation Model," 2025年4月18日. https://www.alibabagroup.com/en-US/document-1851424828087599104
[^7]: Alibaba Cloud, "Alibaba Releases Wan2.2 to Uplift Cinematic Video Production," 2025年7月29日. https://www.alibabacloud.com/en/press-room/alibaba-releases-wan-2-2-to-uplift-cinematic
[^8]: CSDN, "HappyHorse、Seedance、可灵、Gemini Omni:2026年视频大模型深度横评," 2026年7月30日. https://blog.csdn.net/aidoudoulong/article/details/163328673
[^9]: 阿里云 Model Studio, "Wan 2.7 - image-to-video API," 更新于2026年7月22日. https://help.aliyun.com/en/model-studio/image-to-video-general-api-reference
[^10]: OrcaRouter, "Seedance 2.5 vs Kling 3.0: Best AI Video Model in 2026," 2026年6月30日. https://www.orcarouter.ai/blog/seedance-2-5-vs-kling-3-0
[^11]: Dreamina (Seedance官方), "Seedance 2.5 Vs Kling 3.0: Which AI Video Model Fits Modern Content Production?" 2026年6月29日. https://dreamina.capcut.com/seedance/seedance-2-5-vs-kling-3-0
[^12]: wan30.co, "Wan 3.0 Review," 2026年. https://wan30.co/review (注:第三方营销站点,非阿里官方,信息可信度需谨慎对待)