深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

阿里万相Wan3.0实测:30秒音画同步AI视频的能力与成本核验

2026-09-19·AI洛兹克·模型推理AI视频生成万相Wan3.0文生视频大模型AIGC实测多模态生成
▮ SIGNAL SUMMARY · 摘要快读

本文实测阿里通义万相Wan3.0文生视频模型的30秒长镜头、音画同步等五项核心能力,核对其定价、适用场景与现存不足。

阿里万相Wan3.0实测:30秒音画同步AI视频的能力与成本核验

阿里万相Wan3.0实测:30秒音画同步AI视频的能力与成本核验

原文:实测阿里Wan3.0一次直出30秒视频,小时候的主角梦实现了!(AI洛兹克,日期未知)· 原文链接

一文看懂

这篇内容是AI创作者对阿里通义万相系列最新文生视频模型Wan3.0的实打实测,没有照搬官方宣传参数,而是通过5项贴近真实使用场景的测试,验证它能否真正帮普通人降低视频制作门槛。

此前AI生成视频普遍只能输出5-15秒的短片段,还容易出现人物变脸、场景跳变、无内置音效的问题,创作者生成片段后还要自己配音、加字幕、补镜头,折腾很久才能产出完整内容。此前Wan2.1、Wan2.2版本采用Apache 2.0(阿帕奇2.0开源许可协议)开放源代码,而Wan3.0是该系列的第八代迭代版本,官方宣传核心升级有三点:一是原生支持最长30秒一镜到底输出,时长比上一代Wan2.7直接翻倍;二是支持音画一体生成,画面和配套音效同步产出,无需后期额外配音;三是多模态参考能力升级,最多可同时上传20份文本、图片、音频、视频甚至文档类参考素材,保障角色、道具、场景风格的一致性,还支持12种语言的文字直接生成在画面中。

测试完全模拟普通用户使用习惯,作者通过网页版提交需求,所有给AI的指令全部公开,分别验证长镜头稳定性、音画同步准确率、多素材一致性、文字生成正确率、视频延长能力。结果显示,30秒长镜头可按要求自动完成景别推拉、光线过渡,未出现画面崩坏;马蹄声、风吹草动等音效可与画面动作精准卡点;上传14张参考图后,角色造型、场景色彩风格均未跑偏;纯文字指令即可生成无错字的简体中文标题、要点与柱状图,已生成的视频还可继续延长内容。在社区用户盲测榜单中,Wan3.0的带音频、无音频文生视频Elo(埃洛评分)均排名第一。

实测也发现了现存不足:1080P清晰度下远景细节有涂抹感,音效质感尚未达到专业配乐级,小字号文字存在出错概率;目前Wan3.0暂未开源,仅能通过官方网页、阿里云百炼的API(应用程序编程接口)等渠道付费使用,习惯用ComfyUI(康菲节点式AI创作工具)做自定义生成的创作者,暂时只能使用旧版本能力。

成本方面,当前限时七折后1080P视频每秒仅0.84元,一条30秒成片约25元,480P版本仅需约6.3元,生成失败不计费,新用户还可领取30秒免费额度,普通用户、自媒体创作者、电商团队为每款SKU(库存保有单位)生成演示内容、开发者接入能力都有较高性价比。

含金量评估(总评 8.2/10)

这是一份落地性较强的万相Wan3.0一手实测,验证了国产文生视频模型在长时长、音画同步等核心能力上的实质性突破,对内容创作者参考价值较高。

佐证核验

可落地建议


信号强度:8.2/10 | 归类:模型推理 | 解析时间 2026-09-19 22:33

SIGNAL FILE · 情报档案

原载:AI洛兹克

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://mp.weixin.qq.com/s/8YGwif2gFxM0kziuENUzqA(AI洛兹克)

RELATED SIGNALS · 关联信号