当 Sora 倒下,视频生成重新洗牌:从 DiT 到原生多模态的架构进化史
2026 年 3 月 24 日,OpenAI 宣布关停 Sora——这款曾以"电影级"画面震动业界的产品,两年累计收入仅约 210 万美元,而年运行成本据《福布斯》估算高达 50 亿美元。仅仅四个月后,Artificial Analysis 视频竞技场 8 月榜单上,前十名里有八席属于中国实验室,Google 的 Gemini Omni Flash 登顶,Veo 3.1 排第 11,Sora 2 彻底跌出前十二。
这个反转之所以值得技术视角的复盘,是因为它背后藏着一条清晰的架构演进线索:DiT(Diffusion Transformer)统一了视频生成的底座,时空一致性工程决定了长视频上限,原生音视频同步正在重新定义"一段视频"的边界。 本文试图沿着这三条线索,拆解 AI 视频生成从 2022 到 2026 的技术弧线。
一、DiT:一次替换 U-Net 的架构革命
要理解 2026 年所有主流视频模型为什么长得如此相似,得回到 2022 年 12 月那篇论文。William Peebles 和 Saining Xie 在 arXiv 贴出《Scalable Diffusion Models with Transformers》,用纯 Transformer 替换 U-Net 作为扩散模型的骨干网络,拿下 ICCV 2023 最佳论文。核心论点很朴素:U-Net 在中小规模表现尚可,但增加参数和算力带来的提升不稳定;Transformer 则像语言模型一样,能随计算量可预测地变强。
U-Net 的三个结构性短板,在视频场景里被放大到无法忽视:
感受野受限。 卷积层只能看到像素的局部邻域,想让第 1 帧的运镜影响第 96 帧的构图,信息要逐层卷积慢慢传递,要么堆层数,要么加专门的时间层,成本陡增。
扩展不优雅。 U-Net 加深时,skip connection 让计算量二次增长;改宽、改归一化往往需要手动调参。"翻倍参数 → 翻倍质量"这种在语言模型里成立的简单关系,在 U-Net 上不成立。
分辨率偏置。 U-Net 围绕固定空间维度设计,换分辨率、换宽高比要 resize、pad 或训练多个变体;Transformer 天然处理变长序列,换分辨率只是换 token 数量。
DiT 的解法是把图像或视频的潜在表示切成 patch、拉平成 token 序列,喂给标准 Transformer 编码器堆栈。最关键的条件注入设计是 AdaLN(自适应层归一化):把扩散时间步和文本条件编码成尺度参数 γ 和偏移参数 β,直接注入每个 block 的归一化层,而非用 cross-attention"外挂"——这让模型在不同去噪阶段能动态调整计算方式。
DiT 的真正意义不是"换了个网络",而是把扩散模型纳入了 Transformer 的 Scaling Law 体系。 一旦生成质量能随参数、数据、算力可预测地提升,资本和工程投入就有了清晰的回报曲线——这正是 2024 年后所有头部实验室集体转向 DiT 的根本原因。
到 2026 年,Sora 2、Veo 3、Kling 3.0、Seedance 2.5、Hailuo、WAN、HunyuanVideo、CogVideoX、Movie Gen、Runway Gen-4——无一例外都是 DiT 家族。架构收敛到这个程度,在生成式 AI 的历史上并不多见。
二、时空一致性:从"生成一帧"到"讲一个故事"
DiT 解决了"能不能生成"的问题,但视频比图像多一个时间维度,所有真正的难题都在时空一致性上。
一个直观的计算:1 分钟、30fps、512×512 的视频有 1080 帧,每帧切 256 个 patch,序列长度就超过 27 万——远超标准 Transformer 的处理能力。怎么在这么长的序列里让角色脸不漂移、光照不跳变、物体不"融化",是 2024 到 2026 年视频模型迭代的主战场。
3D VAE 时空压缩是第一道工序。快手 Kling 3.0 的 3D 变分自编码器同时压缩空间和时间关系,而非逐帧或分组生成后再平滑过渡——这是它能把"闪烁"和"纹理抖动"压下去的架构原因。传统视频扩散模型先生成帧再补过渡的做法,在物理连贯性上天然吃亏。
时空解耦注意力是第二道。字节 Seedance 2.5 的双分支 DiT(DB-DiT)交替执行空间注意力块(处理单帧构图)和时间注意力块(处理帧间运动),让模型在"加帧"时不丢失"这一帧长什么样"的记忆。这听上去像个工程细节,但它正是 Seedance 2.5 能把单次直出从 15 秒拉到 30 秒的底层支撑。
长程记忆模块是第三道。Seedance 2.5 在帧间时序注意力里引入长程锚定机制,生成第 N 帧时仍能关联开篇的人物、场景、光照特征,保证 30 秒内"铺垫—推进—转折—收尾"的叙事结构由同一套推理链路输出,无拼接痕迹。这里要区分两个概念:把多个 5 秒片段剪在一起叫"拼接",30 秒内容在一次前向传播里完整生成叫"直出"——后者的技术难度完全不在一个量级。
这条线索的尽头,是被反复提及的"世界模型"。香港科技大学王帅教授的判断是:高质量视频生成模型必须在相当程度上学习物体运动、空间关系、光影变化等物理世界规律,Seedance 的技术路径被视为通向"世界模型"的实现路径之一。换句话说,视频模型不再只是"会画的机器",它正在被迫成为"懂物理的机器"。
三、原生音频同步:2026 年最被低估的范式迁移
如果说 DiT 是 2023 年的架构革命,时空一致性是 2024–2025 年的工程深水区,那么 原生音频同步就是 2026 年的最大变量。
早期视频模型产出的都是静音片段,创作者要生成画面后手动叠音乐、配音、音效——AI 视频因此更像"视觉草稿工具"而非完整生产线。2025 年初还没有任何生产级视频模型提供原生音频;到 2026 年中,所有顶配模型都内置了某种形式的音频生成。这个转变发生得极快。
技术路线分两派。后处理派用独立的文生音频或视频生音频模型补音轨,控制精细但引入时序错位——画面里的人第 3 秒张嘴,声音第 3.5 秒才出来。联合生成派把视觉 token 和音频 token 放进同一个 Transformer,让它们在生成过程中相互 attend,一扇门关上的画面和"砰"的音效由同一次前向传播同时产出。
Veo 3.1 是联合生成的代表:一次 prompt 同时生成画面、环境音、人物对白,节奏与口型完美匹配。快手可灵的 Kling-Foley 走得更深——它是一个多模态流匹配模型,文本、视频帧作为条件输入,经 MM-DiT 块预测 VAE 潜在特征,再由梅尔解码器重建声谱图,最后渲染成立体声;帧级音视频对齐模块让"所见即所听"。Kling 3.0 进一步把音频内嵌进扩散管线,人物口型与生成语音作为统一输出,在特写镜头下也扛得住同步误差的放大。
字节 Seedance 2.5 的 DB-DiT 用两个分支分别处理视频流和音频流,通过共享的扩散步骤强制对齐,单次前向传播同步输出画面与声音。这条路线的工程意义在于:当音视频在同一个潜在空间同步计算,"后期添加音轨"这件事就从工作流里消失了。 以往 5 秒画面需要 10 分钟做声音设计,现在一次出片即用。
原生音频对商业落地的影响是直接而刚性的。品牌广告需要虚拟代言人说话、短剧需要角色对白、产品演示需要拟音——这些场景在"静音视频 + 外接 TTS"时代要么做不好,要么做不起。Veo 3.1 在七提示词音频测试里赢了五轮,靠的正是对话、拟音、环境音的同步生成能力。
四、2026 年 8 月:一份视频模型格局速览
把上述三条线索落到当下格局,可以更清楚地看到各家路线的差异。下表汇总了截至 2026 年 8 月主流视频模型的核心指标(数据综合自 Artificial Analysis 视频竞技场与各厂商公告):
| 模型 | 厂商 | 架构特点 | 单次时长/分辨率 | 原生音频 | 竞技场排名 |
|---|---|---|---|---|---|
| Gemini Omni Flash | 多模态统一 | 8s/1080p | 是 | #1(Elo 1245) | |
| MiniMax H3 | MiniMax | 全模态统一上下文 | 15s/2K | 原生双声道 | #2(Elo 1238) |
| Seedance 2.5 | 字节跳动 | DB-DiT 双分支,时空解耦,长程记忆 | 30s 直出/4K | 联合生成 | #3(Elo 1223) |
| Wan 2.7 / HappyHorse | 阿里 | 多镜头角色一致性 | 5–15s/1080p | 跨镜头同步 | #4–#6 |
| Kling 3.0 | 快手 | DiT + 3D VAE,MVL 统一潜空间 | 3–15s/4K 60fps | 双语口型同步 | #7 |
| Veo 3.1 | DiT,多参考图像融合 | 8s/4K | 对话+拟音+环境 | #11(Elo 1095) | |
| Sora 2 | OpenAI | Spacetime DiT | 60s/720p | 实验性 | 跌出前 12 |
数据来源综合自 Artificial Analysis 视频竞技场 8 月榜单与各厂商技术文档。
这张表透露出几个值得玩味的信号。第一,竞技场前十被中国实验室包揽八席,Google 靠 Gemini Omni Flash(一个"顺带能生成视频"的 Gemini 变体)抢到第一,而它主推的 Veo 3.1 反而排第 11——这暗示 Google 真正的视频能力不在它营销的那条产品线上。第二,单次时长不再是唯一硬指标,Seedance 2.5 的 30 秒直出与 Kling 3.0 的 4K 60fps 代表两个不同方向的极致追求。第三,原生音频已成顶配标配,没有它意味着工作流多一道工序。
五、被忽视的变量:成本与商业化
纯看 Elo 分数,容易错过 Sora 倒下的真正原因。Sora 的失败不是技术失败,而是单位经济学的失败。
视频生成的单次推理算力消耗远高于文本和图像,用户越多成本越高。Sora 应用内总收入约 210 万美元,年运行成本超 50 亿美元——这个比例在任何商业模式下都无法持续。更深的问题在于,Sora 作为独立 C 端应用,缺乏与字节 Seedance 之于抖音、可灵之于剪映那种"嵌入内容生产闭环"的场景支撑。游戏科学 CEO 冯骥评价 Seedance 2.0 是"当前地表最强的视频生成模型""AIGC 的童年时代结束了"——这句话的潜台词是,视频模型终于从"炫技玩具"长成了"生产力工具"。
Sora 的倒下证明了一件事:在视频生成赛道,技术领先不等于商业存活。 当中国厂商把单秒生成成本压到美分量级、并把模型深度嵌入短视频和广告生产管线时,"高配版玩具"的商业模式就被判了死刑。
OpenAI 关停 Sora 后将资源转向编程工具 Codex、企业级应用和下一代模型 Spud,本质上是为 IPO 讲一个更简洁的盈利故事。Sora 团队则转向机器人与物理世界模拟研究——视频生成的技术遗产,可能以另一种形态延续。
写在最后:视频模型的下一站
把三条线索收拢,AI 视频生成 2022 到 2026 的演进可以浓缩成一句话:DiT 统一了底座,时空工程拉长了时长,原生同步补上了声音。 这三步走完,"一段视频"的定义已经从"几秒静音画面"变成了"30 秒带对白、有环境音、角色不漂移的完整叙事单元"。
下一站的轮廓正在浮现。Seedance 2.5 已经支持 50 个多模态参考素材、时间戳精度控制在 1 秒内的局部编辑、绿幕与白模参考、Maya/Blender 插件调用——这些能力组合在一起,意味着视频生成正从"生成单条内容"转向"资产驱动的内容生产逻辑"。徐工集团、小鹏汽车、智元机器人接入 Seedance 2.5,则指向一个更工业化的方向:视频模型作为合成数据源,反哺自动驾驶仿真、工业流程可视化、具身智能训练。
一个值得持续观察的判断是:当视频模型开始稳定地建模物理世界规律,它就不再只是"内容生成工具",而是"世界模拟器"的雏形。 Sora 团队转向机器人研究,并非偶然——能生成物理合理视频的模型,与能让机器人理解物理世界的模型,底层能力高度重叠。
至于那个被反复追问的问题——"AI 视频能不能替代实拍"——2026 年 8 月的答案已经比一年前清晰得多:在短视频、广告素材、电商演示、影视预演这些"可控性优先于真实感"的场景,它已经在替代;在需要真人情感、复杂实拍、版权安全的领域,它还在门外。但门正在一寸一寸地打开。
内容由 Qific2.1flash 模型辅助生成
Qific2.1flash 模型是千策人工智能研究院开发的旗舰多模态推理模型。基于 217B 总参数 / 23B 激活参数的稀疏 MoE 架构,原生支持图片和视频理解。