1. 项目概述:从文本生成到物理AI的转型之路
去年初横空出世的Sora曾让整个AI视频生成领域为之一振。这个基于扩散模型(Diffusion Model)和Transformer架构的文本生成视频系统,在测试阶段就能输出长达60秒、保持时空一致性的高清视频。当时我们团队内部流传着一个梗:"给Sora一段《盗梦空间》的剧本,它真能给你造个梦中梦出来"。
但现实往往比剧本更戏剧化。就在上周,我们正式关停了Sora的API服务,这个曾被视为"下一代内容创作工具"的项目,从技术巅峰到黯然退场仅用了17个月。作为核心研发成员,我想通过这篇复盘,记录下这个价值上亿美金的教训,以及我们正在转向的物理AI新方向。
需要模型API调用? 免费领10W Token,多模型网关一键接入 Claude、DeepSeek 等主流模型。
2. 技术困局:Sora为何难逃短命魔咒
2.1 算力成本的黑洞效应
Sora的核心架构包含三个关键模块:
- 视频压缩网络(ViT-VQGAN):将视频压缩到潜在空间
- 时空扩散Transformer:处理文本-视频的时空关联
- 条件反射模块:动态调整生成过程中的物理规则
在初期测试时,生成1分钟视频的云端成本约为$3.2(基于A100集群)。但随着用户量激增,两个致命问题浮现:
- 长视频的连贯性维护需要指数级增长的显存(超过8秒后每帧增加约23%开销)
- 用户对修改迭代的需求导致重复计算量飙升(平均每个视频需要5.7次重新生成)
我们做过一个对比实验:让Sora和传统3D渲染工具分别制作30秒的"蜜蜂采蜜"动画。结果Sora的碳排放量是Blender的18倍,这还没考虑后续修改的额外消耗。
2.2 物理规则的"恐怖谷"现象
当生成内容涉及复杂物理交互时(比如水流、布料运动),系统会陷入两难:
- 完全遵循物理法则 → 丧失创作自由度
- 放任艺术发挥 → 产生违反直觉的"鬼畜"效果
最典型的案例是有用户生成"熔岩瀑布"时,系统无法平衡流体黏度与温度表现,最终输出像番茄酱一样粘稠的熔岩。这类问题暴露了纯数据驱动模型的本质缺陷——它学习的是视觉相关性,而非真实的物理因果关系。
3. 转型决策:为什么选择物理AI
3.1 从视觉欺骗到真实模拟
新项目的核心思路是将物理引擎深度整合到生成流程中。具体实现路径:
python复制# 新型混合架构示例
class PhysicsAwareGenera
