视频生成模型
用文字或图片生成视频片段的模型(Sora、可灵、Runway 等)。目前实用场景集中在短片、广告素材与分镜预演,长镜头一致性与物理合理性仍是难点。
OpenAI 的视频生成模型,从文字描述生成最长约 20 秒的视频。代表视频生成从「几秒片段」进入「可叙事短片」阶段,但物理合理性和长时一致性仍是难点。
用文字或图片生成视频片段的模型(Sora、可灵、Runway 等)。目前实用场景集中在短片、广告素材与分镜预演,长镜头一致性与物理合理性仍是难点。
从随机噪声出发、反复去噪来生成图像/音频/视频的模型族(Stable Diffusion、Sora 等)。训练时先学会加噪,再学会反推去噪,生成过程因而可控、可用提示引导。
在内部建模「环境如何演变」,能预测下一个状态而不只是下一个词。自动驾驶、机器人与视频生成都靠它做长时程规划与场景推演。