视频生成模型
用文字或图片生成视频片段的模型(Sora、可灵、Runway 等)。目前实用场景集中在短片、广告素材与分镜预演,长镜头一致性与物理合理性仍是难点。
从随机噪声出发、反复去噪来生成图像/音频/视频的模型族(Stable Diffusion、Sora 等)。训练时先学会加噪,再学会反推去噪,生成过程因而可控、可用提示引导。
用文字或图片生成视频片段的模型(Sora、可灵、Runway 等)。目前实用场景集中在短片、广告素材与分镜预演,长镜头一致性与物理合理性仍是难点。
模型能同时理解或生成多种类型的信息(文字、图片、音频、视频)。拍照解题、语音对话、看图写文案,都是多模态能力的体现。