多模态(Multimodal)
模型能同时理解或生成多种类型的信息(文字、图片、音频、视频)。拍照解题、语音对话、看图写文案,都是多模态能力的体现。
在内部建模「环境如何演变」,能预测下一个状态而不只是下一个词。自动驾驶、机器人与视频生成都靠它做长时程规划与场景推演。
模型能同时理解或生成多种类型的信息(文字、图片、音频、视频)。拍照解题、语音对话、看图写文案,都是多模态能力的体现。
用文字或图片生成视频片段的模型(Sora、可灵、Runway 等)。目前实用场景集中在短片、广告素材与分镜预演,长镜头一致性与物理合理性仍是难点。
用海量文本训练出来的超大规模神经网络,通过预测“下一个词”学会语言、知识与推理,ChatGPT、Claude、Gemini 背后都是 LLM。