大语言模型(LLM)
用海量文本训练出来的超大规模神经网络,通过预测“下一个词”学会语言、知识与推理,ChatGPT、Claude、Gemini 背后都是 LLM。
在预训练模型基础上,用自己领域的数据继续训练,让模型的风格与能力向特定任务靠拢。比 RAG 更改变模型的“本能”,成本与门槛也更高。
用海量文本训练出来的超大规模神经网络,通过预测“下一个词”学会语言、知识与推理,ChatGPT、Claude、Gemini 背后都是 LLM。
让人类对模型的多个回答排序,用这些偏好数据训练奖励模型,再强化学习优化——是让 LLM“听话、有帮助、无害”的关键对齐技术。