推理(Inference)
模型用训练好的参数对新输入做预测的过程。你每次提问触发的那次计算就是推理,推理成本和速度决定 API 定价。
把模型权重从高精度(如 16 位)压到低精度(8 位/4 位)以省显存、提速。量化后的大模型能跑在笔记本甚至手机上,代价是精度小幅下降。
模型用训练好的参数对新输入做预测的过程。你每次提问触发的那次计算就是推理,推理成本和速度决定 API 定价。
在预训练模型基础上,用自己领域的数据继续训练,让模型的风格与能力向特定任务靠拢。比 RAG 更改变模型的“本能”,成本与门槛也更高。
用海量文本训练出来的超大规模神经网络,通过预测“下一个词”学会语言、知识与推理,ChatGPT、Claude、Gemini 背后都是 LLM。