推理(Inference)
模型用训练好的参数对新输入做预测的过程。你每次提问触发的那次计算就是推理,推理成本和速度决定 API 定价。
按 OpenAI 的请求/响应格式实现的接口,让同一套代码可以切换不同厂商或本地模型(DeepSeek、通义、Ollama 都提供)。迁移成本一降,模型真正变得可替换。
模型用训练好的参数对新输入做预测的过程。你每次提问触发的那次计算就是推理,推理成本和速度决定 API 定价。
用海量文本训练出来的超大规模神经网络,通过预测“下一个词”学会语言、知识与推理,ChatGPT、Claude、Gemini 背后都是 LLM。
模型处理文本的最小单位,约等于 0.5–0.75 个汉字或 0.75 个英文单词。API 按 token 计费,上下文窗口也按 token 计量。