开源大模型(Open-Source LLM)
公开权重可自由下载部署的大模型(Llama、Qwen、DeepSeek 等)。优势是数据不出本地、可微调定制、无 API 依赖;代价是需要自己管算力和运维。
在自己电脑或服务器上运行的大模型(通常用 Ollama、llama.cpp 等工具)。数据完全不出本机,无 API 费用;受限于本地算力,模型规模通常小于云端旗舰。
公开权重可自由下载部署的大模型(Llama、Qwen、DeepSeek 等)。优势是数据不出本地、可微调定制、无 API 依赖;代价是需要自己管算力和运维。
把模型权重从高精度(如 16 位)压到低精度(8 位/4 位)以省显存、提速。量化后的大模型能跑在笔记本甚至手机上,代价是精度小幅下降。
模型用训练好的参数对新输入做预测的过程。你每次提问触发的那次计算就是推理,推理成本和速度决定 API 定价。