推理(Inference)
模型用训练好的参数对新输入做预测的过程。你每次提问触发的那次计算就是推理,推理成本和速度决定 API 定价。
别人说的那个 AI 词到底是什么意思?16 个高频术语,每条一句话讲清,配“什么时候会遇到它”的语境。按拼音/字母排序无关紧要,按重要性排。
模型用训练好的参数对新输入做预测的过程。你每次提问触发的那次计算就是推理,推理成本和速度决定 API 定价。
把文字、图片等转成一串数字(向量),让语义相近的内容在向量空间里距离也近。搜索、聚类、RAG 都建立在它之上。
专门存向量并支持快速相似度检索的数据库(如 Pinecone、Milvus、Chroma)。企业做知识库问答时,文档先转向量存入,提问时检索最相关的片段喂给模型。
控制模型输出随机性的参数:越低越稳定保守(适合翻译、代码),越高越发散有创意(适合头脑风暴)。多数产品默认 0.7 左右。
对话开始前给模型定的“人设与规则”:语气、边界、输出格式都写在这里,比普通提问约束力更强。套壳产品的内核往往就是一条好的系统提示词。
攻击者把恶意指令藏进文本、网页或文档里,诱导 AI 忽略原指令执行危险操作。接入外部内容的应用必须把它当安全边界处理。
用海量文本训练出来的超大规模神经网络,通过预测“下一个词”学会语言、知识与推理,ChatGPT、Claude、Gemini 背后都是 LLM。
模型处理文本的最小单位,约等于 0.5–0.75 个汉字或 0.75 个英文单词。API 按 token 计费,上下文窗口也按 token 计量。
回答前先从外部知识库检索相关资料,再交给模型生成答案。解决模型知识过时与“一本正经胡说”的问题,企业知识库问答的标准架构。
能自主规划步骤、调用工具、根据反馈调整行动的 AI 系统。聊天模型“你问我答”,Agent“给你办事”——订票、改代码、跑数据都算。
在预训练模型基础上,用自己领域的数据继续训练,让模型的风格与能力向特定任务靠拢。比 RAG 更改变模型的“本能”,成本与门槛也更高。
让人类对模型的多个回答排序,用这些偏好数据训练奖励模型,再强化学习优化——是让 LLM“听话、有帮助、无害”的关键对齐技术。
发给模型的指令文本。同一模型下,提示词质量直接决定输出质量;给角色、给上下文、给示例、给输出格式,是写好提示词的四个基本动作。
模型能同时理解或生成多种类型的信息(文字、图片、音频、视频)。拍照解题、语音对话、看图写文案,都是多模态能力的体现。
模型自信地编造不存在的事实、引用或数据。根治尚无方案,缓解手段:要求引用来源、接入 RAG、对关键事实人工复核。
模型一次能“记住”的对话与资料长度上限,以 token 计。窗口越大,能塞进去的文档越长;超长文本的中段召回是各家共同的短板。